十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

RVC WebUI实战指南:用10分钟语音免费训练AI变声模型

RVC WebUI实战指南:用10分钟语音免费训练AI变声模型 RVC WebUI实战指南用10分钟语音免费训练AI变声模型【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUIRVC WebUIRetrieval-based-Voice-Conversion-WebUI是一个基于VITS的开源AI变声与语音克隆工具核心卖点是数据量要求低收集10分钟左右的低底噪人声就能训练出可用的变声模型支持网页界面推理和近实时的麦克风变声且完全免费。原理速览它和普通变声器差在哪传统变声器改的是音高和频率声音骨架没变。RVC的路线不同训练阶段把目标人声的声学特征、音高F0分别提取出来存好再用这些数据微调一个VITS底模推理时用top1检索从训练集特征库里找最接近的片段替换输入的特征向量从而杜绝源音色泄漏到结果里音高提取支持pm、harvest、crepe、rmvpe、fcpe五种算法其中 RMVPE 是 Interspeech 2023 的算法精度最高且比crepe_full快、更省资源官方推荐附带 UVR5 人声分离可以从伴奏里快速拆出干净人声做训练集底模用约50小时的VCTK开源数据集训练MIT协议可以免费使用。安装到能启动三步跑通1. 克隆仓库需要 Python 3.8git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI cd Retrieval-based-Voice-Conversion-WebUI2. 按显卡装依赖。先装 PyTorchpip install torch torchvision torchaudio然后按设备选一份清单设备依赖文件N卡requirements.txtA卡/I卡Windows DirectMLrequirements-dml.txtA卡ROCmLinuxrequirements-amd.txtI卡IPEXLinuxrequirements-ipex.txt3. 补全预训练模型并启动。RVC还依赖一批预训练权重需放到assets/目录下清单和自动下载脚本都在tools/文件夹里如download_models.py、dlmodels.sh。另外装好 FFmpeg音频处理离不开它。启动命令任选其一python gui_v1.pyWindows 下直接双击go-web.bat实时变声用go-realtime-gui.bat。浏览器访问http://localhost:7865即可端口可用--port参数改。10分钟语音训练模型流程与数据建议数据准备时长官方推荐10~50分钟10分钟是能用的下限质量比数量重要低底噪、音色统一、无背景音乐混在歌里的声音先用 UVR5 分离出人声切段时 WebUI 内置的 slicer 可以按静音自动切分训练配置采样率configs/下按 v1/v2 提供 32k/40k/48k 配置48k 音质最好但吃显存训练轮数total_epoch数据音质差、底噪大时20~30轮就够调太高只会放大底噪数据干净且量大可以冲到200轮训练本身速度很快一键训练结束后如果没有生成added_xxx.index索引文件多半是训练集太大卡住了再点一次训练索引即可模型导出weights/下60MB的 pth 才是可分享、可推理的小模型logs/实验名/下几百MB的 pth 是训练状态文件别拿去推理想用别人的模型直接拿 zip内含 pth index即可推理与实时变声关键参数怎么填f0_method音高提取算法算法特点rmvpe精度最高、资源占用小实时变声首选crepe精度高但慢适合离线pm / harvest / fcpe速度更快精度略低index_rate检索特征替换强度0~1之间数值越大音色越贴近训练集、但也越机械。数据质量高可以调高0.7数据一般时0.3~0.5更自然API默认0.3。精度与设备is_half开启半精度FP16可显著提速并省显存4G以下显存如1060 3G基本放弃4G显存仍可运行程序会自动识别1060/1070/1080/16系老卡并强制FP32。实时延迟项目已实现端到端170ms延迟Windows下用ASIO输入输出设备可压到90ms但很依赖声卡驱动支持。批量处理手上有整个文件夹的音频时用tools/infer_batch_rvc.py跑批不用一张张在界面里点。高频问题速查症状先查什么ffmpeg报错/utf8错误多半是路径问题路径含空格、括号、中文训练完选不到新音色点刷新音色再不行看logs/实验名/下的日志Connection Error控制台黑窗口被关了Expecting value: line 1 column 1关掉本地代理含云服务器上的 http_proxy/https_proxyCUDA out of memory训练缩小batch_size推理则调小configs/config.py里的x_pad、x_query、x_center、x_max显存不足被自动降为FP32属正常行为4G以下显存会同时调低preprocess_per完整问答在 docs/cn/faq.md训练经验可看 docs/en/training_tips_en.md。资源索引遇到问题去哪找入门教程docs/小白简易教程.doc训练技巧docs/cn/ 目录下的FAQ与更新日志 docs/cn/Changelog_CN.md推理源码infer/lib/infer_pack/下的模型定义与onnx_inference.py导出ONNX看 tools/export_onnx.pyckpt处理模型融合、小模型提取WebUI的ckpt处理选项卡对应脚本 infer/lib/train/process_ckpt.pyckpt-merge可以按比例混合两个音色命令行推理tools/infer_cli.py不用WebUI训练时跑通一次界面后消息窗会打印等价的命令行实时接口tools/rvc_for_realtime.py 供第三方实时变声器调用下一步建议先按上面的流程跑通一次训练 → 推理出一段音频确认音色对得上再去动 index_rate 和 f0 算法——参数是锦上添花能跑通才谈得上调。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表