十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

10分钟语音数据就够:RVC AI语音转换快速上手指南

10分钟语音数据就够:RVC AI语音转换快速上手指南 10分钟语音数据就够RVC AI语音转换快速上手指南【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUIRetrieval-based-Voice-Conversion-WebUI简称 RVC是一个基于 VITS 的开源变声框架把 10 分钟左右的单人语音录好丢进去就能训出一个模仿该音色的模型再套用到任意音频上。全程在浏览器界面里点按钮内容创作者、游戏开发者、翻唱爱好者都可以低成本上手。一键安装启动四条命令跑通 RVC装好 Python 3.8 后依次执行git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI cd Retrieval-based-Voice-Conversion-WebUI pip install torch torchvision torchaudio pip install -r requirements.txtNVIDIA 显卡用上面的requirements.txtA 卡或 I 卡换成requirements-dml.txtmacOS 直接sh ./run.sh一条命令自动装好环境和模型。依赖装完后RVC 还需要一批预训练权重hubert 特征编码器、RMVPE 音高模型、v1/v2 底模内置脚本会一次性拉到正确目录python tools/download_models.py python infer-web.py启动后自动打开浏览器端口默认 7865可加--port参数更换。入口脚本是 infer-web.py界面里从数据集处理到推理都是现成的按钮不需要写代码。三句话讲清 RVC 的变声原理RVC 走的是检索式路线核心思路只有三步特征提取Hubert 编码器把音频变成一串声学特征RMVPE 模型单独提取音高F0曲线top1 检索替换把输入音频的音色特征换成训练集中最接近的那一条原说话人的音色痕迹在这一步被抹掉这就是它不容易串音的原因合成输出VITS 结构的生成器含 HiFi-GAN 声码器拿替换后的特征 音高重新生成目标音色的音频。推理时还可以加载训练时生成的.index特征索引进一步约束输出音色界面里叫检索比例调高音色更像调低音色更稳。进阶与调优让模型更快更好听显存不够configs/config.py 里的x_pad、x_query、x_center、x_max控制推理时的分段窗口数值改小可明显省显存4G 显存的卡也能跑推理训练轮数底噪大的数据集 20~30 轮就够轮数再高音质也不会变好干净长数据可以拉到 100~200 轮批量转换整目录音频批量变声用 tools/infer/infer_batch_rvc.py不用一首一首点部署其他平台tools/export_onnx.py可把模型导出为 ONNX配tools/onnx_inference_demo.py验证实时变声用go-realtime-gui.bat启动实时界面端到端延迟约 170ms换 ASIO 声卡可压到 90ms 左右音色融合界面 ckpt 选项卡里的 ckpt-merge 可以按权重混合两个模型调出介于两者之间的音色。踩坑自查常见现象对照修复ffmpeg 报错或 utf8 错误→ 多半是音频路径含空格、括号或中文 → 把数据集挪到纯英文路径再处理训练后推理里找不到模型→ 列表没刷新 → 点刷新音色列表仍没有就查logs/下训练日志CUDA out of memory→ 显存不足 → 训练降 batch size推理就调小上面四个x_参数一键训练显示完成但 index 文件缺失→ 数据集太大导致建索引卡住 → 重新点一次训练索引WebUI 弹出 JSON 解析错误→ 本地代理拦截了页面请求 → 关掉系统代理后刷新想分享模型→ 直接发logs/里的 pth 是错的 → 用 ckpt 选项卡导出weights/下 60MB 的小模型再分享。延伸与参与界面内置 12 种语言语言文件都在 i18n/locale/加个语言只需新增一个 json文档覆盖中英日韩法葡土docs/目录里有各语言的 FAQ 和调参经验比界面提示写得细想分离人声和伴奏直接调界面里的 UVR5 功能权重在assets/uvr5_weights提 Issue、改代码、补文档都欢迎CONTRIBUTING.md说明了参与方式。行动清单按第一节命令装好依赖、拉模型python infer-web.py跑通界面备 10 分钟低底噪语音走完处理数据集→提取特征→训练→合成完整流程一次换不同轮数和检索比例再各训一版听感对比后选出最稳参数。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表