十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

RVC变声器完整教程:10分钟录音克隆音色,4G显存也能从零跑通

RVC变声器完整教程:10分钟录音克隆音色,4G显存也能从零跑通 RVC变声器完整教程10分钟录音克隆音色4G显存也能从零跑通【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUIRVC变声器Retrieval-based-Voice-Conversion-WebUI基于 VITS 的语音转换框架做的事很简单你喂给它 10 分钟目标人声的录音它吐出一个音色模型之后任何音频丢进去都会变成那个人的声音。给视频配音、给游戏角色换声、做翻唱都是它的典型场景。这篇按能不能跑 → 数据 → 环境 → 训练 → 调好效果 → 进阶的顺序走一遍全部命令在项目根目录执行。先判断门槛RVC 显存要求与硬件条件装环境之前先确认机器够不够格省得装完才发现问题。你的配置结论说明4G 及以上显存的 N 卡✅ 可训练 推理启动时程序自动读取显存并调整内部参数显存低于 4G3G、2G 老卡❌ 官方 FAQ 建议放弃见 docs/cn/faq.md Q8batch size 缩到 1 还 OOM 就是卡不够无 N 卡AMD / Intel / 纯 CPU⚠️ 能跑走 CPU 或 DirectMLWindows 上 A 卡可用 DirectMLLinux 走 CPU速度明显慢两个容易踩的坑系统内存别忽略。切分音频和提取音高是 CPU 多进程干的活内存吃紧时把训练页的CPU 进程数调低或手动把训练音频切短些FAQ Q14。采样率不用纠结。预处理会自动重采样到你选的档位原始录音多少 Hz 都行。准备 RVC 训练数据10 分钟录音就够数据是效果上限也是整个流程里唯一不可逆的一步所以放在装环境之前想清楚。官方建议总时长1050 分钟录音干净、底噪低、音色有辨识度时510 分钟也能训出可用模型。录制时抓三点环境安静。底噪会原样进模型轮次堆得再高也压不掉。语气有变化。别只念一种腔调语速、语调、情绪的多样性决定了模型能覆盖多少发音状态。单条别太长。几十秒到一两分钟一段即可过长的录音在切分阶段拖内存。录完统一转成 WAV 放进一个文件夹。这一步就是 RVC 10 分钟录音的最低要求——数据够干净后面的调参才有发挥空间。RVC 训练环境搭建拉代码、装依赖、下底模git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI cd Retrieval-based-Voice-Conversion-WebUI python -m venv rvc-env激活虚拟环境后按显卡选依赖清单注意本仓库文件名是requirments_*少了个 e# CPU / AMD / IntelWindows 可走 DirectML pip install -r requirments_cpu_py312.txt # NVIDIA RTX 50 系之前先装 CUDA 11.8 版 Torch再装 pip install -r requirments_cu118_py312.txt # NVIDIA RTX 50 系同上但换 cu128 版 Torch requirments_cu128_py312.txt按硬件精确的分步命令写在 README.md 的环境配置一节照着抄即可。然后补两样必需品ffmpeg切分和重采样全靠它。Ubuntusudo apt install ffmpegmacOSbrew install ffmpeg。预训练底模按 README 的hf download命令把 hubert_base、rmvpe、pretrained 等文件拉到assets/目录。缺底模的话训练和推理都起不来这一步没有替代方案。启动 RVC WebUI三个入口按钮python webui.py浏览器会自动打开7865 端口的训练网页不想折腾环境变量的 Windows 用户直接双击 go-webui.bat 走整合包路线。训练页的工作流填训练集文件夹路径 → 起一个实验名后面找模型、看日志全靠它建议带日期→ 点一键训练。它会按顺序跑完切分、音高提取、特征提取、训练四步日志全部落在logs/实验名/下训练核心代码在 train/ 目录出问题翻日志和这里即可。RVC 三个必调参数与两档关键选项网页上值得动的数字其实就三个其余保持默认参数怎么设为什么总轮数epoch数据有底噪2030 轮干净且时长足可到 200 轮底噪大的数据训太多轮模型会把噪音也学进去FAQ Q9保存间隔每 10 轮存一个点间隔小才能逐个试听挑最早达标的那个避开过拟合批次大小batch size用页面默认值OOM 就往下调默认值约为显存 GB 数的一半见 webui.py是稳定起步值另外两档顺手设好采样率选 48k对应 v2 底模——官方配置里质量上限最高的一档参数见 configs/v2/48k.json。音高提取选 rmvpe界面默认值效果最好且只占少量显存pm适合歌声输入时提速。设置确认无误后点一键训练剩下的就是等日志滚完。RVC 训练后必做的两步索引 推理调参第一步训练索引索引文件决定输出保留多少训练集的音色。跳过它音质可能不错但相似度会打折。在训练页点训练索引它用 faiss 把训练特征聚成检索库产物是logs/实验名/下added_开头的.index文件。如果一键训练结束没看到索引文件多半是训练集太大卡住了索引步骤重按一次训练索引就好FAQ Q2。第二步推理页调两个滑条切到模型推理页点刷新音色选你的模型和索引上传音频转换。重点调的是检索特征占比index rate范围 01默认0.75取值效果调高接近 1音色完全锚定训练集不会漏出输入源或底模的音色但音质上限被训练集锁死调低到 0不做检索保护音质可能更好音色泄露问题会回来训练集本身优质且时长足这个值反而不重要模型自己很少引用外部音色两个辅助旋钮保护滑条protect默认 0.33专防清辅音和呼吸声撕裂输出有电音就往高调变调是整数半音12 升八度、-12 降八度。进阶RVC 批量推理与实时变声批量转换不用逐条点。WebUI 的批量推理页直接填输入文件夹或一次上传多个音频指定输出文件夹格式可导 wav / flac / mp3 / m4a参数与单次推理相同index rate 批量页默认 1.0。实时变声双击 go-realtime_gui.bat 启动实时界面入口代码 realtime_gui.py。官方给出的延迟数据是端到端170ms换用 ASIO 输入输出设备可压到90ms但那依赖声卡驱动支持普通 USB 声卡别期待这个数字。到这里流程闭环了打开推理页挑一个保存点模型把 10 分钟录音里没用过的一段扔进去转换——音色对上了这套 RVC 训练流程就算跑通了。后续想深入训练细节可以翻 docs/ 下的多语言文档和 configs/ 里的各采样率档位配置。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表