十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

RVC 语音克隆实战:10 分钟训出专属声音模型

RVC 语音克隆实战:10 分钟训出专属声音模型 RVC 语音克隆实战10 分钟训出专属声音模型【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI想让 AI 用你的音色翻唱一首歌RVCRetrieval-based-Voice-Conversion-WebUI是个把 VITS 做成网页界面的开源声音转换框架准备 10 分钟左右的清晰人声训出的模型能把任意一段音频唱成接近你的声音。 从 clone 代码到打开 Web 界面先拿到代码clone 之后进入项目目录。git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI cd Retrieval-based-Voice-Conversion-WebUI环境要求 Python 3.8 以上先装 PyTorch 核心三件套再按显卡装依赖N 卡用户直接装 requirements.txt 即可。pip install torch torchvision torchaudio pip install -r requirements.txt显卡环境对应依赖文件NVIDIACUDArequirements.txtAMD / IntelDirectMLWindowsrequirements-dml.txtAMD ROCmLinuxrequirements-amd.txtIntel IPEXLinuxrequirements-ipex.txt依赖之后还差一批预训练权重Hubert 特征模型、f0 底模、v1/v2 基模都要放在assets/下仓库自带下载脚本跑一次全部拉齐。python tools/download_models.py脚本会把 v1 和 v2 两套底模都拉下来体积不小耐心等它跑完。系统没装 ffmpeg 的话补一下Linux 用sudo apt install ffmpegmacOS 用brew install ffmpeg它负责音频切片和转码。都齐了之后启动 Web 界面只需一行浏览器会自动跳到 7865 端口。训练、推理、UVR5 分轨全在同一个页面里。python infer-web.py界面跑起来之后重点就剩两件事数据备得干不干净参数调得对不对。训练数据怎么备、参数怎么调数据是效果的大头。总量 10 到 50 分钟底噪越低越好安静房间人声直录即可内容上覆盖正常说话和带情绪的表达比纯念稿的效果更自然。格式以 wav 为主采样率 32k 或 48k 两档都有对应底模同一批数据别混用多个采样率。在训练页签里指向数据目录、给实验起个名字点开始之后它会自动切片、提取特征和 F0然后进入训练。过程产物落在logs/最终可以分享的模型文件60MB 上下会写到weights/。参数推荐值一句话作用训练轮数 epochs20–30越多越贴近原音色再往上收益很小音高提取算法RMVPE精度最高哑音和金属感最少学习率 learning_rate默认 1e-4调大容易发散保持默认最稳batch size按显存默认 4显存紧张就降到 1索引率 index_rate0.3–0.7控制检索结果对音色的修正强度音高偏移 pitch0换性别 ±120 保原调±12 约跨一个八度轮数别盲目拉满20 到 30 轮之间挑一段试听最顺的 checkpoint 就行。推理阶段把 index_rate 从 0 往上加输出会越来越靠近训练集音色听感更像目标人。进阶玩法实时变声、模型融合、人声伴奏分离实时变声一条命令拉起实时链路官方做到端到端 170ms 延迟换 ASIO 输入设备能压到 90ms直播和语音聊天直接可用。python tools/rvc_for_realtime.py输入输出设备的采样率要和模型匹配卡顿多半出在缓冲参数上先调这个。模型融合两个已训好的模型做权重混合能调出一个谁都不完全像、又像两者的新音色适合做差异化声音。python tools/trans_weights.py两个源模型要同采样率同版本跨 32k 和 48k 底模混合容易出杂音。人声伴奏分离UVR5 分轨直接内嵌在 WebUI 里一首歌可以拆出干净人声切片之后直接当训练数据流程闭环。模型文件在assets/uvr5_weights/勾选降噪模型后再分离人声会更干净。跑出来的干声如果还带混响优先怀疑源音质量而不是分离参数。踩坑速查训练报 CUDA out of memory。显存不够把 batch size 降到 1 或改用 32k 配置仍不行就先 CPU 跑通再换卡。训练完找不到 index 文件。索引是独立一步回索引页签重新生成一次即可。实时变声延迟高、偶发断音。缓冲块太大或后台程序抢 CPU调小 block 参数关掉占声卡的软件。转换结果带金属音或哑音。多半是 F0 提取失败或底噪太大换 RMVPE 重抽音高数据重新降噪切片。输出音色泄漏了输入说话人。index_rate 太低推理时调到 0.3 以上再对比听感。启动报 onnxruntime 相关错误。A 卡/I 卡环境装错了依赖按显卡重装对应的 requirements 文件。想要装得上、跑得通、效果够用的个人级声音克隆RVC 是目前门槛最低的一条路线建议先用 10 分钟数据把全流程跑通再挑实时变声或模型融合其中一个场景深入玩。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表