十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

GPT-SoVITS 六大版本选型指南:五个场景选对话声音克隆版本

GPT-SoVITS 六大版本选型指南:五个场景选对话声音克隆版本 GPT-SoVITS 六大版本选型指南五个场景选对话声音克隆版本【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS准备用 GPT-SoVITS 做少样本声音克隆或语音合成时第一步不是装环境而是选对版本。项目已迭代出 v1、v2、v3、v4、v2Pro、v2ProPlus 共六个版本显存成本、音质取向、速度各不相同选错了要么显存不够用要么达不到音质要求。本文先给结论再按你的场景分流最后附版本档案与避坑清单。结论先行十秒速查选型表 以下建议来自官方更新说明、作者公开的实测数据与社区共识如果你的情况不在表里以官方文档为准。你的场景推荐版本一句话理由低配显卡先跑通声音克隆v2显存门槛最低教程与模型分享资源最多显卡 ≥12GB追求音质v4原生 48kHz 输出金属音已修复训练音频一般手机录音、有底噪v2 或 v2Prov2 系对低质量语料更宽容实时 / 直播 TTSv2ProPlus实测 RTF 最低 0.014支持流式推理已有 v3 存量模型转 v4 重训v4 是 v3 的定向修复版但权重不跨版本通用按场景选你的 GPT-SoVITS 版本低显存新手v2 是保底选择显存低于 8GB或第一次接触声音克隆工具建议从 v22024-08-21 发布入手。理由有二一是它推理和微调的显存要求都低二是社区生态最成熟绝大多数第三方教程与模型分享都基于 v2。v12024 年初发布虽然老显卡也能跑但属于不再投入新特性的历史版本约 2k 小时预训练、仅支持中/英/日不建议新项目选用。若仍需启动 v1 的旧界面可在终端运行python webui.py v1音质优先v4 是上限之选显卡在 12GB 以上时一般建议直接上 v42025-04-22 发布。作者明确将其定位为 v3 的直接替代修复了 v3 非整数倍上采样带来的金属音并原生输出 48kHz 音频闷的问题随之消除。代价是训练显存要求与 v3 相当全量微调约 14GB开启梯度检查点可压到约 12GB。训练集音质一般听劝选 v2 系社区共识是v3/v4 音色更贴参考音频因此对训练集质量要求更高如果素材是手机录音、有底噪或音质参差在 v3/v4 上效果反而不佳。这时选 v2 或 v2Pro2025-06 发布更稳——这一系音色贴合整个训练集对平均音质一般的语料更友好而 v2Pro 的推理性能经作者实测已超过 v4硬件成本却回到 v2 水平。实时、直播场景选 v2ProPlus对延迟敏感的直播或交互式语音场景推荐 v2ProPlus。作者公布的实测 RTFRTX 4060 Ti 约 0.028、RTX 4090 约 0.014合成 1400 词约 4 分钟音频仅需 3.36 秒v2Pro 系列还提供流式推理入口GPT_SoVITS/stream_v2pro.py对实时链路更实用。存量 v3 项目迁移到 v4v3 与 v4 特性同源但按前述规则权重不跨版本通用所谓迁移即重训底模预训练权重复用用 v4 重新走一遍训练流程即可。若 v3 项目显存吃紧也可以先用 LoRA 微调过渡——v3 官方支持 8GB 显存完成 LoRA 训练。版本档案卡六个版本的关键事实 以下事实均可在官方 Changelog 与仓库配置中核验。v12024 年初中/英/日 · 32kHz · 约 2k 小时预训练 · 显存要求低 · 音色偏训练集 · 底模 s2G488k.pthv22024-08-21新增韩语、粤语 · 32kHz · 5k 小时预训练 · 文本前端升级多音字与中英混读更准 · 低质量参考音频容忍度好 · 底模 gsv-v2final-pretrained/v32025-02-28语种同 v2 · 原生 24kHz可开 24k→48k 超分· 相似度提升、情感表达更丰富、GPT 更稳定 · LoRA 8GB / 全量 14GB / 梯度检查点 12GB · 音色偏参考音频 · 底模 s2Gv3.pthv42025-04-22语种同 v2 · 原生 48kHz · 金属音修复 · 显存要求同 v3 · 音色偏参考音频 · 底模 gsv-v4-pretrained/v2Pro2025-06语种同 v2 · 32kHz · 性能超 v4、显存回到 v2 水平 · 音色偏训练集 · 底模 v2Pro/s2Gv2Pro.pthv2ProPlus2025-06同 v2Pro 且推理更快 · 支持流式 · 底模 v2Pro/s2Gv2ProPlus.pth多维横向对照版本发布节点输出采样率训练显存门槛音色取向低质量训练集v2ProPlus2025-0632kHz中等训练集较好v2Pro2025-0632kHz中等训练集较好v42025-04-2248kHz12GB全量 14GB参考音频不推荐v32025-02-2824kHz可超分LoRA 8GB / 全量 14GB参考音频不推荐v22024-08-2132kHz低训练集较好v12024 年初32kHz低训练集尚可一个容易忽略的细节各版本训练产物存放在彼此独立的目录SoVITS_weights_v2、SoVITS_weights_v3、SoVITS_weights_v4、SoVITS_weights_v2Pro、SoVITS_weights_v2ProPlusv1 用无后缀目录同一环境可切换版本而互不干扰目录映射逻辑见 config.py。避坑与常见疑问Q1A 版本训练的模型能在 B 版本推理吗不能。GPT/SoVITS 权重按版本分目录管理跨版本模型不通用切换版本需重新训练底模预训练权重可复用。Q2显存只有 8GB 怎么办两条路选显存需求本就低的 v2/v2Pro或走 v3 的 LoRA 微调路线官方支持 8GB 完成。Q3为什么 v3 听起来闷、还有金属音v3 原生 24kHz高频信息有损失金属音来自非整数倍上采样。对应解法是换 v4整数倍上采样 48kHz或启用内置的 24k→48k 音频超分tools/audio_sr.py。Q4怎么确认下载的预训练权重是哪个版本看 GPT_SoVITS/pretrained_models/ 目录s2G488k.pth 对应 v1gsv-v2final-pretrained/ 对应 v2s2Gv3.pth 对应 v3gsv-v4-pretrained/ 对应 v4v2Pro/ 对应 v2Pro 系列。Q5各版本训练入口分别在哪v1/v2/v2Pro 共用 GPT_SoVITS/s2_train.pyv3/v4 用 GPT_SoVITS/s2_train_v3.pyv3 LoRA 训练用 s2_train_v3_lora.py服务端部署时 v3/v4 可导出 TorchScriptexport_torch_script_v3v4.py。收束一句话口诀低配跑 v2高配上 v4求快求省选 v2ProPlus。想核对每个版本的完整迭代细节可查阅 docs/cn/Changelog_CN.md。【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表