十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

GPT-SoVITS:5秒人声就能克隆的少样本TTS,1分钟微调贴近本人

GPT-SoVITS:5秒人声就能克隆的少样本TTS,1分钟微调贴近本人 GPT-SoVITS5秒人声就能克隆的少样本TTS1分钟微调贴近本人【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS你从播客里截 5 秒人声填进 GPT-SoVITS 的零样本 TTS 推理框几秒后得到这位说话人音色的语音换成 1 分钟干净录音做少样本微调小数据快速训练音色更像、更稳还支持中、英、日、韩、粤 5 种语言的跨语言合成。手头素材不同拿到的结果就不一样只有 5 秒人声走零样本推理直接出活不训练。音色受这 5 秒限制稳定度一般。有 1 分钟干净录音做一轮微调相似度和真实感明显上去像又不像的感觉消失。只有中文底稿把目标文本切成英文或日文出来的仍是这个音色念外语不用另录素材。硬件门槛推理对显卡要求不高8GB 显存可跑 LoRA 微调V3 全参数微调约需 14GB 显存Mac 建议走 CPU 训练官方说明 GPU 训练质量偏低。对比项GPT-SoVITS传统 TTS 流水线素材量5 秒参考 / 1 分钟训练几十分钟干净录音第一条结果零样本推理几秒出数小时训练后出合成速度4090 上 RTF 0.0141400 词约 4 分钟音频耗时 3.36 秒逐条离线合成语言覆盖中/英/日/韩/粤可跨语言推理通常单语言音频输出v4 原生 48kHzv3 原生 24kHz视工具而定️ 克隆、装环境、3 步拿到第一条语音# 1. 拉代码并建 Python 3.10 环境 git clone https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS cd GPT-SoVITS conda create -n GPTSoVits python3.10 conda activate GPTSoVits # 2. 按驱动装依赖并自动下载底模国内网络可换 --source HF-Mirror 或 ModelScope bash install.sh --device CU128 --source HF这段脚本负责三件事装依赖、把预训练底模放进GPT_SoVITS/pretrained_models/、把 G2PW 中文拼音模型放进GPT_SoVITS/text/。看到依赖安装和模型下载完成、无报错即算成功。python webui.py # 打开浏览器访问 9874 端口看到 9874 页面、左侧显卡信息正常就算启动成功。顶部两个主页签0-前置数据集获取工具和1-GPT-SoVITS-TTS。先尝鲜点1C-推理打开独立推理页9872 端口模型选不训练直接推底模上传 5 秒参考音频、填上这段音频的文本再输入要合成的文字。点合成后几秒出现音频先完整听一遍。Windows 用户可下载官方整合包双击 go-webui.bat不用进终端离线环境可提前把底模和 G2PW 模型手动放到上面两个目录。从能用到好用微调四步每步有检查点清洗与切片原始录音先过 UVR5 人声分离9873 端口抠出人声再用语音切分默认静音阈值 -34dB切成短片段。检查点抽查 3 个切片每段只有一句完整话、没有串音。ASR 自动打标批量识别文本再打开标注页逐条对照音频改错。检查点随机点 5 条文本和音频一字不差改完记得点提交文本翻页不提交会回滚白忙。生成训练特征一键提取文本分词、hubert 特征、说话人向量、语义 token 四类数据。检查点logs/实验名/下出现 2、3、4、5、6 开头的文件和文件夹缺一重跑。先训 s1 再训 s2依次训练 GPTs1与 SoVITSs2。8GB 显存选 v3 LoRA 方案全参 V3 微调需约 14GB 显存。检查点两个模型状态都显示已完成。最后回推理页选新权重用同一句目标文本对比微调前后差别一听就知道。卡住了先看这里读错了字、变调→ 训练文本和音频对不上或语言标签标错 → 逐条对照 .list 文件与音频改完重训 s1。合成的音色发飘、带底噪→ 参考音频本身不干净 → 先用 UVR5 分离出人声再上传或换安静环境重录。微调直接 OOM→ 显存不够或切片太长 → 显存 8G 改用 LoRA 微调或开 fp16is_half切片时长调短。想深入看这几个目录GPT_SoVITS/AR/ — GPT 侧自回归模型结构看语义 token 怎么一步步生成。GPT_SoVITS/module/ — SoVITS 声学模型与 VQ 量化、HiFi-GAN 声码器部分。GPT_SoVITS/TTS_infer_pack/ — 推理主流程与多语言文本前端的切换逻辑。GPT_SoVITS/prepare_datasets/ — 1 号分词、2 号 hubert/说话人向量、3 号语义特征对应页面上的三步。docs/cn/README.md — 中文文档与 v1 到 v4 各版本差异速览。今天就先走零样本装完环境、传 5 秒音频、出一段 20 字的语音。不满意再加素材到 1 分钟走微调流程比反复调参数更见效。【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表