
OpenVoice 实战上手十分钟克隆出专属音色六种语言随便说【免费下载链接】OpenVoiceInstant voice cloning by MIT and MyShell. Audio foundation model.项目地址: https://gitcode.com/GitHub_Trending/op/OpenVoice做播客出多语种版本配音怕换人后味道变了又想让智能助手用某个你熟悉的声音说话——这些需求背后其实是同一件事怎么快速让「那个人的音色」开口说任意内容。OpenVoice 语音克隆就是干这个的由 MIT 和 MyShell 开源十几秒参考音频就能提取音色再用它说英语、中文、日语等六种语言V2 起采用 MIT 协议商用免费。它的工作方式很直接先用一个基础 TTS 把文本读出来再把你的参考音色「搬」到这段音频上。下面先让它在你的机器上出声再回头讲原理。十分钟跑通环境、权重与第一声先把环境装好最小环境只要三样东西Python 3.9、代码仓库、官方检查点。conda create -n openvoice python3.9 conda activate openvoice git clone https://gitcode.com/GitHub_Trending/op/OpenVoice cd OpenVoice pip install -e .装完这一步openvoice包和依赖就都就位了V1 和 V2 的安装方式完全一样。检查点放到对的位置检查点压缩包在官方 docs/USAGE.md 里给了下载地址V1 解压到checkpoints目录V2 解压到checkpoints_v2目录目录名不能写错。选 V2 的话还要装 MeloTTSV2 用它当多语言基础说话人pip install githttps://github.com/myshell-ai/MeloTTS.git python -m unidic download三步拿到第一段克隆音频核心流程三步加载转换器 → 提取参考音色 → 转换输出。转换器只依赖checkpoints_v2/converter先拿仓库自带的示例参考音频resources/example_reference.mp3试手import torch from openvoice import se_extractor from openvoice.api import ToneColorConverter device cuda:0 if torch.cuda.is_available() else cpu converter ToneColorConverter(checkpoints_v2/converter/config.json, devicedevice) converter.load_ckpt(checkpoints_v2/converter/checkpoint.pth) target_se, audio_name se_extractor.get_se(resources/example_reference.mp3, converter, vadTrue)target_se就是你要克隆的音色向量get_se会用 VAD 自动切掉静音再平均出特征。完整链路是MeloTTS 先把文本读成 wavconverter.convert()再把这个 wav 的音色换成target_se输出带目标音色的成品。demo_part3.ipynb 里有六语言、多口音说话人的完整示范照着跑即可。本地界面一行就能起用的是 V1 的checkpoints支持中、英输入并自动检测语言python -m openvoice_app --share版本怎么选V1 还是 V2新项目、商用、要多语言选 V2。音质更好内置英、西、法、中、日、韩MIT 协议商用免费。需要细粒度风格切换耳语、怒吼这类V1 的基础说话人模型自带风格参数V2 里这块换成了 MeloTTS 的不同说话人按场景取舍。只想要开箱即用不装环境官方在 USAGE 里列了一批已部署的多语言小部件可以先在线听效果再决定本地部署。原理说人话演员、台本与录音室把它想成剧组。基础 TTS 是演员照着台本你的文本念词腔调、情绪、口音都按他的演法来你的参考音频则像一份「嗓音档案」。转换器干的活是演员念完后把录音室的底噪整体换掉让这段词听起来是档案里那个人在念。关键在于音色和台词、风格是两条独立流水线参考音频说什么语言不重要念词时用什么语言也不重要两边甚至可以互不相干——这就是它零样本跨语言克隆的来源。演员换人、台本换语言音色档案照样成立。功能地图哪些能力什么时候用即时音色克隆做什么十几秒参考音频 → 音色向量任何音频都能换成这个音色。参考音频本身可以是任何语言。什么时候用所有场景的第一步也是 V2 工作流里的第一步。怎么设置get_se()默认走 VAD 切分vadTrue每个说话人用不同的文件名避免特征串缓存。跨语言克隆做什么参考音色说参考音色没出现过的语言。什么时候用给外语内容配「同一张脸的声音」多语种节目、字幕配音。怎么设置V2 用 MeloTTS 的英、西、法、中、日、韩模型当基础说话人V1 里换checkpoints/base_speakers/ZH这类基础模型即可。其他语言的路线见 docs/QA.md只要有那个语言的基础说话人就能接进来转换器最难的训练官方已经替你做完。风格与语速控制做什么情绪、语气、快慢。什么时候用需要耳语、欢快这类效果或调节节奏时。怎么设置V1 在BaseSpeakerTTS.tts里指定speakerfriendly、cheerish 之外的选项见 demo_part1.ipynbwhispering、shouting、sad、angry 等speed调语速换风格后 source 音色向量也要换成对应的比如en_style_se.pth。V2 的风格则通过选不同 MeloTTS 说话人实现。本地 Gradio 演示做什么浏览器里直接输入文本、传参考音频、听结果免写代码。什么时候用快速验证、给别人演示。怎么设置python -m openvoice_app --share启动目前本地演示支持中、英且中文只有 default 风格。遇到问题先看三个 demo 和 docs/QA.md。生成水印做什么给输出音频嵌入隐形标记标识「出自 OpenVoice」。什么时候用你要把服务开放给公众使用时防滥用。怎么设置convert()传message即启用初始化时enable_watermarkTrue默认才加载水印模型。注意官方保留检测任意 OpenVoice 输出音频的能力。让效果更好的几个抓手参考音频是第一变量。按官方 QA 的清单自查够不够干净无背景噪声、够不够长、是不是只有一人在说、有没有长空静音。convert()的tau控制音色混合比例默认 0.3调高一点源音频的音色残留更多适合你觉得「像了但不够像」时往回拉。基础说话人本身决定音质上限。V2 用了更激进的数据增强和不同的训练策略同一段文本下听感明显更稳对质量要求高就直接用 V2。参数/项位置作用建议tauconvert()目标音色混合比例默认 0.3音色不像时调高speed基础 TTS语速1.0 附近最自然speakerV1 基础 TTS风格whispering 等换风格记得同步换 source sevadget_se()静音切分默认 True脏音频尤其需要参考音频输入音色质量上限干净、单人、无长静音进阶玩法把开源 TTS 或自训模型当基础说话人接进框架音色转换器不换语言就随基础说话人扩展docs/QA.md 给了现成思路。常见坑位与修法Silero 模型下载失败get_se走 VAD 时要联网拉 silero-vad连不上 GitHub 就会卡住。手动把压缩包下下来解压到~/.cache/torch/hub/snakers4_silero-vad_master即可QA 文档里还有更多版本方案。「怎么不像」的口音与情绪这是最常见的误解——OpenVoice 只克隆音色不克隆口音和情绪。那两者来自基础说话人模型想要某种口音就换一个带该口音的基础说话人而不是怪转换器。输出发闷、有噪声九成是参考音频的问题——有底噪、多人混说、空段太长或者你复用了旧文件名却没清processed目录拿到的还是旧特征。换干净音频、清目录重跑。input audio is too shortVAD 之后有效语音不够被 assert 拦住。参考音频剪短了换一段更长的。V2 跑不动、报找不到 MeloTTSV2 把 MeloTTS 当基础说话人漏装它和python -m unidic download这两步就会挂回头补上再试。下一步去哪安装与部署细节看 docs/USAGE.mdWindows、Docker 的社区指南也在里面。按顺序读 demo_part1.ipynb风格控制、demo_part2.ipynb跨语言、demo_part3.ipynbV2 多语言三个 demo 就是三块能力地图。遇到怪现象先查 docs/QA.md官方会持续更新。V1/V2 均为 MIT 协议商用、研究都免费可以直接进生产评估。现在可以动手按上面的环境命令装好 V2再跑一遍 demo_part3.ipynb用resources/example_reference.mp3听出第一句带目标音色的输出——这就是你验证整条链路的最小闭环。【免费下载链接】OpenVoiceInstant voice cloning by MIT and MyShell. Audio foundation model.项目地址: https://gitcode.com/GitHub_Trending/op/OpenVoice创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考