十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

OpenVoice 本地部署:4 步跑通你的第一次语音克隆

OpenVoice 本地部署:4 步跑通你的第一次语音克隆 OpenVoice 本地部署4 步跑通你的第一次语音克隆【免费下载链接】OpenVoiceInstant voice cloning by MIT and MyShell. Audio foundation model.项目地址: https://gitcode.com/GitHub_Trending/op/OpenVoice如果你需要给一段视频换配音或者把几十条旁白统一成一个人的声音自己反复录音的成本往往比写脚本还高。OpenVoice 是一个开源的即时语音克隆工具它可以从几秒参考音频里复制出对方的音色再让新声音说出任意文本。本文这套 OpenVoice 本地部署教程会带你把环境搭好最后在你自己的机器上生成一段克隆音色。它解决了什么问题传统配音流程里换一个音色就要重录一遍。OpenVoice 把这件事拆成了两个可以分开处理的环节基础 TTS 模型负责怎么读节奏、语调、情感音色转换器负责谁来读。你只需要提供一段参考音频系统提取出说话人的音色特征再叠加到基础模型生成的语音上。带来的直接好处有三点。第一音色可以精准复制参考音频里的人声特征被保留下来换一句文本听感上仍是同一个人。第二风格可以单独调节情感、口音、节奏、停顿、语调这些参数不受参考音色绑定想让语气更柔和或更急促改参数即可不用重新录参考音频。第三跨语言是零样本的目标语言和参考语言都不要求出现在训练数据里比如用中文参考音频直接合成英文发音。2024 年 4 月发布的 V2 版本在 V1 基础上进一步提升了音质原生支持英语、西班牙语、法语、中文、日语和韩语且 V1 与 V2 均采用 MIT 协议可自由商用。动手前环境与安装环境要求不高Linux 系统Ubuntu 18.04 以上较稳妥、Python 3.9另留一部分磁盘空间存放模型权重。V1 和 V2 的安装步骤完全一致执行下面 5 行命令即可conda create -n openvoice python3.9 conda activate openvoice git clone https://gitcode.com/GitHub_Trending/op/OpenVoice cd OpenVoice pip install -e .pip install -e .会按 requirements.txt 装齐依赖核心包括 librosa音频分析、faster-whisper语音识别、pydub音频格式处理和 gradio本地演示界面。如果你的系统不是 Linux仓库文档里也有社区贡献的其他平台安装说明见 docs/USAGE.md。跑通第一个完整流程目标是在本地浏览器里输入文本、上传参考音频听到克隆音色的输出。第一步准备模型权重。到 docs/USAGE.md 找到 V1 检查点压缩包下载后解压到项目根目录的checkpoints文件夹V2 则是checkpoints_v2。代码里只写了加载逻辑权重文件必须手动就位否则任何脚本都跑不起来。第二步打开 demo_part1.ipynb 按顺序执行每个单元格。它演示了从读取参考音频到合成语音的完整调用链跑完预期会得到一个音频文件音色接近你上传的参考。第三步启动本地演示界面python -m openvoice_app --share浏览器打开提示的本地地址就能看到上传音频和输入文本的表单生成后可直接试听。V2 用户还需按文档安装 MeloTTS 作为基础 TTS然后参考 demo_part3.ipynb 的用法即可使用六种原生语言。效果调优与常见坑生成语音和参考音色不像现象输出音频的口音、情感和参考人差别很大。原因OpenVoice 只克隆音色口音和情感由基础 TTS 模型决定不属于被克隆的范围。处理想要某种口音或情绪换用带该风格的基础模型或调整风格参数参考 docs/QA.md 中 Accent and Emotion 一节。生成音频质量差现象输出有噪声、断续或音色发闷。原因参考音频本身带背景噪音、时长过短、包含多人说话或有较长静音段也可能旧缓存未清理。处理换 5 到 10 秒的干净单人录音如果重用过文件名先删除processed缓存文件夹再重新运行。Silero 组件下载失败现象运行 se_extractor.py 时下载 Silero VAD 模型报网络错误。原因机器无法访问该组件的下载地址。处理手动下载对应 zip解压到~/.cache/torch/hub/下与组件名一致的子目录中具体版本见 docs/QA.md。依赖冲突怎么处理现象pip install -e .报错或已有环境跑脚本时包版本互相打架。原因环境里预装的 librosa、numpy 等包与 OpenVoice 锁定的版本不兼容。处理不要在旧环境里反复试新建一个 Python 3.9 的 conda 环境从conda create开始重装一遍。进阶用法风格参数微调在 demo_part1.ipynb 基础上修改情感、语调、节奏参数观察同一文本的不同读法。跨语言克隆用 demo_part2.ipynb 验证参考语言与目标语言都未出现在训练集时的效果。升级到 V2按 docs/USAGE.md 安装 MeloTTS参考 demo_part3.ipynb体验六种原生语言的更高质量输出。到这里环境、模型权重和第一个克隆结果都已就位。下一步建议用同一段参考音频跑一组不同风格参数的对照先跑通、再调优。之后可以按 docs/USAGE.md 换上 V2 权重感受音质和语言支持的差别。【免费下载链接】OpenVoiceInstant voice cloning by MIT and MyShell. Audio foundation model.项目地址: https://gitcode.com/GitHub_Trending/op/OpenVoice创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表