十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

MeloTTS 多语种文本转语音完整指南:从本地部署到 6 种语言合成

MeloTTS 多语种文本转语音完整指南:从本地部署到 6 种语言合成 MeloTTS 多语种文本转语音完整指南从本地部署到 6 种语言合成【免费下载链接】MeloTTSHigh-quality multi-lingual text-to-speech library by MyShell.ai. Support English, Spanish, French, Chinese, Japanese and Korean.项目地址: https://gitcode.com/GitHub_Trending/me/MeloTTSMeloTTS 是 MyShell.ai 开源的多语种文本转语音TTS库开箱支持英语含 4 种口音、西班牙语、法语、中英混排的中文、日语、韩语 6 种语言CPU 即可实时推理。新手最常卡住的两处装环境macOS 尤其不稳定以及首次调用时会自动从远端下载对应语言的模型网络一慢就卡住。下面从拿到第一条音频讲起覆盖部署、调用、调参与排错。MeloTTS 能做什么6 种语言与说话人一览语言语言代码可用说话人说明英语ENEN-Default / EN-US / EN-BR / EN_INDIA / EN-AU唯一支持多口音的语言西班牙语ESES单说话人法语FRFR单说话人中文ZHZH底层是中英混排模型中文句子里可直接夹英文日语JPJP单说话人韩语KRKR单说话人调用方式有三种Web UI、命令行melo/melotts和 Python API装好后三选一即可。环境装不动时原生安装与 Docker 二选一仓库在 Ubuntu 20.04 Python 3.9 下开发测试docs/install.md 给出两条路线原生安装Linux / macOSgit clone https://gitcode.com/GitHub_Trending/me/MeloTTS cd MeloTTS pip install -e . python -m unidic download⚠️ 注意最后一行是必选项它拉取日语分词词典 unidic。安装钩子虽会尝试自动执行但个别机器上会静默失败手动跑一遍更稳。DockerWindows 和部分 macOS 用户的推荐路线docker build -t melotts . docker run -it -p 8888:8888 melotts本机有 GPU 就加参数docker run --gpus all -it -p 8888:8888 melotts然后浏览器打开 localhost:8888。✅ 验证装完直接敲一行melo hello out.wav能生成 wav 即环境可用。 提示模型文件不在仓库里首次TTS(language...)会按语言自动下载 config.json 和 checkpoint.pth 并缓存也可以先跑python melo/init_downloads.py把 6 种语言一次拉全。第一次合成音频三种调用方式命令行melo 一条命令出音频melo Text to read output.wav melo text-to-speech 领域发展迅速 zh.wav -l ZH melo Hello world en.wav -l EN --speaker EN-AU --speed 1.5 melo file.txt out.wav --file全部参数用melo --help查看。Python API接进你自己的程序from melo.api import TTS model TTS(languageZH, deviceauto) # auto 优先 GPU可填 cpu / cuda / mps speaker_ids model.hps.data.spk2id model.tts_to_file( text我最近在学习 machine learning。, speaker_idspeaker_ids[ZH], output_pathzh.wav, speed1.0, )✅ 验证播放 zh.wav听到自然朗读即成功。想换语言把language改成 ES、FR、JP、KR说话人取对应speaker_ids的键即可。Web UI浏览器里直接试装好后执行melo-ui等价于python melo/app.py页面里选语言、挑说话人、贴文本适合快速试听音色正式出音频还是走 CLI 或 API。换语言、换口音、调语速参数速查参数出现位置可选值说明-l / --languageCLIEN / ES / FR / ZH / JP / KR默认 EN-spk / --speakerCLIEN-Default / EN-US / EN-BR / EN_INDIA / EN-AU仅英语生效其他语言传了会告警-s / --speedCLI 与 API浮点数默认 1.01.5 即 1.5 倍速-d / --deviceCLI 与 APIauto / cpu / cuda / mpsauto 自动挑 GPU-f / --fileCLI开关第一个参数按文本文件读取Python API 的tts_to_file还接受sdp_ratio默认 0.2、noise_scale默认 0.6、noise_scale_w默认 0.8三个合成参数。建议先保持默认一次只动一个听感差异再决定是否保留。用自己的声音训练模型流程概览完整步骤在 docs/training.md要点如下音频建议 44100Hz元数据文件每行格式为音频路径 |说话人|语言代码|文本示例见 melo/data/example/metadata.list。可编辑模式安装后进入melo目录先跑预处理生成训练配置再启动训练python preprocess_text.py --metadata data/example/metadata.list bash train.sh path/to/config.json num_of_gpus 提示显存不够就把生成配置里的batch_size调小训练脚本自带自动恢复中途崩溃不会白跑。训完后用python infer.py --text 文本 -m 检查点路径 -o 输出目录验证效果。出问题了症状对照排错表症状原因解法macOS 装包失败、依赖编译报错原生安装对 macOS 兼容性不足改走 Docker 部署日语合成报错或日文相关模块缺失unidic 日语词典未拉取执行python -m unidic download首次运行卡在模型下载、网络超时首次调用会从远端自动下载模型设置代理或先在能联网的机器取好模型用TTS的config_path/ckpt_path参数指定本地文件GPU 显存 OOM显存不足推理改devicecpu训练调小batch_size非英语合成时出现 speaker 告警--speaker只对英语生效非英语语言不要传说话人CLI 报 empty text传入的文本或文件为空检查文本非空--file时确认文件存在且可读先跑通melo 文本 out.wav这一条路剩下都是在这条路上加语言和参数更多细节看官方文档 docs/quick_use.md 与 docs/install.md。【免费下载链接】MeloTTSHigh-quality multi-lingual text-to-speech library by MyShell.ai. Support English, Spanish, French, Chinese, Japanese and Korean.项目地址: https://gitcode.com/GitHub_Trending/me/MeloTTS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表