十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

ChatTTS-ui 本地文字转语音实战指南:3 步让文字变自然语音

ChatTTS-ui 本地文字转语音实战指南:3 步让文字变自然语音 ChatTTS-ui 本地文字转语音实战指南3 步让文字变自然语音【免费下载链接】ChatTTS-ui一个简单的本地网页界面使用ChatTTS将文字合成为语音同时支持对外提供API接口。A simple native web interface that uses ChatTTS to synthesize text into speech, along with support for external API interfaces.项目地址: https://gitcode.com/GitHub_Trending/ch/ChatTTS-ui上周给一条产品宣传视频录旁白一直在用的云端语音合成接口按分钟收费文字还得走外网。后来我换成了一款本地工具——ChatTTS-ui从启动到听出第一段音频全程不到 10 分钟。它是一个用网页把文字合成为语音的本地工具底层是 ChatTTS 模型支持中英文、数字混杂的文本除了网页界面还对外提供一个/ttsAPI 接口方便别的程序直接调用。下面按它是什么 → 怎么装 → 怎么用 → 出了问题怎么办的顺序带你从零走一遍。先说清楚本地语音合成工具 ChatTTS-ui 到底是什么一句话定位ChatTTS-ui 是一套本地文字转语音方案——合成过程全部跑在你自己的电脑里对外只暴露一个浏览器网页和一个 API 地址。和你可能在用的云端语音合成接口放在一起对比维度云端语音合成 APIChatTTS-ui本地联网每次请求都要联网首次下完模型后不再需要费用按字数或按时长计费部署后免费、不限次数据去向文本发到云端厂商文本和音频都留在本机使用方式必须写代码调用直接开网页点按钮代码调用可选部署成本零用别人的服务需要 Python 环境或 Docker项目入口是 app.py负责加载模型、启动 Web 服务和 API网页界面在 templates/index.html合成接口的实现可以看 infer/api.py。想读源码的话从这三处入手就够了。按环境选一条 ChatTTS-ui 部署路径Windows 预编译、源码、Docker三条路都能走通新手优先看第一条。首选Windows 预编译版双击 app.exe 就运行从 Releases 下载预编译压缩包解压双击app.exe浏览器会自动打开操作页面首次运行自动下载约 2GB 的模型等它下完再开始合成。 两个小提醒部分安全软件可能误报暂时退出即可NVIDIA 显卡显存大于 4G 且装了 CUDA 12.8 时会自动启用 GPU 加速。源码部署最小必要命令5 分钟跑起来Linux、macOS、Windows 通用需要 Python 3.9–3.11git clone https://gitcode.com/GitHub_Trending/ch/ChatTTS-ui cd ChatTTS-ui python3 -m venv venv source ./venv/bin/activate # Windows 用 .\venv\scripts\activate pip install -r requirements.txt python3 app.py启动后访问http://127.0.0.1:9966即可。⚠️ 首次模型下载默认走 ModelScope下载期间请关闭代理否则容易报 proxy 类错误。Docker 容器部署适合服务器和局域网共享在服务器上部署、或想开放给局域网同事用直接上容器GPU/CPU 两个版本各对应一个 compose 文件git clone https://gitcode.com/GitHub_Trending/ch/ChatTTS-ui cd ChatTTS-ui docker compose -f docker-compose.gpu.yaml up -d # 纯 CPU 机器改成 cpu 版本部署完成后访问部署机器的IP:9966。GPU 版要真正加速宿主机同样需要 NVIDIA 驱动和 CUDA 支持。想改监听地址或端口只需编辑项目里的.env文件把WEB_ADDRESS改成例如WEB_ADDRESS192.168.0.10:9966局域网内其他设备就能访问了。从文字输入到音频输出ChatTTS-ui 的完整合成流程打开网页后整个流程其实就 4 步按顺序来即可。文字输入直接粘贴或导入 txt把要合成的文字贴进大文本框每一行是一个独立的合成单元中英文、数字混排都可以。文案较长时点页面上的导入txt按钮可以直接把整个文本文件读进来不用手动复制。音色选择预设音色或用种子值自定义选择音色下拉框列出全部预设音色就是 speaker/ 目录里现成的音色文件。另一条路在音色值里填一个大于 1 的整数——它是生成音色的随机种子同一个值基本能还原同一个音色合成出的音色文件也会自动存进speaker/目录。⚠️ 要有一个预期同一音色值在不同设备上合成结果会有差异同一台设备多次生成音调也可能略有变化。喜欢哪个音色就把种子值记下来或直接把它存成预设音色文件反复用。情感与停顿在 Prompt 里写控制符Prompt 输入框相当于给合成下导演指令几个常用控制符[laugh_0]加一处笑声[break_2]插入约 2 秒停顿[emph_1]对某处加重语气[oral_2]让表达更口语化旁边还有几个滑杆语速1–9默认 5数值越大越快temperature / top_p / top_k 这三个是控制发音随机性的采样参数默认值就能用想调就小步调。音频产出试听、下载或调 /tts 接口点立即合成声音完成后页面出现播放器和下载音频按钮wav 文件统一存在static/wavs/目录。想程序化调用时向/tts发一个 POST 请求即可curl -X POST http://127.0.0.1:9966/tts \ -d text你好世界 -d voice2222 -d prompt[laugh_0]成功返回{code: 0, ...}其中audio_files里带文件路径和可下载的音频地址失败则code为 1 并附带原因。参数全集temperature、custom_voice、speed 等见 README.md 的使用API请求一节。本地文字转语音的三个典型用法对号入座如果你是想给视频赶一段旁白的自媒体创作者——把文案按句分行写进文本框行与行之间用[break_n]控制停顿合成后直接下载 wav 丢进剪辑软件。全程不离开本机稿子内容和成片隐私都不用外泄。如果你是想长期固定一个专属声音的用户——多试几个种子值找到顺耳的记下来以后每次填同一个音色值即可更省事的做法是把它固化成speaker/下的预设音色文件下拉框里直接选。如果你是想把语音合成接进自己脚本或已有软件——把请求指向/tts就行一行requests.post就能拿到 wav 地址。项目已兼容字幕旁白工具 pyVideoTrans 的接口形式README 末尾有接入说明网页上每条合成结果旁边的显示API调用按钮也会给出可直接复用的调用示例。故障速查表本地语音合成的常见现象处理遇到报错先别慌多数问题在这张表里就能对号入座更细的逐条解答在 faq.md直接搜报错关键词。现象可能原因处理办法模型下载失败报 proxy 类错误代理干扰了 ModelScope 下载关闭代理重试想改走 Hugging Face 的话看 app.py 约 50–60 行的注释开关提示缺少spk_stat.pt、path.yaml等文件模型下载不完整重新下载模型或把缺的文件手动放进models/pzc163/chatTTS/对应子目录有独立显卡但合成很慢装的是 CPU 版 torch卸载后按 CUDA 12.8 重装 GPU 版 torch参考 faq 第 2、9 条网页文字乱码系统或浏览器编码不对确认系统编码为 UTF-8浏览器语言设置为中文进度条卡在 0%macOS 常见本机不支持 torch.compile在.env里把compile改为false或按 faq 调整启动参数报Dynamo is not supported on Python 3.12Python 版本过高降到 Python 3.9–3.11让本地文字转语音明显提速的 4 个技巧能上 GPU 就上 GPU。NVIDIA 显卡显存 ≥4G CUDA 12.8 时会自动启用同样的文本合成速度大约是 CPU 的 3–5 倍。启用了却仍跑 CPU就按上面表格重装 CUDA 版 torch那条处理。长文本按句分段输入。界面按行合成写长稿时建议按 50 字左右、在句号处手动断行整体等待时间差不多但某一行读错时只需重做那一行不用整段重来。需要时跳过文本润色这一步。勾上跳过 refine text模型会省掉对文字做一遍润色改写的阶段耗时更短但你在 Prompt 里写的控制符保留下来会更不保险所以用控制符时建议不勾。让模型缓存为你工作。模型下载一次后就缓存在本地models/目录之后每次启动都是本地加载不会再重复下载——首次部署多花的那几分钟只用付一次。ChatTTS-ui 上手清单按顺序逐项打勾获取项目Windows 直接拿预编译版其他系统git clone https://gitcode.com/GitHub_Trending/ch/ChatTTS-ui首次启动app.py等模型下载完成约 2GB记得关代理打开127.0.0.1:9966用默认音色合成一句话确认整条链路通试 2–3 个预设音色或挑一个顺耳的种子值记下来可选用[laugh_0]、[break_2]各试一次听出差别可选局域网要共享的话改.env里的WEB_ADDRESS为本机 IP熟悉两个关键目录音频产物在static/wavs/音色文件放speaker/卡住时优先查 faq.md逐条报错解答和 README.md、README_EN.md部署细节与 API 文档。这套工具的价值不在功能多而在本地两个字文字不出机器、不按次收费、不受调用限额。清单全部打勾之后你的文字就正式开口说话了。【免费下载链接】ChatTTS-ui一个简单的本地网页界面使用ChatTTS将文字合成为语音同时支持对外提供API接口。A simple native web interface that uses ChatTTS to synthesize text into speech, along with support for external API interfaces.项目地址: https://gitcode.com/GitHub_Trending/ch/ChatTTS-ui创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表