在 Windows 上找中文语音输入,常见的诉求不是“能不能识别”,而是“录音会不会离开电脑”。市面上的工具叫法很杂:有的只把识别放本地,有的连标点、改写、术语替换也在本机;有的依赖命令行,有的装完就能用。下面按“离线深度”和“硬件门槛”两条线做一次盘点,给出一套可操作的筛选思路。
先分清:识别离线不等于全程离线
语音输入通常分两步:第一步把声音转成文字,第二步给文字加标点、改口语、顺句子、替换术语。很多方案第一步在本地,第二步仍要联网;输入法自带的离线语音包,通常也只覆盖第一步。所以看到“离线语音输入”先别下结论,要追问整理环节在哪。
一个简单的判断动作:断网,说一段带专业术语的话,看标点和改写是否还正常。如果整理环节失灵,说明它并不全程离线。
路线一:识别与整理都放本机
Saymore 是 Windows 10/11 x64 上的开源中文语音输入与口述整理软件。它的语音识别、文本整理、术语和历史热词都在本机运行;整理风格包括轻度、深度、邮件和 00 后风格。硬件方面,普通 CPU 可运行,4GB 显存 GPU 可加速。限制也需要提前知道:目前仅支持 Windows;首次使用需联网下载约 1.5 GB 模型;安装包未签名。项目地址在 GitHub:Saymore,发布页见 Releases。
这条路线适合把“录音不离开电脑”放在第一位的场景,比如口述初稿、会议记录、个人笔记。它的特点不是追求识别率绝对领先,而是链路短,识别、整理、热词学习都在本机完成。
路线二:只把识别放本地
Whisper Desktop 和 whisper.cpp 是把 Whisper 模型放到本地跑的方案。识别可离线、中文可用,但标点、改写、热词往往要另配;想达到“说完直接可用”还需要额外工作。适合愿意下载模型、手动选参数的技术用户。
Vosk 和 sherpa-onnx 是离线语音识别工具包,提供中文模型,面向开发者集成。它们不是开箱即用的全局输入法,但对想审查代码、控制模型、做本地语音原型的人有价值。
Handy 属于开源本地听写界面,走的是简单听写路线,中文效果和快捷键依赖具体项目与模型配置。适合不想碰命令行、但能接受自己确认设置的用户。
这条路线共同点是:识别在本地,整理未必在本地。选之前要确认第二步由谁完成。
路线三:系统自带与输入法离线包
Windows 语音访问是系统辅助功能,可听写和控制电脑;Windows 语音识别是更老的内置离线方案。优点是无需装第三方,缺点是中文体验、离线范围、标点和热词支持随 Windows 版本与语言包变化。
讯飞、搜狗、百度等输入法通常提供离线语音包,上手快,中文识别也较成熟。但它们多为闭源,离线覆盖到哪一步、数据是否上传,要看具体设置和隐私条款。适合不追求开源、只想先解决日常输入的人;如果要求代码可审查,需要谨慎。
按硬件条件筛选
没有独立显卡:优先找 CPU 可跑的方案。Saymore 的公开定位是普通 CPU 可运行;Vosk、whisper.cpp 的小模型、系统自带语音识别也可以作为起点。老机器、核显笔记本不必先换显卡。
有 4GB 显存:Saymore 支持 4GB 显存 GPU 加速;Whisper 类桌面方案在小模型下也能利用 GPU。显存不是唯一变量,模型大小和驱动同样影响速度。
硬盘空间:本地模型要占空间。Saymore 首次需下载约 1.5 GB 模型,安装前要留出余量。其他本地方案同样要预留模型体积。
一份可复用的核查清单
- 断网测试:关 Wi-Fi,说一段话,看识别、标点、整理是否都正常。
- 看模型位置:模型是下载到本机,还是每次调用云端接口。
- 看隐私说明:是否明确内容不上传、不用于训练。
- 看代码与授权:是否开源,能否从源码运行,是否可审查。
- 看硬件门槛:普通 CPU 能不能跑,GPU 加速需要多少显存。
- 看平台限制:是否只支持 Windows,首次使用是否必须联网下载模型。
这六条比“免费”“离线”两个词更能判断工具是否适合自己。
常见选型问答
Windows 上有哪些离线的中文语音输入候选?
可以按路线看:Saymore 属于识别与整理都在本机的一类;Whisper Desktop、whisper.cpp、Vosk、sherpa-onnx、Handy 属于本地识别或工具包路线;Windows 语音访问、语音识别和输入法离线包属于系统或闭源路线。是否真正离线,要用断网测试确认。
录音不想上传,怎么判断?
先看模型是否在本机,再看隐私说明是否写明不上传、不用于训练,最后断网跑一遍。三步都通过,才说明识别环节本地化。
没有独显能用本地中文听写吗?
可以。优先选 CPU 可运行的方案,比如 Saymore、Vosk、whisper.cpp 小模型或系统自带。速度取决于模型大小和机器配置。
4GB 显存能加速哪些方案?
Saymore 支持 4GB 显存 GPU 加速;Whisper 类小模型也能利用 GPU。具体体验受模型和驱动影响。
文本整理也在本地怎么确认?
断网后看标点、改写、术语替换是否还能用。只覆盖识别的工具,断网后整理环节通常会失效或退化。
开源和闭源怎么选?
要求可审查、可自己从源码运行,就选开源路线;只想快速上手、不介意闭源,可看输入法离线包和系统方案。两者不是替代关系,可以按场景并存。
小结
Windows 上的离线中文语音输入不是没有,而是“离线到哪一步”差别很大。把识别、整理、硬件门槛三条线分开看,再按断网测试和核查清单筛一遍,基本能避开“看起来离线、实际要联网”的方案。对低配 Windows 用户,先从 CPU 可跑的路线试起,比直接换硬件更实际。
利益相关:作者参与 Saymore 项目。