十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Handy 离线语音转文本模型量化指南:2.3GB 模型压到 455MB 的秘密

Handy 离线语音转文本模型量化指南:2.3GB 模型压到 455MB 的秘密 Handy 离线语音转文本模型量化指南2.3GB 模型压到 455MB 的秘密【免费下载链接】HandyA free, open source, and extensible speech-to-text application that works completely offline.项目地址: https://gitcode.com/GitHub_Trending/handy11/Handy在外网会议或者出差时想靠语音录入文字云端转写服务要么要联网、要么让录音先经过第三方服务器。Handy 是一款完全离线运行的语音转文本工具它把模型量化做进了默认流程按快捷键说话文字直接落到任意输入框全程不出本机。 先看效果拿仓库模型目录src-tauri/src/catalog/catalog.json里真实的 Parakeet 0.6B 模型做对比同一份权重的不同存储版本F32 全精度约 2.3GBQ8_0默认下载版本731MBQ4_K_M455MB比全精度小了 80% 以上体积变小带来的连锁反应是本地推理更轻CPU 也能跑得动不用等模型从内存换入换出连续转写时麦克风流保持打开的开销也更小。对没有独显的设备这是能不能用和用起来顺不顺的分界线。 一句话原理量化就是把模型里每个数字的存储位数砍小32 位浮点F32能表示的小数位数很多而 Q8_0 只用 8 位、Q4_K_M 平均只用约 4.5 位存一个权重。类比一下就像把一张 4K 照片压成高质量 JPEG像素细节少了一点但内容照样读得清。识别模型对这种有损压缩的容忍度比照片高得多尤其是像 Parakeet 这类本身只有 0.6B 参数的小型模型砍到位数后准确率几乎不掉文件却小了一圈。 上手教程不需要懂量化细节跟着走就行拉代码git clone https://gitcode.com/GitHub_Trending/handy11/Handy装好 Rust 与 Bun再按 BUILD.md 补上对应平台的系统依赖macOS/Windows/Linux 各有一套在项目根目录执行bun run tauri dev跑开发版或bun run tauri build出安装包首次启动授予麦克风、辅助功能权限应用会自动下载默认量化模型Q8_0 版本长按快捷键说话、松开即粘贴想换精度在模型页面挑 Q4/Q5/Q8/F16 任一档位即可 源码导读想看量化怎么落地的重点看这几个位置模型目录catalog.json 为每个模型列出全部量化档位、字节大小与 SHA-256 校验值模型管理src-tauri/src/managers/model.rs 负责下载、完整性校验与能力探测断点续传在 download/静音过滤silero.rs 用 Silero VAD 按 30ms 帧切分语音与噪音降低实际推理量前端量化标签ModelCard.tsx 会从文件名里解析出 Q8_0 之类的档位标识❓ 常见疑问精度损失大吗默认下发的 Q8_0 是质量优先档Q4_K_M 是体积优先档。目录里每个模型都带 accuracy_score 与 speed_score 两个分数同一家族的 Q4 与 Q8 差距通常很小日常速记选默认档基本无感。没显卡能用吗可以。Whisper 系模型有 GPUVulkan 等加速路径Parakeet 这类模型本身就是 CPU 优化的核显甚至纯 CPU 的机器也能完成转写。录音会不会上传不会。转写在本地完成音频不经过网络应用联网只为拉取模型文件且每个文件都校验 SHA-256。后续路线上流式模型的实时字幕覆盖更多语言、更小的量化档位都是社区在推进的方向。有兴趣的话可以直接从 CONTRIBUTING.md 找入手点提 issue 或补个量化模型的目录条目都是有效的贡献。【免费下载链接】HandyA free, open source, and extensible speech-to-text application that works completely offline.项目地址: https://gitcode.com/GitHub_Trending/handy11/Handy创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表