十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

whisper.cpp 语音识别模型选型指南:tiny 到 large-v3-turbo 5 档模型怎么挑

whisper.cpp 语音识别模型选型指南:tiny 到 large-v3-turbo 5 档模型怎么挑 whisper.cpp 语音识别模型选型指南tiny 到 large-v3-turbo 5 档模型怎么挑【免费下载链接】whisper.cppPort of OpenAIs Whisper model in C/C项目地址: https://gitcode.com/GitHub_Trending/wh/whisper.cppwhisper.cpp 是 OpenAI Whisper 的 C/C 移植版让你不依赖 Python 框架在嵌入式、手机、桌面和服务器上跑本地语音转文字。部署时最大的纠结只有一个从 75 MiB 的 tiny 到 1.5 GiB 的 large-v3-turbo你的设备到底该用哪一个。速查whisper.cpp 模型选型三档推荐不想看推理过程直接按设备档位抄作业你的处境推荐模型磁盘占用官方标注运行内存极端省内存嵌入式、Raspberry Pitiny.en纯英语/tiny多语言75 MiB约 273 MB性能与精度平衡手机、桌面日常small.en或large-v3-turbo-q5_0466 MiB / 547 MiB约 852 MB / 约 900 MB追求最高精度服务器离线批处理large-v3或 q8_0 量化版2.9 GiB约 3.9 GB三档判断依据内存是否装得下、速度能否满足实时交互、语言覆盖是否够。下面三个问题把依据拆开讲。选型三问硬件还剩多少资源模型文件只是账面上的数字运行时内存才是真实门槛。whisper.cpp 推理时要在模型权重新增约 200 MiB 的开销官方 README 内存表可查再算上音频缓冲。选型时按设备可用内存 ≥ 模型运行内存 × 1.5来卡。设备档位典型可用内存装得下的模型区间嵌入式MCU 开发板、Raspberry Pi256 MB ~ 1 GB仅 tiny / tiny.en再大就会 OOM移动端Android / iOS4 ~ 8 GB 应用配额base、small.en上限是 large-v3-turbo-q5_0桌面16 GB 起8 ~ 16 GB 可分配到 medium服务器32 GB 起large-v2 / large-v3 全量两个容易被忽略的点量化版是移动端的高精度捷径。large-v3-turbo 全量要 1.5 GiB 磁盘、约 2 GB 运行内存而官方已提供large-v3-turbo-q5_0547 MiB 磁盘。量化指把 16 位浮点权重压成 5 位整数存体积变小精度损失很小——在手机上这几乎白捡一档精度。磁盘大小和内存大小不是一回事。tiny 文件只有 75 MiB但运行内存约 273 MB。拿文件多大代替能跑多大是选型最常见的错误。选型三问你要求多快出结果实时倍数衡量的是处理 1 分钟音频要多少倍于 1 分钟的时间——1 分钟内跑完就叫 ≥1 倍实时能追上语速才有实时交互的体验。模型越大这个倍数越低精度越高这是 Whisper 家族的基本规律。按延迟需求分两类实时交互车载指令、语音助手、实时字幕要求处理速度 ≥1 倍实时。选 tiny 到 small 区间配examples/stream/stream.cpp的流式模式——它按滑动窗口边收音频边识别不用等整段音频录完。默认参数--step3000、--length10000 就是每 3 秒出一批结果、回看 10 秒上下文车载场景可据此调小 step 换更低延迟。离线批处理会议转写、字幕生成、讲座归档对速度不敏感把预算全砸精度上直接 medium 起步。用examples/server/server.cpp起 HTTP 服务做并发转写或examples/cli批量处理文件。判断方法很直接先用你目标硬件跑一遍基准脚本看输出里的处理耗时与音频时长比值。仓库自带两种工具examples/bench/bench.cpp压测单个模型在指定线程下的吞吐scripts/bench.py一次跑多个模型、多种线程组合做横向对比。选型三问你要支持几种语言Whisper 的.en后缀是单语模型同尺寸下比多语言版文件更精简、识别更准。所以语言需求先决定选单语还是多语再决定选多大。语言需求选型建议只转英语一律优先.en版本tiny.en / base.en / small.en / medium.en同尺寸下更准更省中、日等小语种为主至少 small 起步中文正式转写建议 large-v3-turboq5_0 量化版可下探到移动端多语种混合、不确定语种只能选多语言模型资源紧张时 small资源充足上 large-v3一个常见误判用多语言模型转纯英语内容。能跑但白白多花内存和延迟——如果你的业务 99% 是英语换成.en版是免费的精度提升。实测对比各档模型体积与内存实测数据以下磁盘与内存数据取自仓库内 models/README.md 的官方模型表和 README.md 的 Memory usage 章节是选型前唯一可信的硬指标模型磁盘占用运行内存官方标注定位tiny / tiny.en75 MiB约 273 MB嵌入式实时base / base.en142 MiB约 388 MB移动端起步small / small.en466 MiB约 852 MB桌面平衡点medium / medium.en1.5 GiB约 2.1 GB服务器批处理large-v3-turbo-q5_0547 MiB约 900 MB移动端高精度large-v3-turbo1.5 GiB约 2 GB桌面高精度turbo 为蒸馏加速版比全量 large-v3 快数倍large-v3-q5_01.1 GiB约 1.9 GB服务器精度/内存折中large-v2 / large-v32.9 GiB约 3.9 GB服务器最高精度速度数字无法给出放之四海皆准的表因为它完全取决于你的硬件。正确做法是拿仓库自带脚本在自己设备上实测两条命令分别覆盖吞吐压测和多模型横评# 压测单个模型encoder 编码速度 ggml_mul_mat-t 为线程数 ./build/bin/bench -m models/ggml-base.en.bin -t 8 # 一次跑多个模型、多种线程组合输出各模型的实时倍数 python3 scripts/bench.py -f samples/jfk.wav -t 2,4,8 -p 1,2拿到基准后对照选型实时交互场景要求实时倍数 ≥1离线批处理则主要看精度和单条耗时是否可接受。真正划算的调优手段量化、线程数与 GPU 加速三种调优手段各有值得做的边界别一上来全开量化Q5_0 等适合大模型 内存吃紧的组合。官方量化脚本一条命令生成 q5_0 文件磁盘上 large-v2 从 2.9 GiB 压到 1.1 GiBlarge-v3-turbo 压到 547 MiB精度损失在一般语音场景几乎无感。tiny 这种小模型本来就能装下量化收益不大不值得花时间。./build/bin/quantize models/ggml-large-v3-turbo.bin models/ggml-large-v3-turbo-q5_0.bin q5_0线程数CPU 推理速度对线程数非常敏感通常从 4 加到 8 会有明显加速但超过物理核心数后收益趋平、还会挤占内存带宽。用scripts/bench.py的-t 2,4,8对比一下取你机器上实时倍数最高的那档不要猜。GPU 加速CUDA / Metal / Core MLmedium 及以上的服务器部署值得开编译时加-DWHISPER_CUDA1或-DWHISPER_METAL1。但注意两点小模型在 CPU 上本来就够快数据搬上搬下 GPU 反而可能变慢Apple Silicon 上更推荐 Core ML 路径-DWHISPER_COREML1官方 README 明确标注 encoder 相比纯 CPU 有 3 倍以上加速。常见翻车点现象、原因与解法现象加载 medium 后进程被系统杀掉。原因只看磁盘 1.5 GiB 就上了设备实际运行内存约 2.1 GB 再加系统开销。怎么办按可用内存 ≥ 运行内存 × 1.5重新卡档位。现象MP3 / 视频音轨直接喂进去报错。原因whisper-cli只吃 16-bit WAV。怎么办先用 ffmpeg 转成16000Hz 单声道 pcm_s16le的 WAV 再转写。现象输出全是乱码或大段重复。原因音频信噪比太低或模型语言与实际语种不符。怎么办显式指定-l语言参数并确认用的是覆盖该语种的最小模型。现象下载了ggml-large-v3.bin却想当然以为拿到的是量化版。原因量化是独立的转换步骤文件名带-q5_0才是量化模型。怎么办用仓库examples/quantize的 quantize 工具转换或直接下载官方预量化文件。现象换了更强的服务器速度却没提升。原因默认只开 4 线程没利用新 CPU 的核心。怎么办-t显式指定线程数并用 bench 脚本验证。现象实时场景延迟忽大忽小。原因一次性处理整段音频而非流式。怎么办改用examples/stream/stream.cpp的滑动窗口模式按--step/--length控制出结果节奏。结尾决策逻辑只有三步回到最初的问题——whisper.cpp 模型怎么选顺序不能乱先看资源上限内存装不下的模型直接排除这一步会砍掉一半选项再看延迟底线实时交互必须保证 ≥1 倍实时用 bench 脚本在目标硬件上实测而不是看别人的数据最后才比精度在剩下的候选里用真实业务音频听辨效果多语种和中文往 large 系列靠英语场景大胆用.en小模型。资源定边界延迟定下限精度定最终答案——本地语音转文字部署的选型到这一步就没有纠结空间了。【免费下载链接】whisper.cppPort of OpenAIs Whisper model in C/C项目地址: https://gitcode.com/GitHub_Trending/wh/whisper.cpp创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表