十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

faster-whisper:比官方 Whisper 快4倍的语音转文字,13分钟音频1分钟搞定

faster-whisper:比官方 Whisper 快4倍的语音转文字,13分钟音频1分钟搞定 faster-whisper比官方 Whisper 快4倍的语音转文字13分钟音频1分钟搞定【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisperfaster-whisper 是基于 CTranslate2 推理引擎重实现的 OpenAI Whisper 语音转文字工具准确率不变最高快 4 倍、内存更少还支持 8 位量化进一步省内存。一条命令装好不用装 FFmpeg。⚡ 为什么 faster-whisper 更快官方基准数字同一段 13 分钟音频、beam_size5在 RTX 3070 Ti 上跑 large-v2 模型实现精度耗时显存openai/whisperfp162分23秒4708 MBfaster-whisperfp161分03秒4525 MBfaster-whisperint859秒2926 MBfaster-whisperbatch_size8int816秒4500 MBCPU 侧small 模型、8 线程官方要 6 分 58 秒int8 加批处理只要 51 秒。提速来自 CTranslate2 这个专为 Transformer 打造的推理引擎int8 量化再省一半内存。一条命令安装不用装 FFmpeg先装它。Python 3.9 以上执行pip install faster-whisper即可。官方实现要求系统里装 FFmpegfaster-whisper 改用 PyAV 解码音频FFmpeg 库直接打包在依赖里装完即用。模型首次使用时从 Hugging Face Hub 自动下载不用手动准备。最小可运行示例拿到第一份转录文本装好后加载模型、调用 transcribefrom faster_whisper import WhisperModel model WhisperModel(large-v3, devicecuda, compute_typefloat16) segments, info model.transcribe(audio.mp3, beam_size5) print(检测到语言:, info.language, info.language_probability) for seg in segments: print(f[{seg.start:.2f}s - {seg.end:.2f}s] {seg.text})info 里是检测到的语言和置信度segments 是生成器逐段吐出带起止时间的结果。全部参数说明在 核心转录逻辑。GPU 加速与 int8 量化配置示例跑在 GPU 上这要求 CUDA 12 cuDNN 9NVIDIA 的 cuBLAS 与 cuDNN 库。Linux 上可用 pip 安装注意要在启动 Python 前设置好 LD_LIBRARY_PATHpip install nvidia-cublas-cu12 nvidia-cudnn-cu129.* export LD_LIBRARY_PATH$(python3 -c import os, nvidia.cublas.lib as b, nvidia.cudnn.lib as d; print(os.path.dirname(b.__file__) : os.path.dirname(d.__file__)))最新 ctranslate2 只支持 CUDA 12 cuDNN 9CUDA 11 用户需把 ctranslate2 固定到 3.24.0。只有 CPU 的话device 传 cpu、compute_type 传 int8省内存的效果一样有。进阶能力三件套批量推理、词级时间戳、VAD 过滤再说说三个值得开的功能。批量转录用 BatchedInferencePipeline 包一层模型解码变成批处理VAD 默认开启。对照上面的表int8 加 batch 8 只要 16 秒。词级时间戳transcribe 时加 word_timestampsTrue每段结果附带每个词的开始与结束时间做字幕直接可用。VAD 过滤vad_filterTrue 会用 Silero VAD 模型先剪掉无声片段再送模型推理默认只剔除超过 2 秒的静音阈值参数见 VAD 模块。避坑建议与模型选择最后提醒几个我踩过和常见的坑。transcribe 返回的是生成器真正开始转录要等迭代没输出基本都是忘了 for 循环或 list()。和官方实现对耗时前先对齐 beam_size本库默认 5官方默认 1和 CPU 线程数结论才可靠。老环境 CUDA 11 / cuDNN 8 上别随意升级 ctranslate2否则模型加载失败。模型选择.en 后缀是英文专用、精度更高distil-large-v3 和 turbo 性价比突出追求精度选 large-v3。字幕制作、会议记录、播客归档这类批量音频处理都适合想做实时流式识别社区也有多个基于 faster-whisper 后端的实现可以参考。【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表