十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

FunASR 语音识别快速上手:5 分钟完成本地转写、字幕与说话人分离

FunASR 语音识别快速上手:5 分钟完成本地转写、字幕与说话人分离 FunASR 语音识别快速上手5 分钟完成本地转写、字幕与说话人分离【免费下载链接】FunASROpen-source speech recognition toolkit for training, inference, streaming ASR, VAD, punctuation, speaker diarization pipelines, and OpenAI-compatible/MCP serving.项目地址: https://gitcode.com/GitHub_Trending/fun/FunASR一段录音要变文字通常得调云端接口还要担心流量和隐私。FunASR 是达摩院开源的语音识别工具包把离线语音转写、VAD 端点检测、标点恢复、说话人分离这些环节整合在一套代码里装在本地 Python 环境就能跑音频不用出内网。这篇文章面向想把它跑起来的用户装完依赖、跑通第一条命令再用批量转写、SRT 字幕和热词把真实任务做完。它帮你解决什么问题FunASR 不是一个模型而是一套工具箱识别模型Paraformer、SenseVoice、Fun-ASR-Nano 等、端点检测模型 fsmn-vad、标点模型 ct-punc、说话人模型 cam 都放在 model_zoo 里既能单独调用也能在一条流水线里串起来用。对新手来说最省事的入口是两条命令行工具funasr一条命令转一个文件支持批量、JSON、SRT 字幕输出Python APIAutoModel把 ASR、VAD、标点、说话人分离拼成一条流水线返回带时间戳的结构化结果 环境准备与三步安装依赖只有 Python 3.8 和 PyTorch。有 NVIDIA 显卡的话先装与驱动匹配的 torch 版本纯 CPU 机器直接装 CPU 版即可。第一步装推理框架和工具包pip install torch torchaudio pip install funasr注意国内网络环境如果拉取慢可以换源安装安装文档给出了等价命令例如pip3 install -U funasr -i https://mirror.sjtu.edu.cn/pypi/web/simple。第二步确认环境可用python -c import torch; print(torch.cuda.is_available())打印True说明 GPU 可用后面命令里--device就能写cuda打印False就用cpu。第三步安装后首次运行会自动从 ModelScope 下载模型默认--hub ms网络通畅即可不需要手动下载权重文件。️ 5 分钟转写你的第一个音频命令行一条命令出结果准备一个audio.wav直接执行funasr audio.wav看到终端打印出识别出的中文句子就算成功了。想控制细节加上关键开关funasr audio.wav --model paraformer --language zh --hotwords FunASR,达摩院--model识别模型默认sensevoice支持中/英/日/韩/粤CPU 友好中文生产场景常用paraformer复杂音频可换fun-asr-nano需要 GPU--language语种默认auto自动判断也可以显式指定zh、en、ja等--hotwords热词英文逗号分隔能提升专业术语的召回率不传则不启用完整参数表见 CLI 文档。Python一条流水线出结构化结果要说话人分离和时间戳用 Python API 更直接from funasr import AutoModel model AutoModel(modeliic/SenseVoiceSmall, vad_modelfsmn-vad, spk_modelcam, devicecpu) result model.generate(inputaudio.wav, batch_size_s300) for seg in result[0][sentence_info]: print(f[{seg[start]/1000:.1f}s] Speaker {seg[spk]}: {seg[sentence]})vad_model负责切出有人说话的片段spk_model给每段标上说话人编号batch_size_s300表示按 300 秒做动态批处理长音频更稳。运行后看到形如[0.6s] Speaker 0: 欢迎大家……的输出说明 VAD ASR 说话人整条链路都通了。模型 ID 与能力对照可以参考 模型选择指南。⚙️ 批量、字幕、热词完成一个真实任务拿到一堆会议录音不用写循环通配符直接批量转funasr *.wav --output-format srt --output-dir ./output--output-format输出格式默认text可选json、srt、tsvsrt和tsv会请求句级时间戳--output-dir指定文件落盘目录。运行完在./output里看到每个音频对应的.srt字幕文件就是成功了。需要带说话人和词级时间戳的结构化结果换这一条funasr meeting.wav --spk --timestamps -f json--spk开启说话人分离默认关闭--timestamps附带时间戳默认关闭-f json输出可被脚本直接解析的 JSON。热词机制在 Fun-ASR 系列里走的是 RAG 思路用户热词与音频上下文一起喂给模型术语命中率会明显提升。 更快更准换模型、上服务CPU 还是 GPUSenseVoice 在 CPU 上就能跑到 17 倍实时速度有 GPU 且追求极致速度时官方基准里 Fun-ASR-Nano 配合 vLLM 可达 340 倍实时。选哪个模型直接看 README 的 Model Zoo 和 模型选择指南。给其他程序调用把 FunASR 暴露成 OpenAI 兼容接口下游代码一行不用改funasr-server --device cuda服务起在localhost:8000用POST /v1/audio/transcriptions上传音频即可接口细节和 Docker 部署方式见 OpenAI API 示例。注意funasr-server和fun-asr-nano这类 LLM-ASR 模型都需要 GPU装完先跑torch.cuda.is_available()确认打印False时把--device改为cpu并换sensevoice或paraformer否则模型会直接报错。❓ 常见问题与适用边界模型下载慢或中断默认从 ModelScope 拉取可加--hub hf换到 Hugging Face中断后清理该模型的缓存目录再重试排查方法见 故障排查文档。macOS M 系列芯片装 cffi 报架构错误安装文档里有对应的重装命令。SRT 只有一条整块字幕说明模型没返回句级时间戳CLI 会退化成单条提示换带标点句级的流水线如 paraformer ct-punc可改善。这套pip 安装 命令行/Python 双入口的组合适合会议归档、访谈转写、录音质检这类音频不能出网的任务本地闭环成本只是电费和机器。流式识别、WebSocket 服务、Android/iOS 端部署等更深的用法可以继续看 部署总览 和 快速上手指南。【免费下载链接】FunASROpen-source speech recognition toolkit for training, inference, streaming ASR, VAD, punctuation, speaker diarization pipelines, and OpenAI-compatible/MCP serving.项目地址: https://gitcode.com/GitHub_Trending/fun/FunASR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表