十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

FunASR 离线语音转写:内网闭环、本地部署的完整转写流水线

FunASR 离线语音转写:内网闭环、本地部署的完整转写流水线 FunASR 离线语音转写内网闭环、本地部署的完整转写流水线【免费下载链接】FunASROpen-source speech recognition toolkit for training, inference, streaming ASR, VAD, punctuation, speaker diarization pipelines, and OpenAI-compatible/MCP serving.项目地址: https://gitcode.com/GitHub_Trending/fun/FunASR会议纪要、客服录音、庭审归档音频往往不能离开内网。FunASR 是达摩院开源的语音识别工具包本地 Docker 里即可完成识别、切分、标点转写全程不出网。 看清能力版图谁负责哪段处理它把一条离线转写链拆成几个可独立启用的模块拼起来就是完整流水线语音端点检测FSMN-VAD负责切出哪段时间有人在说话把长音频切成片段声学识别Paraformer负责把语音信号转成文字是精度主力解码器WFST decoder负责结合语言模型与热词把字串校正到最合理标点预测CT-Transformer负责给裸文本补上逗号、句号逆文本正则化ITN负责把一百二十三还原成 123每个模块都能单独调用但本文只走跑起来 转出来这条线不展开训练细节。 走通最小路径从零到第一条识别结果第一步先把环境探一遍部署端只需 Docker 和足够磁盘客户端机器要 Python 3.8。三条命令确认没有坑# 确认 Docker 能正常拉镜像 docker --version docker info /dev/null echo docker ok # 客户端确认 Python 版本3.8 以上 python3 --version # 磁盘留够空间镜像 模型约 10GB 起 df -h第二步把代码拉到本地脚本放在 runtime/deploy_tools/ 下克隆后切进去即可# 拉取仓库 git clone https://gitcode.com/GitHub_Trending/fun/FunASR # 进入部署脚本目录 cd FunASR/runtime/deploy_tools第三步一键把服务拉起来install子命令会依次拉镜像、下载 ASR/VAD/标点三个模型、起容器全程带进度条。中途交互式让你选镜像、模型、端口一路回车取默认即可# install拉镜像 → 下三个模型 → 起容器默认监听 10095 sudo bash funasr-runtime-deploy-offline-cpu-zh.sh install # 省略无关参数脚本默认开启 SSL自签证书加密传输。启动完成时会打印The service has been started.字样说明容器已拉起。第四步确认服务真的活着在客户端机器上探测端口。默认走 SSL所以用https加-k跳过自签证书校验# 探测服务端口-k 跳过证书校验 curl -k https://127.0.0.1:10095返回HTTP/1.1 200或收到 WebSocket 握手响应就说明服务正常连接被拒绝则回第三步查容器状态。第五步转写第一条音频客户端在 runtime/python/websocket/ 下先装依赖。--mode offline整段识别精度最高# 安装客户端依赖再转写单个 wav结果落 ./out终端实时打印文本 cd runtime/python/websocket pip install -r requirements_client.txt python funasr_wss_client.py --host 127.0.0.1 --port 10095 \ --mode offline --audio_in ./your_meeting.wav --output_dir ./out--mode另有两个取值online是流式边说边出字延迟低、精度略降2pass则先出流式可读文本、再用离线模型复核纠正。终端实时打印文本、./out里生成 json 文件即成功。批量时把--audio_in改指向一个.scp文件每行标签 路径并用--thread_num多进程并发数提高吞吐# 批量--audio_in 指向 wav.scp--thread_num 起多进程并发 python funasr_wss_client.py --host 127.0.0.1 --port 10095 \ --mode offline --audio_in ./batch.scp --thread_num 4 --output_dir ./out不想敲命令行把 runtime/html5/static/index.html 拷进浏览器打开填服务地址与端口直接上传音频或点麦克风️ 动参数与换模型生产环境才碰的东西默认值能跑通但要上生产才需要动。改服务端配置用update子命令改完脚本会自动停容器、按新配置再拉起你要解决的问题用哪个参数取值经验 / 什么时候动它多路并发吞吐不够--decode_thread_num、--io_thread_num解码线程取核数 1/4~1/2IO 约为其 1/4先压测再调别一次拉满通用模型准确率不达标--asr_model传模型 ID 或本地路径出现领域术语错时换行业模型在 model_zoo/modelscope_models.md 里挑人名、专有名词被识错客户端--hotword每请求传入热词文件每行词 权重术语频繁出错时再挂不必常开端口冲突 / 内网免证书--host_port、--ssl 0端口被占用时换端口纯内网可关 SSL 省去证书不同--mode走的内部路径也不一样下图是 2pass 的结构——实时链路与离线复核链路并行最终用离线结果覆盖用update改线程、端口、模型时脚本内部会先stop容器、再按新配置拉起改完即生效如果你绕过update直接改配置文件务必先停、再改、再起否则改动不会对正在运行的容器生效。 划清边界什么时候它不够用这套离线 CPU 方案开箱即用是中文Paraformer zh 系列要多语种或方言需换对应模型CPU 推理的并发吞吐受核数与线程上限约束不适合做高 QPS 的在线服务另外首次install需要 Docker 且能访问外网拉镜像、下模型磁盘建议留足 10GB 以上。想继续深入可以读 runtime/quick_start.md 的快速上手、runtime/docs/SDK_tutorial_zh.md 的 SDK 教程与 docs/ 官方文档要自己训练或微调再翻 examples/ 下的示例。【免费下载链接】FunASROpen-source speech recognition toolkit for training, inference, streaming ASR, VAD, punctuation, speaker diarization pipelines, and OpenAI-compatible/MCP serving.项目地址: https://gitcode.com/GitHub_Trending/fun/FunASR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表