十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Buzz 离线转录:本机 4 步把音频变字幕

Buzz 离线转录:本机 4 步把音频变字幕 Buzz 离线转录本机 4 步把音频变字幕【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzzBuzz 是一款开源的离线音频转录工具它在个人电脑上直接运行 OpenAI 的 Whisper 语音识别模型模型下载后存放在本地音频不上传任何服务器支持 99 种以上语言的转录与翻译。它既能处理音视频文件也能做麦克风实时录音并把结果导出为 TXT、SRT、VTT 格式。它替你省掉哪些事离线转录适用的 3 种情况敏感录音不出门商务会议、采访素材、内部讨论上传到云端 API 意味着音频会留在别人服务器上。Buzz 的全部计算在本地完成原始文件不离开硬盘断网环境也能跑模型可以提前从别的电脑拷贝过来。字幕不用手敲给视频加字幕时导入文件、点一次运行导出的 SRT 直接拖进剪辑软件省去逐句对照音频打字的环节。说话时同步出文字讲座、会议这类场景Buzz 边录边转还能开一个演示窗口把文字投到屏幕上省去事后补记录的工序。五分钟跑起来Buzz 离线转录安装清单先核对机器条件系统Windows 10/11、macOSIntel 与 Apple Silicon 均可、Linux内存至少 4GB建议 8GB 以上模型越大越吃内存磁盘预留 1GB 以上空间含模型文件CPU需支持 AVX2 指令集很老的机器跑不了网络只在首次下载模型时需要安装文档里有各平台的详细说明按平台选一种安装方式平台安装方式Windows / macOS从官方发布页下载安装包或 DMG双击安装即可Linuxflatpak install flathub io.github.chidiilliams.Buzz改为flatpak install flathub io.github.chidiwilliams.Buzz或使用sudo snap install buzz开发环境Python 3.12 系统安装好 ffmpegpip install buzz-captions python -m buzzWindows 安装包未做签名安装时弹出安全提示点更多信息 → 仍要运行即可。首次启动后用Ctrl,打开偏好设置在模型标签页可以查看模型下载进度、确认模型存放目录。跟着任务走导入文件、跑出转录、调整与导出第一步导入文件点击左上角图标或CtrlO选择音视频文件MP3、WAV、FLAC、MP4、AVI 都支持也可以粘贴 YouTube 链接选择任务转录 / 翻译成英语并手动指定语言——自动检测只依据开头几秒音频容易判断错点Advanced...展开高级选项在 Initial prompt初始提示里填入容易拼错的专有名词点运行主界面显示任务队列、进度与状态支持一次导入多个文件排队处理第二步拿到结果状态变为 Completed 后双击该行进入转录查看窗口。窗口内可以全文搜索、拖动进度条逐句回放对照、调节播放速度适合先通读一遍再决定怎么改。第三步调整与导出转录时若勾选了词级时间戳Word-Level Timings为每个词记录时间点点Resize按钮可以按每行最大字符数重新合并字幕行并选择是否在标点处断开想字幕停留更久可以给每行末尾统一延长几秒且不会越过下一行的开始时间没有词级时间戳的结果也能调整只是只能按最大长度重新合并从导出菜单选择 TXT、SRT 或 VTT 保存多人录音点Identify speakersBuzz 会给每人的句子打上标签每个标签还能试听 10 秒音频核对身份后改真名并可选择合并同一人的连续语句。实时录音的动线类似选麦克风 → 设语言与质量 → 点 Record。录音期间可以打开演示窗口投屏显示文字在偏好设置里开启实时转录导出后文本会边生成边写入文件方便接 OBS 等直播工具。场景速写Buzz 转录的两个真实用法案例一采访素材的隔夜整理场景一天录了 3 小时采访第二天要用关键引语写稿做法晚上把 WAV 文件批量导入手动指定语言用 small 模型整晚跑完早上直接导出 TXT 摘录效果单小时音频从人工整理 2-4 小时压缩到模型运行 10-30 分钟案例二网课的中英双语字幕场景课程中文录制留学生需要英文字幕做法Buzz 转录中文并导出 SRT在转录查看窗口的工具栏点Translate配置一个支持 OpenAI 接口格式的翻译模型本地跑的也行生成英文版效果单集双语字幕制作时间约 30-60 分钟让效果再上一档模型选择与加速Buzz 内置多种推理后端与多个模型档位思路是档位越小越快越大越准。后端常用档位硬件条件适合场景Whisper.cppC 优化版tiny / base / small纯 CPU、集显均可实时录音、低配机器、MacFaster Whispermedium / large6GB 以上显存的 NVIDIA 卡大文件、追求精度WhisperOpenAI 原版任意吃内存、速度慢对照基准一般不选HuggingFace自定义 / PEFT / MMS 模型视模型而定针对特定语言的微调模型两个最值钱的进阶设置量化模型Whisper.cpp 支持 q5 等量化版本显存和内存占用明显下降速度更快在模型标签页下载时直接选NVIDIA 显卡加速PyPI 安装版需自行装带 CUDA 的 PyTorch 版本README 的 GPU support 一节有完整命令Windows 安装包已内置 GPU 支持要求 CUDA 12 机器是 16 线程时把环境变量BUZZ_WHISPERCPP_N_THREADS设为 8Whisper.cpp 转录速度约提升 15%线程开满反而更慢。踩坑手册离线转录的 3 个高频问题现象转录太慢10 分钟音频跑了半小时→ 原因模型档位太大或者在纯 CPU 上跑重模型 → 解法换 tiny/base 档位或 Whisper.cpp 后端有 N 卡就用 Faster Whisper批量任务可以改用命令行buzz add -t transcribe 音频文件挂后台现象识别不准专有名词总拼错→ 原因语言自动检测跑偏或模型档位不够、背景噪声大 → 解法手动指定语言Initial prompt 里写入专有名词重要内容升到 medium 以上档位嘈杂录音勾选Extract speech先分离出语音轨再转录现象启动就崩溃或模型下载总失败→ 原因模型文件下载不完整或已损坏 → 解法在偏好设置 → 模型里删掉该模型重新下载仍不行就用 Help → About Buzz → Show logs 查看日志定位FAQ 里也列了同类问题的处理方式动手清单4 步完成第一次转录装好 Buzz打开偏好设置的模型页下载 base 或 small 模型点导入一段 1 分钟以内的短音频手动指定语言导出格式选 SRT运行转录完成后双击结果对照音频播一遍确认质量要出字幕的话开启词级时间戳重跑一次用 Resize 设定每行最大字符数后导出更多参数对照文件导入文档实时录音的高级选项静音阈值、转录步长、显示模式在实时录音文档里。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表