十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Buzz 本地语音转文字全解:离线转录与批量字幕生成

Buzz 本地语音转文字全解:离线转录与批量字幕生成 Buzz 本地语音转文字全解离线转录与批量字幕生成【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz会议录音、采访素材、播客节目在线转录服务意味着音频要先上传到别人的服务器。Buzz 是一款本地语音转文字工具基于 OpenAI 的 Whisper 模型一种语音识别模型在你自己的电脑上完成离线转录与翻译数据不出本机。 项目速览Buzz 是跨平台的音频转录客户端支持 Windows、macOS、Linux 三大系统。它把音频、视频文件甚至 YouTube 链接转成带时间戳的文本可导出 TXT、SRT、VTT并内置麦克风实时转写与插件系统。项目说明功能定位离线本地语音转文字、实时录音转写、字幕生成与翻译技术栈/依赖Python PySide6 界面Whisper、Whisper.cpp、Faster Whisper 等转录后端依赖 ffmpeg许可证MIT适用人群做会议记录、播客字幕、课程剪辑的个人与团队 快速上手安装 ffmpeg。Buzz 靠它解析音频PyPI 安装方式必须先备好Debian/Ubuntu 用sudo apt install ffmpeg其他系统换对应包管理器。准备 Python 3.12 环境安装并启动 Buzz。Linux 用户也可用 Flatpak 或 Snap 直接装。pip install buzz-captions python -m buzz导入音频。按CtrlOmacOS 为CmdO选择文件可一次多选进入批量转录队列。配置任务。指定语言自动检测偶尔跑偏手动选更稳并在 偏好设置 → 模型 中下载一个模型如 Whisper.cpp 的 small。验证安装。点 Run 跑一个短音频状态变为 Completed 后双击该行能看到带时间戳的文本即环境正常。 核心功能拆解文件导入批量转录任务队列一次导入多个文件后Buzz 把它们排进任务队列逐个处理并显示进度长音频和短音频可以各配不同模型。按CtrlO或点工具栏 导入 MP3、MP4 等文件支持多选每个任务单独设置转录/翻译、语言与模型高级选项里可开按词计时每个词单独打时间戳方便拆字幕和语音分离先从噪声里分离人声支持 TXT、SRT、VTT 三种导出格式需要脚本化时CLI 与图形界面等价适合定时任务buzz add --task transcribe --model-type whispercpp --model-size small --language zh --srt ~/audio/interview.mp3批量任务在列表里各占一行、独立显示状态做完的双击即可进入编辑器开启文件夹监控后指定目录里新出现的音频会自动开转。麦克风实时转写与演示窗口会议、讲座需要边说边出字Buzz 直接录麦克风并滚动输出文本还能弹出独立的演示窗口投屏。选好任务、语言、麦克风后点 Record 开始实时模式三选一新句加下方、加上方或追加并纠错会回改上一句更费资源录音中点演示窗口弹出大字号独立窗口供现场观看官方建议实时场景用 Whisper.cpp 后端加小模型默认 Whisper 后端吃资源开启实时导出偏好后文本会边生成边写入 txt 文件译文另有.translated.txtOBS 这类推流工具可以直接读取实现直播字幕。模型与转录后端怎么挑模型越大越准也越慢。Buzz 支持 Whisper、Whisper.cpp、Faster Whisper、Hugging Face 四类后端同一套界面里按硬件切换。偏好设置 → 模型 页下载 tiny 到 large 各尺寸Whisper.cpp 还有 q_5 等量化版显存占用更低没有 NVIDIA 显卡选 Whisper.cppMac 首选可跑核显显存 6GB 以上选 Faster Whisper模型统一缓存在本地Linux 为~/.cache/Buzz整个目录拷走就能给无网机器用换后端、换模型不改任何工作流任务参数里切换即可转录查看器编辑、搜索与字幕重排原始转录总有错字和时间戳偏差查看器把音频播放和文本编辑合并在一个窗口里修正。双击任务打开查看器支持时间戳、纯文本、译文三种视图CtrlF全文搜索CtrlG跳到当前播放位置Ctrl←/→微调段落起止时间步进 0.5 秒可开段落循环播放点 Resize 按最大字幕长度和标点规则重排字幕开了按词计时的任务还能按静音间隙合并点 Identify speakers 给每句打说话人标签可试听 10 秒片段后改成真实姓名修正完直接导出 SRT、VTT、TXT、JSON字幕进剪辑软件即用。插件系统摘要、降噪与自动导出转录完成后还有一堆收尾活——摘要、降噪、导出 Word。Buzz 1.4.5 起内置插件系统在不动核心的前提下扩展流程。Help → Plugins里开关插件、拖拽调整执行顺序AI Summary 用 OpenAI 兼容接口生成摘要写入备注或存成文本文件DeepFilterNet 插件在转录前先本地降噪产出_DeepFilterNet3.wavExport to DOCX 导出 Word可带时间戳Skip Already Transcribed 对转过的文件直接跳过适合重复导入把转完再说的流程变成一键流水线参考 插件源码 还能写自己的插件。⚙️ 进阶调优与常见坑高级偏好通过环境变量设置启动前 export 即可配置项推荐值说明BUZZ_WHISPERCPP_N_THREADS核心数的一半Whisper.cpp 线程数16 线程机器设 8 可提速约 15%BUZZ_REDUCE_GPU_MEMORYtrue8bit 量化降低 GPU 显存占用BUZZ_FORCE_CPUtrue显卡慢或有故障时强制走 CPUBUZZ_MODEL_ROOT自定义目录改模型缓存位置便于无网部署统一分发BUZZ_DISABLE_TELEMETRYtrue关闭使用统计BUZZ_PARAGRAPH_SPLIT_TIME2000TXT 导出时按多长静音毫秒分段Q转录太慢怎么办A先换更小的模型或改用 Whisper.cpp 后端显存 6GB 以上可上 Faster Whisper实在慢就把识别交给 OpenAI API 远程执行。Q没有网络的机器能用吗A可以。在有网电脑上先下好模型把缓存目录Linux 为~/.cache/Buzz整体拷到离线机器同位置模型下载脚本 可以提前备好模型包。Q启动或转录时闪退A多半是模型文件没下完整去 偏好设置 → 模型 删除重下仍不行就通过 Help → About Buzz → Show logs 看日志。另外 CPU 必须支持 AVX2太老的机器跑不了。Q录音时报错 PaErrorCode-9999A检查系统是否允许应用使用麦克风。Windows 在设置 → 隐私 → 麦克风里给 Buzz 授权并可临时关掉杀毒软件测试。Qlarge 系列模型怎么选ALarge-V2 最稳Large-V3 精度最高但偶发幻听读出音频里没有的词Turbo 偏重速度精度平衡。最可靠的做法是拿自己的语言实测对比详见 官方 FAQ。✍️ 写在最后Buzz 把语音转文字的整条链路——转录、翻译、编辑、导出、自动化——收进一个本地应用敏感音频不必离开你的电脑。建议下一步用一段 5 分钟的会议录音跑通导入 → 转录 → 导出 SRT再换更大的模型对比准确率为不同场景各留一个配置。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表