十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Buzz 音频转录完整指南:本地部署 Whisper,一条命令开始语音转文字

Buzz 音频转录完整指南:本地部署 Whisper,一条命令开始语音转文字 Buzz 音频转录完整指南本地部署 Whisper一条命令开始语音转文字【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzzBuzz 是一款基于 OpenAI Whisper 的本地语音转文字工具它把模型直接装在你电脑上音频文件、麦克风录音和网页链接都能在离线状态下转录成带时间戳的文字还支持翻译成英文。数据不出本机、不收 API 账单、不限调用次数这是它最值得上手的地方。整个处理链路很简单音频输入 → 预处理 → Whisper 推理 → 后处理 → 导出你不需要理解细节只需要会点按钮。为什么音频转录要搬到本地结论先说怕录音内容泄露、常断网、或不想被 API 额度卡住的人本地部署是更稳的选择。把两种方案放在一起看差异很清楚维度云端 API 转录Buzz 本地部署隐私音频上传到第三方服务器文件始终留在本机网络必须联网弱网即失败模型下载一次后即可完全离线使用用量限制按分钟计费或有调用配额无限制转多久都行速度受网络波动影响取决于本地硬件可复现Buzz 支持 99 种语言的转录也支持把任意语言翻译成英文模型自动下载并缓存在本地各平台的缓存位置可在 docs/docs/faq.md 查到断网环境照样能跑。四大平台安装速查安装本身一条命令就够唯一的公共前置是装好 ffmpeg——Buzz 靠它解码音频。Windowswinget install ChidiWilliams.BuzzmacOSbrew install --cask buzzLinuxFlatpak 或 Snapflatpak install flathub io.github.chidiwilliams.Buzz sudo snap install buzz源码 / PyPI 安装先装好 ffmpegUbuntu 用sudo apt install ffmpeg再执行pip install buzz-captions python -m buzzNvidia 显卡用户装好 CUDA 版的 PyTorch 即可获得 GPU 加速具体步骤参考 docs/docs/faq.md 的 GPU 部分。第一条转录跑起来四步就能看到结果建议第一次就用 tiny 模型出结果最快打开 Buzz点击导入文件快捷键CtrlO选一个音频或视频文件。在转录选项里确认模型为 tiny、语言选自动检测。点击开始转录首次运行会自动下载模型耐心等待一次。任务完成后双击列表中的转录记录即可查看带时间戳的全文。上图就是 Buzz 的文件转录界面左侧导入文件右侧是转录任务列表所有后续操作都从这里出发。文件、录音、URL 三种入口怎么选三种入口覆盖几乎所有场景按素材来源对号入座即可。转录本地文件适合已有的录音、播客、会议录像等成品文件。CtrlO导入一个或多个文件支持批量设置语言、任务类型转录或翻译成英文和模型开始转录输出 TXT/SRT/VTT 保存在源文件同目录。录音实时转录适合会议、讲座、采访等正在发生的内容。点击顶部麦克风按钮进入录音界面选择输入设备点红色录制按钮开始过程中可随时暂停跳过无关片段停止后自动保存录音音频和转录文本。导入 URL适合 YouTube 等可直接下载链接的内容免去手动下载视频。工具栏选择导入 URL粘贴链接Buzz 下载媒体文件后按任务队列正常排队处理后续操作与本地文件完全一致。Buzz 模型怎么选准确率与速度的权衡选型的唯一权衡就是速度换精度小模型跑得快但错得多大模型准但吃内存、跑得慢。模型速度精度内存需求适合谁tiny最快基础1 GB快速预览、低配电脑base快良好~1 GB日常速记small中等优秀~2 GB多数人的默认选择medium较慢非常好~5 GB专业内容large最慢最佳~10 GB关键内容、嘈杂音频除了尺寸还有三个参数直接决定准确率温度默认是一组递增的后备值。清晰人声用低温度更稳环境吵、口音重时适当调高给模型更多重试机会。初始提示转录专业内容时把术语表写进初始提示如本次涉及心电图、心肌梗死等术语模型会优先识别这些词。手动指定语言混合语言内容建议直接指定主语言比自动检测更可靠。这些参数都在首选项 → 模型页维护模型文件由 buzz/model_loader.py 统一下载和缓存。另外 Whisper.cpp 引擎在纯 CPU 和 Mac 上表现最好有 6 GB 以上显存的 Nvidia 显卡则建议用 faster-whisper。从草稿到成品Buzz 的转录查看器支持搜索、播放控制并允许精修到单词级时间戳拖拽片段边缘或直接改时间值修正不准确的起止点双击文本直接编辑改错字、补标点合并或拆分片段让段落更自然通过导出菜单输出 TXT、SRT、VTT 三种格式文件名模板可在首选项里自定义。转录完的长视频可以用分段调整功能把一条大段落切细字幕就不会挤成一坨Buzz 批量转录文件夹监控与命令行处理一整批文件时别再手动点。打开 帮助 → 首选项 → 文件转录勾选启用文件夹监控选好输入文件夹和输出文件夹按需勾选删除已处理文件在同一页面配置好默认模型、语言等转录选项之后丢进输入目录的新文件会被自动处理。监控逻辑实现在 buzz/widgets/transcription_task_folder_watcher.py。更喜欢脚本化的人直接用 CLI完整参数见 docs/docs/cli.md# 转录单条文件并直接导出 SRT buzz add --model-type whispercpp --model-size small --srt ./meeting.mp3 # 批量转录多个文件 buzz add --model-size medium --language zh ./a.mp3 ./b.mp3排错速查现象、原因与动作 遇到问题先对照这张表能解决大部分常见状况现象可能原因你的动作转录速度太慢模型太大或纯 CPU 运行换 tiny/base 模型Nvidia 显卡装 faster-whisper其他机器换 Whisper.cpp内存占用大large/medium 模型吃显存降一档模型减少同时入队的任务数识别错误多模型小、音频吵或领域词陌生换更大模型写入术语初始提示先降噪某格式导入失败未装 ffmpeg 或版本过旧安装最新版 ffmpeg 后重试启动或转录时崩溃模型文件下载不完整首选项 → 模型中删除后重新下载还不行就看 帮助 → 关于 Buzz → 显示日志提示 CPU 不支持老机器没有 AVX2 指令集硬件限制需更换支持 AVX2 的电脑更多细节离线环境搬运模型、系统录音等见 docs/docs/faq.md。写在最后Buzz 把 Whisper 本地部署做成了普通用户也能上手的程度一条命令装好四个步骤转出第一条文字之后靠模型、温度、初始提示三个旋钮调质量最后用文件夹监控和 CLI 把重复劳动交给机器。会议录音、课程录像、访谈整理这些场景里它都能离线顶用。项目仍在持续迭代多说话人分离等能力也在路上如果你愿意修 bug 或加功能可以从 CONTRIBUTING.md 开始。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表