十年匠心定制 · 商业建站与技术教学双线并行 咨询热线:400-886-1026 service@lmnt.cn
ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

Buzz 离线音频转录教程:从零开始完成本地语音转文字

Buzz 离线音频转录教程:从零开始完成本地语音转文字 Buzz 离线音频转录教程从零开始完成本地语音转文字【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzzBuzz 是一款免费开源的本地转录工具基于 OpenAI 的 Whisper 模型实现离线音频转录与语音转文字。全部计算在你的电脑上完成无需联网录音不会离开本机。本教程面向无音频处理基础的用户覆盖三平台安装、首次转录、模型选型、结果编辑导出以及批量自动化配置。Buzz 是什么Buzz 是一款完全在本地运行的离线转录工具内置 Whisper 语音识别引擎支持约 100 种语言可处理文件、实时麦克风音频和 YouTube 链接。与云端转录服务不同Buzz 不要求把音频上传到远程服务器——识别在本地完成只在你主动选择翻译任务并配置了对应 API 时才会产生外部请求。上手前准备清单安装前确认以下两项即可无需任何音频处理经验。平台支持Windows / macOSIntel 与 Apple Silicon/ Linux提供官方安装包通过 PyPI 安装的版本需要 Python 3.12 环境与 ffmpeg硬件与模型体积项目说明CPU需要支持 AVX2 指令集较老的处理器不受支持GPU可选。NVIDIA 显卡可启用 CUDA 加速Apple Silicon 与集显可经 Whisper.cpp 后端使用 Vulkan 加速模型体积tiny 最小约几十 MBlarge 最大数 GB 级首次使用时自动下载到本机缓存目录模型保存在用户缓存目录下如 Linux 的~/.cache/Buzz可手动拷贝到其他机器因此 Buzz 也可以完全离线使用。三平台安装方式安装文档详见 docs/installation.md。Windows 安装从官方发布页下载.exe安装包双击安装即可。应用未做签名系统弹出安全警告时选择更多信息再仍要运行。macOS 安装下载.dmg镜像文件将应用拖入 Applications 文件夹。Linux 安装Flatpak 或 Snap 二选一flatpak install flathub io.github.chidiwilliams.Buzz sudo snap install buzzSnap 方式建议先安装libportaudio2等运行库PyPI 安装方式pip install buzz-captions同样可用详见安装文档。完成第一次转录三种输入来源的入口都在主界面操作路径不同下面分开说明。转录本地音视频文件点击Import Media File菜单项或工具栏的按钮快捷键 Ctrl/CmdO选中 MP3、WAV、FLAC、MP4 等音频或视频文件选择任务类型转录或翻译成英文、语言和 Whisper 模型点击运行等待状态变为已完成双击任务行打开转录结果查看器实时录音转录在录音界面依次选择任务、语言、质量等级和麦克风点击记录开始Buzz 边收音边输出文字实时模式计算开销大建议使用 Whisper.cpp 后端并选择较小的模型需要时打开演示窗口可将实时文字投屏到大屏幕转录 YouTube 链接将视频链接粘贴为导入目标Buzz 会自动下载音轨其余步骤与本地文件相同选语言、选模型、点运行无需事先用其他工具下载视频模型与参数怎么选模型大小决定速度与精度的平衡按下表选型即可。模型体积适用场景tiny最小快速预览、低配电脑、实时录音base小日常使用速度与准确度折中small中精度要求较高的专业转录medium大高精度需求需要较强硬件large最大关键内容、多语言混合音频后端方面没有 NVIDIA 显卡的电脑包括所有 Mac选 Whisper.cpp它可运行在纯 CPU 上有 6GB 以上显存的 NVIDIA 显卡可考虑 faster-whisper速度提升明显。语言手动指定Buzz 支持自动检测语言但官方文档建议只要知道录音语言就手动指定语言代码如zh、en、ja这在很多情况下能明显提升准确率对方言或口音较重的音频尤其如此。初始提示Initial prompt在高级设置中填入容易识别错的术语、人名或机构名。例如转录医学讲座时列出相关术语可减少同音字误识。结果编辑与导出转录完成后在查看器中完成最后的修正与导出界面如下。时间轴调整直接修改每段字幕的起止时间文本修正逐段点击编辑识别错误的文字合并与拆分拆分过长的字幕段或合并间隔过短的相邻段导出支持 TXT、SRT、VTT、JSON 等格式分别对应文字稿、视频字幕与程序化处理做字幕时可用调整大小插件按标点自动切分长句、合并短段并设定每行目标长度批量与自动化命令行入口位于 buzz/cli.py完整参数见 CLI 文档。CLI 转录buzz add支持一次性传入多个文件或链接并可直接指定导出格式例如用 small 模型转录一个 MP4 并同时输出 SRT 与 VTTbuzz add -t transcribe -m whispercpp -s small \ --srt --vtt 视频文件.mp4文件夹监控在偏好设置的 Folder Watch 页启用监控指定输入与输出文件夹后新放入的音频会自动开始转录并可设置完成后自动删除源文件适合持续入库的录音。GPU 加速Windows 安装包内置 CUDA 12 支持Linux 上 NVIDIA 显卡开箱即用Mac 可通过 Whisper.cpp 使用 Apple Silicon 或核显加速。FAQ模型越大越好吗不一定。更大的模型更准但需要更多内存和更长时间日常对话用 base 或 small 通常已足够。最可靠的方法是用你自己的语言内容实测对比。一定要手动指定语言吗建议指定。自动检测依赖开头几秒的语音遇到口音、方言或混杂内容时容易判断错误手动选择语言代码可以稳定结果。音频质量对结果影响大吗影响明显。安静环境、音量稳定、使用外接麦克风都能提升准确率嘈杂音频可勾选提取语音选项先分离出人声再转录。Buzz 能完全离线使用吗可以。在有网机器上下载好所需模型把模型缓存文件夹整体拷贝到离线机器的相同位置Linux 为~/.cache/BuzzWindows 为%USERPROFILE%\AppData\Local\Buzz下的缓存目录即可。没有麦克风权限导致录音失败怎么办检查系统设置Windows 在设置 → 隐私 → 麦克风中确认允许 Buzz 访问麦克风其他系统同理确认应用权限未被拦截。收尾Buzz 将 Whisper 语音识别完整搬到本地文件、实时录音、YouTube 链接三种入口配合模型选型与编辑导出覆盖大多数离线转录需求。下一步建议用一段几分钟的音频完成一次完整转录熟悉导入与运行流程对比 tiny 与 small 两个模型选定适合你硬件的默认配置了解 CLI 文档 与 Folder Watch 配置为批量处理做准备【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表