Buzz 本地音频转录完全指南:从安装到批量处理的上手教程
Buzz 本地音频转录完全指南从安装到批量处理的上手教程【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz一段 30 分钟的采访录音如何在电脑上变成文字稿这一节用一个具体场景帮你理解 Buzz 能做什么。你刚结束一场 30 分钟的采访录音存在手机或笔记本里希望当天晚上就拿到一份可编辑的文字稿。用 Buzz你不需要把文件上传到任何服务器也不需要注册账号或按分钟付费打开软件导入这个 MP3 文件点一下运行Buzz 就在你自己的电脑上用 Whisper 模型完成转录。Buzz 是什么免费开源的本地离线转录工具这里用一段话说清楚 Buzz 的定位Buzz 是一款基于 OpenAI Whisper 的开源音频转录工具MIT 协议支持 Windows、macOS 和 Linux全部计算在本地完成录音文件不离开你的设备。它既能转录音频和视频文件也支持麦克风实时录音转录。和常见的云端转录服务相比差别如下对比维度云端转录服务Buzz 本地转录数据去向文件上传到服务器全程在本机处理网络要求必须联网首次下载模型后可离线使用费用按使用量收费免费无订阅限制常有文件大小和次数限制无文件大小限制格式支持取决于服务商依赖 ffmpeg覆盖绝大多数音视频格式离线使用有一个前提模型文件需要先下载一次。如果你要在完全断网的机器上用可以在有网电脑上下载好模型再拷贝过去仓库里的 scripts/download-models.py 就是为准备离线模型缓存写的脚本。安装 BuzzmacOS、Windows、Linux 三种方式这一节给你每个平台最常用的安装方式一条命令装完。macOS如果装了 Homebrew一条命令即可brew install --cask buzzWindows下载官方安装程序.exe双击运行。软件没有做签名安装时系统会弹出警告选择更多信息里的仍要运行即可。LinuxFlatpak 和 Snap 都支持推荐 Flatpakflatpak install flathub io.github.chidiwilliams.Buzz习惯命令行或想自己打包 Python 环境先装好 ffmpeg再执行pip install buzz-captions python -m buzz第一次转录从导入文件到导出字幕这一节带你完整走通第一个文件从导入到导出字幕全程大约一两分钟。导入音频文件打开 Buzz 后点工具栏左上角的图标或菜单 File 里的 Import Media File快捷键 Ctrl/Cmd O选中你的音频或视频文件。MP3、WAV、M4A、FLAC、MP4、MOV 等常见格式都可以也支持粘贴 YouTube 链接直接导入。选择任务、语言和模型文件右侧会出现三个下拉框第一次使用按下面的推荐配置即可任务类型Transcribe按原语言转成文字。只有当你要把外语内容转成英文时才选 Translate to English。语言知道音频语言时直接选比如中文选 Chinese比自动检测更准只有不确定时才用 Detect Language。模型日常使用选 small。它速度、准确率、内存占用的平衡最好约 2GB 内存就能跑。如果音频里经常出现特定的人名、专业术语点Advanced...按钮在 Initial prompt 里把这些词写进去可以明显减少听写错误。运行并查看、导出结果点 Run运行后任务列表里会出现这一行任务状态从排队、转录中变为 Completed。双击这一行打开转录查看器在这里你可以播放音频并对照文字逐句检查、直接编辑文本、搜索关键词还能调整倍速。确认无误后导出导入时选中的 Export As 格式就是导出格式TXT纯文本、SRT字幕、VTT网页字幕三选一做视频字幕就选 SRT 或 VTT。如何选择合适的转录模型速度、准确率与内存的权衡模型大小决定了Buzz本地转录的速度和内存消耗五个档位大致如下模型速度准确率内存占用适合场景tiny最快基础约 0.5GB快速预览、低配设备base快良好约 1GB日常随手转small中等优秀约 2GB推荐默认档位medium较慢非常好约 5GB重要会议、专业内容large最慢最佳约 10GB学术级要求、不差时间推荐日常一律用 small会议录音、采访这类不能返工的音频用 medium 多花一倍时间换准确率是值得的。另外 Buzz 不止一种 Whisper 实现NVIDIA 显卡选 Faster Whisper 能快很多没有独立显卡或 Mac 上选 Whisper.cpp它对集显和 CPU 都很友好也是实时录音场景的推荐后端。模型的下载、删除都在偏好设置的 Models 页里管理实时录音转录边开会边出文字Buzz 的另一个核心能力是把麦克风输入实时转成文字适合会议、讲座、采访这类需要现场出记录的场景。用法在顶部切换到 Live Recording选好语言、模型和麦克风点 Record 开始。文字会一边录音一边追加录完直接保存。官方文档特别提示默认 Whisper 后端实时转录比较吃资源实时场景建议改用 Whisper.cpp 并选更小的模型这样普通笔记本也能跟上。两个值得知道的细节演示窗口录音开始后可打开 Presentation window把实时文字大字显示出来演讲和活动现场很实用。转录模式偏好设置里可切换 Append below新句子追加在下方、Append above新句子置顶和 Append and correct追加并回头修正上一句第三种效果最好但更耗性能。批量处理文件夹监控与命令行如果你有大量文件要处理手动逐个导入太慢Buzz 提供了两条自动化路径。文件夹监控在偏好设置的 Folder Watch 里指定一个文件夹之后放进该文件夹的音频文件会自动排队转录适合录音笔每晚自动同步这类工作流。命令行Buzz 自带 CLI可以用buzz add加参数指定任务、语言、模型和输出格式TXT/SRT/VTT写进脚本就能实现无人值守的批量转录详细说明见仓库文档目录 docs/docs/cli.md。提高转录准确率的实用建议这一节汇总几个被反复验证有效的做法。给上下文提示Initial prompt 里写人名、术语、常见口误词是成本最低的提准手段。降噪后再转音频质量差时先做降噪和人声分离Buzz 自带的 Extract speech 选项也相当于转录前把语音单独提出来。长音频分段超过一小时的录音建议切成几段分别处理出错时不用整段重跑。固定语言别偷懒用自动检测知道语言就一定手选自动检测只根据开头几秒判断容易选错。中英混合内容这类内容用英语模型识别效果通常更好也可以把 Initial prompt 写成中英混合的示例句引导模型输出对应语言。Whisper 体系支持约 99 种语言主流语言覆盖没问题如果你需要更多语言Hugging Face 后端还能接入 Meta MMS 等支持上千种语言的模型。避坑清单慢、卡、报错时依次检查什么遇到问题时按这个顺序排查能解决大多数情况转录太慢先把模型从 large/medium 降到 small再换 Whisper.cpp 或 Faster Whisper 后端关闭 Word-Level Timings逐词时间戳选项它会明显拖慢速度。内存不够换 tiny 或 base 模型同时把并发任务数调小。导入格式失败Buzz 依赖 ffmpeg 解析文件确认 ffmpeg 是较新版本、文件没有损坏。录音报错 PaErrorCode-9999检查系统隐私设置里 Buzz 是否有麦克风权限Windows 在 设置 → 隐私 → 麦克风。崩溃且日志提示模型异常多半是模型下载不完整到偏好设置 Models 页删除后重新下载。完全没网的环境在有网电脑上下载模型拷贝到离线机的模型目录Linux 是~/.cache/Buzz。老电脑打不开Buzz 要求 CPU 支持 AVX2太旧的机器不支持。几个进阶项可以顺手配置NVIDIA 显卡在 Linux 上开箱支持 CUDAWindows 安装包内置了 GPU 支持偏好设置里能自定义快捷键、给导出文件设命名模板支持{{ input_file_name }}、{{ task }}、{{ date_time }}等变量。更多细节看仓库的官方文档目录 docs/docs/遇到代码层面的问题可以查核心模块 buzz/transcriber/ 或到项目 Issues 里反馈。适合谁用以及下一步Buzz 适合三类人一是处理客户、患者等隐私内容的专业人士数据不出设备是硬性需求二是经常做会议记录、讲座笔记、采访整理的人实时转录和批量处理能省下大量整理时间三是做视频字幕、播客文稿的内容创作者SRT/VTT 导出直接对接剪辑软件。如果你的需求恰好是本地、免费、多平台的音频转录它就覆盖到了。下一步按上面安装 Buzz一节给你的系统装上它然后打开仓库文档目录 docs/docs/index.md 对照自己的场景读一遍使用章节第一个文件的转录通常十分钟之内就能跑通。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考