拓冰建站拓冰建站
首页 / 资讯中心 / 正文

Buzz 离线语音转文字快速教程:3 步把音频变成 SRT 字幕

Buzz 离线语音转文字快速教程3 步把音频变成 SRT 字幕【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz最近要给一份讲座视频配字幕。发云端服务得先上传、再按分钟计费纯手打又至少两小时。最后我装了 Buzz——一款免费的离线语音转文字工具它把 OpenAI 的 Whisper 模型跑在你本机音频全程不出设备。这篇是我两周使用下来的完整记录从给视频上字幕到整理多人会议再接上自动化流水线。场景一给视频配字幕从原始音频到成片 SRT先说安装一句话带过到项目发布页下载对应系统的安装包。Windows 是 exe安装包未签名弹窗时点更多信息 → 仍要运行即可macOS 是 dmg注意新版仅支持 Apple 芯片最后支持 Intel Mac 的版本是 1.4.5Linux 走 Snap 或 Flatpaksudo snap install buzz如果你习惯命令行也可以直接从 PyPI 装需要 Python 3.12 并预装 ffmpegpip install buzz-captions python -m buzz装好后出字幕就是三步导入文件点左上角添加选本地音频或视频也可以直接粘贴 YouTube 链接选模型和任务下拉选 Whisper 模型任务选转录或翻译成英文点运行任务排队处理列表里状态从 Queued 走到 In Progress 再到 Completed多文件并行也不慌完成后打开导出菜单TXT、SRT、VTT、JSON 都能选SRT 和 VTT 可以直接丢进剪辑软件。如果完全不想碰界面还有 CLI 一行搞定比如用 Whisper.cpp 的 small 模型转一段视频并同时输出两种字幕buzz add --model-type whispercpp --model-size small --srt --vtt presentation.mp4全部命令行参数语言、词级时间戳、输出目录等见 CLI 文档。主界面任务列表每一行对应一个文件可看到模型、任务类型与实时状态场景二多人会议录音先分清谁说了什么单人讲座只需要字对但两小时的会议录音还得回答谁说的。转录完成后双击列表里的那一行进入查看器点Identify speakers可以选 Auto 自动检测也可以直接指定人数——你知道实际几个人时手动指定能避免安静的声音被并进别人名下。识别完每句都有标签还能试听任意一句的前 10 秒把说话人 1改成真名勾选Merge speaker sentences后同一人连续的段落会合并成一段稿子干净很多。注意该功能在 Intel 版 macOS 上不可用细节见说话人识别文档。查看器本身也是个校对台搜索定位CtrlF 直接跳到你想核对的那段讨论边放边读底部播放器支持变速CtrlG 让文字跟随音频滚动就地改错发现识别错误直接改自动保存快捷键和循环播放、段落跟随等完整能力见转录查看器文档。转录查看器里每句话都带精确的起止时间可边播放音频边校对场景三还没有文件实时录音转写与文件夹自动转录第三种用法是录音都还没有。插上麦克风点录制说出来的话就实时变成文字还带一个适合投屏的演示窗口做活动字幕、现场采访都能用。这里要说实话官方文档明确写了实时转写比较吃资源可能无法完全实时它更适合做会议记录和访谈整理不适合当毫秒级直播字幕用。开启Live transcript exports后文字还会实时写进 txt 文件可以直接喂给 OBS 当字幕源。批量场景则有文件夹监控在设置里指定一个目录之后丢进去的新音频自动转录全自动流水线不费手。还有个容易被忽略的点翻译可以接任何 OpenAI 兼容 API包括本地跑的 Ollama、LM Studio把转录结果翻成别的语言也能全程离线。让 Buzz 离线语音转文字出片的关键模型怎么选、字幕断行怎么调出片质量主要看两个旋钮模型和断行。模型大小分档我的经验是按用途挑档位定位Tiny / Base速度快适合草稿或老机器Small / Medium速度和准确度的平衡点日常默认LargeV2/V3/Turbo准确度最高V3 多数情况最好但偶尔会幻听出不存在的词官方 FAQ 的建议很实在哪种模型最适合你的语言唯一的确定方法是都测一遍原文见FAQ。同一个模型还能换后端跑Whisper.cppC 实现Vulkan 能用任意品牌 GPU纯 CPU 也行Mac 和 AMD 用户首选Faster Whisper比原版快很多但要求 Nvidia 显卡有至少 6GB 显存Hugging Face能跑 Whisper 之外的模型如支持 1000 语言的 Meta MMS 系列Whisper.cpp 还支持自定义模型和 q_5 这类量化版模型管理就在偏好设置里下载、删除、贴自定义 .bin 模型链接都在这里模型管理页可下载和切换不同 Whisper 模型也能添加本地 .bin 自定义模型断行对应查看器里的Resize按钮。如果转录时勾了词级时间戳word-level timings可以设字幕最大字符数、指定按标点断句Buzz 会自动把长行拆开并结合音频里的静音间隙优化字幕边界还能给每条字幕统一延长显示秒数。细节见编辑与 Resize 文档。音频环境吵的话转录前还有个先分离语音再转的预处理开关能明显提升识别率。Resize 面板按最大长度、标点和音频静音间隙重组字幕断行顺带说个好消息Buzz 可以完全离线使用——在联网机器上把模型下载好把 models 文件夹整个拷到离线机器的同一位置Linux 下是~/.cache/Buzz仓库里还带了离线模型准备脚本 scripts/download-models.py。适合谁一张短清单适合隐私敏感客户访谈、会议纪要、合同录音全程不出设备批量处理CLI 加文件夹监控把转录变成定时任务无网环境飞机上、现场机房都能转前提是提前备好模型不适合太老的机器CPU 不支持 AVX2 就跑不起来弱机器想要实时字幕实时转写吃资源官方明确说可能不实时追求云端级一次成型大模型在纯 CPU 上偏慢值得掂量要不要上 GPU 加速想上手的话最短的路径就是把代码拉下来看一眼git clone https://gitcode.com/GitHub_Trending/buz/buzz或者装个 Snap 一条命令。找份旧录音试一把十分钟就能拿到你的第一份字幕。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门