拓冰建站拓冰建站
首页 / 资讯中心 / 正文

Buzz 离线音频转录完整指南:一条录音到字幕导出的快速上手

Buzz 离线音频转录完整指南一条录音到字幕导出的快速上手【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz你录下十分钟的会议Buzz 把它变成一份完整的文字稿。Buzz 是一款离线音频转录工具它调用 OpenAI 的 Whisper 模型把整个转录过程放在你自己的电脑上完成一个字节音频都不会上传到任何云服务器。使用免费代码开源覆盖 Mac、Windows 与 Linux。你的音频到底去了哪里云端转录服务和本地转录最本质的区别只有一条音频文件必须先上传到别人的服务器。会议录音、采访原声、内部培训资料在传输链路上都可能被第三方读到。Buzz 的路径相反音频不出本机模型在本地运行结果写进本地文件。两种方式摆在一起看维度音频上云的转录服务Buzz 本地转录音频存放位置第三方服务器自己的磁盘断网能否用不能能计费方式按时长或订阅无费用速度上限网络与排队你自己的硬件唯一的代价是首次要下载一次 Whisper 模型较小的规格只有几百 MB之后便可完全离线工作。五分钟安装 Buzz 并跑通第一条录音安装方式因系统而异macOS 直接下载 .dmg 安装Windows 用官方安装包程序未签名系统拦截时点更多信息 → 仍要运行Linux 用 Flatpakflatpak install flathub io.github.chidiwilliams.Buzz或 Snapsudo snap install buzz。偏好源码环境的话在 Python 3.12 下执行pip install buzz-captions再运行python -m buzz前提是装好 ffmpeg。打开程序后最短路径只有三步把音频或视频文件MP3、WAV、M4A、FLAC、MP4 等拖进主界面也可以粘贴链接导入在新建任务面板选一个模型首次保持默认即可语言保持自动检测点击开始任务在表格里从排队走到完成点开对应行就能看到文字并导出。走到这里你就走完了文件进、文字出的全程。导出文件名的默认模板定义在 buzz/settings/settings.py可在首选项里按自己的习惯改。离线转录怎么提速模型规格与硬件加速按用途选模型规格Whisper 模型的规格决定了显存、内存与准确率之间的权衡tiny / base出字快、资源占用低适合试水和粗稿small / medium平衡点日常会议与采访素材选这里large准确率最高但内存需求在 8GB 上下留给重要存档素材。让硬件替你干活Buzz 接了多种后端NVIDIA 显卡可走 CUDA 加速Mac 的 Apple Silicon 有原生支持其余显卡包括集显可切换到 whisper.cpp 后端获得 Vulkan 加速。几条实操经验8GB 内存的机器停留在 base 到 small 档位转录时把其他占内存的应用关掉启用 GPU 后medium 模型处理长录音通常快于音频时长GPU 没被识别时先更新显卡驱动PyPI 安装版还需要自己装 CUDA 版 torch 才能用上加速。Buzz 能干的三件事字幕、多语言、现场录音视频做字幕从导入到 SRT把课程录像直接拖进来Buzz 会先抽出音轨再转录完成后打开转录编辑器可以边播放边校对文字拖动时间轴对齐片段。字幕行太长时用字幕调整工具按时间间隔合并、按标点拆句最后导出 SRT 或 VTT直接丢进剪辑软件。外语材料先转写再翻译源语言选自动检测Buzz 会自己判断语种勾选翻译任务后除原语言转写外还会额外产出一份英文译文Whisper 内置的翻译方向。转录环节本身依旧完全在本地完成翻译结果不满意时再人工修正即可。现场录音与投屏。Buzz 支持麦克风实时转写选好录音设备后点击开始屏幕上的文字随讲话滚动更新。它还有一个专门的演示窗口讲座或活动现场可以把实时字幕投到大屏幕上长录音可以设置静音阈值让段落按停顿自动切分。Buzz 装不上或转不动五个现象对应五招装完打不开或启动即崩多半缺依赖。PyPI 版需要先装 ffmpegLinux 还需libportaudio2等音频运行库。Windows 弹安全警告官方 Windows 包未签名点更多信息 → 仍要运行即可属正常现象。模型下载一直失败先查网络也可以手动把模型文件放到 Buzz 的缓存目录里程序会直接复用。转录速度慢先降一档模型规格再确认 GPU 后端真的启用了看后端是否显示 Vulkan/CUDA 而不是 CPU。准确率上不去先听原声——噪音大就先启用转录前的语音分离选项把底噪去掉再考虑换更大的模型。再往前一步插件、命令行与文件夹监控Buzz 带一个插件系统buzz/plugins/ 目录里内置了若干开箱即用的扩展AI 摘要、转录自动整理、DeepFilterNet 降噪、说话人识别、DOCX 导出等在插件对话框里按需启用。批量场景走命令行。核心是add命令把文件入队并指定模型、语言与输出格式python -m buzz add --model-size base --language zh --srt interview.mp3另外在首选项里配置一个文件夹监控目录新文件落进去就自动排队转录。这两样组合起来每晚自动处理当天新录音这类流程不难搭。把数据留在自己手里Buzz 的价值可以用一句话概括从音频到文字每一步都在你的控制之下。模型在你的机器上文件在你的磁盘里代码开源任何人可以审查数据去了哪里。对经常打交会议录音、采访素材这类敏感音频的人来说这一点比任何速度指标都更值钱。源码仓库git clone https://gitcode.com/GitHub_Trending/buz/buzz问题与改进都欢迎提。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门