拓冰建站拓冰建站
首页 / 资讯中心 / 正文

Buzz实战:免费离线音频转录与语音转文字的完整指南

Buzz实战免费离线音频转录与语音转文字的完整指南【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzzBuzz是一款基于 OpenAI Whisper 的免费开源离线转录工具完全运行在你自己的电脑上能把会议录音、播客音频、视频转成文字并导出为字幕文件无需上传云端。本文面向新手带它走一遍安装、日常使用、模型选择和常见问题。会议和播客的语音转文字为什么值得用离线方案处理大量音频内容第一痛点是手动整理一小时的会议录音靠人敲纪要往往要半天。改用在线服务又带来两个问题——文件要先上传敏感内容存在外泄风险部分功能按使用量收费。Buzz 的思路是把模型放到你自己的机器上音频不出设备转录和翻译都在本地完成完全断网的环境下也可以把模型文件拷贝过去继续转录三大平台覆盖支持 MacIntel 与 Apple silicon、Windows、Linux后端可替换Whisper、Faster Whisper、Whisper.cpp、Hugging Face 模型可选从核显笔记本到独显工作站都能适配Buzz怎么安装三种系统与命令行的四条路径按使用习惯挑一条即可macOS / Windows新手推荐从官方发布页下载 .dmg 或安装程序Windows 安装时会提示未签名警告点更多信息 → 仍要运行即可Linux 包管理器flatpak install flathub io.github.chidiwilliams.Buzz也可用 Snapsudo snap install buzz命令行安装适合开发者先装好 Python 3.12 和 ffmpeg再执行pip install buzz-captions python -m buzz源码方式源码开放想查看实现或二次开发时先准备 Python 3.12 与 ffmpeg然后git clone https://gitcode.com/GitHub_Trending/buz/buzzNvidia 显卡用户如果用 PyPI 版本还需按官方说明安装对应 CUDA 版本的 torch 才能启用 GPU 加速。Buzz 的转录流程盘点从导入文件到导出结果转录流程文件、链接与实时录音导入 MP3、WAV、FLAC 音频和 MP4 等视频自动抽取音轨也支持直接填 YouTube 链接麦克风实时录音转录默认 20 秒延迟可在设置里调整监视文件夹功能自动转录新增文件适合批量处理提供 命令行接口buzz add用于脚本与自动化翻译与多语言从译成英文到任意语言 AI 翻译内置 Whisper 翻译任务可把外语语音直接转成英文文本可接入任何 OpenAI API 兼容服务ChatGPT、Claude、Gemini或 Ollama 这类本地服务把文本翻译成任意语言实时录音与已转录的文件都可用配合演示窗口可以在活动现场边说边显示译文结果查看与编辑带时间戳的转录查看器文本搜索、播放控制、倍速调节按时间戳拆分或合并段落修正字幕时间轴说话人识别自动标注不同发言者可试听 10 秒语音片段并改成真实姓名导出 TXT / SRT / VTT 三种格式插件与自动化内置插件系统提供 AI 摘要、自动段落调整、语音分离Demucs等能力嘈杂录音先做语音分离再转录准确率会有提升。插件源码见 buzz/plugins/。Whisper 模型怎么选离线转录速查表先选后端再选模型大小后端适用硬件特点WhisperOpenAI通用精度基准实现速度慢、吃内存Faster Whisper6GB 以上显存的 N 卡速度比 Whisper 快很多Whisper.cpp无 N 卡 / Mac / 核显支持 Vulkan核显笔记本可跑是 Mac 的首选Hugging Face 模型通用支持语言专项社区模型、MMS1000 语言、Parakeet 等模型大小从 tiny 到 large越小越快但准确率越低large-v2更稳定large-v3精度更高但偶尔会脑补不存在的词turbo在速度和精度之间取平衡。名字带.En的模型只支持英语。实操调优建议速度不够时先降级模型大小或换 Whisper.cpp再考虑 GPU明确知道语言时手动指定比自动检测准确率更好Linux 的 N 卡开箱即有 CUDA 支持Windows 安装包自带 CUDA 12三个常见用法会议纪要、视频字幕、现场演示会议纪要把录音加入任务列表并选好模型 → 转录完成后打开查看器 → 用说话人识别给每位发言人打标 → 导出 TXT 或 SRT。视频字幕导入 MP4 自动抽取音轨 → 转录后导出 SRT/VTT 直接进剪辑软件 → 用段落调整器修正时间轴长度。现场演示选好麦克风开始录音 → 打开演示窗口实时显示转录内容延迟可调。学语言时也可以转录外语播客边播放边对照原文。常见问题转录很慢降低模型档位或改用 Whisper.cpp有 6GB 以上显存的 N 卡可以切到 Faster Whisper本地实在扛不住时也可以接 OpenAI API。准确率不高在安静环境录音、手动指定语言、换更大的模型特别吵的音频先开语音分离。支持哪些语言覆盖 Whisper 的全部语言中文、英文、日文、西班牙文等约 99 种通过 Hugging Face 的 MMS 模型还能扩展到更多语言。能完全断网使用吗可以。先在有网机器上下载模型再把模型缓存目录拷到离线机器也可以用 scripts/download-models.py 提前生成模型缓存。Buzz 的功能清单与 CLI 参数详见仓库内的 docs/docs/index.md 和 docs/docs/faq.md。项目仍在持续更新高级编辑工具与更多社区模型在陆续接入作为一台本地语音转文字工具它目前的能力已经足够覆盖日常会议、字幕制作与语言学习的使用场景。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门