Buzz 离线语音转文字:用本地 Whisper 把音频变成文字稿的完整指南
Buzz 离线语音转文字用本地 Whisper 把音频变成文字稿的完整指南【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzzBuzz 是一款在你自己电脑上离线完成语音转文字的工具基于 OpenAI 的 Whisper 模型可以把音频文件、视频文件和麦克风实时录音转成可编辑的文字稿整个过程不经过任何云端服务。它解决什么问题两个最常见的场景一是你手上有会议录音、采访或讲座的音频上传给在线转录服务意味着把敏感内容交给第三方而 Buzz 的全部计算都在本机完成文件不会离开你的电脑。二是你需要在无网络的现场比如出差途中、机房环境立刻把录音变成文字Buzz 只要提前把模型下载到本地之后可以完全断网使用。三步跑通最小流程第一步安装根据你的系统选一种方式# LinuxFlatpak 方式一条命令装好 flatpak install flathub io.github.chidiwilliams.Buzz # 或者 Snap 方式 sudo snap install buzz # 或者从 PyPI 安装先装好 ffmpeg且需要 Python 3.12 pip install buzz-captions python -m buzzmacOS 和 Windows 用户直接去官方发布页下载.dmg或安装程序双击安装即可Windows 安装包未做签名安装时出现警告选择更多信息 → 仍要运行。第二步首次运行打开 Buzz 后你会看到主界面上方一排是转录任务的状态栏下方是任务队列。第一次使用建议先在帮助 → 偏好设置 → 模型里确认已下载一个模型比如 small首次下载后模型会缓存在本地之后离线也能用。第三步拿到第一段文字按Ctrl/Cmd O或点工具栏的号选择一个 MP3、WAV 或 MP4 文件选择任务类型转录或翻译、语言建议手动指定别用自动检测和模型档位点Run等状态变成 Completed 后双击那一行就能看到带时间戳的文字稿可直接导出为 TXT、SRT 或 VTT场景和功能对照同一个 Buzz 覆盖的能力不同下面按场景列出对应功能和入口方便你按需查找你的场景对应功能操作入口把本地录音、视频变成文字文件转录支持音频和视频文件File 菜单 → Import Media File或 Ctrl/Cmd O会议、讲座边录边出文字 实时录音转录麦克风输入即时出稿选择录音任务、语言、麦克风后点 Record演讲、演示时现场展示实时字幕演示窗口Presentation window开始录音后出现的 Presentation window 选项外语录音转成英文或其他语言翻译任务Whisper 原生转英文其他语言可接 AI 模型导入时 Task 选 Translate或在转录结果页点 Translate嘈杂环境下准确率不够转写前先做人声分离提取人声轨道导入选项里勾选 Extract speech需要区分谁在说话说话人识别转录结果页的 speaker identification 入口剪辑视频要字幕文件字幕合并与时长调整Resize双击转录结果 → Resize 按钮新文件丢进去自动转文件夹监控Watch folder偏好设置 → Folder Watch 标签页给转录结果生成摘要、自动整理字幕插件系统AI summary、transcript resizer 等偏好设置 → Plugins 标签页参数怎么选参数主要分两层Whisper 后端类型和模型档位。后端类型决定跑在什么硬件上Whisper.cppC 实现速度快、内存省兼容各种 GPU 甚至纯 CPU官方建议实时录音优先用它没有 N 卡或 Mac 用户选它最稳Faster Whisper优化版比原生快很多适合有 6GB 以上显存的 N 卡Whisper原生最准确但慢且吃内存硬件强时再用HuggingFace支持大量第三方模型包括 Meta MMS 系列覆盖上千种语言OpenAI API唯一需要联网的后端用远端服务器跑识别需在偏好设置里填 key模型档位决定速度和准确率的平衡档位体积约建议用途tiny75MB快速预览、低配电脑base142MB日常对话速度与准确率的平衡点small466MB专业转录日常推荐档位medium1.5GB重要内容的长音频large2.9GB最高精度需要较强硬件处理慢决策建议先用 base 或 small 跑一遍你的实际音频听一下错字率够用了就别升级。large 系列内部还有 V2、V3 和 Turbo 变体V3 准确率最高但偶发编造词Turbo 侧重速度官方 FAQ 的建议是拿自己的语言实测对比见 docs/docs/faq.md。如果音频里有人名、术语在Advanced设置里填 Initial prompt能明显减少这类词的错拼。常见问题处理问题一转录太慢。原因语音识别计算量大模型档位或后端类型与你的硬件不匹配。 解法换更小的模型或改用 Whisper.cpp 后端有 6GB 以上显存的 N 卡可换 Faster Whisper。问题二打开录音功能报错如 PaErrorCode-9999或录不到声音。原因系统没有授权 Buzz 访问麦克风。 解法到系统隐私设置里开启麦克风权限Windows 是设置 → 隐私 → 麦克风确认 Buzz 在允许列表里。问题三Buzz 崩溃或启动失败。原因模型文件下载不完整或损坏。 解法在帮助 → 偏好设置 → 模型里删除对应模型重新下载。另外注意 Buzz 要求 CPU 支持 AVX2非常老的机器无法运行。还有一类常见需求完全离线环境使用。在有网电脑上下载好模型通过偏好设置 → 模型 → Show file location找到模型缓存目录Linux 为~/.cache/Buzz把整个目录拷到离线机器的相同位置即可仓库里也提供了 scripts/download-models.py 帮你批量准备离线模型包。进阶入口命令行Buzz 自带 CLI适合脚本化。例如一条命令用 Whisper.cpp 的 small 模型转录并直接导出 SRT 和 VTT 字幕文件buzz add --task transcribe --model-type whispercpp --model-size small --language zh --srt --vtt meeting.mp3加--hide-gui可以不弹主窗口后台运行完整参数列表见 docs/docs/cli.md。自动化在偏好设置的 Folder Watch 标签页配置一个监控文件夹之后凡是放进该文件夹的音频都会自动开始转录适合持续产出素材的工作流。工作流集成导出层支持 TXT纯文字、SRT/VTT剪辑工具字幕、JSON程序化处理实时录音开启导出后文字会实时写入文本文件可以直接喂给 OBS 这类直播软件做实时字幕。最后说几句Buzz 的定位很明确把 Whisper 的语音转文字能力完整搬到本地文件、视频、麦克风录音三类输入统一处理转完可编辑、可调字幕、可导出。三条上手建议先装一个 small 模型拿一段 5 分钟以内的音频跑通导入 → 转录 → 双击查看这条主线手动指定语言别依赖自动检测这是官方明确推荐的用法如果你有持续处理的文件配好 Folder Watch如果要写脚本直接用buzz add命令行【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考