Buzz 免费离线语音转文字完全指南:把音频转录装进你自己的电脑
Buzz 免费离线语音转文字完全指南把音频转录装进你自己的电脑【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzzBuzz 是一个免费开源的本地音频转录工具基于 OpenAI 的 Whisper 模型一种把语音变成文字的 AI 模型工作。它在你自己的电脑上离线运行音频不用上传到任何服务器支持 99 种以上语言装好几分钟就能把录音变成可编辑的文字稿。它到底能做什么转录音频、视频文件和 YouTube 链接不用先把视频下成音频麦克风实时录音转文字边说边出字还能开一个演讲模式大窗口转录完可以直接翻译成英语也能导出 TXT、SRT、VTT 字幕格式嘈杂录音可先做语音分离把人声从噪音里抠出来再转录准确率更高支持多种 Whisper 引擎默认 Whisper、更轻量的 Whisper.cpp、支持 NVIDIA 显卡加速的 Faster Whisper带命令行接口和文件夹监控能接进自动化脚本更多细节可以看官方文档 docs/docs/usage/。三步装好 BuzzWindows去 Buzz 的发布页面下载.exe安装包双击安装即可。安装包没有数字签名系统弹出未知发布者警告时点更多信息选仍要运行就行。macOS下载.dmg文件把图标拖进 Applications 文件夹完成后第一次打开时按 Cmd空格 输入 buzz 启动。Linux两种官方渠道任选其一# Flatpak flatpak install flathub io.github.chidiwilliams.Buzz # 或者 Snap sudo snap install buzz也支持从源码跑pip install buzz-captions然后执行python -m buzzLinux 上需要额外装几个系统依赖具体清单见 docs/docs/installation.md。把一段录音变成文字最快路径整个过程四步第一次用大概花两分钟不算模型下载时间。添加文件点工具栏的选中你的音频文件MP3、WAV、FLAC、MP4 都可以。也可以直接粘贴一个 YouTube 链接。选语言和模型在行内选项里选语言中文选 zh模型先用默认的 Whisper Tiny 试跑即可。点运行任务进入队列状态列会实时显示排队中、进度百分比、完成耗时。打开结果完成后双击该行进入转录查看器每一段文字都带着起止时间戳可以边播放边核对直接改字再从顶部菜单导出 TXT 或 SRT。能力深挖基础层模型怎么选才不踩坑偏好设置Ctrl,的 Models 标签页里能看到已下载和可下载的模型Tiny、Base、Small、Medium、Large 按精度递增。日常对话用 Small 就够速度快、占用小只有内容特别重要、术语特别多时再上 Medium 或 Large。实时录音场景建议用 Whisper.cpp 引擎加小模型对系统压力小很多具体说明在 docs/docs/usage/2_live_recording.md。进阶层实时录音和字幕调整录音功能在工具栏的麦克风按钮选任务、语言、麦克风点 Record 就开始边录边转支持追加和追加并校正两种模式校正模式会回头修正前面刚转的句子。General 标签页还能设置实时转录结果自动导出成 TXT 文件方便对接 OBS 之类的工具。转好的字幕如果长短不齐用查看器里的 Resize 功能下一张图就是它的界面设一个理想长度按标点自动分段、把间隔太碎的段落合并导出 SRT 直接能进剪辑软件。高阶层命令行和文件夹监控Buzz 有完整的命令行接口核心逻辑在 buzz/cli.py一条命令就能提交转录任务python -m buzz --task transcribe --model-type whisper --model-size small --language zh 音频文件.mp3再配合偏好设置里的 Folder Watch 标签页指定一个监控文件夹往里扔文件就自动开始转录。两个功能叠起来就是一套无人值守的批量转录流水线。谁会用、怎么用学生课堂录音是长音频、环境杂。录音时用实时模式 Whisper.cpp Base 模型课后导出 TXT 贴进笔记软件外语材料转录完顺手用翻译任务转成英语或对照阅读。内容创作者要的是能直接用的字幕。视频文件直接导入转完进查看器修正错字再用 Resize 把字幕按 40 字符左右切齐导出 SRT 拖进剪辑软件比手写字幕快一个量级。职场人会议录音往往敏感不想上云。选 Medium 以上模型保准确率General 里配好默认导出文件名模板和固定导出文件夹散会文件就齐了全程断网也能跑。坑与捷径别一上来就用 Large 模型因为它在普通电脑上可能要转几十分钟先用 Small 跑通流程确实不满意再加大。别依赖自动检测语言因为指定语言能明显减少专名和同音字的识别错误中英混说的内容更要手动指定。别忽略麦克风质量因为转录模型救不了底噪大的录音安静环境加外接麦克风比换更大的模型有用。用 Whisper.cpp 引擎加 CUDA/Vulkan 加速能更快有独显的话速度能提升数倍。用初始提示喂专业术语能更快医学、法律讲座里的人名和术语丢进去识别率立竿见影。给导出文件配好模板变量能更快{{ input_file_name }} {{ task }}d on {{ date_time }}一套规则搞定命名批量文件不会互相覆盖。写在最后Buzz 把语音转文字这件事搬回了你自己的电脑不联网、不要钱、不上传模型可挑格式能导长音频、实时录音、批量流水线都覆盖。建议先拿一段两分钟的录音用 Tiny 模型完整走一遍转录和导出熟悉手感后再按内容重要程度换更大的模型。现在就可以装一个试试把最近一段录音变成文字。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考