拓冰建站拓冰建站
首页 / 资讯中心 / 正文

Buzz:离线语音转文字在本地跑通,从导入音频到导出 SRT 字幕三步完成

Buzz离线语音转文字在本地跑通从导入音频到导出 SRT 字幕三步完成【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzzBuzz 是一款免费开源的离线语音转文字工具全部处理在个人电脑上完成。它基于 OpenAI Whisper 模型能把音频、视频文件在本地转写成文字并翻译成英文也支持麦克风实时转录。适合需要整理会议记录、采访稿、视频字幕或者不想把敏感音频上传到云端的用户。装好后导入文件、选一个模型就能得到 TXT、SRT 或 VTT 格式的结果。先判断本地语音识别是否适合你的场景Buzz 覆盖文件转写 实时录音 字幕导出三条主线但有两件事需要先确认硬件和环境。适合的情况会议录音、访谈、讲座音频需要在自己的机器上处理为视频制作字幕要求输出 SRT 或 VTT无网络环境把模型缓存目录从别的电脑复制过来后即可离线转写需要批量任务多文件转写、文件夹自动监听、录音实时出字需要先确认的CPU 需支持 AVX2过老的机型无法运行首次下载模型需要联网纯离线使用需手动搬运模型目录实时转录比较吃资源建议搭配 whisper.cpp 后端和较小的模型说话人区分功能在 Intel 版 macOS 上不可用最小成功路径从安装到跑通第一次转录按下面四步走一遍就掌握了 Buzz 的完整链路。安装。Linux 用户任选一种包管理器flatpak install flathub io.github.chidiwilliams.Buzz sudo snap install buzzWindows 和 macOS 从官方发布页下载安装包或 dmg 即可Windows 安装包未签名安装时选更多信息 → 仍要运行。开发环境可用pip install buzz-captions再执行python -m buzz前提是装好 ffmpeg 并准备 Python 3.12。下载模型。进入设置 → 模型标签页先下载tiny体积最小、速度最快用来验证流程足够。导入文件。点工具栏的 或按Ctrl/Cmd O选择音频或视频文件然后确定转写任务、语言和模型。运行并查看。点击运行任务状态变为 Completed 后双击该行打开转录查看器校对文字并导出。核心任务工作流按你要完成的事来用三个高频任务每个都按任务—动作—产出走。任务一批量转写已有文件一次选择多个文件导入或直接用命令行把参数和输出格式一起给定buzz add --task transcribe --model-type whispercpp --model-size small --srt --vtt /path/to/file.mp4产出是每个文件各一份转写结果。如果文件会持续产生在设置中开启文件夹监听新文件放入指定目录后会自动进入转写队列无需手动操作。任务二为视频导出可调时长的字幕导入时勾掉默认设置、在高级中开启字级时间戳转写完成后再点查看器里的Resize按钮可以设定单条字幕最大长度、是否按标点切分、把每条字幕的结束时间统一延后几秒。开启字级时间戳时工具还会分析音频里的静音段来修正字幕边界。产出是可直接导入剪辑软件的 SRT 或 VTT 文件。任务三录音时的实时转录选好任务转写或翻译成英文、语言、模型和麦克风后点录制文字边说边出。转录有三种模式新句追加在下方、追加在上方、追加并纠错最后一种会回头修正上句错误但更耗算力队列积压时要调大转录步长。演讲场景可打开演示窗口投出大字也可以把实时文字持续导出为 txt 文件供 OBS 等直播软件读取。如果一段录音里有多人转写完成后可在查看器中点Identify speakersBuzz 会自动给每句打上说话人标签你可以试听片段、改成真实姓名并把同一人的连续发言合并为一段。影响结果的设置项模型、语言与导出模板这些配置决定快不快和准不准建议按优先级逐项了解。模型后端Whisper 原版准确但慢Faster Whisper 适合显存 6GB 以上的 NVIDIA 显卡Whisper.cpp 兼容任意显卡甚至纯 CPU是实时转录和 Mac 的推荐选择HuggingFace 后端支持大量自定义与多语言模型。模型大小tiny 到 large 逐级更准也更慢官方 FAQ 给出结论——唯一可靠的方法是用自己的语言把候选模型各测一遍显存紧张时可改用 q_5 这类量化版本。语言手动指定比自动检测稳定自动检测依据开头几秒容易选错。初始提示词在高级里填入人名、术语等容易拼错的词能明显减少错字。语音提取嘈杂音频可先勾选 Extract speech把语音单独抽到一条音轨再转写。导出文件模板设置中支持{{ input_file_name }}、{{ date_time }}、{{ language }}等变量统一批量文件的命名规则。快捷键与进阶参数录制、导入、播放均可重绑快捷键更细的参数如BUZZ_WHISPERCPP_N_THREADS控制 whisper.cpp 线程数通过环境变量设置。遇到卡点时按症状排查转写慢先换更小的模型或改用 whisper.cpp有 NVIDIA 显卡可试 Faster Whisper线程数设得过高反而会拖慢可适当降低。结果不准手动指定语言、换更大的模型、补初始提示词噪音大的场景开启语音提取。麦克风报错PaErrorCode-9999检查系统隐私设置和杀毒软件是否拦截了麦克风访问。程序崩溃多半是模型下载不完整在设置中删除对应模型重新下载也请确认 CPU 支持 AVX2。PyPI 版本批量处理失败检查 ffmpeg 是否已安装它负责音视频解码。继续了解CLI 命令参考buzz add全部参数、语言代码和示例常见问题 FAQ模型存放位置、离线使用、GPU 加速等细节插件系统内置 AI 摘要、DOCX 导出、增强语言检测等插件源码【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门