拓冰建站拓冰建站
首页 / 资讯中心 / 正文

Buzz 免费离线语音转文字完整指南:本地 Whisper 桌面工具三步跑通

Buzz 免费离线语音转文字完整指南本地 Whisper 桌面工具三步跑通【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzzBuzz 是一款基于 OpenAI Whisper 的免费开源桌面工具在你自己的电脑上完成离线音频转录与多语言翻译不上传任何音频、不依赖云端服务适合做会议记录、视频字幕和敏感内容整理的人。 项目名片Buzz 到底是什么一句话定位Buzz 把音频变文字这件事完全留在本地完成——声音进文字出计算全在你的机器上。字段内容它是什么离线音频转录与翻译的桌面应用技术底座Python 3.12 PyQt6本地 SQLite 存转录历史与设置转录后端Whisper、Whisper.cpp、Faster Whisper、Hugging Face、OpenAI API许可证MIT谁来用会议记录者、字幕创作者、语言学习者、写自动化脚本的开发者上手成本一个安装包或一条 pip 命令三步出第一次转录结果隐私特点可完全离线运行模型能在别的机器上提前备好 能力全景从输入、处理到输出看懂 BuzzBuzz 的功能图谱可以按音频怎么变成文字、文字怎么被用上这条数据流来读。输入端文件、麦克风、目录三个入口文件导入导入音频或视频自动抽取音轨也支持直接粘贴 YouTube 链接手头有录音、视频素材的用户实时录音从麦克风边录边转可弹出演示窗口供活动现场查看会议、讲座、访谈现场监视文件夹目录里新增文件自动建任务并转录批量流水线、日常积累场景处理端四种后端把声音变成文字多语言识别支持近百种语言转写留空即自动检测语言语言不确定或混杂的内容后端可切换Whisper、Whisper.cpp、Faster Whisper、Hugging Face 各有独立后端CUDA、Vulkan、Apple Silicon 都能用不同硬件配置按机器选语音分离嘈杂录音先分离语音再转写提升准确率多人对话、环境噪音大的素材语音翻译把转写结果译成目标语言也兼容 OpenAI API 类服务跨语言内容整理输出端五种方式把文字用起来格式导出TXT、SRT、VTT 三种格式直接进剪辑软件视频字幕制作说话人识别区分同一录音中的不同发言人采访与多人会议纪要段落调整微调每个片段的起止时间戳让文字与音频对齐字幕校对环节转录查看器搜索、播放控制、变速按时间戳跳转任意位置核对与校对CLI 与插件一条命令指定模型、语言和输出格式内置 AI 摘要、DOCX 导出、字幕自动调时自动化与 CI 场景 落地三步环境准备、首次跑通、拿到第一个结果环境准备按平台选最短安装路径Windows / macOS下载对应安装包。Windows 包未签名安装时出现安全警告选更多信息→仍要运行即可。注意 Intel 版 Mac 已停在 1.4.5现在需要 Apple Silicon。Linux一条命令装好flatpak install flathub io.github.chidiwilliams.Buzz也有 snap 和 AppImage 可选。开发者前提是装好 ffmpeg 并使用 Python 3.12 环境然后pip install buzz-captions。首次跑通导入文件三步点击① 打开应用Ctrl/CmdO 导入媒体文件视频也可以音轨会自动抽取② 任务选转写语言指定或留空自动检测模型按机器性能选大小③ 点击运行等进度条走完。拿到第一个结果一条命令直接出字幕GUI 用户到上一步即可结束脚本用户一条命令就能拿到交付物buzz add -m whispercpp -s small -l zh --srt meeting.mp3最终得到与音频同目录的一个 SRT 字幕文件。默认输出到输入文件所在目录可用--output-directory改成指定目录。 两个实战用例字幕与会议记录各走一遍用例一视频转字幕产出可直接进剪辑软件目标把一个视频变成 SRT/VTT 字幕时间戳不用手工补。操作序列 ① 导入视频文件Buzz 自动抽取音轨无需手动转换格式 ② 任务选转写语言指定中文模型选 small 或 medium点击运行 ③ 打开转录查看器配合播放逐句核对时间戳有偏差就进段落调整拖起止点 ④ 导出 SRT 或 VTT。交付物与验收标准一个字幕文件验收方法是抽查 3 个片段的时间戳误差不超过 1 秒导入剪辑软件后全程文字与语音对得上。用例二会议实时记录带说话人标注目标拿到带时间戳、能分清发言人的会议文字稿。操作序列 ① 主界面切到实时录音模式选对麦克风 ② 开始录音底部面板实时出字默认 20 秒延迟保证文字与语音同步 ③ 结束后保存再跑一次说话人识别给发言人标注 ④ 个别时间戳对不上时用段落调整拖起止时间。交付物与验收标准带时间戳和发言人标注的会议文字稿验收方法是随机跳转任意片段播放文字与语音一致两位以上发言人标注清晰不串人。⚡ 提速与排障四个高频问题的定位法现象定位处理转录明显太慢模型对机器过大或后端没吃到 GPU换 tiny/base 小模型无独显或 Mac 改用 Whisper.cpp可走 Vulkan/CPUNvidia 显存 6GB 以上可上 Faster Whisper专有名词、术语识别错模型缺少领域上下文高级设置里填初始提示initial prompt已知音频语言就手动指定不用自动检测PyPI 版 GPU 不生效默认装的是 CPU 版 torchWindows 上按 README 改装 CUDA 版 torch 及对应 cu12 运行库启动或转录时崩溃模型下载不完整损坏或老 CPU 不支持 AVX2在偏好设置-模型里删除该模型重新下载硬件太老的只能放弃补充一条离线场景需要 Buzz 全程离线机器无网时先在联网机器上把所需模型下好再把模型缓存目录Linux 为~/.cache/BuzzMac 为~/Library/Caches/BuzzWindows 在%USERPROFILE%\AppData\Local\Buzz下整体拷到离线机器相同位置即可。 源码导航想扩展从哪四个地方入手buzz/transcriber/多后端抽象层Whisper、Whisper.cpp 等每个后端各占一个文件想接新转录后端从这入手最清晰。buzz/plugins/插件机制AI 摘要、DOCX 导出、字幕自动调时都走这里也是写自己后处理插件的入口。buzz/widgets/transcription_viewer/转录查看器、段落编辑器、说话人识别的界面实现改校对体验看这里。docs/docs/CLI 全参数、安装、偏好设置与 FAQ 的官方文档其中 cli.md 列全了buzz add的所有选项。收尾Buzz 的价值在于把音频变文字从云服务里搬回你自己的机器模型在本地数据不出门。更多细节看仓库 docs/ 目录下的官方文档遇到问题或有改进想法直接到项目 Issues 提交维护者更新频率很高。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门