不上传音频:Buzz 离线语音转文字从 0 到字幕成片的完整流程
不上传音频Buzz 离线语音转文字从 0 到字幕成片的完整流程【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzzBuzz 是一款免费开源的离线语音转文字工具把 OpenAI Whisper 模型装进你本地电脑音频转录、翻译、字幕导出全程不联网。如果你正要把一期播客、一场访谈或一段课程视频变成文字稿和 SRT 字幕文件这篇指南按结果倒推的方式带你从零走到交付。先看清楚交付物一份带时间轴的文字稿一个能直接压进视频的字幕文件在动手之前先明确你最终会拿到什么。跑完 Buzz 之后一个 90 分钟的访谈录音会变成两样东西一份文字稿——每一句都带有精确的开始/结束时间支持逐句播放对照、搜索定位、直接改写改动自动保存一份字幕文件——TXT、SRT、VTT 三种格式任选导出其中 SRT/VTT 可以直接交给剪辑软件压在画面上。也就是说它覆盖的不只是语音变文字这一步而是从原始录音到可交付字幕的整条链路。为什么选本地 Whisper数据不出机器成本只发生一次选转录工具时真正要比较的往往不是识别率而是三件长期的事数据流向。云服务把录音上传到对方的服务器再返回结果Buzz 的 Whisper 模型首次使用下载到本地约 200MB之后所有识别运算都在本机完成。访谈录音、未发布的节目内容、内部会议始终不离开你的硬盘。使用成本。本地运行不按时长计费没有账号、没有订阅转多少都是零边际成本断网环境同样可以跑。后端的可选性。它不是绑死单一模型的封闭应用Whisper.cpp、Faster Whisper、Hugging Face 上的 Whisper 系列都可以作为后端切换也支持 OpenAI Whisper API 这种联网模式NVIDIA GPUCUDA、Apple Silicon、Vulkan 加速都能用上。需要时它是一个平台不需要时它就是一个安静跑在硬盘上的识别引擎。安装 Buzz按平台对号入座按你的环境选一条即可不需要全试。Windows安装包从项目的发布渠道下载安装文件双击运行。注意安装包未签名系统会弹出安全警告点更多信息 → 仍要运行继续即可。macOSHomebrew 一键brew install --cask buzzLinuxSnapsudo snap install buzz命令行用户PyPI前提是装好 ffmpeg然后执行pip install buzz-captions python -m buzz有 NVIDIA 显卡想跑 GPU 加速的话README 里给出了对应的 CUDA 环境安装命令。更多细节可以翻 安装文档。第一次跑通把录音丢进队列再决定模型档位打开 Buzz主界面就是一张任务表格每个文件占一行列出了模型、任务类型和实时状态Queued → In Progress → Completed。首次使用按这三步走添加来源拖入本地音频/视频文件也可以直接粘贴 YouTube 链接让它代为下载定模型和任务任务类型只有两个选项——Transcribe转录或 Translate翻译成英文点运行任务进入队列多文件并行处理进度在表格里实时刷新。模型档位怎么挑给个保守的判据档位适合的场景Tiny / Base实时录音、先出草稿赶时间Small / Medium日常主力档速度和准确度的平衡点Large重要交付物、专业字幕准确度的上限第一次别纠结先用 Small 跑通流程发现错漏再对该文件换大模型重跑——这正是表格化任务管理方便的地方每个文件可以独立换参数。想自己管理模型下载、指定后端、填 Hugging Face 模型 ID时进偏好设置里的 Models 页操作即可。文字稿交付前在查看器里完成校对与搜索转录结果双击即进查看器这一步决定稿子能不能直接交付播放校对底部播放器边放音频边核对文字发现识别错误直接改自动保存不需要再导一次搜索定位90 分钟的录音里找报价两个字搜索框回车就跳到对应时间点格式导出TXT 给纯文字记录SRT/VTT 给字幕三选一或都要。字幕拆并Buzz 的 Resize 规则很多转录工具停在把话说对但字幕还要排得好看——一句话 40 多个字符挂在屏幕上观众根本读不完。Buzz 的 Resize 面板源码在 transcription_resizer_widget.py就是干这个的按目标长度拆分设一个字符上限过长的字幕自动断开按音频间隙合并停顿超过设定阈值时把相邻短句合成一条节奏更自然按标点断句在句号、逗号处断开符合阅读习惯。如果转录时勾选了词级时间戳word-level timings拆分边界还能结合静音分析来做比单纯按字数切更贴听觉节奏。做完这一步再导出 SRT压进视频基本不用再手动修。从手动到流水线录音、监听目录与翻译基本流程跑顺之后下面这几件事可以帮你把转录变成背景任务实时录音转录。接上麦克风说话的同时文字实时上屏还带一个适合投屏的演示窗口——现场记录、采访整理结束即出稿。文件夹监听。在偏好设置的 Folder Watch 页指定一个目录之后丢进去的新音频自动排队转录。录音笔每天回传的原始文件从此不用过手。多语言翻译。Whisper 自带的 Translate 是译成英文要翻成任意语言可以在 General 页配置一个 OpenAI 兼容 API 端点参考 translator.py接 Ollama、LM Studio 这类本地模型时翻译也保持离线。说话人识别。多人访谈转录后自动区分不同说话人做纪要时省掉这段是谁说的来回确认。命令行CLI。想把转录写进自己的自动化脚本buzz add等命令可以直接调度选项含义见 CLI 文档。另外环境嘈杂的音频可以先开语音分离预处理再转录准确率提升比较明显。收尾常见问题 按场景的行动清单它真的完全免费吗是MIT 许可开源没有账号、订阅或按分钟计费。第一次运行要联网吗需要联网下载 Whisper 模型约 200MB之后离线可用。字幕能直接给剪辑软件吗可以导出 SRT 或 VTT 即可。翻译能做吗默认任务是把语音翻译成英文其他语言走 OpenAI 兼容 API。Windows 安装弹安全警告安装包未签名选更多信息 → 仍要运行是正常流程。按你的目标对号入座只要一份带时间的文字稿 → Whisper 查看器校对直接交付要给视频加字幕 → 转录时开启词级时间戳用 Resize 调整拆并导出 SRT每天固定批量处理 → 开文件夹监听或改用 CLI 写脚本内容涉及多语言 → 转录完成后走翻译任务 / 兼容 API多人访谈 → 开启说话人识别再整理。想跑在服务器上或者二次开发也可以直接拉一份源码git clone https://gitcode.com/GitHub_Trending/buz/buzz【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考