Vibe 语音转文字完整指南:离线本地转写,从安装到 GPU 加速一次搞懂
Vibe 语音转文字完整指南离线本地转写从安装到 GPU 加速一次搞懂【免费下载链接】vibeTranscribe on your own!项目地址: https://gitcode.com/GitHub_Trending/vib/vibeVibe 是一款开源免费的本地语音转写工具把音频和视频直接在你自己的设备上转成文字。它基于 Whisper 引擎同时支持 Nemotron 和 Parakeet 模型覆盖近百种语言还能批量处理、分离说话人、导出字幕并且全程离线运行——你的录音从头到尾都不会离开这台电脑。三分钟把 Vibe 装进电脑这一步的目标是让你打开主界面、能开始转写。先确认系统够格硬件上没有硬性门槛资源占用可以在高级设置里自己调见 系统要求与安装说明。系统最低版本安装包备注Windows8 及以上.exe可能需要安装 Visual C RedistributablemacOS13.3 (Ventura) 及以上Apple Silicon 用aarch64.dmgIntel 用x64.dmg首次需右键打开LinuxUbuntu 22.04 及以上.debArch 用户可用 debtap不支持直接监听音频文件Windows三步装好双击.exe安装程序 → 按向导点完从开始菜单打开 Vibe能看到主界面。若提示msvc140.dll缺失 → 先安装 Visual C Redistributable 再打开。macOS装完记得右键一次按芯片选对 dmgApple Silicon 选aarch64.dmgIntel 选x64.dmg拖进应用程序 → 装好。右键应用图标 → 选打开 → 弹窗里再点一次打开绕过系统安全提示后正常启动。Linux装包 补依赖 关合成模式用包管理器装.deb→sudo dpkg -i vibe.deb安装主程序。提示缺依赖 →sudo apt-get install -f自动补齐。窗口白屏/黑屏 →export WEBKIT_DISABLE_COMPOSITING_MODE1关闭合成模式。终端里运行vibe→ 应用正常打开。⚠️ Linux 上暂不支持直接监听音频文件其余功能正常。想从源码自己编译开发者git clone https://gitcode.com/GitHub_Trending/vib/vibe # 克隆仓库 cd vibe # 进入项目目录 chore build # 拉取 sidecar 并构建生产版本需要先装 chore、pnpm、Cargo 等前置工具Linux 还要先跑chore linux-deps装系统依赖完整清单见 源码构建说明。第一次打开选语言、下模型跑出第一份文字这一步完成首次引导做完你就能转出第一段带时间戳的文字。Vibe 启动后会带你走完选语言 → 下模型 → 点转录三件事。在语言下拉里选目标语言 → 列表里有Auto Detect选它会自动识别语音里的语言。Vibe 支持近百种语言包括中文可选模型见 推荐模型清单。挑一个模型 → 模型大小决定速度和精度常见选择如下模型适合场景特点Tiny快速任务、低配设备最小最省资源Small日常通用小巧够用Medium大多数场景速度与资源平衡Large (v3)高精度、复杂音频更吃算力和内存Large v3 Turbo日常主力推荐速度快但不支持翻译成英文Parakeet TDT 0.6B / Nemotron 3.5听写、流式支持流式最适合实时听写⚠️ 翻译成英文只对 Whisper 的 small / medium / large 生效Large v3 Turbo 不行。点转录 → 进度条走完右侧出现带时间戳的文字就成了 ✅。 想离线装模型启动后取消自动下载进设置的 Customize 区手动挑模型文件放进模型目录即可全程不用联网。转写能帮你做的四件事这一节按它能帮你做什么来拆覆盖日常绝大多数转写场景。把一段音频或视频变成可编辑的文字最基础的动作丢文件进去拿到文字。支持 MP3、WAV、MP4 等常见音视频文件。拖一个音视频文件进窗口或点选择文件→ 文件出现在输入区。选好语言与模型点转录 → 转录过程中能实时预览逐句生成的文字。点导出 → 选格式文件保存到指定位置。导出格式都集中在一个导出面板里按需挑格式是什么Text纯文本HTML带样式的网页Markdown带标题和格式的 MarkdownPDF可直接打印的文档SRT带编号时间戳的字幕VTT (WebVTT)网页字幕JSON结构化转写与时间戳数据DOCX格式化 Word 文档CSV可直接进表格的数据一次丢一堆文件或丢个网页链接文件多、或想省掉下载这一步就交给它自动跑。批量切到 Batch 面板把多个文件拖进去统一设好语言和格式点全部转录队列里逐个跑完。网页直转不想自己下视频直接粘贴 YouTube、Vimeo、Twitter 等链接Vibe 用内置的 yt-dlp 抓音频再转写省掉下载这一步。对着麦克风说、录系统声音或从手机递录音不是只有文件才能转声音来源可以很多。麦克风切到 Record挑好麦克风设备点录制说完即转。系统声音录电脑里正在播放的声音macOS 需要系统音频权限。手机递传在设置里打开手机配对扫一次二维码以后手机上录音、电脑负责转写文字直接回手机——iOS、Android 都不用装 App见 手机端递传。 还能设全局快捷键在任意位置按住说话、松手转写Vibe 也能检测 Google Meet、Zoom、Teams 开会时主动提醒你录不录。分清谁在说、字幕卡得准长会议、做字幕光有文字还不够。说话人分离在 More Options 里开启 Speaker diarization首次需下载约 25MB 的模型每句话会标出Speaker N最多支持 4 位说话人。稳定时间戳做电影/长视频字幕时开启 Stable timestamps时间戳更稳、更贴合台词。注意它走 VAD 逐段解码速度大约是普通模式的 1/4换来的是更准的字幕时间。让 AI 帮你把长文缩成摘要转完一大段摘要交给 AI分本地和云端两条路。Ollama本地装好 Ollama 后运行下面命令再在 Ollama 选项里开启 Summarize、跑一次检查通过即可摘要完全在本地生成。ollama run llama3.1 # 下载并运行 llama3.1 摘要模型Claude API云端在设置里填 API Key 和 Prompt必须带%s占位符放转写内容转完直接出摘要批量也支持。译成英文把任意语言转成英文用 small / medium / large 模型。进阶让 Vibe 跑得更快、按你口味定制这一节讲可选的加速与定制按需打开不动也能正常用。开启 GPU转录速度明显更快有独立显卡的话GPU 加速默认就是开着的按平台自动选后端见 推荐模型清单。平台加速后端macOSCoreML / MetalWindowsVulkanLinuxVulkanNVIDIA、AMD、Intel 显卡都能用。 macOS 上还有更快的办法找到与你模型对应的.mlcmodelc文件拖进模型目录和.bin放一起。第一次转会慢在编译之后每次数倍提速。嫌 GPU 不稳More Options 里有Transcribe on the CPU强制走 CPU慢一点但避开驱动崩溃。多显卡填GPU Device number选 0 或 1。内存紧张设Unload model after inactivity闲置后自动释放显存下次转写时重新加载会慢一点。换上自己下载的模型或给模型传提示词Vibe 支持 ggml / gguf 格式.bin/.gguf的自定义模型换模型不用重启。把模型文件放进模型目录设置里Models Folder看路径、Change Models Folder换位置。在下拉里选中新模型 → 直接生效。想从网站拉模型设置里粘贴模型链接或用vibe://download/?url模型地址直接下进 Vibe。高级玩家还能调线程数建议 4、温度、上下文长度、采样策略贪心 / 束搜索、提示词把预期会出现的专有名词喂给模型比如 Vibe、Tauri、Whisper。用命令行和本地 API 转写Vibe 的转写引擎 vibe-server 是一个独立的本地进程带 OpenAI 兼容的 HTTP API详见 本地转写引擎。桌面 App 本质上是把参数转发给它。./vibe-server pull 模型URL # 下载一个模型文件 ./vibe-server serve --port 0 # 启动本地 HTTP 服务端口交给系统自动分配 ./vibe-server devices # 列出可用设备它对外暴露 Swagger 文档和 OpenAPI 规范Python 脚本、其他桌面应用、AI Agent 都能直接调。桌面端还提供API Agents开关和本地 API以及可一键安装的 Agent 技能。高级参数给转录加料在 More Options 里这些参数能明显改善特定场景的转写质量Word timestamps给每个词打时间戳JSON 里特别有用。Max Sentence Length控制一句话最多多少字字幕断行用。Normalize loudness对忽大忽小的音量做归一提升准确率代价是每小时音频多花最多 8 分钟。Prompt把专有名词、人名、术语写进去模型遇到时更准。避坑排错出问题基本是这几类按现象 → 原因 → 怎么办对着查。现象Windows 打开报msvc140.dll/vcomp140.dll缺失原因系统没装 Microsoft Visual C 运行库。解决安装 Visual C Redistributablex64再打开。若是vulkan-1.dll缺失则装 Vulkan 运行时。现象Linux 窗口白屏、黑屏或闪退原因Webkit 合成模式在该环境不兼容。解决启动前export WEBKIT_DISABLE_COMPOSITING_MODE1关闭合成模式。现象GPU 加载模型失败转录回退到 CPU原因显存不够、或驱动尤其老 AMD 驱动不兼容。解决显存不足时 Vibe 会自动重载到 CPU、重试当前文件之后记住该模型太大改走 CPU。想彻底避开就在 More Options 里勾Transcribe on the CPU。现象提示模型文件损坏 / 完整性检查失败原因模型没下全或被写坏。解决点Re-download重新下载该模型即可。现象转写崩了、没报错想定位原因原因要看引擎日志。解决用带日志的方式从终端启动或在设置里开Enable Logs需重启。各平台日志位置macOS~/Library/Application Support/github.com.thewh1teagle.vibeWindows%appdata%\github.com.thewh1teagle.vibeLinux~/.config/github.com/thewh1teagle.vibe更多排查思路见 排错指南。现象链接转写突然失效原因yt-dlp 版本落后跟不上网页端变动。解决Vibe 会提示有新版本点更新 yt-dlp 通常就能修好失效链接。相关文档想深挖某块直接看这些系统要求与安装说明推荐模型清单本地转写引擎架构说明手机端递传排错指南【免费下载链接】vibeTranscribe on your own!项目地址: https://gitcode.com/GitHub_Trending/vib/vibe创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考