Handy:完全免费的离线语音转文本,5 分钟上手的完整指南
Handy完全免费的离线语音转文本5 分钟上手的完整指南【免费下载链接】HandyA free, open source, and extensible speech-to-text application that works completely offline.项目地址: https://gitcode.com/GitHub_Trending/handy11/Handy刚开完的会还要花一小时听录音补纪要访谈口述时云端语音识别要订阅费内容还得上传服务器心里不踏实。Handy 是一款免费、开源、完全离线的语音转文本桌面应用断网照样能用录音和文本全部在本机处理数据不出电脑。离线语音转文本怎么安装安装基本就是一行命令的事。Windows 用户直接winget install cjpais.HandymacOS 和 Linux 可以下载对应安装包也能自己构建。装好后按下面三步走选个模型首次启动会引导你下载一个本地语音识别模型大小几百 MB 上下。按住录制键默认快捷键按住就开始说话松开即结束。看结果转录文本自动出现在你当前的输入位置就像语音版的打字机。第一次转录可能要等模型加载几秒之后就是即说即出。实时转录会议 / 访谈️ 最实用的场景。在设置里开启始终麦克风或干脆按住全局快捷键屏幕角落会浮出一个小窗边说边把文字转出来。浮层里能看到正在写入的文本和当前录音进度随时确认转写了多少。配合语音活动检测可以理解为一个只在有人说话时才开工的开关静音和背景噪音不会乱切句长访谈一遍就能得到干净的结果。自定义热词让术语不再认错录音里如果有大量专有名词、品牌名或行业黑话识别率会掉。这时打开设置里的自定义词汇把热词一条条加进去医疗药名、病症编程库名、框架缩写学术术语、人名原理很朴素提前给模型一张小抄这些词被写对的可能性就大得多。外接 LLM API 润色文本Handy 本体完全离线但你可以在后处理里选配外部大模型 API转录完成后把草稿发给大模型做语法检查、标点修复和语气整理。配上之后润色一步到位不配依然是纯离线体验。关键是原始录音不会被传出去只发你选处理的文本。语音识别模型怎么选⚡ Handy 内置两大系模型取舍很直接模型特点适合谁Whisper Small快、轻日常速记低配机器Whisper Medium速度与精度均衡普通笔记本Whisper Turbo / Large精度最高重活重场景有显卡Parakeet V3CPU 优化约 5 倍实时速度自动识别语言纯 CPU、中英混用几句建议没有独显选 Parakeet V3CPU 上跑得很顺。有显卡、追求最准Whisper Turbo。只是随手记两句Small 足够最省资源。模型支持动态加载和卸载空闲时自动释放内存不用一直挂着占地方。三大平台的差异与隐藏技巧macOS— 体验最顺滑。Apple Silicon 芯片有原生加速转录明显更快还能把Globe 键设为触发键按住空格旁边的地球键就能说话比组合快捷键自然得多麦克风和辅助功能权限也会自动申请不用手动翻系统设置。Windows— 除了 winget 一行装好全局快捷键走 rdev 监听后台、锁屏状态下都稳定可靠。Linux— X11 和 Wayland 都支持。录音浮层依赖 gtk-layer-shell个别 Wayland 环境下显示不出来时启动前加一个环境变量即可HANDY_NO_GTK_LAYER_SHELL1关掉浮层不影响核心转录功能只是少个屏幕提示。进阶配置快捷键、剪贴板与硬件加速快捷键行为默认按住录音、松开结束。如果你习惯按一下开始、再按一下停把 Shortcut Behavior 改成 Toggle录长段口述就方便了。剪贴板策略Handy 提供直接输入、剪贴板粘贴等多种方式把文字放进文档。遇到个别输入框某些远程桌面、特殊控件接收不到直接输入时切换成剪贴板粘贴模式就好。硬件加速NVIDIA 显卡选 CUDAApple Silicon 选 Metal其他环境试 OpenCL配置弱的机器就用纯 CPU 模式它本身也做了 SIMD 和多线程优化速度并不慢。写给想二次开发的读者️ 三个点快速上手设置界面在 src/components/settings/每个开关就是一个 React 组件新增设置项就是在这个目录里加一个组件再补上状态逻辑。核心逻辑在 Rust 侧src-tauri/src/managers/transcription.rs 负责转录流程的协调src-tauri/src/managers/model.rs 管模型的加载卸载语音检测逻辑在 src-tauri/src/audio_toolkit/vad/。调试模式按 CmdShiftDmacOS或 CtrlShiftDWindows/Linux打开调试面板实时日志、模型推理耗时、波形和语音检测状态一目了然排查麦克风到底有没有收到声音很有用。接入自己的模型把 Whisper GGML.bin文件放进应用数据目录的 models 文件夹重启 Handy它就会出现在模型列表里。整体是 Tauri React Rust 的结构三者懂哪门就从哪层切入。Handy 可以一句话概括装好、选模型、开始说话免费、开源、离线隐私敏感的场合用它最省心。随着本地模型越来越快、越来越准在自己设备上说出来就是写出来会很快成为日常习惯。【免费下载链接】HandyA free, open source, and extensible speech-to-text application that works completely offline.项目地址: https://gitcode.com/GitHub_Trending/handy11/Handy创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考