Umi-OCR 离线识别完整攻略:3 步跑起来,截图、批量、PDF 文档一条龙
Umi-OCR 离线识别完整攻略3 步跑起来截图、批量、PDF 文档一条龙【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCRUmi-OCR 是一款免费、开源、完全离线的 OCR 文字识别软件屏幕上截到的字、图片里的字、PDF 扫描件里的字它都能在本地帮你抠出来不用注册、不用联网更不用把文件上传到别人的服务器。它的目标用户很明确——不想折腾在线工具、又天天跟扫描件和截图打交道的普通办公族和学生。先感受一下反差。以前同事发来一份扫描版合同你想引用其中一段条款全选、复制屏幕上只有一行无法从此 PDF 复制文字转去在线识别网站要么文件超限、要么一天就几次免费额度更扎心的是合同数据得先传到别人服务器上。现在双击打开 Umi-OCR快捷键一框文字进剪贴板把 PDF 拖进去跑完输出一份能搜索、能复制、能划线的双层 PDF全程数据不离开你的硬盘。这篇文章不聊原理只给结果。读完你会得到一条完整的上手路径3 步把它跑起来、三大主力功能逐个实操、几个进阶玩法让它接进你的工作流、外加一份照着做就能解决的高频问题速查表。全程不需要任何技术背景跟着点就行。一张表看懂Umi-OCR 到底能干什么核心能力适用场景一句话价值截图 OCR屏幕上任何看得见的文字随抓随用快捷键一框结果直接进剪贴板批量 OCR几十上百张截图、扫描件、相册照片一次拖入几百张导出 txt / jsonl / md / csv文档识别PDF 扫描件、电子书等六种格式扫描 PDF 转成可搜索、可复制的双层 PDF忽略区域带水印、LOGO、页眉页脚的图片框住干扰区识别结果自动隐身二维码扫码、一图多码、生成二维码支持 19 种码协议截图/粘贴/拖入都能读排版解析多栏论文、竖排书、代码截图按阅读顺序整理散装文字多语言中文、繁中、英文、日文、俄语、葡语等界面语言与识别语言库可自由搭配程序化调用自动化工作流命令行 本地 HTTP 接口几十行代码接入这 8 项里前 3 项是每天都会用到的主力第 4 项是批量识别的隐藏神器后面几项决定你能把它玩多花。下面从最基础的开始。从下载到第一次识别成功3 步跑起来第一步拿压缩包。Umi-OCR 是绿色软件从项目发布页下载.7z压缩包或.7z.exe自解压包——后者的好处是电脑没装解压软件也能直接双击解开。全程不需要安装这是它最舒服的地方。第二步解压。解压到任意目录都行但路径里尽量不要带中文和空格。这不是玄学是为了避开一些莫名其妙的兼容问题。解压完Windows 双击Umi-OCR.exeLinux 运行umi-ocr.sh。第三步给杀毒软件打招呼。这一步最容易卡住新手Umi-OCR 内置了本地 OCR 引擎和运行库部分杀毒软件会误报导致闪退。启动前先把软件目录加进杀毒软件白名单能省掉后续一大半为什么打不开的烦恼。第一次启动时软件会自动读取你的系统语言把界面切成对应语言想手动切换随时去全局设置 → 语言/Language 里改。程序主体由一组标签页组成——截图 OCR、批量 OCR、文档识别、二维码、全局设置跟浏览器标签栏一个用法还能锁定常用标签防止误关。现在完成你的第一个真实小任务切到截图 OCR页按下快捷键唤起截图框划选屏幕上的任意一段文字——右侧记录栏立刻出现识别结果直接复制走人。前后不超过 5 秒你的第一条本地 OCR 流水线就跑通了。三个高频场景实操对号入座直接抄场景一看到什么就想复制什么——截图 OCR这是日常最高频的用法看文档、看网页、看聊天记录见到一段文字想立刻用。打开截图 OCR标签页按快捷键唤起截图框划区、松手、结果秒出。几个用起来会顺手很多的小习惯不用截图也能识别——在别处复制一张图片比如聊天窗口里发的截图回到 Umi-OCR 直接粘贴照样帮你识别。结果可以二次编辑——右侧记录栏里能直接改错字还能划选多条记录一起复制识别完顺手就把格式整理好了。竖排文字不虚——排版解析自动处理横排和竖排从右到左文本只要 OCR 引擎本身支持竖排就能用。如果你经常截图代码记得在文字识别设置里把排版方案切成单栏-保留缩进输出能基本保持行首缩进和行中空格配合截图 OCR 就是截图抄代码的利器。记住这一句截图 OCR 的入口是快捷键粘贴图片也能识别排版方案里单栏-保留缩进是代码专用档。场景二几百张图片一口气喂完——批量 OCR一次要处理几十上百张截图、扫描件、相册照片时逐张截屏就太亏了。切到批量 OCR页把图片直接拖进窗口支持jpg、png、webp、bmp、tif、tiff等常见格式一次拖几百张没有数量上限。点开始任务右侧逐张显示文件耗时、置信度和识别结果跑完按需导出成txt、jsonl、md、csvExcel 直接打开四种格式。深夜挂机场景它也想到了支持任务完成后自动关机或待机睡前扔进去几百张图醒来直接拿结果。批量识别还有个高频痛点配套功能——忽略区域。图片角落的水印、LOGO、页眉页脚每次都会混进结果里手动删到崩溃。进忽略区域编辑器按住右键在图上画几个矩形框把水印可能出现的位置全框住识别时这些区域自动被排除。做论文批量转换时把统一的页眉页脚一次框掉输出干净一大截。这里有个机制必须记住只有完全处于矩形框内部的整个文本块才会被忽略而不是单个字符。所以画框宁可大一点把水印所有可能出现的位置都包住——漏框一次结果里就混进一行杂音。记住这一句批量 OCR 支持几百张图片无上限、四种格式导出画忽略区域时框要大要包住水印所有可能出现的位置。场景三扫描版 PDF 变可搜索文本——文档识别如果说前两个是热身文档识别就是 Umi-OCR 的压轴功能。它支持pdf、xps、epub、mobi、fb2、cbz六种格式其中 PDF 扫描件是最典型的应用场景。底层逻辑概括成三步解析 → 识别 → 重组。PDF 先被解析引擎拆开区分本来就有的文本层和需要 OCR 的扫描图片层扫描图片交给本地 OCR 引擎逐页识别最后按阅读顺序重新拼装输出。两个值得展开的亮点双层可搜索 PDF——对扫描版 PDF 做 OCR 后输出底层是原图、上层是透明文字的双层 PDF。外观跟原扫描件一模一样但里面的文字可以搜索、复制、划线。历史合同归档、论文数字化这个功能都能直接顶上去。灵活的提取模式——Umi-OCR 会优先提取 PDF 自带的文本层速度快、零识别误差只有遇到纯扫描页才自动切到 OCR。你也可以主动选择整页强制 OCR或反过来只提取原文本v2.1.2 起还支持输出单层纯文本 PDF想要体积小、好编辑的文件就选它。文档识别同样支持忽略区域还能按页码范围设置用来排除扫描件的页眉页脚也支持任务完成后的自动关机。家里一堆扫描版书要转成可搜索存档的话这个标签页能帮你省下大量人工。记住这一句文档识别优先提取自带文本层、扫描页自动补 OCR输出双层可搜索 PDF 是最常用的存档姿势。进阶玩法命令行、接口、插件把 OCR 塞进你的工作流图形界面够用之后想再进一步Umi-OCR 给了两条程序化通道几分钟就能拼出意想不到的用法。命令行模式入口就是主程序本身几个常用姿势# 截屏识别结果直接进剪贴板 umi-ocr --screenshot --clip # 识别指定图片结果输出到文件 umi-ocr --path D:/扫描件.png --output result.txt # 识别整个文件夹含子目录 umi-ocr --path D:/scans -- all_result.txt # 生成二维码 umi-ocr --qrcode_create 你好Umi-OCR D:/qrcode.png 256配合快捷键工具比如 HotkeysCMD还能实现按一个键自动截指定屏幕区域并识别的骚操作。所有指令都支持简写比如--screenshot写成--sc也没问题。完整参数和简写规则见项目内的命令行手册 docs/README_CLI.md。HTTP 接口Umi-OCR 启动后本地 HTTP 服务提供 OCR、文档识别、二维码等接口接口文档在 docs/http/api_doc.md。开发者可以用几十行代码把它封装成局域网内的小工具或接进自己的自动化流程实现上传图片 → 返回 JSON 识别结果。注意命令行和接口都依赖这个本地 HTTP 服务做进程间通信默认开启仅监听本地环回、不经过物理网卡数据不会外泄可以放心用。引擎与插件生态软件默认内置 Rapid-OCR 引擎兼容性好和 PaddleOCR 引擎速度快一些全局设置里随时切换。想折腾的话项目还有独立插件库支持扩展更多 OCR 引擎。版本演进可以看 CHANGE_LOG.md——v2.1.0 加入文档识别、v2.1.2 支持单层纯文本 PDF 与任务暂停、v2.1.3 登陆 Linux 并支持 Docker 部署、v2.1.5 修复了 PDF 页面旋转导致的文本错位问题。手头有旋转过方向的扫描件务必用最新版。高频问题速查8 个坑照着答案做就行忽略区域画了却没效果检查矩形框是否够大——只有整个文本块完全在框内才会被忽略再确认一下是否保存了忽略区域配置。截图时界面闪烁、错位这是显卡渲染兼容问题去全局设置 → 界面和外观 → 渲染器切换渲染方案或直接关闭硬件加速通常能解决。长图识别结果缺胳膊少腿在文字识别设置里调高限制图像边长而不是盲目放大原图——过度放大会增加噪声反而降低准确率。命令行指令没反应Umi-OCR 依赖本地 HTTP 服务进行进程间通信确认全局设置里 HTTP 服务已开启默认开启。批量任务想中途休息v2.1.2 起支持暂停任务只要软件不退出待机/休眠后可以继续跑。内存占用偏高用 PaddleOCR 插件的话v2.1.4 起默认内存占用被限制在系统总内存一半以内想进一步压可在插件配置里调低线程数。代码截图排版全乱了切到单栏-保留缩进排版方案。文件夹里几万个文件加载很卡v2.1.5 优化了异步加载机制稍等加载完成再操作预览界面会显示加载进度。遇到渲染、语言、快捷键等全局问题基本都集中在全局设置页里界面长这样照着找就行三句话记住 Umi-OCR然后去干点正事它是免费、开源、离线的 OCR 工具解压即用图片和文档都不离开你的电脑截图、批量、文档识别三大功能覆盖从日常摘抄到批量归档的绝大多数场景遇到问题别慌——忽略区域、排版方案、渲染器这三个旋钮能解决大部分麻烦。下一步行动建议现在就去下载一份把一份扫描版 PDF 拖进文档识别页点开始任务。十分钟后你会得到一份能搜索、能复制、能划线的文件从此告别对着扫描件手抄的日子。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考