离线OCR保姆级实操:从一箱旧照片到可搜索档案,Umi-OCR六道工序全拆解
离线OCR保姆级实操从一箱旧照片到可搜索档案Umi-OCR六道工序全拆解【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCRUmi-OCR 是一款免费、开源、完全离线的文字识别软件。它没有账号体系不需要联网解压后双击即可运行图片和文档全程不出你的硬盘。这篇离线OCR实操指南不谈原理只沿一条真实路线走你手头有一批看得见字、却复制不出来的图片和扫描件我们一步一步把它们变成能搜索、能复制的干净文本。先给你一个具体画面。书柜最底层那口纸箱装着你爸年轻时的剪报、你妈手抄的菜谱还有你三年前拍下却一直没空整理的两百多张书页照片。你早想把它们变成可搜索的电子档案但一想到要对着屏幕逐字敲打这个周末再说吧就拖了三年。Umi-OCR 就是来终结这种打字地狱的。它像一位随叫随到的拆字工不领工资、不联网、不把你的文件送去任何服务器。接下来我们把整理旧照片这件事拆成六道工序一步步走完。开工前先看终点三种成品长什么样动手之前先搞清每个任务最后要交出什么。你的需求不同走的工序也不同对号入座即可你手头的东西想要的成品用到的工序一屏代码截图、聊天记录截图可编辑、保留格式的文本截图取字 保留缩进排版几百张带水印、页眉的扫描图干净的去水印 txt / csv批量识别 忽略区域一摞扫描版 PDF 合同、论文可搜索、可复制的双层 PDF文档识别 双层 PDF 输出心里有终点后面每一道工序你就知道它解决什么了。第一道工序先让拆字工在电脑里住下来好消息是它不需要安装。从项目发布页下载.7z压缩包或.7z.exe自解压包解压到任意目录路径尽量别带中文和空格能少很多兼容麻烦然后Windows 双击Umi-OCR.exe启动Linux 运行umi-ocr.sh。首次启动会自动读取你的系统语言把界面切成对应语言。顺手做一件事给软件目录加个杀毒软件白名单。它内置了本地 OCR 引擎和运行库部分杀软会误报提前加白能省掉日后为什么闪退的烦恼。程序主体由多个标签页组成——截图OCR、批量OCR、文档识别、二维码、全局设置像浏览器标签栏一样随意切换还能锁定常用标签防止误关。✅ 到这一步拆字工已经住下来了。第二道工序屏幕上看见什么划框就取什么日常最高频的动作看到一段文字想立刻拿走。在截图OCR标签页按下快捷键屏幕上出现截图框划出目标区域——识别结果瞬间出现在右侧记录栏里。几个让效率翻倍的小习惯不截图也能识别在聊天窗口复制一张图片回到 Umi-OCR 直接粘贴即可。结果随手可改记录栏里的文字能直接编辑还能划选多条记录一起复制识别完顺手就能整理格式。竖排文字照样拿下排版解析会自动处理横排和竖排从右到左的文本只要引擎本身支持竖排即可。不过截图一次只能取一处碰上两百张照片这种量级得换下一道工序。第三道工序几百张图一次拖进去一口气消化切到批量OCR标签页把图片直接拖进窗口。支持jpg、png、webp、bmp、tif、tiff等常见格式没有数量上限一次塞几百张也没问题。点下开始任务右侧面板逐张显示耗时、置信度和识别结果。任务跑完可以按需导出成txt、jsonl、md、csvExcel 直接打开四种格式。这里有几个值得记下的点深夜挂机友好支持任务完成后自动关机或待机睡前扔进几百张图醒来直接拿结果。可以中途休息v2.1.2 起支持暂停任务只要软件不退出待机/休眠后还能接着跑。结果格式灵活要进 Excel 就选 csv要进笔记软件就选 md随你挑。但批量场景有个老毛病水印、LOGO、页眉页脚总混进结果里。这就要进入第四道工序了。第四道工序教它挑活干让水印自动隐身在批量识别页右侧设置里打开忽略区域编辑器按住右键在图片上绘制多个矩形框把水印可能出现的位置全部框住。识别时这些区域里的文字会被自动排除。做论文批量转换时把统一的页眉页脚一次框掉输出会干净一大截。这里有个必须记住的机制否则你会以为功能坏了只有完全处于矩形框内部的整个文本块才会被忽略而不是单个字符。所以画框时宁可大一点把水印所有可能出现的位置都包住——漏框一次结果里就混进一行杂音。文档识别里也有忽略区域而且可以按页码范围设置专门用来排除扫描件的页眉页脚。第五道工序扫描版PDF洗成能搜索能复制的文档这是把旧书档案数字化的压轴一步。文档识别支持pdf、xps、epub、mobi、fb2、cbz六种格式底层逻辑可以概括为三步解析 → 识别 → 重组。PDF 先被拆开区分出本来就有文本层的部分和需要 OCR 的扫描图片层扫描页交给本地引擎逐页识别最后按阅读顺序重新拼装输出。两个亮点值得展开双层可搜索 PDF输出为底层是原图、上层是透明文字的双层 PDF。外观跟原扫描件一模一样但里面的字可以搜索、复制、划线。给公司归档历史合同、给学校数字化旧论文它都能直接顶上。灵活的提取模式软件优先提取 PDF 自带的文本层快、零识别误差只有遇到纯扫描页才自动切到 OCR。你也可以主动选择整页强制 OCR或反过来只提取原文本。v2.1.2 起还支持输出单层纯文本 PDF想要体积小、好编辑的文件就选它。⚠️ 提醒一句如果你手头的扫描件是旋转过方向的务必用最新版。v2.1.5 专门修复了 PDF 页面旋转导致的文本错位问题。第六道工序把整套流程交给命令行和接口图形界面够用但如果你想把它嵌进自己的工作流Umi-OCR 还留了两条暗号通道。命令行入口就是主程序本身几个常用姿势# 截屏识别结果直接进剪贴板 umi-ocr --screenshot --clip # 识别指定图片结果输出到文件 umi-ocr --path D:/扫描件.png --output result.txt # 识别整个文件夹含子目录 umi-ocr --path D:/scans -- all_result.txt # 生成二维码 umi-ocr --qrcode_create 你好Umi-OCR D:/qrcode.png 256配合快捷键工具还能实现按一个键自动截指定区域并识别。软件启动后还会提供本地 HTTP 接口OCR、文档识别、二维码都能通过接口调用方便你写脚本自动化比如上传图片 → 返回 JSON 识别结果。命令行依赖本地 HTTP 服务进行进程间通信默认开启且只监听本地环回、不经过物理网卡——数据不会外泄放心用。顺手调三个旋钮语言、排版、性能把流程跑通之后再花两分钟把手感调到顺手。旋钮一界面语言。全局设置 → 语言/Language支持中文、繁体中文、英文、日文、俄语、葡萄牙语等。注意界面语言和识别语言库是两回事。界面语言管按钮菜单识别语言库管引擎认哪种文字在各标签页的文字识别设置里单独选。界面用中文、日常识别日文书完全可以搭配。旋钮二排版方案。OCR 引擎吐出的字是散装的谁先谁后靠排版解析来摆。方案选对了输出才符合阅读习惯排版方案一句话说明多栏-按自然段换行多栏论文书籍自动断段最常用多栏-总是换行每句独立成行方便按行处理多栏-无换行整段压成一行单栏-按自然段换行单栏文档段落自然换行单栏-保留缩进代码截图专用保留行首缩进和行中空格不做处理引擎原样输出不确定选哪个直接上多栏-按自然段换行能覆盖大多数场景。写代码的朋友记得试试单栏-保留缩进——把代码截图扔进去缩进结构基本原样保留小程序员的福音。旋钮三性能。三个常见问题各有解法长图识别不完整到文字识别设置里调高限制图像边长而不是盲目放大原图——过度放大会增加噪声反而降低准确率。内存占用偏高PaddleOCR 插件 v2.1.4 起默认把内存占用限制在系统总内存一半以内想再压可以在插件配置里调低线程数。截屏闪烁或界面错位这是显卡渲染兼容问题去全局设置 → 界面和外观 → 渲染器切换渲染方案或直接关硬件加速。卡壳时对号入座一张速查表把最常见的卡壳点集中成一张表遇到问题直接查现象对策忽略区域画了没效果检查矩形框是否包住整个文本块确认已保存配置长图识别缺字调高限制图像边长别放大原图截屏闪烁、界面错位切渲染器或关闭硬件加速命令行指令没反应确认全局设置里 HTTP 服务已开启批量任务想中途休息用暂停任务待机/休眠后继续跑代码截图排版全乱切到单栏-保留缩进多栏论文输出顺序串行切到多栏-按自然段换行超大文件夹加载很卡等异步加载完成预览界面有加载进度最后叮嘱两句一句话记住它的性格免费、开源、离线数据不出你的硬盘。这也是它和在线识别网站最本质的区别——敏感合同、隐私笔记你可以放心扔给它。而软件自带的 Rapid-OCR兼容性好与 PaddleOCR速度快两套引擎也足够你折腾一阵子了。所以别等哪天有空了。今天下班后就把那箱旧照片的文件夹拖进批量OCR点上忽略区域按下开始任务。明早醒来你手里就多了一份等了三年都没等到的可搜索档案。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考