Umi-OCR 离线OCR使用指南:免费识别截图、图片与PDF
Umi-OCR 离线OCR使用指南免费识别截图、图片与PDF【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCRUmi-OCR 是一款免费、开源、离线运行的 OCR 软件。它把文字识别整个放在你本地电脑上完成屏幕截图、图片文件、PDF 文档、二维码都能处理不上传、不联网。内置多种语言识别库解压即用。适合经常要从截图里抠文字、要批量转换扫描件、或想把识别能力接到自己脚本里的个人和团队。️ 装好软件跑通第一次识别获取方式二选一。想直接用预编译版下载发行包.7z压缩包或.7z.exe自解压包解压后双击Umi-OCR.exe即可无需安装。想从源码构建则克隆仓库git clone https://gitcode.com/GitHub_Trending/um/Umi-OCR软件首次打开时会按你系统的语言设置自动切换界面语言之后可在“全局设置 → 语言”里手动改支持简中、繁中、英文、日语等。跑通第一次识别走最短路径打开“截图OCR”标签页按默认快捷键CtrlShiftA框选屏幕一块区域。几秒后左侧预览栏显示原图右侧记录栏显示识别出的文字。在记录栏划选文字即可复制或在预览栏用鼠标框选直接复制。除了快捷键截图还能在别处复制一张图片直接粘贴进软件识别。看到结果出现在记录栏说明环境已经跑通。 拿它做什么四类识别任务Umi-OCR v2 由若干标签页组成你按需打开。下面按“你想解决什么问题”来对应功能。屏幕上的文字截图OCR适合从技术文档、聊天记录、报错弹窗里提取文字。左侧预览栏支持鼠标划选复制右侧记录栏可以编辑文字也能多选几条记录一起复制。对代码截图切到“单栏-保留缩进”方案行首空格和缩进会原样保留复制进 IDE 基本不用再调。成堆的图片批量OCR适合一次处理几百张扫描图、截图归档。把文件夹或一批图片拖进来即可支持jpg / jpe / jpeg / jfif / png / webp / bmp / tif / tiff没有数量上限。识别结果可保存为txt、jsonl、md、csv(Excel)四种格式任务结束后还能设置自动关机或待机。遇到超长的图片记得在“页面的设置 → 文字识别 → 限制图像边长”里把数值调高避免大图被压缩丢字。整本扫描件文档识别适合把 PDF 扫描件变成能搜索的文字。支持pdf / xps / epub / mobi / fb2 / cbz对扫描件做 OCR或提取已有文本输出双层可搜索 PDF。也能设置忽略区域把每页重复出现的页眉页脚排除掉。码图二维码识别与生成适合从图片里读出二维码、条形码内容或反过来把文本生成码图。识别支持一图多码覆盖QRCode、DataMatrix、PDF417、EAN13等 19 种协议生成时可设置纠错等级等参数。 识别结果不顺眼这样调识别出来的文字顺序乱了、格式不对多半是排版没选对。Umi-OCR 用“排版解析方案”来整理识别结果的顺序和换行按下表选你识别的是什么选哪个方案效果双栏学术论文、报告多栏-按自然段换行默认自动识别多栏按自然段换行代码截图单栏-保留缩进保留行首缩进与行内空格报纸杂志等密集排版多栏-总是换行每句话单独换行普通单栏文本单栏-按自然段换行不区分多栏按段换行要原始输出不做处理直接给引擎原始结果这些方案都自动兼容横排和竖排竖排还需要引擎本身支持。结果里混进不想要的文字比如水印、LOGO、页脚用“忽略区域”在批量页右栏进入忽略区域编辑器按住右键画几个矩形框把干扰区域整个包住。处于框内的整块文本会被丢弃框外内容照常保留。引擎方面Umi-OCR 内置RapidOCR-json和PaddleOCR-json两套离线引擎。日常识别用默认的 RapidOCR 兼容性好追求速度可切到 PaddleOCR在“全局设置 → 切换OCR插件”里换即可。 让脚本和别的系统调用它命令行入口就是主程序umi-ocr --help查看全部说明。常用几条umi-ocr --screenshot唤起截图识别umi-ocr --path D:/img1.png识别指定文件或文件夹结果用--clip复制到剪贴板、用--output result.txt写入文件。命令行依赖软件内置的 HTTP 服务通信默认开启主机选“仅本地”即可过程只在系统本地环回进行。完整参数见 命令行手册。HTTP 接口在“全局设置”里勾选 HTTP 服务后就能用 RESTful 接口调用。默认端口是1224图片识别入口为http://127.0.0.1:1224/api/ocr建议先请求/api/ocr/get_options查一次可传参数语言、排版方案、忽略区域、返回格式等再按需发起识别。文档识别、二维码各有独立接口。注意后端并发能力有限尽量串行调用。详细字段见 HTTP接口手册。更多资料在哪遇到具体问题建议按顺序查这几份材料参数和字段以 HTTP接口手册 和 命令行手册 为准界面功能细节看仓库根目录的 README.md新功能与改动记录见 更新日志。Umi-OCR 把识别能力留在本地从一次截图到成批扫描、再到接口对接都是同一套引擎在跑。先把上面四类任务各跑一遍找到自己最常用的那个标签页剩下的就是调排版和忽略区域这类细活。想深入定制语言库或引擎或是对翻译、插件有兴趣可以翻源码和插件目录或在社区提问交流。【免费下载链接】Umi-OCROCR software, free and offline. 开源、免费的离线OCR软件。支持截屏/批量导入图片PDF文档识别排除水印/页眉页脚扫描/生成二维码。内置多国语言库。项目地址: https://gitcode.com/GitHub_Trending/um/Umi-OCR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考