拓冰建站拓冰建站
首页 / 资讯中心 / 正文

如何 10 分钟让扫描 PDF 可搜索可复制:OCRmyPDF 实战指南

如何 10 分钟让扫描 PDF 可搜索可复制OCRmyPDF 实战指南【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDFOCRmyPDF 是一款开源 PDF OCR 工具给扫描版 PDF 叠加一层可搜索的文本层。它不改变文档外观却能让文档被搜索、复制和归档。适合要处理扫描合同、旧文档、纸质文件的人。遇到这些情况你就需要 OCR扫描合同里想复制一句话只能对着图片干瞪眼在扫描文件里搜人名、单号什么都搜不到地图、图表类文档想搜地名又怕处理完图被弄乱上图是地图扫描文档OCR 后地名可搜索地图本身保持原样两步装好并跑通第一次 OCR需要 Python 3.11 以上一条命令安装pip install ocrmypdf再一条命令处理文件把输出指向新文件ocrmypdf scan.pdf searchable.pdf跑完后 searchable.pdf 和原件看起来一样但文字已经能选中、能复制。上图是 OCRmyPDF 实际运行截图扫描、OCR、转 PDF/A、压缩一步完成常用 OCR 参数速查参数作用何时用-l chi_sim指定识别语言多语言用连接文档是中文或中英混合时--rotate-pages自动把横倒的页面转正扫描方向乱的时候--deskew纠正倾斜的文字页面歪斜几个角度时--clean去污点、杂质扫描件背景脏的时候--oversample 600先以 600 DPI 渲染再识别识别不准、原图模糊时--pages 1-10只处理指定页大文件先试几页时进阶玩法当你需要批量 OCR 整个文件夹终端一行 for 循环跑完当前目录所有 PDF输出统一加ocr_前缀for f in *.pdf; do ocrmypdf $f ocr_$f; done并发太多时加--jobs 1限制进程数即可。上图是排版密集的技术说明书扫描件OCR 后即可全文搜索当你需要抢救低质量扫描件模糊的低分辨率图别直接识别先提渲染分辨率再跑 OCRocrmypdf --oversample 600 old.pdf out.pdf老打字机文档、低清扫描用这一个参数识别率通常明显提升。上图是打字机旧文档扫描件提高分辨率后更容易识别当你需要归档标准文件命令末尾加--output-type pdfa输出就变成符合国际归档标准的 PDF/A-2 文件适合要长期保存的合同、票据类文档。翻车与自救识别结果乱码→ 语言选错了。装语言包如sudo apt install tesseract-ocr-chi-sim再用-l chi_sim重跑大文件处理报内存不足→--jobs 1限制并发或用--pages分段处理跑完文件没变化→ OCRmyPDF 默认跳过已有文本层的页面想强制重做加--redo-ocr装完找不到命令→ 用ocrmypdf --version验证确认安装目录在 PATH 里指向扫描 PDF它就变成可搜索、可复制的文件。完整参数参考项目docs/目录下的官方文档。【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDF创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门