拓冰建站拓冰建站
首页 / 资讯中心 / 正文

OCRmyPDF完整指南:一条命令为扫描PDF添加可搜索文本层

OCRmyPDF完整指南一条命令为扫描PDF添加可搜索文本层【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDFOCRmyPDF 是一个免费开源的命令行工具作用是对扫描版 PDF 做 OCR 识别并把结果作为隐藏文本层写回文件使原本只能看的扫描件变成可以搜索、复制、做全文索引的文档。原图完整保留输出默认是经过校验的 PDF/A 归档格式。如果你经常处理扫描合同、档案资料或纸质文档的数字化这份指南按从装好到跑通再到处理疑难文件的顺序说明它怎么用。它接受什么输入产出什么文件项目说明输入扫描版 PDF也直接支持 jpg、png 等图片文件输出带可搜索文本层的双层 PDF默认为 PDF/A 格式文本位置文本层与图像逐字对齐复制粘贴时顺序不乱图像质量保留嵌入图像的原始分辨率不重采样校验输入输出都会做 PDF 有效性检查一句话概括它的产出外观和扫描件一模一样但在文字下面多了一层肉眼不可见、可以被选中的真实文字。图一份典型的扫描纸质文档处理后即可在其中搜索关键词。最快怎么安装第一条命令怎么写各系统都有一条安装命令装完即可直接使用系统安装命令Debian / Ubuntu / WSLapt install ocrmypdfmacOS (Homebrew)brew install ocrmypdfFedoradnf install ocrmypdf tesseract-osdFreeBSD / OpenBSDpkg install py-ocrmypdf/pkg_add ocrmypdf更细的环境差异Docker、离线安装等可查安装文档。装好后最小可用的命令只有两个参数ocrmypdf scanned.pdf searchable.pdf第一个是输入第二个是输出。运行期间它会先渲染页面、再逐页调用 Tesseract 识别完成后输出文件就能在 PDF 阅读器里搜索了。中英文混排或多语言文档能识别吗可以。语言通过-l参数指定多种语言用加号拼接可识别的语言数量取决于 Tesseract 语言包覆盖一百种以上语言语言包的安装方法见语言包说明。ocrmypdf -l engfra --sidecar out.txt in.pdf out.pdf上面这条命令做两件事按英法混排模式识别同时用--sidecar额外导出一份纯文本文件方便直接交给后续脚本做检索或分析。图一份荷兰语打字机文档属于多语言识别的常见输入类型。页面歪斜、方向转了、背景发脏怎么办这类问题在扫描件里非常常见对应四个参数参数作用--deskew估计页面倾斜角度并旋转回水平适合歪斜几度的扫描件--rotate-pages判断页面朝向把横倒、上下颠倒的页旋转正位--clean清除扫描图中的噪点、小黑点--remove-background压制背景底色让文字更干净ocrmypdf --deskew --rotate-pages in.pdf out.pdf原理上一句话带过deskew 依据文本行的角度估计来计算旋转量识别引擎是 Tesseract图像预清理由 unpaper 完成。一整批文件怎么批量处理在放满 PDF 的目录里一条 for 循环就够了for f in *.pdf; do ocrmypdf --deskew $f ocr_$f; done补充两个与批量场景相关的参数--jobs N指定并行工作进程数不写时默认用满 CPU 核心--optimize NN 取 1 到 3在识别后压缩图像数值越大文件越小、画质损失越大。多页大文件会按页并行处理进度条会实时显示各阶段状态。图实际运行截图展示了多页并行扫描、识别与优化各阶段的进度。更多批处理写法如跳过已有文本层、失败续跑可参考批处理文档。下一步按系统表格安装后运行ocrmypdf --help确认工具可用并浏览全部选项。挑一份手头的扫描件执行ocrmypdf 输入.pdf 输出.pdf在 PDF 阅读器里搜索一个已知词验证文本层已生效。有批量或归档需求时克隆仓库获取完整脚本与文档git clone https://gitcode.com/GitHub_Trending/oc/OCRmyPDF其中 docs/batch.md 与 docs/pdfa.md 是后续最常查的两篇。【免费下载链接】OCRmyPDFOCRmyPDF adds an OCR text layer to scanned PDF files, allowing them to be searched项目地址: https://gitcode.com/GitHub_Trending/oc/OCRmyPDF创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门