开源OCR插件OCR It:20ms把PDF转Markdown,比Docling快近300倍
8 月 29 日前后一个叫 OCR It 的开源 OCR 工具在 GitHub 上火了起来。据报道这是 Y Combinator 孵化的 Firecrawl 团队联合创始人兼 CTO Nicolas Camara 宣布推出的能在 20ms 内把一份不可复制的 PDF 里的文字提取出来并转成 Markdown且 100% 离线运行。目前项目在 GitHub 上已有 343 个 star截至 8 月 31 日支持 Chrome 和 Firefox 两个浏览器。技术本质还是 OCR但把门槛打下来了先说清楚OCR It 本质上还是老牌的 Tesseract OCR 引擎通过 tesseract.js 在浏览器里跑 WASM 版不是那种大模型 OCR。它的价值在三个点上快。据报道在处理质量与 Docling 相当的前提下OCR It 比 Docling 快近 300 倍3 秒可处理 200 份 PDF的说法也来自相关报道。单页 20ms 这个量级意味着边翻页边识别几乎无感。纯离线。内置 Tesseract 的 WASM 运行时和语言包不联网、不要 API Key、不做任何出站请求图片不出本机。对在意数据隐私的文档场景这是很实在的优势。形态轻。它是浏览器插件框选一次区域之后按快捷键就自动截图-识别-翻页循环整本书都能变成可编辑的纯文本直接喂给 LLM 做总结和问答。顺带说一句 Tesseract 是什么它是老牌开源 OCR 引擎被 tesseract.js 编译成 WASM 后能在浏览器里直接跑这也是 OCR It 能纯离线的基础——识别全部发生在本地而不是把图片传到云端。作为打工人我比较在意的一点是公司文档、客户资料这类东西过一遍第三方 API心里总有点不踏实离线方案至少省了这道顾虑。怎么用安装后基本三步Windows/Linux 把 Option 换成 AltOptionShiftR 框选/重框选要识别的文字区域Enter 确认 OptionShiftS 识别当前页识别完自动翻到下一页 OptionShiftA 自动档截图→识别→翻页循环直到文档结束Esc 停止自动档会在这些情况下自己停下来连续识别到两张相同页面判定到底了、翻不了页、OCR 失败或卡住、达到 300 页上限。导出支持 Copy all 和 Download .txt每页之间带--- page N ---分隔符识别错的单页可以单独重跑。几个容易踩的细节来自项目 README属于公开事实中文不是开箱即用。内置语言只有英语、葡萄牙语、西班牙语简体中文chi_sim等 Tesseract 语言需要自己 vendoring 进扩展npm run vendor -- chi_sim这类方式再改src/shared.js里的语言列表。版面分析保持 Auto。README 给了实测数据把 Single block 模式用在双栏页面上字符错误率 52.9%而 Auto 是 0.0%。Single block听上去很稳实际会安静地翻车两栏内容会一行一行交错着拼出来。Chrome 内置 PDF 阅读器里自动翻页不可用阅读器是插件扩展注入不进去处理 PDF 建议手动档自己按翻页键。怎么选、有哪些坑简单版式选它文字清晰、单栏的扫描件/不可复制 PDFOCR It 够用胜在快、免费、离线。典型场景扫描版合同、电子书、翻拍的 PPT 截图、网页里的图片型 PDF这些都是它的舒适区处理后得到的纯文本可以直接进 RAG 知识库或者丢给 LLM 做摘要等于把喂 AI 前的脏活省掉了一半。复杂版式别指望它标题、脚注、表格、数学公式和正文混排的页面它目前处理得还不太稳定网友实测的共识是输出会乱。这种场景老老实实用 Docling、marker-pdf、RapidDoc 这类文档解析方案慢一点但版面还原好。服务端批处理别用插件它本质是人在浏览器里翻页适合个人和小批量要管道化批量处理选能在服务器上跑的库。版本迭代快的坑开源项目改快捷键、改行为是常态用之前看一眼 README 和版本号。最后说几句使用层面的建议。一是先小批量试、再批量跑拿一两页复杂页面测一下输出质量确认可用再开自动档跑整本免得一本几十页跑完才发现版面全乱了。二是把识别结果当半成品OCR 输出的文本总会有错别字和断行问题喂给 AI 前最好过一遍清洗或者在做总结和问答时让 LLM 容忍一定程度的 OCR 噪声。三是留意隐私边界虽然它不发任何请求但截图本身还是在你的浏览器里发生的涉及敏感页面该脱敏还是要脱敏别因为离线两个字就放松警惕。一句话总结OCR It 把文档转 Markdown 喂 AI这件事的门槛又压低了一截但离所有 PDF 丢进去就完事还差得远复杂文档该用重工具还是得用重工具。你怎么看评论区聊聊。