拓冰建站拓冰建站
首页 / 资讯中心 / 正文

37 种语言一次搞定:MinerU 多语言 OCR 实用指南

37 种语言一次搞定MinerU 多语言 OCR 实用指南【免费下载链接】MinerUTransforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows.项目地址: https://gitcode.com/GitHub_Trending/mi/MinerU一批合同扫描件同一页里混着中文、英文和日文条款你想把文字提取出来建可检索的知识库过去只能按语言拆成三份分别处理。MinerU 2.1.0 的多语言 OCR 支持 37 种语言的文字识别平均精度提升超过 30%而 MinerU 多语言 OCR 使用方法的要点其实就是一个语言参数。先看效果再讲用法不列功能清单直接看三个输入 → 输出的例子。例子一中英混排的扫描版 PDF。输入是没有文字层的扫描件输出是按段落切分的 Markdown中文、英文各自成段页眉页脚被自动去除公式转成 LaTeX。例子二纯俄文的技术手册。整页西里尔字母识别结果保持原有阅读顺序输出段落和表格结构不丢失。例子三日文为主、夹带繁体中文注释的专利文件。同一份文档里两种字符体系共存输出时按版面位置排序不会把日文段落插到中文注释中间。 五分钟跑通先装包再跑一条不指定语言的命令——不指定语言就是自动模式系统自己判断该用哪套识别模型pip install mineru mineru -p ./contract.pdf -o ./out mineru -p ./ru_manual.pdf -o ./out --lang eslav自动模式的判定路径是这样的手动指定语言有两种方式命令行加--lang参数如上Python 调用时传同名的lang参数即可其余写法不变。 它都覆盖哪些语言判断依据是你手上的文档大概率是什么语言。字典文件可以理解为模型附带的字符集表它决定了模型能输出哪些字符PP-OCRv5 则是这套识别模型的系列名称全部语言共用一个文本检测模型。文档语言类型语言代码识别模型字典文件中、英、日、繁混排及常见拉丁字母语言ch默认PP-OCRv5 ch 模型ppocrv5_dict.txt法语、西语、葡语等欧洲语言latinPP-OCRv5 latin 模型ppocrv5_latin_dict.txt俄语、白俄罗斯语、乌克兰语eslavPP-OCRv5 eslav 模型ppocrv5_eslav_dict.txt阿拉伯语、波斯语、乌尔都语等arabicPP-OCRv3 arabic 模型arabic_dict.txt泰米尔语、泰卢固语、卡纳达语ta / te / ka对应语言 PP-OCRv3 模型对应字典文件印地语、梵文等天城文系语言devanagariPP-OCRv3 devanagari 模型对应字典文件代码只在--lang这一个位置出现正文其他地方不需要再记。 三个真实工作流工作流一国际化合同批处理输入一个目录约 50 份中英混排扫描件。做法目录可直接作为输入一条命令跑完整个文件夹。mineru -p ./contracts/ -o ./out注意点先抽两页确认中英混排切分正常再放全量遇到整页日文的个别文件单独用--lang ch重跑即可。工作流二多语言论文引用抽取输入参考文献夹带俄语、西语文献的论文。做法只解析引用所在的页码区间减少无效计算。mineru -p ./paper.pdf -o ./out --lang eslav -s 12 -e 18注意点正文与引用语言不一致时正文按默认模式跑、引用页按 eslav 跑结果合并比全程锁定一种语言召回更稳。工作流三批量手册转换输入20 份手册俄文与拉丁字母语言混合。做法按文件名循环调用输出目录与源文件一一对应。for f in ./manuals/*.pdf; do mineru -p $f -o ./out/$(basename $f .pdf) --lang eslav done注意点阿拉伯语文档走的是 v3 模型见下节批量前先抽样验证准确率。参数细节可查 命令行工具说明 与 快速上手。⚖️ 效果与代价先看数字这是 2.1.0 前后两代模型在同一批样本上的对比指标旧版PP-OCRv42.1.0PP-OCRv5变化单语文档识别准确率85.2%92.7%8.8 个百分点多语言混排识别72.1%89.3%23.9 个百分点处理速度3.2 页/秒3.8 页/秒18.7%内存占用512 MB480 MB−6.3%短板也要说清楚阿拉伯语系目前仍由 v3 模型承担没有升到 v5卡纳达语等小语种训练语料有限低清扫描件上的精度低于主流语言语言指错语系时效果反而比默认模式差。所以实践上的取舍是扫描源尽量保证 300 DPI单语文档明确指定语言混排文档交给默认模式大文档批处理时控制单批页数与并发数跑完抽 5% 的页面人工核对。 排错三问语言识别不准时先检查什么先确认文档主语言是否已被默认模型覆盖——中、英、日、繁本来就在 ch 模型的范围内纯英文文档通常不必额外指定。再试什么用--lang锁定主语言重跑仍不理想时可把语言置信度阈值系统判定语言归属的分数线调低一点让边界样本换一次模型。混合文档效果差时先检查什么看各语系的占比中文文档里零星出现外文术语影响很小两种语言各占一半时单一模型必然顾此失彼。再试什么按页拆分——主体语言跑一遍效果差的页用对应语言代码重跑最后合并结果。特定语言识别错时先检查什么对照上表的字典文件确认出错字符在该语系字典的覆盖范围内西里尔文文档出现大量拉丁文混淆多半是语言参数没指对。再试什么提高扫描分辨率或换到 ch_server 这类强化了特殊字符的模型再验证一次。一个语言参数换 37 种语言的能力批处理前建议先用几页验证准确率。本文基于 MinerU 2.1.0 编写参数名以实际版本为准。【免费下载链接】MinerUTransforms complex documents like PDFs and Office docs into LLM-ready markdown/JSON for your Agentic workflows.项目地址: https://gitcode.com/GitHub_Trending/mi/MinerU创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门