拓冰建站拓冰建站
首页 / 资讯中心 / 正文

让 37 个模型去考 3000 年前的字:最强 OCR 专精的甲骨文卷只拿了 2.45 分

一句话总结Ancient-Bench 用 2,700 张精标图、9 种载体介质、7 种书体、3,000 余年跨度给认古字立了一把统一标尺37 个模型同场考试全员不及格——最强综合模型 F1 也只有 57.86满分 100越高越好OCR 专精模型在甲骨文子集最高仅 2.45。做 OCR、多模态评测和数字人文的同行这份成绩单值得细看。 导语你的 OCR 模型敢考一场 3000 年前的试吗做 OCR光学字符识别把图片里的字变成机器可读文本的同学多半活在一种舒适区里手头的测试集不是印刷体现代文档就是清晰规整的证件票据模型刷到 95 分以上不算新闻。但如果把一张 3000 年前的甲骨拓片丢给你的模型它还认得几个字这不是抬杠。文物数字化、古籍整理、数字人文研究第一道工序都是把古字变成可检索的文本。可你想找个能横向比较的基准时就会发现测甲骨的只有甲骨测古籍的只有古籍各家标注口径还不一样——模型 A 在这份榜 80 分、在那份榜 50 分到底信谁的Ancient-BencharXiv 2608.2716912 位作者就是来终结这种各考各的局面的9 种载体介质、7 种书体、横跨 3000 余年的 2,700 张图用统一标准重新标注再把 37 个模型——从 GPT-5 到一票 OCR 专精选手——统统拉来同场考试。成绩单相当难看而且难看得很有信息量。想看原文 论文arXiv 2608.27169 这篇论文到底想解决什么问题一句话版的研究问题怎么造一把公平的尺子系统地量出模型跨介质、跨书体、跨时代认古字的真实水平之所以要新造尺子是因为旧尺子全是单科卷。论文用一张对照表盘点了现有基准的碎片化大致四类问题介质专属MTH1000、M5HisDoc、HisDoc1B 只覆盖印刷古籍OBI-Bench 只做甲骨DeepJianDu 只做简牍CalliBench 只做书法书体不全没有任何已有基准同时覆盖全部 7 种书体时间稀疏有的只收到 1911 年的刻本有的只有商代甲骨中间两千多年是空白标注规范缺失重文号、残损占位、异体字、阅读顺序这些古文档特有坑各家各说各话。最接近的 MCHDoc 想把多介质攒到一起但数据主要回收自已有单介质数据集标注标准并不统一。换句话说在此之前模型对 3000 年文字演化的泛化能力这件事从未被系统测过——这也正是文博机构做数字化时心里最没底的一环。️ 它的思路是什么怎么破作者的思路不是再添一份单科卷而是重出一张综合卷。先说清楚Ancient-Bench 本身不提出新识别模型它干的是造考卷的活——采集数据、定标注标准、定打分规则再把模型拉来测。数据从 14 家国家级文博机构系统采集9 种介质各 200–400 张、共 2,700 张时间从公元前 1200 年的甲骨一路排到 1911 年书体覆盖甲骨文、金文、篆书、隶书、楷书、草书、行书 7 种。图说2,700 张图像、9 种异质介质与主流书体串起 3,000 年文字演化字符级区分隶定释文与简繁、生僻、异体字并标注特殊符号、阅读顺序与版面信息。图像先过三步预处理原始 PDF 批量转高清图用多模态大模型过滤掉水印严重或不可逆损坏的样本帛书因介质本身易损获得豁免再用图像处理算法精确定位、裁出待识别的文字区。这样评测量到的才是认字难而不是画质差。真正的硬功夫在标注。论文提出三大规范化标准核心原则是所见即所得——图上是什么就记什么不做面向现代读者的翻译。每条都点在古文档特有的坑上 符号规范化重文号形如两短横的表示此字再写一遍在简牍帛书里还可能表合文、专名一律原样保留看不清或损毁的字用 □ 占位字库未收录的古体字统一标 。✍️ 字符规范化古文字隶定把甲骨、金文里古奥的原字形按学界通行做法转写为今人可读的隶楷字形以繁体为基准商代甲骨的马要标成馬简繁不归一——後/后这类被简化合并的字在古文里本义不同照图像字形录有通行异体字的未编码字做替换没有的用占位标签。 解析规范化竖排从右往左逐列换行行间留白转成 标记大留白约等于分段小字双行夹注用全角括号包住刻本的书口、书耳包进 天头地脚的批注包进 除印章子集外后世收藏印一律不标。这套规范的价值是把博物馆面向现代读者的可读性转录系统性改造成了可公平评测的真值——我倾向于把它理解成给古文字数据集界提供了一份可复用的标注模板。标注执行也够重20 名受训标注员干了六个月靠殷契文渊、古音小镜、字统网、说文解字四部专业工具逐字交叉核验再经中文与历史领域专家反馈修正、独立复核人终审。甲骨子集的标注流程长这样图说依据原器信息在专业工具中定位拓片交叉核对摹释总集的释文再经字库逐字验证——单张图背后是多工具交叉验证 多轮人工 终审的质控链路。从统计画像看这份考卷的覆盖度设计得相当用心图像分辨率从 41×80 一路跨到 5,795×16,745相差两个数量级每图字符数则两极分化——玺印、甲骨、青铜器受载体面积所限多为短文本帛书、刻本、书法则能长到数百上千字。图说各介质样本量、介质与书体的对应关系、分辨率分布、机构来源分布与每图字符数分布——短文本介质与长文本介质并存难度天然分层。打分规则也有讲究。指标是字符级 NED归一化编辑距离分数把模型输出改成标准答案最少要增、删、改几个字按序列长度归一越接近 100 越好和 F1精确率与召回率的调和平均越高越好。打分前统一归一化□、 这类特殊标签当作不可拆分的原子 token 按出现次数匹配简繁不做归一——写错简繁本身就是识别错误标点差异忽略。Prompt 分两层9 条基准规则打底保留古符号、残损用 □、按列换行、只输出可见文字等再叠介质专属规则——甲骨要区分兆纹与笔画、未释读字统一标 印章要处理朱文白文与实物镜像简牍帛书要把合文拆开输出。这相当于把古文字学先验直接注入了考题——这个设计是双刃剑理性看待一节还要说它两句。 效果到底怎么样考卷出好了放考生进场37 个模型——10 个闭源 VLM、13 个开源 VLM、8 个端到端 OCR 专精、6 个管线式 OCR 专精——全部同题作答。结果一句话没有一个能摸到可用的边。综合最强是闭源的 Doubao-seed-2-0-liteNED 52.08 / F1 57.86开源阵营最强的 Kimi-K2.6 紧随其后50.62/56.62OCR 专精模型整体掉队端到端里最好的 HunyuanOCR 综合也只有 40.42/46.11两大旗舰被按在腰部以下GPT-5 综合 16.00/20.80GPT-4o 15.90/25.33——通用模型语言强救不了古字弱。最惨烈的在甲骨文子集OCR 专精模型里最好的 GLM-OCRF1 只有 2.45HunyuanOCR 2.29dots.mocr 干脆为 0Deepseek-OCR2 仅 0.27——接近全灭。通用 VLM 里最好的 Gemini-3.1-pro 也只有 15.75。别忘了甲骨是这 3000 年文字演化的起点起点处的字AI 基本不认识。难度梯度同样清晰古籍刻本的单介质最好成绩 94.66、碑刻 88.88、书法 84.24、摩崖 78.27到了帛书 52.21、印章 44.56、简牍 39.14、金文 38.48甲骨垫底 15.75——大体上文字越古老、离现代字形越远模型越抓瞎。另一个反直觉的发现是通用 VLM 整体好于 OCR 专精模型管线式先检测文本行、再逐行识别的模块化流水线又好于端到端一个模型直接从图出文本。专精不等于全能——我倾向于把它读成专精模型在古文字这种分布外数据上先验反而成了包袱论文自己也据此推断模块化的检测→识别分解对异质版面更稳健。图说红删除、绿插入、蓝替换的逐字对齐——甲骨金文上认成形近的现代字简牍帛书上的形近混淆与幻觉印章的镜像处理刻本的失分集中在生僻字与阅读顺序。把错题摊开看失败模式收敛在四类变体字与生僻字混淆——认成视觉形近的现代字特殊符号漏识或误识——重文号、合文这些小符号最容易被吞掉版面导致的阅读顺序错误——竖排、夹注一多顺序就乱视觉歧义下的幻觉——模型一本正经地脑补。其中最值得展开的是幻觉。论文在书法子集专门构造了幻觉评测抓出两种模式一是先验驱动的语义补全——草书笔画粘连变形时语言模型会补出通顺但无根据的字看错图也能写对常见句二是裁剪、检测带来的过度识别——检测框带进邻行笔画输出里多出一串连读字符。换句话说高分介质的成绩里有一部分是语言模型在写字而不是视觉在认字——看榜单时这层怀疑得留着。图说上为先验驱动的语义补全脑补出通顺但无据的字下为裁剪/检测导致的过度识别多出一串字符红删除、绿插入、蓝替换。 为什么你要关心数字摆完了落到所以呢。多模态大模型隔三差五刷榜的今天这份成绩单至少对三类人有直接用处️ 做文物、古籍数字化的别默认现成 OCR 产品能顶上——这次恰恰是专精模型在古文字上失效选型前先看它在你要处理的介质上的实测分数必要时走微调或人机协同 做多模态评测的这篇最值得抄作业的不是 2,700 张图而是方法论——三大标注规范、原子 token 计数匹配的评分协议、介质专属 prompt 的写法做任何垂直领域基准都用得上 做 VLM 训练与数据的甲骨、金文这些子集就是一份现成的短板清单书法子集的幻觉分析也在提醒你刷榜时小心语言先验代打。再往远看一层统一标尺对数字人文还有额外的意义3000 年的字形演化第一次能被模型横着读文字演化的量化研究从此有了一个可复用的底座。⚖️ 理性看待分数要先打个折扣再读这份成绩是模型 高度定制 prompt 归一化协议复合系统的成绩排名宜看作该协议下的相对量。具体有三点基准 prompt 注入了大量古文字学先验甲骨兆纹排除、印章共用字重组等不同模型对长 prompt 的服从度不同论文未做 prompt 敏感性消融数据来自公开渠道无法排除被测模型训练时接触过这些材料目前只有行/区域级转录暂无字符级框作者计划后续补充。工程层面还有两件事论文脚注给出的 GitHub 仓库在本文复核时尚未公开想复现得再等一等正文一处 SOTA 表述与主表矛盾正文称 kimi-k2.6 最优主表与结论均显示最强是 Doubao-seed-2-0-lite引用时以表格为准。基准论文自己也有笔误类的小瑕疵——读的时候表格和正文对照着看更稳妥。作者lusca 版本lusca-paper-blog v1.5.0 出处https://github.com/yjmm10/lusca-skill/tree/main/skills/lusca-paper-blog
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门