《大话文渊慧典》:外三篇-欧洲用AI重建古罗马,我们还在为竖排发愁:差距与底气都在哪里?

发布时间:2026/7/30 14:19:21
《大话文渊慧典》:外三篇-欧洲用AI重建古罗马,我们还在为竖排发愁:差距与底气都在哪里? ——小菜“大胖老师我昨天刷到一个新闻说欧洲用AI把整个古罗马城都重建出来了连哪条街上有几家面包房都一清二楚。再看看咱们还在纠结一页古籍能不能认全。这差距是不是有点大”——二黑推了推眼镜从手机里翻出一篇论文摘要“你说的是‘欧洲时间机器’项目。他们用深度学习分析古罗马的建筑遗迹、铭文、地图重建了公元四世纪罗马城的三维模型。预算两亿欧元干了快十年。”——大胖老师端起保温杯吹了吹热气“两亿欧元十年。咱们的预算呢零。干了多久三年。团队呢仨人加一群贴膏药的研究生。你拿这个跟人家比就好比拿三轮车比高铁——不是不能比是比的维度不对。” ——小菜不服气“但人家确实牛啊。咱们就不能也搞点高大上的”——二黑合上手机“高大上的背后是什么是人家花了二十年把古籍OCR的基础问题先解决了才有余力去搞三维重建、知识图谱。我们呢连竖排都还没搞利索。这不是谁聪明谁笨的问题是发展阶段不同。但要说底气我们也有——而且是欧洲人羡慕不来的那种。”一、欧洲的“天花板”标准、联盟与千年古城大胖老师在白板上贴了一张欧洲地图上面标注了“Europeana”“时间机器”“大英图书馆”等项目的位置。“欧洲在古籍数字化上强在三个字标准化。他们搞了一套元数据规范——Dublin Core、METS、ALTO——精细到每一页、每一行、每一个字的坐标都能结构化存储。全欧洲几千家图书馆和文化机构用同一套标准描述数字资源跨库检索丝般顺滑。这是他们最厉害的地方。”“时间机器项目更是雄心勃勃”二黑调出一段项目介绍“不仅扫描古籍还用AI把古地图和历史文献里的地名、建筑、人物关系自动抽取出来构建一个跨越千年的欧洲历史地理信息系统。他们现在能在数字世界里重建古罗马城、中世纪威尼斯、文艺复兴时期的佛罗伦萨。点一下某个建筑能跳出所有相关文献记载。这种知识图谱级别的东西我们的确还做不到。”小菜听得眼睛发直“这不就是咱们的终极梦想吗”大胖老师点头“是。但你要看清楚他们为什么能做到。第一拉丁字母的OCR技术已经成熟了几十年他们不用为‘竖排横排’‘己和已’这种问题发愁。第二欧洲各国的古籍数字化起步比我们早了至少二十年数据积累雄厚。第三他们有欧盟层面的持续资金支持——不是一次性项目经费而是列入长期预算的基础设施投资。”“但我们也有他们眼红的东西。”二黑话锋一转“我去年在一个国际会议上听一位德国教授抱怨他们想训练一个中世纪拉丁文手稿的OCR模型但公开的标注数据只有几千页而且分散在十几个国家版权和隐私限制让数据整合几乎不可能。他听说我们有五千页金标古籍数据、而且愿意全部开源时眼珠子都快瞪出来了。他说了一句话我至今记得‘你们中国人是真的愿意把好东西拿出来共享。’”二、我们的差距不是技术是“时间债”大胖老师在白板上画了一条时间轴从2000年延伸到2026年。“说回差距。欧洲和美国大规模启动古籍数字化是在2000年左右。谷歌图书计划2004年开始哈佛燕京从2000年就批量扫描馆藏。我们呢国图大规模扫描是2012年以后的事。这中间的十几二十年人家不仅积累了海量的扫描数据更重要的是积累了一整套工作流——怎么扫描、怎么元数据著录、怎么质量检查、怎么上网发布。我们到2020年还在争论‘要不要做OCR’人家已经在做知识图谱了。”“这就是‘时间债’。”二黑补充“就像两个人跑步人家提前跑了二十分钟你后面跑得再快也不可能马上追上。而且时间债不仅是时间差还包括人才培养滞后——既懂古籍又懂深度学习的人全中国可能不超过三位数标准建设滞后——我们直到近几年才推出古籍数字化元数据国家标准经费结构失衡——钱大多花在扫描硬件上投给OCR技术研发的很少。”小菜有点沮丧“那咱们岂不是永远追不上”大胖老师摇头“追不上不代表不能另辟蹊径。移动支付我们没走信用卡阶段直接跳到扫码支付现在全球领先。古籍OCR我们也有机会走一条不同的路——不是砸钱不是封闭不是手工作坊而是用开源协作的方式用最轻量的技术栈覆盖最广大的基层需求。”三、我们的底气数据、场景、开源社区二黑站起来在白板的另一侧写下了三个词数据、场景、社区。“先说数据。”他打开一张图表“中国大陆现存古籍约三千万册。这是什么概念哈佛燕京号称北美最大的东亚图书馆中文古籍也就六十万册。整个欧洲的中文古籍加起来可能还不如我们一个省馆。我们的数据资源是全世界任何国家都比不了的。虽然目前标注数据还不多但数据源天然是我们的。只要标注工具和激励机制跟上来我们在数据规模上碾压全球只是时间问题。”“再说场景。”大胖老师接过话“从国图到县馆从学者到民间爱好者中国对古籍数字化的需求是全世界最旺盛、最多元的。欧洲一个数字人文项目可能只需要满足几百个学者的学术需求我们要满足的是几千万普通读者、几十万研究者、几千家图书馆。这种海量场景的驱动会倒逼我们做出更实用、更普惠的技术。”“第三个是社区。”二黑打开GitHub页面“PaddleOCR在GitHub上的Star数已经超过了绝大多数国际OCR开源项目中文模型的能力全球领先。虽然针对古籍的优化还有待提升但基础模型的迭代速度是全世界最快的。更重要的是中国的开源社区有一种独特的活力——民间开发者愿意为‘没用但有趣’的事情花时间。那个用PaddleOCR做家谱识别的深圳程序员那个用Tesseract硬怼竖排的大学新生那些在‘吾与点’平台上义务校对的大爷大妈——这种自下而上的热情是比算力和经费更宝贵的资源。”四、一张表说清楚差距与底气大胖老师画了一张对比表投在屏幕上维度欧洲/美国中国我们的底气起步时间2000年左右2012年左右后发优势可以直接用最新技术数据存量有限中文古籍少海量三千万册全球最大的中文古籍数据源标准化程度极高正在追赶后发可以直接对标最新国际标准资金投入持续且充裕断层且不均轻量化方案降低了对资金的依赖人才储备图情AI复合人才较多极度稀缺开源社区降低了技术门槛核心痛点多语种、手写体竖排、繁体、异体我们的痛点最痛解决后的收益也最大技术路线封闭商业为主开源社区协作社区活力全球领先需求规模学术驱动相对小众全民需求海量长尾场景倒逼技术迭代“看懂了没”大胖老师敲着表格“表面上看我们落后一大截但换个角度看我们的优势全在‘规模’二字——数据规模、需求规模、社区规模。这些规模优势一旦被激活产生的加速度是任何先发国家都比不了的。”五、殊途同归欧洲重建古罗马我们重建古中国二黑忽然想起什么调出一张图片——那是“时间机器”项目的三维重建截图古罗马斗兽场和元老院的数字模型栩栩如生。“其实欧洲重建古罗马和我们用OCR识别古籍本质上是同一件事——把散落在故纸堆里的文明碎片拼回原来的样子。只是他们拼的是建筑和街道我们拼的是文字和句子。他们用三维建模和知识图谱我们用版面分析和文字识别。工具不同目标一致。”大胖老师点头“而且他们的古罗马重建之所以能做得那么漂亮前提是把拉丁文古籍的OCR问题先解决了。没有准确的文本识别那些古地图上的地名、建筑名、历史事件就提取不出来。我们也是——不把竖排繁体搞定后面的知识图谱、三维重建就无从谈起。我们现在做的事是铺路。路铺好了以后的‘数字重建古长安’‘数字复原宋代苏州’就是水到渠成。”小菜若有所思“所以我们不是在为竖排发愁而是在为以后的‘数字复原中华文明’打地基”“对。”二黑推了推眼镜“而且我们的地基必须比欧洲的更宽、更厚、更能承重。因为中华文明的时间跨度和空间广度比古罗马大得多。他们重建一个城邦我们要重建一个天下。这不是自卑的理由这是终极的野心。”六、尾声差距是刻度不是判决书文章快结束时大胖老师分享了一件最近的事。“上周我接待了一个从法国来的访问学者。她研究的是敦煌文献特别羡慕我们能直接到敦煌去看原件。她说你们有那么多的古籍那么完整的文明记录简直是数字人文研究者的天堂。我当时就想对我们有全世界最丰富的历史文献遗产这不是我们的负担是我们的矿藏。现在矿藏还埋在地下但已经有人在打井了。”他在白板上写了最后一句话“差距不是判决书是刻度。它告诉你现在站在哪里不是决定你最终能走到哪里。”二黑补充“欧洲用AI重建古罗马我们还在为竖排发愁。但没关系。他们用了二十年我们可以用十年。他们花了两亿欧元我们可以用开源社区的力量做到同等量级。他们的优势是早我们的优势是多。多到如果我们做成了将是对全世界文明的贡献。”窗外夕阳正好。小菜在笔记本上写道“欧洲有重建罗马的雄心我们有重现汉唐的底气。差距不是墙是路。我们在路上。”他给这篇笔记配了一个标题就叫《差距与底气》。大胖老师的保温杯里今天泡的是王姐刚寄来的新茶。他喝了一口忽然说“二黑下一期咱们聊聊那些年我们花过的冤枉钱吧。踩过的坑不给后来人看清楚等于白踩了。”二黑从抽屉里掏出那本《文渊慧典填坑日志》“已经整理好了随时可以讲。”窗外图书馆的灯次第亮起。实验室的白板上那张对比表旁边又多了一张“全球古籍数字化起步时间图”。小菜在图下写了一行小字早行的有早行的风景晚到的有晚到的从容。只要在路上就永远不晚。本文为注水技术版您看看即可不必当真写此文字就是图一乐-