AI应用开发中的多模态输入:扫描件为何识别对文字却填错字段
一家企业的财务部门把报销单、合同、发票的扫描件和照片交给智能体做信息提取希望自动录入台账。单据版式规整时还比较顺利一旦遇到合并单元格、盖章压字或多栏表格智能体就会把金额提取到别的栏位日期和抬头也跟着错位。财务人员不得不逐张人工核对自动化没有省下人力反而多出一道返工。这类问题在AI应用开发中并不少见。企业把多模态输入当成图片转文字这么简单却忽略了从版面识别到结构化提取之间还有一长串容易出错的环节。表格多合并几格、一行文字被印章压住模型就可能读对了字却放错了位置。一种常见的误判是以为OCR能识别出文字提取就算成功了。可实际业务要的不是一行行文字而是与固定字段一一对应的结构化数据文字识别正确与字段归位正确是两件不同的事。另一种误判是以为把整张图交给大模型它自然能看懂版面。可扫描件的版式千差万别合并单元格、跨页表格、双栏排版、手写批注叠加模型在复杂版面上仍然可能错位靠一次生成就想得到可靠的字段并不现实。还有一种误判是以为提取结果只要数值格式没报错就能直接入库。可版面错位时数字本身往往也是对的只是被安到了错误的对象头上只看格式根本发现不了这种静默错误。拆开来看这类问题通常有三类原因。一类原因是缺少文档类型识别系统没有先判断输入是合同、发票还是通用单据不同类型的单据对应的字段定义、解析策略和校验规则并不相同混在一起处理就容易错位。另一类原因是版面与结构分析不到位系统没有先识别表格、文本块、印章、单元格及其空间关系遇到合并单元格或跨栏结构时文字与单元格的对应关系就会被打乱。还有一类原因是提取结果缺少校验字段提取出来之后没有结合识别器置信信号和字段规则做风险评估也没有做跨字段的一致性检查错误的字段就这样直接进了台账。针对这些原因一种实现方式是把提取链路改造成先识别、再分析、后校验的流程。起始环节是文档类型识别先判断输入属于哪一类单据再根据文档类型选择对应的字段定义、解析策略和校验规则而不是用一套通用规则硬套所有文件。紧接着是版面与结构分析识别表格、文本块、印章、单元格及其空间关系理清每个文字块和单元格的归属让后续提取在正确的区域范围内进行。具体实现可以采用区域切分也可以使用具备版面理解能力的文档解析模型而不是对着整页盲目识别。再往后是结构化字段提取按预先定义好的字段列表从对应区域里取出金额、日期、抬头等值并保留它们与版面位置的对应关系方便出错时回溯。字段定义还会带上数据类型和取值范围让提取本身就有约束而不是把版面里的任何文字都当作可用的值。随后是结果校验与风险判断结合OCR或文档解析器的置信信号、字段规则、版面一致性和交叉校验结果判断风险。校验不只盯着单个字段还要看跨字段的一致性合计金额与分项是否匹配、日期是否符合业务时间范围、抬头与税号和合同主体是否对应、表格行列关系是否一致这些才能发现数字合法却安错对象的静默错误。对于校验失败或低可信的字段进入降级处理转人工复核而不是直接入库也不依赖模型自报的置信度。本文基于青山不语AI工作室在部分AI应用开发项目方案中的实践将这套处理框架概括为多模态输入版面分析与结构化提取。它要解决的不是让模型看懂图片而是把版面上的文字转化成与字段一一对应、可校验、可追溯的结构化数据。这里有一道边界需要企业自己拿捏。哪些单据需要自动入库、哪些必须人工复核、字段校验的严格程度定在哪里涉及企业的财务制度和容错要求。服务方提供的是版面分析、字段提取和校验机制具体的字段规则、校验阈值和复核流程需要企业内部的业务和财务负责人确认。从行业观察来看企业评估AI应用开发服务时值得多问一句对方交付的系统有没有把文档类型识别、版面结构分析、字段校验、低可信降级作为一个整体来管理。我的判断是多模态输入不是一个图片转文字的按钮而是一条从文档类型识别到结果校验再到人工兜底的链路只有把错误挡在入库之前自动提取才真正值得信任。