拓冰建站拓冰建站
首页 / 资讯中心 / 正文

AAAI 2026 | LAT:让文档RAG一边推理,一边指出证据在哪里

在视觉文档问答中模型给出正确答案并不代表推理过程可信。面对论文、报告、网页截图和多页文档用户不仅需要知道“答案是什么”还需要知道模型依据了哪一页、哪张表以及每一步推理是否得到原始文档的支持。针对这一问题中国科学技术大学提出了Chain-of-EvidenceCoE推理范式和Look As You ThinkLAT强化学习框架让视觉语言模型在生成推理步骤的同时持续定位相应的视觉证据。一、文档RAG的问题不只是答错更是无法验证现有视觉文档检索增强生成系统通常包括两个环节。系统首先从文档库中检索相关页面再由视觉语言模型阅读页面并生成答案。为了提高可信度部分方法还会在最终答案后提供页码或边界框指出答案可能来自哪个区域。但这种“答案加最终证据”的方式仍然存在明显缺陷。模型只展示了最终结果却没有说明自己如何逐步找到答案。用户无法判断模型是否先定位到了正确章节是否准确读取了对应表格也无法确定中间推理是否引用了错误内容。例如面对“研究中共有多少名患者”这一问题模型可能正确回答“231”但用户仍然不知道模型是否找到了描述研究对象的部分是否正确读取了男性患者204人和女性患者27人以及最终答案是否真的由这两个数字相加得到。人类阅读复杂文档时通常不会直接跳到答案而是按照“章节、段落、具体元素”的顺序逐步缩小范围。论文认为可靠的文档RAG也应该呈现类似的渐进式证据搜索过程。Figure 1Figure 1清晰展示了传统回答方式与CoE的区别。模型不再只框出最终答案而是在寻找章节、读取句子、检查表格和完成计算的过程中持续标记当前使用的视觉区域。二、Chain-of-Evidence每一步推理都有据可查传统的 Chain-of-Thought 让模型输出一连串文本推理例如“先查找临床特征部分再阅读表格男性患者为204人女性患者为27人因此患者总数为231人。”这些文字看起来逻辑完整但用户无法确定模型是否真的看到了对应内容。模型也可能根据语言模式生成一段听起来合理、实际上没有文档支撑的解释。CoE在此基础上增加了一个关键要求每当推理步骤引用文档中的事实、图表或文字时模型都要同时输出对应的页码和边界框。以论文第一页展示的案例为例。模型需要回答“研究中共有多少名患者”。CoE推理过程会依次完成第一页展示的案例找到文档中“Clinical characteristics”部分。定位介绍队列特征的句子。转向表格进行确认。找到男性患者204人、女性患者27人的具体区域。计算得到总人数为231人并再次标出支持最终答案的表格区域。这样一来模型输出的不再只是一条文本推理链而是一条由“文字推理、页码、视觉区域”共同组成的证据链。从形式上看CoE需要模型同时生成三类结果• 文本推理步骤• 每个步骤对应的页面索引与边界框• 最终答案及其核心支持区域因此CoE的价值并不只是让输出“看起来更详细”而是把文档问答拆解为一系列可以逐步检查的证据单元。用户不仅能够核查最终答案也可以核查推理过程中的每一次信息引用。三、LAT框架用少量标注和强化学习教模型“边想边看”要让模型生成CoE一个直接方案是人工标注大量逐步推理过程并为每一步框选证据区域。但这种方法成本极高。标注者不仅要回答问题还需要编写完整推理过程定位页面并为多个中间步骤绘制边界框。为减少对人工标注的依赖论文提出了两阶段训练框架Look As You Think。两阶段训练框架第一阶段是冷启动监督微调研究团队从每个训练数据集中抽取1000个样本利用Gemini 2.5 Pro生成带有推理步骤、页码和边界框的CoE轨迹。生成结果先根据答案召回率进行过滤再由人工检查和修正错误的边界框及输出格式。经过筛选后大约30%的高质量样本被保留下来用于对Qwen2.5-VL-7B-Instruct进行LoRA监督微调。这一阶段的主要目标不是获得最终性能而是让模型先学会CoE的基本输出方式。第二阶段采用GRPO强化学习LAT从原始数据中抽取5%的问答样本让模型自主生成多条CoE轨迹再通过四类规则奖励判断哪些轨迹值得强化。答案准确性奖励LAT结合软精确匹配与词语召回率评估答案。完全匹配的答案可以获得较高奖励表达略有差异但包含关键信息的答案也可以获得部分奖励。逐步证据归因奖励对于每个带边界框的推理步骤系统会从原始文档中裁剪对应区域再使用ColQwen2计算该区域与推理文本之间的语义相似度。只有当推理内容与框选证据相匹配时模型才能获得奖励。LAT还计算不同步骤边界框之间的重叠程度防止模型在每一步都框选同一个大区域。该约束鼓励模型从较大的相关区域逐渐定位到更具体的内容。最终证据定位奖励模型不仅需要给出正确答案还需要正确选择答案所在的页面。预测边界框与真实证据区域的IoU超过0.5时模型才能获得最终定位奖励。格式奖励模型需要按照规定格式分别输出推理过程和最终答案。格式错误会得到负奖励从而提升生成结果的稳定性和可解析性。四种奖励分别约束答案、过程、最终证据和输出形式。更重要的是逐步证据奖励受到答案正确性的限制。也就是说只有最终答案足够准确时证据一致的中间推理才会得到强化。这一设计避免模型只学会“框选与文字看起来相关的区域”却无法生成正确答案。四、实验结果论文在Wiki-VISA和Paper-VISA上进行实验分别评估单图像与多图像场景。单图像场景直接向模型提供包含答案的页面。多图像场景则向模型提供三个候选页面模型需要先判断哪个页面包含答案再完成推理和证据定位。实验使用三个主要指标EM衡量最终答案是否正确。IoU0.5衡量最终证据区域是否定位准确。SA衡量每个中间推理步骤与对应视觉证据是否一致。表1与原始Qwen2.5-VL-7B相比LAT在四个实验设置中的软EM平均提升8.23个百分点IoU0.5平均提升47个百分点。证据定位能力的提升尤其明显。在Wiki-VISA单图像场景中LAT-Ind.的IoU0.5达到53.7而原始模型只有2.2。在Paper-VISA单图像场景中IoU0.5由3.8提升至49.9。在Wiki-VISA多图像场景中EM由54.9提升至64.5IoU0.5由11.0提升至38.0。在Paper-VISA多图像场景中EM由39.6提升至51.2IoU0.5由16.2提升至46.9。这些结果说明原始模型虽然具备一定的文档问答能力却很难精确指出答案所在区域。LAT在保持和提升答案准确性的同时显著改善了视觉证据定位。论文还单独评估了完整CoE推理过程。表2仅在提示词中加入一个CoE示例只能有限地改善模型表现。经过LAT训练后模型不仅能遵循CoE格式还能准确地将不同推理步骤绑定到相关证据区域。论文报告LAT生成的CoE轨迹平均SA达到57.1%表明模型已经能够在较大比例的推理步骤中实现文本内容与视觉证据的一致。图3五、过程与结果共同优化论文的消融实验揭示了LAT性能提升的核心原因。表4第一阶段监督微调得到的Mdist已经明显优于原始模型说明少量经过验证的CoE数据能够帮助模型掌握证据链格式并初步改善视觉定位。但从Mdist进入LAT强化学习阶段后IoU0.5和SA仍然获得了大幅提升。这表明仅仅模仿人工生成的CoE轨迹还不够模型还需要通过强化学习不断探索和筛选更可靠的推理路径。移除逐步证据奖励后模型的SA平均下降约15.5个百分点最终证据定位性能也随之降低。这一结果说明中间步骤的证据质量会直接影响模型最终能否找到正确答案区域。另一方面如果仅优化推理文本与视觉区域之间的相似度却取消答案准确性对过程奖励的约束模型可能生成“局部合理但整体错误”的证据链。因此LAT最重要的设计并不是某一个独立奖励而是将两类目标连接起来过程层面要求每一步推理都能找到对应证据结果层面要求整条证据链最终导向正确答案。这一思路也体现了论文的核心价值。传统文档RAG更关注模型有没有答对LAT则进一步追问六、总结LAT的核心价值不只是提升文档问答的答案准确率更在于把推理过程与视觉证据统一起来。通过Chain-of-Evidence模型需要在生成每一步推理时同步指出对应的页面和文档区域使用户能够沿着证据链逐步核查答案的来源。当然LAT仍有一定局限。图文语义相似度只能衡量推理文本与局部区域是否相关尚不能完全证明二者具有严格的逻辑支持关系。边界框形式也更适合单一区域定位在跨页面、多区域信息整合等复杂任务中仍显不足。尽管如此这项工作推动文档RAG从“给出答案”进一步走向“展示依据”。未来更可靠的文档智能系统不仅需要回答正确还需要说明答案来自哪里、经过了怎样的推理以及每一步是否能够回到原始文档中验证。当模型能够在思考过程中同步展示自己正在查看的证据文档RAG才真正从黑箱生成迈向可追溯、可核查的推理。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门