Meta AI提出全新评测框架GAMUT:如何判断AI“说全了没有“?

发布时间:2026/8/1 8:35:51
Meta AI提出全新评测框架GAMUT:如何判断AI“说全了没有“? 这项由Meta AI研究团队完成的研究发表于2026年7月论文编号为arXiv:2607.19322v1有兴趣深入了解的读者可以通过该编号查询完整论文。**评判AI的答案光看说错了没远远不够**假设你戴着一副智能眼镜看着桌上一盘热气腾腾的菜随口问一句这是什么菜怎么做的AI助手回答说这是西红柿炒鸡蛋需要用西红柿和鸡蛋。这个回答对不对严格说来没有一个字是错的。但你心里一定觉得少了什么——它没告诉你要先打散鸡蛋没说要用油没提炒的顺序更没讲火候。这个答案虽然没有说错但它严重不完整。这恰恰是当今AI评测领域长期忽视的一个核心问题。Meta AI的研究团队发现现有的评测方法大多只盯着AI有没有说错而完全忽略了另一个同等重要的问题AI有没有说全。为了解决这个缺口他们构建了一套名为GAMUTGrounded Assessment of Multimodal Factuality即基于真实场景的多模态事实性评估的全新评测框架与数据集。GAMUT包含1813道问题每道题都配有一份经过专家人工核验的详细评分标准。研究团队用它测试了14个当今最强的AI模型结果发现即使是最顶尖的模型——谷歌的Gemini 3.1 Pro——得分也只有58.7%远未及格。这说明让AI给出一个真正完整、详尽的答案至今仍是一个远未解决的难题。---一、现有评测方法的根本缺陷只检查错没错不管全不全要理解GAMUT解决了什么问题需要先弄清楚目前的AI评测是怎么做的以及它为什么不够用。目前学术界最主流的评测方法叫做分解-搜索-验证流程。简单说这套方法把AI的回答拆解成一条条独立的陈述然后逐一去网上搜索验证这些陈述是否正确。比如AI说炒鸡蛋需要油系统就去验证这句话对不对AI说西红柿富含维生素C系统就去核实这个事实。这套方法在发现AI说错了的方面相当有效就像一位严格的监考老师能准确圈出卷子上的错误答案。然而这套方法有一个根本性的盲点它只检查AI说了什么从不追问AI漏掉了什么。这就好比你让一个学生描述做一道菜的全部步骤他只写了需要西红柿和鸡蛋监考老师检查后说这两个事实都正确满分——但这显然是荒谬的因为这道答案几乎什么都没说。研究团队把这种有没有说错叫做精确度precision而把有没有说全叫做召回率recall。目前学界有一小部分工作开始关注召回率但仍然面临另一个更深层的问题所有这些方法无论是检查精确度还是召回率都把一道问题的答案视为一张独立事实的清单每个事实打一个勾或叉相互之间没有关联。现实中知识的组织方式远比这复杂。有些问题需要列出所有必须满足的项目比如一道菜的核心配料每一样都缺一不可。有些问题则相反答案是一个开放性的集合比如哪些传统菜肴用到了这种香料这里没有唯一正确的列表只要覆盖得足够广就算好。还有一类问题答案本身是一个有顺序的流程比如烹饪步骤说错顺序就是答错了即使每一步本身描述得都对。这些复杂的结构用独立打勾的清单完全无法表达。正是意识到了这个根本性的不足Meta AI的研究团队设计了一套全新的两级元评分标准框架而GAMUT就是这套框架在现实世界中的具体实例。---二、解决方案的核心用结构化菜谱描述完整答案再拆解成逐项检查清单GAMUT的核心思路可以用一个烹饪的比喻来理解。当一位厨师想把一道复杂菜肴的做法传授给徒弟时他不会只给出一张杂乱的食材列表而是会先画出整道菜的结构哪些食材是必不可少的主料哪些是可以灵活替换的配料制作步骤分几个阶段哪些步骤是绝对不能颠倒顺序的哪些可以根据实际情况调整。这份菜谱蓝图就是GAMUT中所谓的元评分标准meta-rubric它在结构层面描述了一个完整答案应该包含哪些内容以及这些内容之间的关系。但问题在于如果你直接拿着这份复杂的菜谱蓝图去让一个打分员给AI答案打分他需要同时考虑覆盖率、顺序、重要性层级等诸多因素很容易给出主观、不一致的评价——就像让不同的试吃员凭感觉给一道菜打分每个人标准都不一样。所以GAMUT在菜谱蓝图之上还设计了第二层把这份结构化蓝图用固定的机械规则自动转换成一张逐项检查清单——每一条都是一个非此即彼的是非题可以明确判断AI的回答是否满足该条件。这张清单就像一份标准化的验收表让AI打分员实际上是另一个大型语言模型能够客观、一致地逐条判断。这两层设计的精妙之处在于复杂的结构和主观判断发生在菜谱蓝图这一层由人类专家负责而实际的打分工作则在检查清单这一层进行每道题都有明确标准大大降低了评分的不一致性。研究团队把元评分标准中的内容分为五种类型分别对应了知识组织的五种不同方式。第一种叫简单知识就是一个单一的离散事实比如这道菜叫什么名字。第二种叫严格列表指的是一个有限集合其中每一项都是必须提到的比如一道菜的核心配料少了任何一样都是不完整的。第三种叫灵活列表指的是一个有效选项的集合但不要求全部说到只需覆盖足够多——比如用到这种食材的传统菜肴能列出五道菜和能列出两道菜是不一样的好但没有哪道菜是必须提到的。第四种叫流程指一个有顺序的步骤序列顺序本身承载着意义说错了顺序就算回答有误。第五种叫关系描述不同事物之间的联系或对比比如某种特性导致了某种效果。此外一个列表或流程还可以附带一个元洞见——这是对多个具体项目的总结性概括是一种只看单条项目无法得到的整体认识。比如对于一道使用各种红肉的菜肴具体用牛肉、猪肉还是羊肉是灵活列表但这道菜本质上总是使用某种红肉这个模式就是一条元洞见。---三、从菜谱蓝图到检查清单机械转换规则的设计细节理解了这两层结构之后一个自然的问题是怎么把蓝图转换成清单这个转换过程是完全确定的、机械的不依赖任何主观判断从而保证了体系的可重复性和可审查性。对于最简单的简单知识类型转换直接一条知识变成一个检查项。对于严格列表每一个列表项都变成一个独立的检查项它们都继承原列表的重要性级别。灵活列表的转换最为精妙。它会生成两类检查项第一类是覆盖基线形式类似于在以下六种配料中至少提到其中两种并且把所有选项全部列出让检查项本身就是完全自足的不需要参考其他任何地方。第二类是额外加分项具体形式取决于列表的长度如果列表较短七个选项以内则每个选项单独成为一个加分检查项放在比基线低一个重要性级别的位置如果列表很长则不逐项展开而是设置几个更高的覆盖门槛作为加分项避免让清单里充满大量低价值的检查项。这样的设计意味着满足基线覆盖是及格的门槛多覆盖几项能拿到更高分但在七个选项之外另举一个有效例子既不加分也不扣分——这恰好符合直觉因为这道问题本来就没有唯一标准答案。流程类型的转换同样细致。每个步骤都生成一个存在性检查项即有没有提到这个步骤必须步骤的检查项继承流程的重要性级别可选步骤的检查项降低一级。除此之外还会额外生成一个顺序检查项专门验证被提到的必须步骤是否按照正确顺序排列——这个顺序检查项措辞非常精确明确说明缺少某个步骤不算失败只要被提到的步骤之间没有顺序颠倒就算通过这样就避免了因为AI没提某步骤而额外惩罚排序正确性。如果流程中同时有必须步骤和可选步骤还会在较低重要性级别上再生成一个覆盖全部步骤的整体顺序检查项。整个清单中的检查项被划分为三个重要性级别答案关键级Answer-Critical、有价值级Valuable和背景级Context。答案关键级是一个完整答案不可缺少的核心内容有价值级是能显著提升答案深度和实用性的内容背景级是有助于理解但不影响答案是否正确的补充信息。---四、打分方式既区分说错了和忘说了也区分大致对和完全对有了这张检查清单实际打分是怎么进行的研究团队设计了一套既简单又精妙的评分机制。对于清单上的每一条检查项由一个强大的大型语言模型充当评分员独立判断AI的回答满足情况返回四种判定之一完全满足、部分满足、未提及、与要求矛盾。这四种判定对应的分值设计很有讲究。完全满足得1分未提及得0分部分满足得0.5分——这是为了奖励那些方向正确但不够精确的回答比如说对了属但没说对种。而与要求矛盾则得负分而且惩罚力度比未提及重得多。这是因为在一个以事实可靠性为目标的评测体系里一个错误答案的危害远大于一个不完整答案——你说错了会误导用户你没说只是让用户觉得不够完整两者的性质截然不同。每个重要性级别内的所有检查项分别汇总成一个级别得分。然后三个级别的得分按照固定的全局权重合并成最终的GAMUT分数。答案关键级的权重是0.6有价值级是0.3背景级是0.1。采用全局固定权重而非每道题按检查项数量动态分配权重是为了避免一道题里有很多背景级检查项就把答案关键级的重要性稀释掉的情况。GAMUT分数的范围是从负1到正1负分意味着AI不仅没说全还在关键问题上给出了错误信息。---五、数据集的构建一万三千多个问题从哪里来又如何保证质量GAMUT数据集的构建过程分为两个阶段首先生成问题然后为每道问题构建评分标准。两个阶段都遵循同一个原则用强大的AI模型产生初稿再由专业人工标注员审核修改确保最终成果不依赖未经核验的AI输出。问题的来源非常有特色。研究团队从CRAG-MM这个可穿戴设备图像数据集中抽取了1938张图片这些图片大约80%是用智能眼镜拍摄的第一视角照片被拍摄的目标经常很小、模糊、被遮挡或光线昏暗覆盖了植物、食物、动物、车辆、本地地点、日常物品、消费品等十个生活领域实体的知名度也从头部到长尾各有分布。为每张图片生成的问题必须满足几个严格条件需要多步骤的网络研究才能回答答案应该超过一两段话语言要自然像真实用户会说的话对被拍摄对象的称呼必须依赖图像本身只能用这辆车这些浆果等指代不能在问题里直接说出实体的名字。为了确保问题不会泄露答案研究团队设计了一个陌生人测试如果一个问题只有在已经知道图片里是什么的情况下才能提出那这个问题就是引导性的必须淘汰。比如这款发动机的涡轮增压器相比上一代有哪些改进只有认出了车型并知道其发动机历史才能问出这个问题而这辆车是什么性能怎么样则是任何人看到一辆车都可能提出的问题符合标准。问题经过AI初步生成后由专业标注员进行多轮审核每道问题由两位标注员独立评审有分歧时由第三位裁决。通过人工审核后还要经过另一个AI模型的自动过滤最终入选的问题必须同时通过人工和自动两关审核。整个流程产生了1843道问题每张图片对应一道。评分标准的构建比问题生成更为复杂。AI模型先通过网络搜索收集支持证据以引用网页片段的形式记录下来然后在这些证据的基础上而非依靠模型自身的记忆构建元评分标准再按规则转换成二进制检查清单。生成初稿后AI还会进行自我审查——重新浏览每个引用的网页核实片段内容标记不完整的列表或流程然后从头独立搜索把新发现的内容补充进去最终生成一个覆盖更全面的修订版本。之后由研究团队内部的专业人员对评分标准进行多轮人工修订。这里有一个有趣的设计选择标注员看到的是元评分标准但实际修改的是二进制检查清单因为检查清单才是最终用于打分的内容直接修改它才能同时核验转换过程本身是否正确。在完成第一轮人工修订后又进行了一轮AI精炼和第二轮人工修订。整个过程中还发现并纠正了12例CRAG-MM数据集中实体标注错误的问题并删除了少量无法构建合理评分标准的问题最终留下1813道完整问题。---六、测试结果最强AI只拿到58.7分说漏了才是主要问题研究团队用Gemini 3.1 Pro作为评分模型对14个当前主流的AI系统进行了全面测试覆盖了谷歌、Anthropic、OpenAI的旗舰模型以及多个开源模型。结果相当清晰。在所有被测试的商业闭源模型中Gemini 3.1 Pro以58.7分排名第一Gemini 3 Flash以57.9分紧随其后Claude Opus 4.8排名第三得53.1分Gemini 2.5 Pro得51.8分Claude Opus 4.6得50.5分GPT-5.4得42.6分Claude Sonnet 4.6得41.5分GPT-4o得34.2分。在开源模型中Qwen3-VL 235B以33.0分领先Llama 4 Maverick得18.3分Llama 4 Scout得14.1分Qwen3-VL 8B得13.7分Llama 3.2 90B得11.8分Llama 3.2 11B得5.1分。分析各模型的答题模式可以发现一个共同规律主要失分原因不是说错了而是没说到。对于最弱的模型大约三分之二的检查项显示为未提及即使是最强的模型也有超过四分之一的检查项显示答案不够完整。与此形成对比的是明确与要求矛盾的回答比例相对较低最强的几个模型矛盾率在4%到6%之间最弱的模型矛盾率也只有8%左右。换句话说这些AI模型在说准确方面做得相对不错但在说完整方面还有很大的提升空间。研究人员还发现这份排名具有很好的区分度——模型之间的分数差异很大而且排名结果与学界对这些模型能力的普遍认知高度吻合更新、更大的模型得分高于更旧、更小的商业闭源模型整体高于开源模型各模型在判定分布上也表现出各自已知的特点比如两个Qwen3-VL模型的矛盾判定比例明显高于其他模型而Claude Opus的矛盾比例是所有模型中最低的。为了验证评分结果不依赖评分模型的选择研究团队还用Claude Opus 4.8和Qwen3-VL 235B分别重新对全部14个模型打了一遍分。Gemini和Claude给出的排名完全一致逐个模型的分数差距在1.8分以内两者都没有表现出偏袒自家答案的倾向——Gemini给自己打的分和Claude给Gemini打的分相差不超过0.3分。Qwen3-VL 235B作为一个相对弱一些的评分模型整体给分偏高4到11分但排名顺序基本保持不变只有相邻且分数接近的模型之间出现了少量换位。这说明GAMUT的评分结果对评分模型的选择具有良好的稳健性。---七、纯文字版本的测试去掉图片后模型能答得更好但差距依然存在由于GAMUT的元评分标准框架本身与图像无关研究团队还制作并发布了一个纯文字版本。在这个版本里每道问题都被改写为把被拍摄实体的名称直接写入问题不再需要看图才能理解——比如这辆车是什么性能怎么样变成大众高尔夫GTI的性能怎么样。1813道问题中有7道在转换后仍然依赖图像本身被排除最终保留1806道问题评分标准和打分方式完全不变。测试结果显示所有模型在纯文字版本上的得分都高于多模态版本提升幅度在8到24分之间。GPT-4o的提升幅度最大23.9分从34.2分提升到58.1分说明对它来说视觉识别是一个较大的瓶颈Claude Opus 4.8的提升幅度最小7.8分从53.1分提升到60.8分说明它的视觉识别能力相对较强。一个关键的发现是这个提升幅度在不同模型之间相当均匀也就是说去掉图片对所有模型的帮助程度大致相似。这意味着视觉识别更像是一个加在所有模型头上的固定税而不是区分强弱模型的关键因素。换句话说多模态测试中的排名差异主要反映的是模型在知识完整性方面的差异而不是视觉识别能力的差异。即使是最强的Gemini 3.1 Pro在知道了被拍摄对象是什么的情况下也只能拿到74.1分距离完整回答仍有相当距离。---八、数据集的多样性分析问题覆盖广泛评分标准结构丰富研究团队对GAMUT数据集本身的特征进行了详细分析以证明它不是一个充斥着模板化问题的平庸数据集。从问题内容来看每个领域都涵盖了多种不同角度的问题而不是反复重复同一类型。植物与园艺领域的问题分布在栖息地35%、特征14%、养护12%、比较12%等多个方向本地地点领域的问题涵盖历史34%、建筑25%、文化9%、商业7%等车辆领域包括规格参数25%、历史18%、比较16%、可靠性15%、设计13%等食物领域涵盖食材21%、历史17%、比较15%、品牌11%、地域变体10%等。这种分布表明问题是针对每个领域的具体特点定制的而不是套用统一模板。从问题形式来看问题的中位数长度是23个词简洁自然。最常见的25种开头短语只覆盖了不到60%的问题大约六分之一的问题不以标准疑问词开头而是以如果我想……根据……等形式开始体现了较高的多样性。从评分标准的结构来看每道题平均有15.2个二进制检查项中位数15个其中平均5.9个属于答案关键级5.8个属于有价值级3.5个属于背景级。最关键的统计数字是98%的问题需要至少一种超出简单知识的结构性元素平均每道题有1.6种结构类型。灵活列表是最常见的结构出现在86%的问题中严格列表出现在49%的问题中流程出现在17%的问题中关系出现在6%的问题中。灵活列表的中位数选项数量是4个有12%的灵活列表超过7个选项属于长列表需要使用覆盖门槛而非逐项检查流程的中位步骤数是4步其中57%的流程混合了必须步骤和可选步骤。有13%的问题包含元洞见全数据集中共有295条元洞见。所有评分标准都有证据支撑每道题的元评分标准平均引用约10个网页片段整个数据集引用了超过9400个不同的网页97%的元评分标准条目和94%的二进制检查项都有对应的引用。---说到底GAMUT做的事情是把我们评价AI的标准往前推进了一大步。过去我们只问AI有没有说错现在还要问AI有没有说全以及AI对知识的组织方式有没有忠实地反映现实。这项研究表明最顶尖的AI系统在说全这件事上的表现远不如我们想象的好——哪怕是最强的模型在知道了图片里是什么的前提下也只能给出大约74%完整度的答案而在同时需要识图的情况下这个数字只有58.7%。更有意思的是这个差距的主要来源不是AI说了错误的事情而是AI不知道自己还漏掉了很多该说的事情。对普通用户来说这意味着当你用AI助手查询任何需要较为全面答案的问题时——比如了解一种药物的完整使用注意事项或者学习一项新技能的完整步骤——都应该对AI给出的答案保持警觉主动追问还有什么我没问到的而不是默认AI已经告诉了你所有重要的事情。GAMUT数据集、纯文字变体以及评测代码已经公开发布在GitHub上有兴趣深入了解这套评测框架的技术细节的读者可以通过arXiv编号2607.19322查阅完整论文。---QAQ1GAMUT评测框架和现有的AI事实性评测方法有什么本质区别A现有方法主要检查AI有没有说错而GAMUT同时评估AI有没有说全。更根本的区别在于GAMUT用结构化的元评分标准描述知识的内在组织方式能表达必须全部说到的项目可以灵活选择的集合有顺序的流程等复杂结构而现有方法只能把答案视为一张独立事实的清单无法表达这些结构关系。Q2GAMUT测试中当前最强的AI模型得分为什么只有58.7%A得分低的主要原因不是AI说了错误的内容而是AI漏掉了大量应该回答的内容。在最强模型Gemini 3.1 Pro的检查项中超过四分之一的检查项显示答案不够完整即答案只覆盖了一部分应该涵盖的知识点。这说明让AI给出真正完整、全面的答案在技术上仍然是一个未解决的难题。Q3GAMUT数据集的1813道问题是怎么保证质量的A每道问题都经过双重审核先由两位专业标注员独立评审有分歧时由第三位裁决再经过一个独立AI模型的自动过滤通过陌生人测试问题能否在不知道实体身份的情况下自然提出等硬性标准。评分标准同样经过AI自我精炼和专业人工多轮修订并要求每个评分条目都有网页引用作为证据支撑。