拓冰建站拓冰建站
首页 / 资讯中心 / 正文

27 任务 810 样本、Seedance 2.0 只拿 51%:UIUC 给视频生成建了第一个「视觉推理」评测基准

27 任务 810 样本、Seedance 2.0 只拿 51%UIUC 给视频生成建了第一个「视觉推理」评测基准Hugging Face 每日论文2026-08-27 精选最近两年视频生成模型从「画面像不像」卷到「能不能做事」但「做事」该怎么测一直没有公认标准。8 月 21 日 arXiv 上挂出的 VGI-Bencharxiv:2608.19583把这件事给出一个可量化的答案27 个任务、810 个样本分四类领域、覆盖多类技能标签当前最强的视频生成模型 Seedance 2.0 也只拿到 51.0% 的评测分。这件事意味着视频生成作为「视觉世界模拟器」这件事已经走通但作为「视觉推理器」这件事才刚刚开始算入门。UIUC、清华、滑铁卢、MIT、UBC、Microsoft Research、NetMind.ai、Etude AI 等机构 28 位作者联合署名把过去两年「零样本视觉推理」赛道的散点工作收束成一套可复现、可分维度剖析的评测集。8 月 27 日它登上 Hugging Face 每日论文榜时拿到 136 个 upvote。这件事的痛点过去的评测都在测「最终画面」而不是「推理过程」过去两年测视频生成模型的视觉推理能力工程团队普遍用两类工作做基准第一类是 PhysGenBench、WorldSimBench 这类偏物理一致性的评测侧重「物体受重力影响后会不会下沉」「液体倒入容器后液面是否对齐」这类低-中等推理需求的任务。第二类是 V-ReasonBench、VBVR-Bench 这类走抽象输入的评测用线稿或示意性图作为 prompt要求模型完成高难度视觉推理。这两类工作在 2024 到 2025 年间都被广泛使用但 UIUC 团队在论文里把它们的三类共性问题写得很清楚第一输入视觉分布不匹配。线稿、抽象图与当前视频生成模型在训练阶段看到的自然图像分布差距太大模型对抽象输入经常出现画面崩塌、约束忽略。这类失败看上去像「模型不擅长视觉推理」但本质上可能是「视觉域错位」。评测得分到底反映了视觉推理能力还是反映了视觉域适配能力过去没有人能分清楚。第二对「过程」的需求不充分。很多评测任务只要最终画面看上去合理就算通过模型完全可以在中间帧之间「作弊」跳到最终态不必真的按物理或逻辑链条一步步演化。这意味着「最终态看起来合理」和「中间过程真的在做推理」是两件事但前者无法区分后者。第三难度不可控。一些基准把难度堆到远超当前模型能力的位置结果模型几乎全挂得分集中在 0% 到 5% 之间分不出谁比谁强另一些又把难度放得太低所有模型都拿 80% 以上看不出改进。VGI-Bench 的整套设计就是针对这三类问题展开的。27 任务 810 样本四类领域 × 多类技能标签VGI-Bench 的任务集合包含 27 个具体任务、810 个样本每个任务同时被归入一个「领域」和一个或多个「技能标签」。领域是互斥的分四类- 物理类弹球滚动、流体倾倒、刚体碰撞、机械组装等- 空间几何类二维到三维折叠、截面推断、视角变换、路径规划等- 语义类物体属性归因、关系推理、意图解读、组合操作等- 任务执行类目标导航、子目标拆解、长程执行、动作链一致性等技能标签是叠加的可以一个任务同时打多个标签。论文给出的技能标签集包括空间Spatial、时序Temporal、规划Planning、属性归因Attribute Grounding、弹簧动力学Spring、拓扑Topology、可供性Affordance等几个维度覆盖当前视觉推理工作里最关心的几类子能力。维度设计选择解决的问题输入视觉风格真实场景图像不用线稿/抽象消除视觉域错位让评测分数反映真实视觉推理能力评测对象中间轨迹 最终状态区分「过程推理」与「终态直跳」难度分布预生成过滤 人工审核把任务难度卡在「勉强可做但容易失败」区间让分数有区分度领域分类4 类互斥物理/空间/语义/任务让分数可以被分维度剖析技能标注多标签叠加Spatial/Temporal/Planning 等跨任务横向比较同一类技能的不同表现27 个具体任务的例子包括二维到三维的立方体展开与折叠、迷宫路径规划、空间拓扑操作、多步目标导航、装配序列推理、汉诺塔式层级操作等。每一个任务都从真实场景图像出发要求模型生成一条中间过程可视的视频轨迹并在最终帧上给出答案。当前最强模型也只拿 51%分数不是越高越好是越能定位越好论文对一组代表性视频生成模型做了系统评测覆盖闭源商用模型、开源模型、微调后模型三类。整体结论是当前生成系统能解决一部分视觉推理任务但离可靠还差得很远。即使是被评测集中表现最好的 Seedance 2.0在 VGI-Bench 的评测标准下也只拿到 51.0%。51% 这个数字本身不是 VGI-Bench 想强调的重点。重点是分数的分维度分布Seedance 2.0 在物理类任务上表现相对最好在空间几何类任务上次之在语义类和任务执行类任务上掉分最严重。其他模型也有类似的模式但具体分布各有差异。这种「分维度分布」才是研究者真正想要的信号因为它告诉研究者下一阶段该补哪一类能力。论文进一步给出四类深入分析分析维度关键发现对模型设计的含义输出失败模式模型在多种任务上出现「终态正确但中间过程崩坏」单纯优化最终帧目标不够需要显式优化中间轨迹输入条件敏感度模型对 prompt 措辞、初始帧选择、视角微小变化高度敏感需要更稳健的条件编码与去噪机制合成微调迁移边界在合成数据上微调后在真实任务上只能迁移部分能力合成数据不能替代真实世界训练去噪内部视角后期去噪步主要「润色」早期假设而非纠正早期推理错误早期假设空间需要被显式扩大或重采样最后一条尤其关键。当前主流视频生成的去噪机制是「逐步细化」论文用一种去噪内部视角的方法观察发现模型在早期去噪步形成的「假设」在后期去噪步里几乎不会被推翻。换句话说模型并不是像人一样在生成过程中持续纠正推理错误而是在前几步就锁定了大致走向后面的步骤只是把画面做得更精细。这件事给视频生成研究者一个新的设计抓手如果想真正提升视觉推理能力关键不在后期去噪步而在早期假设空间的扩大与重采样。为什么「真实场景图像」这件事这么重要论文在评测方法里反复强调「真实场景图像输入」。这件事看起来是个工程细节但实际是 VGI-Bench 区分于过去工作的最关键设计。输入类型代表基准模型表现主要失分点线稿/示意性图像V-ReasonBench、VBVR-Bench经常出现画面崩塌视觉域错位掩盖真实推理能力真实场景图像VGI-Bench表现更接近真实应用场景推理能力本身的不足用线稿做 prompt 的好处是任务定义容易、prompt 可控性强、生成结果易于评估。坏处是当前的视频生成模型都是在自然图像上预训练对线稿输入的视觉先验严重不足模型会在「理解线条」这件事上先崩一次再做视觉推理这件事上又崩一次。两类失败被混在一起评测分数就无法拆开。VGI-Bench 的真实场景图像输入更贴近当前模型的实际使用场景用户上传一张真实照片让模型「想象」场景如何演化。在这种输入下模型的失败主要来自推理能力本身而不是视觉域错位。论文在控制对比实验里给出的数据是当同一个任务用线稿和真实图像两种 prompt 测同一个模型时真实图像版本的成功率显著更高但失败模式的分布也明显不同。这件事的工程含义是未来想用视频生成做视觉推理的产品最好按真实图像 prompt 的方式去设计 prompt 流程而不是按学术线稿的方式。VGI-Bench 给出的评测分数更接近真实应用场景。任务设计里的「勉强可做」原则VGI-Bench 的难度设计有一个反直觉的取舍他们刻意把任务难度卡在「勉强可做但容易失败」的区间而不是「完全做不到」或「几乎全做对」。「完全做不到」的问题是分数集中在 0% 附近分不出模型之间的差异。「几乎全做对」的问题是分数集中在 90% 以上看不出改进空间。两者都会让评测失去区分度浪费研究者的时间。VGI-Bench 的做法分两步第一步预生成过滤。任务作者先用当前最强模型跑一遍所有候选任务记录每个任务的通过率。通过率 5% 的任务被剔除难度过高模型整体挂通过率 80% 的任务被剔除难度过低所有模型都能拿满分。第二步人工审核。剩下的任务由人工再次审核检查任务定义是否清晰、视觉推理难度是否落在合理区间、是否存在偶然通过。经过这两步VGI-Bench 的 27 个任务最终落在「最强模型 50% 左右通过率」这个区间。这种难度分布让评测分数既有区分度又能反映真实的改进空间。留给视频生成研究者的三件事第一件把视觉推理能力从「最终画面」拆到「中间轨迹」。论文用去噪内部视角给出一个清晰结论当前模型后期去噪步主要润色早期假设而不是纠正早期错误。研究者应该把改进重点放在早期假设空间的扩大与重采样而不是简单的后期细化。第二件把训练数据从「合成」拉回「真实」。论文给出合成微调的迁移边界合成数据上微调后在真实任务上的迁移能力有限。视频生成的训练数据需要更多真实场景视频而不是更多合成 prompt。第三件把评测分数从「总分」拆到「分维度」。Seedance 2.0 的 51% 不是 51%它在不同领域、不同技能标签下的分布完全不同。研究者应该按分维度报告分数按分维度寻找改进空间而不是只看总分。VGI-Bench 给出的不只是一个评测集更是一套让视频生成研究者可以按维度定位问题、按维度改进能力的评测方法论。它把「视频生成是不是真的在做视觉推理」这件事从一句口号变成了 810 个具体样本上的可量化分数。
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门