拓冰建站拓冰建站
首页 / 资讯中心 / 正文

苹果教AI“看视频先想后答“:不用画图,也能预判未来

你有没有过这种经历正在看一场球赛直播球员刚刚起跳你脑子里已经看到了他大概会往哪个方向扣篮。你不需要真的在脑海里画出一张未来的画面你只是感觉到了接下来会发生什么。这种能力,对人类来说毫不费力,但对AI来说,是一道相当棘手的题。苹果的研究团队最近发了一篇论文专门琢磨这件事怎么让多模态大模型能同时理解文字和图像视频的AI系统在看一段没播完的视频时提前预感接下来会发生什么而且还要做到既快又准。这篇论文的名字叫《Beyond Visual CoT: Internalized Visual Thinking for Proactive Video Reasoning》翻译过来大致是超越视觉思维链为主动式视频推理内化视觉思考。听起来有点绕我们慢慢拆开讲。先搞清楚AI要解决的是个什么问题先说说这类任务到底是什么。研究者把它叫做主动式视频推理具体分成两种情况。第一种叫早期事件预测*早期事件预测在一个动作还没做完的时候就要认出这是个什么动作。比如一个人刚抬起手准备倒水视频还没播到水倒出来那一刻AI就得说出这是倒水这个答案。*第二种叫下一事件预测*下一事件预测预测接下来即将发生、但目前画面里压根还没出现的动作。比如看到一个人正在拿杯子AI要猜出他接下来大概率会去倒水而这个倒水动作在当前画面里根本还没开始。*这两种任务和我们平常说的看完一整段视频再回答问题完全不是一回事。普通的视频问答证据都摆在那儿了AI只需要老老实实看完再说。但主动式推理不一样它要求AI在信息不全的情况下靠已经看到的这一小段去推断没看到的部分。这就好比让你看一部电影的前十分钟然后回答男主角接下来会不会和女主角吵架——你手里的线索是不完整的你得靠经验和逻辑去补全。那现在的AI是怎么处理这类问题的主流思路是思维链*思维链Chain-of-Thought简称CoT让AI在给出最终答案之前先生成一系列中间推理步骤就像人做数学题时先写演算过程再写答案。*大多数模型用的是文字版思维链也就是模型先在心里其实是在生成的文本里嘀咕几句话分析一下情况然后再给出答案。这个办法在很多任务上确实管用但放到视频推理里问题就露出来了语言天生不擅长精确描述运动、位置、物体形态这些视觉信息。你让AI用文字描述球员起跳后手臂会怎么摆动篮筐的角度大概是多少这种描述往往又啰嗦又不准甚至有时候模型会说一堆和真实画面毫无关系的幻觉内容。于是有人想出了另一个办法既然文字讲不清楚那就让AI直接画出来。这就是所谓的视觉思维链*视觉思维链Visual CoTAI在回答问题前先生成一张或几张representing推理过程的图像比如画出未来可能发生的场景然后再基于这些图像给出最终答案。*这个思路听起来挺聪明,毕竟一图胜千言。论文里提到的一个代表性方法叫Zebra-CoT它的做法是模型先想象并画出一张接下来会发生什么的画面然后把这张画面重新编码成AI能理解的信息再据此生成文字答案。这套流程在空间推理、机器人操作规划等任务上确实拿到了不错的成绩。但问题来了画一张图,可不是免费的。画图的代价慢了5到6倍还不一定值研究者做了一个非常扎实的对照实验专门衡量画图预判这件事到底值不值。他们拿Zebra-CoT这套视觉思维链方案和一个只做文字回答、不画图的基础模型叫Answer-Only SFT即只用标准答案微调放在同一起跑线上比较。*Answer-Only SFT一种最朴素的训练方式直接把观察到的视频片段和问题丢给模型让它输出答案文字中间不经过任何额外的视觉生成步骤。*结果很有意思。在早期事件预测任务上视觉思维链确实带来了提升四个评价指标全面超过了纯文字方案其中CIDEr一种衡量生成文本质量的指标提升了17.9%。这说明画一张未来的画面确实能帮上忙至少在动作已经开始、只是还没结束的情况下是这样。可是到了下一事件预测任务,情况就变了。那里要预测的事件压根还没开始,视觉思维链的效果变得可有可无,甚至在三个指标上还出现了轻微下降,只有METEOR指标涨了4.3%。更要命的是速度。研究者用端到端的实际运行时间来衡量效率,而不是简单数生成了多少个文字token,因为画图这件事牵涉到解码出一张图片、再把图片重新编码成模型能处理的向量,这些开销根本不会体现在生成了多少字这种统计里。测出来的结果是,视觉思维链让早期事件预测的平均延迟涨到了原来的6.2倍,下一事件预测涨到了5倍。这就好比你问朋友这场比赛谁会赢,他非要先跑去买一份实体报纸、翻到体育版、画一张详细的赛况示意图,再根据这张图告诉你答案。等他画完图,比赛可能已经打完了。如果不这么做,直接凭经验脱口而出,虽然可能少了几分依据感,但至少能在比赛还没结束时给出预判——而这正是主动式任务最看重的东西:时机。研究者还做了一个特别巧妙的诊断实验:如果给模型的不是它自己画出来的可能不准确的未来画面,而是真实发生的未来画面也就是作弊用了正确答案对应的真实帧,结果会怎样?答案是:所有指标全面暴涨。早期事件预测的ROUGE-L指标涨了21.6%,下一事件预测涨了6.8%。*ROUGE-L一种常用于评估自动生成文本质量的指标衡量生成的答案和标准答案之间在词序上的重合程度。*这个结果揭示了一个关键的事实:未来的视觉信息本身是有用的,问题不在于要不要参考未来,而在于AI自己画出来的那张未来的画到底靠不靠谱。它画得不准,就等于给自己挖了个坑,反而可能误导后面的判断。研究者管这个叫取决于生成未来状态的保真度——翻译过来就是,如果你的想象力不靠谱,靠它来推理反而会拖后腿。这个发现直接引出了整篇论文的核心问题:未来的视觉信息确实有价值,但把它变成一张真实的图片再重新处理一遍,这个过程又贵又不一定准。有没有办法只要未来信息的价值,不要画图和读图的成本?核心方案:把想象内化到脑子里,而不是画在纸上苹果团队给出的答案叫Internalized Visual Thinking*内化视觉思考Internalized Visual Thinking简称IVT一种后训练框架让模型在训练阶段学习预测未来画面的隐藏表示不是真实图片而是一串数字向量但在实际使用时不再生成任何图像直接给出文字答案。*这里最关键的设计思路是:训练的时候让模型脑补未来,但推理的时候不要求它把脑补的画面画出来。具体怎么操作?论文用一个简单的公式说明了这件事。假设模型看到了一段视频的前半部分,还有一个问题要回答。标准的训练方式只会计算一个损失,衡量模型给出的文字答案和标准答案之间的差距。IVT额外加了一项:让模型同时预测未来几帧画面的潜在表示*潜在表示latent representation不是一张能直接看的图片而是经过某个编码器处理后得到的一串抽象数字向量包含了图像的关键信息但不是像素本身。*打个比方:如果画一张完整的图片相当于把一整段乐曲完整地演奏一遍,那预测潜在表示更像是心里默唱这段旋律的骨架,记住它的节奏和走向,但不发出声音。你依然在想,只是没有把这个想法转成外部可感知的完整作品。而且默唱的过程比真实演奏快得多,也不需要乐器。如果不这么做,非要每次都完整演奏一遍才能继续往下想,那整个思考过程就会被表演本身拖慢。训练的时候,模型的损失函数由两部分组成:一部分是常规的文字生成损失,另一部分是预测未来潜在表示的损失,两者加权相加(论文里权重设成1)。这样训练完之后,模型的参数里已经吸收了大量关于画面如何演变、物体如何转移、动作如何延续的知识。关键的一步在这里:等到真正要用这个模型回答问题的时候,IVT走的是和只用标准答案微调完全一样的推理路径,直接从观察到的视频片段生成文字答案,不再多走一步预测未来潜在表示的计算,更不会去解码出一张真实图片。这就意味着IVT在推理阶段的计算图,和那个最朴素、最快的Answer-Only SFT基本一样。训练时它多想了很多,但用的时候,它一步到位。预测什么样的未来画面最管用内化的思路定下来了,但具体要往模型脑子里塞什么样的未来表示,这里面还有大量讲究。研究者试了四种不同的目标表示。第一种叫Flux-VAE潜变量*Flux-VAE一种图像生成模型中用来压缩图片信息的编码器它把图像转换成的潜变量保留了大量细节和空间结构信息主要是为了后续能把图片准确还原出来。*第二种是DINOv2特征*DINOv2一种自监督视觉特征提取模型它抓取的是图像里更高层次的语义概念比如这是一只猫这种抽象信息而不太关心猫的每一根毛发长什么样。*第三第四种都基于SigLIP2*SigLIP2一种视觉-语言联合编码模型论文里测试了它的两个变体一个是自适应版本编码器的参数会随着训练一起更新另一个是冻结版本编码器参数固定不变。*实验结果显示,预测Flux-VAE潜变量的效果是四种方案里最强、最稳定的,在早期事件和下一事件预测两类任务上全面领先。DINOv2也有提升效果,但幅度和稳定性都比不上Flux-VAE。自适应版本的SigLIP2普遍比冻结版本表现更好。这个结果背后传递的信息值得琢磨一下:不是随便找个辅助视觉目标塞进训练过程就管用,关键要看这个目标表示本身是不是暴露了足够多的、和场景演变有关的结构信息。DINOv2那种偏向语义抽象的特征(这是一只猫)固然有用,但对于这只猫接下来会往哪边跑它的爪子会怎么落地这类细粒度的动态预测,保留了更多空间细节的Flux-VAE明显更对味。这就好比让一个学生提前预习明天要考的内容。如果只告诉他明天考的是关于猫的知识(相当于语义特征),他确实能有点准备,但比起把整份考试大纲的具体条目都给他看一遍(相当于保留细节的表示),后者能让他准备得更精准、更充分。如果预习材料只给一个模糊的主题词,学生大概能猜个方向,但具体到哪道题、考哪个细节,他是抓瞎的。训练数据怎么配比,是个大问题确定了预测什么之后,下一个问题是:训练过程中,应该让模型花多少精力去练预测未来这件事,又花多少精力去练回答问题这件事?研究者对比了三种数据配比方案:1比1、3比1、5比1,数字越大意味着分配给回答问题这个任务的训练样本越多,相应地留给预测未来的样本就越少。结果出乎不少人的预料。那些偏重回答问题的配比(3比1和5比1)在训练刚开始的时候表现更好,进步很快。但训练进行到大约12000到18000步之后,这些配比就开始停滞不前,甚至掉头下降。反倒是最均衡的1比1配比,一开始表现落后,但一直在稳步上升,最终在20000步的时候,四个指标全部超过其他两种配比,拿到了整场比赛里最好的成绩。这个现象说明了什么?说明预测未来这件事,不能被当成一个偶尔调味的辅助任务。如果对它的训练强度不够,那个预测未来的能力就会在持续的答题训练中被慢慢覆盖、稀释掉,最终对下游推理起不到什么帮助。这就好比健身,如果你每周只抽10分钟练核心力量,剩下的时间全在跑步,短期内你确实跑得更快了,但核心力量始终没能真正建立起来,跑到后期反而容易受伤、掉速度。只有把核心训练和有氧训练放在同等重要的位置上,长期坚持下来,才能看到综合能力的提升。如果不坚持给核心力量足够的训练量,那这项能力永远只是个摆设,遇到需要它发挥作用的场合就顶不上去。基于这个发现,研究团队在后续所有实验里都统一采用了1比1的均衡配比。怎么教模型预测未来:两种不同的教法定好了要预测什么、按什么比例训练,接下来要解决怎么教的问题。论文比较了两种预测目标的训练方式。第一种叫直接特征回归*直接特征回归让模型直接预测出目标表示的具体数值用均方误差衡量预测值和真实值之间的差距这是最直接、最朴素的监督方式。*第二种叫矫正流匹配*矫正流匹配Rectified-Flow Matching一种源自扩散模型的训练技巧不直接预测目标本身而是让模型学习一个速度场也就是从一个随机噪声逐步演化到目标表示所需要走的路径方向。*实验发现,这两种训练方式谁更好,取决于你预测的是什么类型的目标。对于DINOv2这种语义特征,直接回归的效果明显更好,四个指标全面领先。而对于Flux-VAE潜变量,两种方式的差距就小得多,直接回归在大部分训练阶段领先,但到了训练末期,矫正流匹配在个别指标上反而略微反超。这里有个挺值得说一说的细节。论文提到,虽然它们用的基础模型BAGEL原本在生成图像的时候用的就是矫正流匹配这套方法,但把这个方法直接搬来预测未来的潜在表示,效果并不总是最优的。直接回归这种更简单的方式,在很多情况下反而表现相当,甚至更好。这说明一个道理:某个技术在它原本的用途里表现出色,不代表把它挪到一个新场景里依然是最佳选择。真正决定用哪种训练方式的,是目标表示本身的特性,比如它的数值范围、分布形态、维度大小,而不是这个方法在别的地方好用这种经验之谈。训练节奏:一步到位,还是分两步走接下来,研究者琢磨了另一个问题:预测未来这件事,应该和回答问题这件事同步训练,还是分成两个独立阶段,先专门练预测未来,再专门练回答问题?他们对比了三种做法。第一种是只练回答问题的基础方案。第二种叫两阶段训练,先花10000步专门练预测未来,然后完全切换到只练回答问题的模式,继续训练。第三种是联合训练,让两个目标从头到尾同步进行。结果非常清楚:联合训练在所有指标上都拿到了最好的成绩,比基础方案的ROUGE-L提升了12.6%,CIDEr提升了26.3%。而两阶段训练反而比什么都不做基础方案还要差,所有指标全面下滑,ROUGE-L掉了6.5%。这个结果相当反直觉。你可能会觉得,先打好预测未来的基础,再去专攻回答问题,听起来是个很合理的学习顺序,就像先学走路再学跑步。但实验数据推翻了这个直觉:一旦进入第二阶段的专攻训练,模型好像把第一阶段辛苦学到的东西给忘掉了大半,最后甚至比完全没学过还差。这其实揭示了一个很朴素但容易被忽视的道理:如果两种能力要互相配合发挥作用,那么训练它们的过程也得是配合进行的,不能指望先各自练好再拼装到一起。就像学一门乐器合奏,如果吉他手和鼓手分别关起门来单练一个月,最后拼到一起,配合度往往还不如从第一天就一起排练来得好。分开练习各自都能精进技术,但两者之间的呼应关系,只有在同步训练里才会真正建立起来。如果不这样同步训练,那预测未来学到的东西,很可能就是一堆和回答问题这个最终目标脱节的知识,派不上用场。模型内部结构:共享脑子,还是分开思考最后一个关键设计选择,是关于模型内部的架构安排。研究者比较了两种结构。第一种叫Dense设计*Dense密集架构模型处理理解型信息和预测型信息时用的是完全同一套解码器参数两种任务的训练信号会直接一起更新这套共享参数。*第二种叫MoE设计*MoEMixture-of-Experts混合专家架构模型内部准备了两套不同的前馈网络参数理解类信息交给理解专家处理预测未来的信息交给预测专家处理两者只在其余部分共享计算资源专家的选择是按信息类型直接指定的不是靠一个学出来的路由器动态决定。*研究者还测试了不同的预测视野*预测视野Prediction Horizon模型需要往未来预测多少帧画面。比如预测视野等于1就是只预测未来1秒后的画面等于3就是要同时预测未来1秒、2秒、3秒这三个时间点的画面。*结果显示,两种架构在所有预测视野下都比基础方案表现更好,但各有各的脾气。在预测视野较短的情况下(只预测未来1到2秒的画面),共享参数的Dense架构明显更胜一筹,比如在预测视野为2的时候,Dense拿到37.4的ROUGE-L,而MoE只有33.8。但随着预测视野拉长,Dense的表现开始走下坡路,而MoE反而表现得更平稳,大约在预测视野为3的时候达到自己的最佳状态,而且视野从3拉到4变化也不大。这个规律说明,当你要预测的未来足够近、足够确定的时候,让预测任务和回答任务共用一套大脑,信号传递得更直接,效果更好。但一旦要预测得更远,未来的不确定性变大,把预测任务和回答任务绑得太紧,反而可能把一些不那么靠谱的信号硬灌进语言生成的通路里,拖累最终表现。这时候把两条通路适当隔开,反而能减少这种噪音干扰。这就好比一个团队里,如果任务目标非常明确、时间紧迫(比如下一秒该做什么),让所有人共用一份信息、协同决策效率最高。但如果要规划的是一个相对模糊、跨度更长的目标(比如接下来几天团队方向如何调整),让专门的人负责专门的模块,反而能减少互相干扰,各自把自己那块想清楚。如果不做这个区分,硬要一套人马应对所有时间跨度的决策,短期任务或许还行,长期规划很容易变得混乱。真正的成绩单:六个测试场景全面告捷把前面所有的设计决策敲定之后,研究团队在三个大规模数据集上做了完整测试:Ego-Exo4D、Ego4D、EPIC-KITCHENS-100*Ego-Exo4D、Ego4D、EPIC-KITCHENS-100三个大规模第一人称视角视频数据集记录了大量日常活动比如做饭、修东西、运动等常被用来研究人类行为理解和预测。*每个数据集都测试了早期事件预测和下一事件预测两类任务,总共构成六个评测场景。对比的对象包括几个开源视频大模型作为参照基准,比如LLaVA-NeXT-Video、VideoLLaMA3、Qwen2.5-VL、Qwen3-VL,再加上论文自己搭建的几个受控对比方案:只用标准答案训练的基础方案、文字思维链方案、视觉思维链方案,以及IVT本身。最终结果是,IVT在全部六个测试场景里,每一个场景的每一个指标,都超过了只用文字训练的基础方案。这是一个相当干净、没有例外的胜利。跟视觉思维链比,情况稍微复杂一点。IVT在六个场景里的四个场景中表现更好,而且在全部三个下一事件预测的场景里都获胜了。视觉思维链只在两个早期事件预测场景上略胜一筹,分别在Ego4D和EPIC-KITCHENS-100上超出IVT约1.2到1.3个ROUGE-L点。放在下一事件预测这个更难的任务上看,差距相当明显。IVT在三个数据集上的平均ROUGE-L是49.7,而视觉思维链只有45.9,差了将近4个点。这符合前面观察1里提到的那个规律:视觉思维链在未来事件根本还没开始的情况下,画出来的那张想象图很难真正靠谱,反而是内化在模型参数里的预判能力更管用。跟外部的通用大模型比,IVT在7B这个参数规模量级上具备了竞争力,不过还是稍稍落后于规模更大的Qwen3-VL-8B。这也提示我们,IVT这套方法本身并没有让模型变得无限强大,它解决的是效率和准确度之间的权衡问题,不是凭空创造出超越模型规模天花板的能力。速度方面的对比更是直观。IVT的推理路径和最朴素的基础方案几乎一致,平均延迟维持在1.2秒左右,而视觉思维链平均要花6.5秒以上,慢了超过5倍。在极端情况下(P95延迟,也就是最慢的5%的样本),视觉思维链甚至要花将近8秒,IVT只要不到2秒。对于那些真正需要在事情发生前给出预判的场景来说,这个速度差距不是锦上添花,而是决定这套系统能不能真正落地的门槛。想象一下自动驾驶系统需要判断前方行人接下来是否会突然横穿马路,如果这个判断要花6秒才能算出来,那这套系统压根没有实用价值,行人可能早就走过去了或者出事了。换个场景考验一下:没见过的数据集,行不行到这里,研究团队还留了一手,专门测试了一下举一反三的能力。他们把Charades这个数据集完全排除在训练数据之外,直接拿在Ego-Exo4D上训练好的模型去测试。*Charades一个记录人们在室内进行各种日常活动的视频数据集常用于动作识别和理解任务。*这个测试相当苛刻,因为Charades和训练用的Ego-Exo4D在画面内容和任务形式上都有明显差异,Ego-Exo4D是开放式的文字描述任务而Charades要求从多个选项里选出正确答案。这意味着模型不仅要面对全新的视觉场景还要在完全没见过的答题格式上保持不出错。结果是,IVT依然拿到了在所有受控对比方案里最好的成绩,准确率达到73.2%,超过了基础方案的71.7%和视觉思维链的58.2%(视觉思维链在这个跨域测试里掉得特别惨)。而且这个优势在不同的预测视野设置下都保持稳定。这个结果给了一个额外的信心:IVT训练出来的那种预判未来的能力,不是死记硬背某个数据集里的具体场景规律,而是真的学到了一些更通用的、关于视觉动态变化的知识,换个陌生场景依然能派上用场。写在后面读完这篇论文,最触动我的一点是那个用真实未来帧替代生成帧的诊断实验。研究者没有满足于视觉思维链效果一般这个表面结论,而是硬生生把答案先泄露给模型,看看模型到底能不能用好这份作弊信息。结果发现能,而且用得很好。这说明视觉思维链的失败不是未来信息没用这个假设的失败,而是生成未来信息的能力不够这个具体环节的失败。这种拆解问题的方式,值得在做任何为什么方法A不如方法B的分析时借鉴,别急着否定整个思路,先看看是不是某个具体齿轮卡住了。另一个让我意外的地方是两阶段训练的失败。直觉上先打基础再精修是很多人做事的默认策略,但这篇论文用扎实的数字告诉你,至少在这个场景下,分阶段训练比完全不做预测训练还差。这多少提醒我们,某些看似合理的分步走策略,在特定任务结构下可能反而是有害的,值得多留一分警惕,别把直觉当成必然正确的经验。论文里没有细谈的一个问题是,如果预测视野继续拉长到几十秒甚至几分钟,这套内化预判的思路还能不能撑住?毕竟越往远处预测,不确定性会指数级增长,那时候模型内部藏着的这份预感,到底还剩多少含金量,这个问题留给了未来的研究者。QAQ1Internalized Visual ThinkingIVT是什么AIVT是苹果团队提出的一种后训练框架让多模态大模型在训练阶段学习预测未来视频帧的潜在表示但在实际推理时不需要真正生成图像直接输出文字答案从而兼顾预判能力和响应速度。Q2IVT和视觉思维链Visual CoT相比有什么优势AIVT在六个测试场景中全面超过纯文字训练方案并在四个场景中优于视觉思维链尤其在下一事件预测任务上表现更好同时推理速度比视觉思维链快5倍以上避免了生成和重新编码图片带来的延迟。Q3为什么视觉思维链在预测还没发生的事件时效果不好A因为视觉思维链需要模型自己画出未来画面如果画得不准确反而会误导后续判断。实验显示用真实的未来帧替代模型生成的帧后效果大幅提升说明问题出在生成质量上不是未来信息本身没有价值。
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门