符号诞生之前:视觉通用智能如何开启 AGI 的物理进化之路
符号诞生之前视觉通用智能如何开启 AGI 的物理进化之路由全球多家顶尖学术机构、科研高校以及前沿工业界实验室共同合作发表名为《Visual General Intelligence: Pathways and Perspectives in the AGI Era》白皮书它探讨了视觉通用智能VGI作为实现通用人工智能AGI潜在路径的可能性。研究者们认为视觉模态不仅是传感器输入更是捕捉世界结构的核心智能功能其演化历史远早于语言。文中提出了多种观点包括将生成式视频模型视为视觉基础模型以及强调具身智能在物理世界中感知与行动的重要性。不同于目前的语言中心模型VGI 旨在通过预测、想象和重建等机制从视觉经验中自主提取知识。该研究不仅关注模型规模的扩展还探讨了持续学习、物理结构恢复以及多模态融合对构建全面智能系统的关键作用。总之这一议程试图理清视觉在人工智能时代应追求的原则以实现超越人类水平的通用认知能力。在人工智能AI的发展中视觉通用智能VGI与传统大语言模型LLMs区别在人工智能AI的发展中视觉通用智能VGI与传统大语言模型LLMs在数据本质、智能起源、物理理解、感知交互以及学习机制上存在着本质区别智能的演化起点与历史底蕴不同LLMs 依赖于极年轻的人类文化产物人类的高级语言和文字系统在生命的进化史上是极近期才出现的现象。大语言模型处理的是高度抽象、已被人类高度压缩过并符号化的人类经验。VGI 扎根于更底层的世界感知智能复杂的视觉系统如眼睛在生物进化史上可以追溯到大约 5 亿年前的寒武纪是生物体与物理世界互动、捕获世界结构的最底层和最基础的智能功能。在智能系统能够用语言描述世界之前它必须首先发现并发现世界的底层物理结构。信息载体与符号化层级的差异LLMs 拥有天然的符号化分级结构LLMs 建立在人类预设的词义、短语、句子和文档等清晰的符号层级之上利用子词 Token 进行高效的表征与推理。VGI 缺乏天然的符号单元视觉数据高维、密集且高度连续像素由于过于底层而无法作为智能的感知基元而图像补丁Patches也仅仅是工程上的便利而非真正的语义抽象。这导致视觉学习无法依赖现有的符号压缩层必须自主探索如何过滤和压缩信息其学习成本极高通常需要比语言预训练高出 1,000 到 10,000 倍的有效计算和数据处理才能自然浮现出正确的视觉抽象。对物理世界规律的表征与理解深度LLMs 难以触及语言之外的物理世界语言是人类对经验的抽象但物理世界的许多精细规律、材料属性和动态交互例如面团对擀面杖的反应、花朵盛开并枯萎的过程在文字中鲜有详细描述。单纯依赖文本统计预测的 LLMs 无法真正感知这些未命名的世界结构。VGI 致力于恢复真实的物理结构与动力学仅仅预测像素或生成逼真的视频并不等同于真正理解物理。VGI 的目标是恢复物理世界的组合结构包括实体、几何、材质等内在属性光照和姿态等外在属性以及物体的支持与包含关系等。它需要建模并理解质量、摩擦力、关节轴等不可见物理变量以便支持干预、编辑、模拟和验证。感知模式被动输入 vs. 主动具身交互LLMs 的旁观者模式传统的 LLMs 通常以被动的形式接收和处理预先收集、分块好的静态文本序列。VGI 的主动具身特性VGI 往往与具身智能Embodied AI紧密结合。智能体不只是被动的观察者而是可以通过主动改变视点、移动、甚至通过推、拉、提起物体等物理干预行为来消除感知歧义从而获取常规被动观测无法得到的物理和几何属性。在这种闭环中视觉指导行动而行动的反馈和结果反过来不断修正、完善视觉世界模型。经典生物视觉研究也证实了感知与自发行动耦合的重要性如 Held 和 Hein 的猫动作实验。学习机制静态冻结 vs. 持续生命周期学习LLMs 的单次训练与冻结当前的 LLMs 通常在静态数据集上完成一次性预训练后即被部署为固定模型无法随着现实世界的发展实时、动态地重新组织理解只能依靠后续的数据重训。VGI 追求在整个“视觉生命周期”中持续进化VGI 强调在智能体自身的运转过程中进行连续、无监督、无需重新打乱历史数据的学习。它由相互作用的感知、空间与动态世界模型、多尺度存储及行动接口组成使模型能在运转过程中检测新奇事件、保留有用知识并实现稳定持续的自我提升。九大核心观点在人工智能进入通用人工智能AGI时代的关键节点白皮书《Visual General Intelligence: Pathways and Perspectives in the AGI Era》汇总了来自不同顶尖研究机构的学者对视觉通用智能VGI的核心探索和观点。白皮书中展示的九大核心观点对应章节 2.1 至 2.9从不同的侧面描绘了如何从视觉经验中培育出通用智能并阐明了计算机视觉应当追求的底层原理1. 视频模型是视觉基石模型 (Video models are visual foundation models)提出者Robert Geirhos (Google DeepMind)核心内容大规模训练 生成式目标是让视频模型演变为像 LLM 那样能够统一整个视觉领域的关键。核心逻辑传统的图像分类如 ImageNet太容易让模型通过利用纹理或背景等局部“捷径”混过关。而生成式目标则是一项极具挑战的任务它逼迫模型掌握物体、背景、纹理、几何、光影等一切世界的内在元素从而学到真正有意义的世界规律。视频生成是许多视觉任务最通用的框架静止图像可以被看作其特例。实验如 Veo 3表明先进的生成式视频模型在无特定任务训练下已能作为视觉基石模型通过“图生视频”以零样本Zero-shot方式解决边缘检测、目标分割、图像编辑、超分辨率甚至迷宫和图遍历等视觉推理任务。2. 创造力是检验 VGI 的核心测试 (Creativity as a Test of Visual General Intelligence)提出者Aditi Raghunathan (Carnegie Mellon University)核心内容智能不能仅局限于寻找单一正确答案的任务。在面对开放式、有约束的视觉任务时模型能否表现出“算法创造力”是检验 VGI 的核心测试。核心逻辑视觉创造力包括组合创造力在熟悉元素间建立新联系与探索性创造力在物理、几何、语义或任务约束下构建新模式。视觉创造力需要全局的协调与规划。评估视觉创造力应该关注三个重要属性连贯性满足物理、几何与语义约束、结构多样性输出实质不同的多样化方案而非表面的颜色/纹理变化和原创性相对于训练数据的独创性。研究表明相比传统的“预测下一Token”基于无教师训练teacherless training和扩散模型等“多Token方法”能更有效地表达高层布局规划生成更具结构多样性与原创性的解决方案。3. 在“生命周期”中持续进化、自主学习的系统 (A learning system that learns from one datum)提出者Yuki M. Asano (University of Technology Nuremberg)核心内容目前的视觉系统是被动且训练完就被冻结的。真正的 VGI 应该像生物那样在整个“视觉生命周期”中连续、无监督且自主地学习并重构对世界的理解。核心逻辑生物在能够用语言描述世界之前就已经通过持续的感官体验和物理相互作用自发发现了世界的深层结构如物体的持久存在性、运动、遮挡与包容关系。一个稳健的人工视觉大脑应该由感知系统、空间和动态世界模型、多尺度存储系统以及任务行动接口等多个相互作用、更新频率不同的子系统组成。语言应当是后续用来查询和引导已对齐物理世界的交互界面不应是视觉系统最核心的组织原则。4. 视觉智能将是多模态、生成式且高效的 (Intelligence will be multimodal, generative, and efficient)提出者Deva Ramanan 等 (Carnegie Mellon University)核心内容实用的视觉智能尤其在具身智能/机器人领域不能仅靠视觉而应走向多模态原生融合、全生成式建模与极致计算能效。核心逻辑视觉包含了高维、极其丰富的物理世界信息必须本体感觉、触觉等其他多模态信号进行原始信号级别的预训练融合。生成式建模如视频扩散/流模型是自监督学习的天然进化未来将彻底取代显式表征学习如DINO和JEPA。由于视频生成的能耗和计算成本极其高昂未来必须通过重新融入递归机制以维持长视频一致记忆、3D 空间结构和多尺度处理等经典概念来提升能效并且依靠强化学习和多样性数据策展而非无节制地扩展数据规模。5. 视觉智能推动科学发现 (Visual Intelligence and Discovery)提出者David Fouhey (New York University)核心内容科学发现是检验 VGI 的独特阵地。VGI 的科学应用面临数据高度受限、缺乏传统基准真值且必须通过物理学与跨模态先验来校准的挑战。核心逻辑科学领域的关键数据如历史观测、特定生物演化标本往往无法重复收集导致数据量极度受限。科学观测往往没有现成的真值排行榜验证过程需要长期地将模型的估计结果与已有的物理学公式或跨仪器观测进行交叉校验例如通过原子物理学将太阳冕区的热结构预测与 X 射线观测对齐。科学仪器往往自带非物理系统性误差伪影模型必须能够深度分离出真实信号并支持针对此类系统误差的可编辑剔除。6. 构建空间 AI 的持久表征与高效硬件结构 (What is the Computational Structure of Spatial AI?)提出者Andrew J. Davison (Imperial College London)核心内容空间 AISpatial AI的核心是让设备在极端受限的硬件条件下构建出高品质、任务无关且持久自适应的环境表征如密集场景图、物理属性以支持通用交互。核心逻辑空间 AI 的前身是 SLAM即时定位与地图构建解决的核心问题是如何在有限算力和内存预算内从多传感器流中实时构建持久表征并实现在有限资源内无漂移地更新 3D 地图、物体层级场景图及动力学属性。未来的芯片处理器趋势是高度并行的细粒度核心、内存与计算单元就近 geographic 地融合Tile 布局并使用异步、低位宽传输。因此算法必须能够在这种多核局部互连的图结构硬件上通过异步消息传递如信念传播算法来执行推理和学习使得软件计算图在芯片地理布局上对齐最终实现类似生物大脑般的高能效。7. 视觉智能本质上是具身智能 (Visual Intelligence is Embodied Intelligence)提出者Yilun Du (Harvard University)核心内容具身化不仅是视觉的下游应用更是其核心检验标准智能体必须通过主动交互与选择视角来校准、丰富其世界模型。核心逻辑静态的被动观测极易产生感知歧义而具身智能体可以通过物理干预如推、拉、提来揭示隐藏属性如关节连接、质地稳定度甚至主动寻找Surprisal惊讶度最高、信息量最大、能验证模型假说的视点进行探索。系统在生成式世界模型上将感知转化为对场景隐状态的推理并将决策表征为预测未来的视觉轨迹再由底层控制器将其落地为具体运动。通过对比“实际观测”与“模型预测”利用发生的预测失败Failure来触发有针对性的数据收集与世界模型迭代构建主动闭环系统。8. 通过“代码程序”恢复物理世界的底层组合结构 (Seeing the Physical World via Code)提出者Shangzhe Wu Jiajun Wu (University of Cambridge / Stanford University)核心内容视觉不是单纯的像素预测其本质是逆向还原物理世界的组合代码Code必须将连续的特征与离散的符号关系紧密结合。核心逻辑一个真正理解物理的世界模型必须解构出世界的底层物理结构包括实体、内在属性几何、材质、质量、摩擦力、外在属性位姿、光照以及动力学关系。仅仅追求视觉生成质量Perceptual Quality的像素级模型无法验证其是否真正掌握了质量、触点、摩擦力等参数一旦面临介入和模拟需求就会失效。物理世界是高度组合、递归的由部件构成物体由物体构成场景。作者主张使用神经符号化表征将离散的关系结构写成具有逻辑的、可执行验证的“代码程序”形式利用嵌套、循环与参数约束而将无法用语言精准命名的连续几何和纹理留给神经网络嵌入。代码具有“可编译和可运行测试”的独特性借助 LLM 代理LLM agents作为结构代码的创作者便能在接收到物理引擎的仿真渲染反馈或实际视觉不一致后持续修正、优化该 3D 物理资产和结构代码实现极强的零样本泛化能力。9. 走向视觉原生的交互智能 (From Visual Models to Vision-Native Intelligence)提出者Zhuang Liu (Princeton University)核心内容视觉绝不能仅是 LLM 旁边的“小挂件”。VGI 应当是视觉原生的需要探索自适应视觉抽象、主动视觉机制和高多样性的数据策展。核心逻辑人类大量的空间、关系与行为推理过程天然不适合被强行文本Token化。视觉数据不像人类早已创造并高度压缩好的文字那样拥有天然的符号层级由于像素太底层、图像 Patches 又只是工程上的凑合视觉模型必须依靠更海量的计算可能需要比语言大出 1,000 到 10,000 倍的有效计算和数据处理才能自主孕育出正确的抽象。一个优秀的视觉原生智能系统的检验核心是自适应的视觉抽象它能够对环境中不重要的、与任务无关的区域保持粗糙表征而能主动识别、并自发将计算资源向任务关键区域分配细粒度表征自主决定何时看、朝哪看以及需要看多深。总结通往 AGI 的三力合一路径在白皮书的最后Hirokatsu Kataoka 等人指出了这些观点的汇聚方向视觉通用智能并不旨在取代大语言模型而是为机器智能提供一个独立、扎根于真实物理世界的底层基石。他们提出VGI 的最终涌现极有可能通过以下三大互补性学习目标的融合而实现序列预测 (Sequential Prediction)在漫长的时间线和多变的环境中强迫模型预测未来的视觉演化以此逼迫模型学习物理规律和因果世界模型。开放式生成 (Open-ended Generation)将生成作为机器的“想象力”和“内部模拟器”使智能体能够在其构建的虚拟替代场景中自我博弈、测试假说、生成反事实并持续进化。结构重建 (Reconstruction)通过解决超分辨率、逆向渲染、快速 3D/4D 重建等不完备观测问题逼迫模型学习空间、距离、深度以及三维物理一致性等隐藏规则。这三大基石相互配合共同推动机器视觉系统从传统的“单一视觉任务执行器”向“具有自我适应、持续学习和具身交互的通用智能系统”进化。此白皮书发布机构包含以下 14 家 研究机构和企事业单位 日本产业技术综合研究所 (AIST) (National Institute of Advanced Industrial Science and Technology) 牛津大学视觉几何组 (VGG) (Visual Geometry Group, University of Oxford) 剑桥大学 (University of Cambridge) 哈佛大学 (Harvard University) 斯坦福大学 (Stanford University) 普林斯顿大学 (Princeton University) 卡内基梅隆大学 (Carnegie Mellon University) 纽约大学 (New York University) 伦敦帝国理工学院 (Imperial College London) 纽伦堡技术大学 (University of Technology Nuremberg) 筑波大学 (University of Tsukuba) OpenAI 谷歌 DeepMind (Google DeepMind) CADDi 公司 (CADDi)https://arxiv.org/pdf/2608.25924