A Survey on Agentic Multimodal Large Language Models
该文章是首篇关于智能体多模态大语言模型(Agentic MLLMs)的综述,系统梳理了该领域从基础理论到应用实践的全貌,明确了其与传统MLLM智能体的核心差异,为领域研究提供了统一框架和关键资源。一、文章主要内容总结1. 核心概念与定位Agentic MLLMs定义:具备自主决策能力的多模态模型,能通过推理、反思、记忆实现长程规划,主动调用外部工具,并与虚拟/物理环境交互,突破传统MLLM“查询-响应”的静态范式。与传统MLLM智能体的差异:通过动态工作流(而非固定流程)、主动执行(而非被动响应指令)、跨领域泛化(而非单任务适配)实现更灵活的复杂任务处理。2. 三大核心能力框架文章将Agentic MLLMs的能力拆解为三个维度,构成其技术核心:智能体内在智能(Agentic Internal Intelligence):模型的“认知中枢”,包括推理(通过提示工程、监督微调、强化学习三种范式提升长链推理能力)、反思(分为隐式诱导和显式诱导,修正错误并优化决策)、记忆(含上下文记忆的令牌压缩/窗口扩展,及外部记忆的启发式/推理驱动管理)。智能体外部工具调用(Agentic External Tool Invocation):扩展模型能力边界,涵盖信息检索(通过强化学习实现自主搜索时机与内容决策)、代码执行(支撑数学计算、程序工程等精确任务