拓冰建站拓冰建站
首页 / 资讯中心 / 正文

【值得收藏】AgentFly:通过案例推理实现LLM智能体持续学习,零微调成本高效进阶!

前言近年来大型语言模型LLM智能体已成为AI领域的热点它们能自主使用工具、进行多步推理完成复杂任务如深度研究、代码生成、多轮对话等。然而现有的LLM智能体面临两大困境一是依赖静态、手工设计的工作流程缺乏灵活性无法适应新环境二是通过微调LLM参数来实现适应虽然灵活但成本极高且容易发生“灾难性遗忘”不适合持续学习。这就引出了一个核心问题能否让LLM智能体像人类一样通过记忆和经验持续学习而不必每次都重新训练或微调模型论文AgentFly: Fine-tuning LLM Agents without Fine-tuning LLMs链接https://arxiv.org/pdf/2508.16153本论文正是针对这一挑战提出的创新解决方案。作者受人类记忆机制启发提出了一个基于记忆的在线强化学习框架智能体通过不断积累成功和失败的经验存入“案例库”在遇到新任务时快速检索相似案例指导决策从而实现持续进步——整个过程完全不更新LLM的权重。AgentFly在多个权威基准测试中表现卓越如在GAIA验证集上达到87.88%的准确率排名第一在DeepResearcher上显著超越已有训练型方法证明了其高效性和泛化能力。这不仅为构建低成本、高自适应的通用智能体提供了新范式也推动了AI向更接近人类学习方式的方向发展。下面我们将深入解读AgentFly的核心方法、实现细节、实验结果及其深远意义。核心方法基于记忆的MDP与案例推理CBR形式化框架记忆增强的MDPM-MDP传统强化学习使用马尔可夫决策过程MDP建模智能体与环境的交互包括状态、动作、转移概率、奖励函数等。AgentFly在此基础上引入外部记忆空间形成记忆增强的MDPMemory-augmented MDP, M-MDP其定义为其中S状态空间当前任务或环境状态A动作空间智能体可执行的操作P状态转移函数R奖励函数r折扣因子M记忆空间存储历史经历案例记忆空间是AgentFly的核心创新。每个案例 是一个三元组 分别表示过去某次任务的状态、执行的动作和获得的奖励。智能体通过不断积累这些案例形成一个不断增长的“经验库”。CBR智能体的决策机制AgentFly的决策过程模仿人类的案例推理Case-Based Reasoning, CBR过程分为四步检索Retrieve根据当前状态 从案例库 中检索出最相关的案例 。重用与修订Reuse Revise基于检索到的案例 LLM生成当前动作 。评估Evaluate执行动作 获得奖励 和下一个状态 。保留Retain将本次经历 存入案例库更新记忆。整个轨迹的概率可表示为优化目标最大熵强化学习与软Q学习为了优化案例检索策略 作者采用最大熵强化学习在最大化累积奖励的同时鼓励策略多样性避免陷入局部最优。其目标函数为其中 是熵 是温度超参控制探索与利用的平衡。在该框架下软Q函数表示在状态 和记忆 下选择案例 的期望回报其贝尔曼方程为其中 是软价值函数。最优检索策略 具有闭式解该公式是核心中的核心它告诉我们检索案例的概率由它们的Q值决定——Q值越高的案例即过去越成功的案例被选中的概率越大。温度参数 控制着探索程度 越大策略越随机 越小越倾向于选择Q值最高的案例。两种记忆机制实现AgentFly提供了两种实现检索策略 的方式非参数化记忆直接使用向量检索如余弦相似度从案例库中找最相似的案例。简单高效但缺乏适应性。参数化记忆训练一个神经网络Q函数 来评估案例价值并通过梯度下降更新见公式15和26。更灵活能学习到任务之间的潜在规律。实现AgentFly深度研究智能体AgentFly被实例化为一个规划器-执行器Planner-Executor架构如上图所示两者交替工作共同完成任务。双阶段协作流程规划器Planner由强大LLM如GPT-4.1驱动是一个CBR智能体。它接收用户任务从案例记忆中检索K个相关案例据此制定计划分解为子任务并写入子任务记忆。执行器Executor由轻量LLM如o4-mini驱动负责执行子任务。它读取子任务使用工具记忆记录工具使用历史调用相应工具如搜索、代码执行并将结果写回。三类记忆模块分工案例记忆Case Memory存储宏观规划经验任务-计划-奖励。子任务记忆Subtask Memory记录当前任务的子任务列表及其状态。工具记忆Tool Memory记录每个子任务下的工具调用和返回结果。这种设计确保了任务上下文的持续传递和精细化管理。强大的工具集成为了应对深度研究的复杂需求AgentFly通过Model Context Protocol (MCP)集成了丰富的外部工具信息获取Meta搜索引擎SearxNG 精准爬虫Crawl4AI多模态处理支持图片、音频、视频、PDF、PPT、表格等数十种格式的解析与理解推理与分析Python代码执行沙盒、数学计算工具这使得AgentFly能真正像人类研究员一样在互联网上搜索信息阅读各种格式的文档进行数据分析并最终给出答案。记忆读写机制对比机制写入Write读取Read特点非参数化直接追加案例TopK相似度检索简单、快速、可解释参数化追加案例 更新Q网络按Q值TopK检索自适应、可学习、更精准在深度研究场景中任务通常是单步规划即规划器只规划一步执行器执行多个工具调用因此作者将Q学习目标简化为监督学习避免了时序差分学习的不稳定性并用交叉熵损失替代MSE更适合二值奖励信号。实验与性能论文在4个具有挑战性的基准上进行了全面评估充分验证了AgentFly的有效性。数据集GAIA复杂工具使用与多步规划分3个难度等级。DeepResearcher7个开源QA数据集合集测试实时网络研究与多跳推理。SimpleQA事实性单跳问答检验幻觉抑制能力。HLE(Humanity’s Last Exam)涵盖多学科的长尾知识问答测试极限推理能力。主要结果DeepResearcherAgentFly取得了66.6% F1和80.4% PM的平均分数显著超越所有Prompt-Based和Training-Based基线模型证明了其在线研究能力的强大。GAIA在验证集上达到87.88% Pass3排名第一在测试集上达到**79.40%**名列前茅超越了Manus、AWorld、OWL等知名开源框架。SimpleQA达到95.0%的准确率创下新SOTA表明其出色的事实准确性和抗幻觉能力。HLE达到24.4% PM仅次于GPT-5在专家级长尾知识问题上展现了惊人潜力。消融实验消融实验清晰地展示了各个组件的贡献离线执行器 → 在线执行器接入实时工具带来巨大提升如SimpleQA: 28.8 F1但有时因数据污染会下降DeepResearcher: -18.0 F1说明模型内部知识同样重要。在线执行器 → AgentFly (w/o CBR)增加规划器带来全面、显著的提升所有任务10~30点证明规划与工具编排至关重要。AgentFly (w/o CBR) → 完整AgentFly引入CBR记忆机制带来一致的额外提升4~8点证明了案例推理的独立价值。持续学习与泛化能力持续学习随着迭代次数增加案例库变大性能持续提升参数化CBR增益优于非参数化。OOD泛化在训练时未见的任务上MusiQue, Bamboogle, PopQA性能仍有4.7% ~ 9.6%的绝对提升展现了出色的泛化能力。超参数分析检索案例数 并非越多越好。实验表明 时效果最佳超过后性能持平或下降。这说明少量高质量案例比大量噪声案例更有效与少样本学习中的“越多越好”结论不同凸显了记忆 curation策展的重要性。讨论与分析效率与成本分析工具使用统计随着任务难度增加代码、搜索、爬虫工具的使用占比显著上升说明复杂任务更依赖外部信息获取和处理。Token消耗Level 3任务的输入Token121k远高于输出Token9.8k说明计算开销主要来自整合和分析多步工具的输出而非生成最终答案。这为优化系统性能指明了方向。规划器模式“快思考”胜于“慢思考”一个有趣的发现是使用快速、非慎思的规划器GPT-4.1配以强大的执行器o3其效果70.9%远好于使用慢速、慎思的规划器o3本身63.03%。分析表明慢速规划器容易产生冗长、模糊的计划甚至跳过规划直接回答问题导致执行器困惑。而快速规划器能生成简洁、结构化的计划更有效地指导执行器。这揭示了在模块化系统中角色清晰分工比每个组件都“大力出奇迹”更重要。结论AgentFly提出了一种革命性的LLM智能体持续学习范式。其核心在于将智能体形式化为一个记忆增强的MDP通过案例推理CBR机制利用外部记忆库存储和复用历史经验从而实现在线、高效的适应性学习而无需微调LLM参数。这项工作的巨大价值在于理论创新将CBR与最大熵RL相结合为智能体学习提供了新的形式化框架。工程实用提出的 planner-executor 架构与MCP工具集成是一个强大、可扩展的深度研究智能体系统。性能卓越在多个权威基准上达到顶尖水平充分验证了方法的有效性。低成本高效益开辟了一条不依赖昂贵微调、更接近人类学习方式的智能体发展路径。未来AgentFly的研究方向可能包括更高效的记忆压缩与检索机制、遗忘策略以应对记忆爆炸、以及在更开放的多智能体环境中的协作与应用。这项工作无疑为迈向通用人工智能AGI的关键一步——持续终身学习——提供了坚实而高效的实现基础。最后为什么要学AI大模型当下⼈⼯智能市场迎来了爆发期并逐渐进⼊以⼈⼯通⽤智能AGI为主导的新时代。企业纷纷官宣“ AI ”战略为新兴技术⼈才创造丰富的就业机会⼈才缺⼝将达 400 万DeepSeek问世以来生成式AI和大模型技术爆发式增长让很多岗位重新成了炙手可热的新星岗位薪资远超很多后端岗位在程序员中稳居前列。与此同时AI与各行各业深度融合飞速发展成为炙手可热的新风口企业非常需要了解AI、懂AI、会用AI的员工纷纷开出高薪招聘AI大模型相关岗位。最近很多程序员朋友都已经学习或者准备学习 AI 大模型后台也经常会有小伙伴咨询学习路线和学习资料我特别拜托北京清华大学学士和美国加州理工学院博士学位的鲁为民老师给大家这里给大家准备了一份涵盖了AI大模型入门学习思维导图、精品AI大模型学习书籍手册、视频教程、实战学习等录播视频全系列的学习资料这些学习资料不仅深入浅出而且非常实用让大家系统而高效地掌握AI大模型的各个知识点。这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】AI大模型系统学习路线在面对AI大模型开发领域的复杂与深入精准学习显得尤为重要。一份系统的技术路线图不仅能够帮助开发者清晰地了解从入门到精通所需掌握的知识点还能提供一条高效、有序的学习路径。但知道是一回事做又是另一回事初学者最常遇到的问题主要是理论知识缺乏、资源和工具的限制、模型理解和调试的复杂性在这基础上找到高质量的学习资源不浪费时间、不走弯路又是重中之重。AI大模型入门到实战的视频教程项目包看视频学习是一种高效、直观、灵活且富有吸引力的学习方式可以更直观地展示过程能有效提升学习兴趣和理解力是现在获取知识的重要途径光学理论是没用的要学会跟着一起敲要动手实操才能将自己的所学运用到实际当中去这时候可以搞点实战案例来学习。海量AI大模型必读的经典书籍PDF阅读AI大模型经典书籍可以帮助读者提高技术水平开拓视野掌握核心技术提高解决问题的能力同时也可以借鉴他人的经验。对于想要深入学习AI大模型开发的读者来说阅读经典书籍是非常有必要的。600AI大模型报告实时更新这套包含640份报告的合集涵盖了AI大模型的理论研究、技术实现、行业应用等多个方面。无论您是科研人员、工程师还是对AI大模型感兴趣的爱好者这套报告合集都将为您提供宝贵的信息和启示。AI大模型面试真题答案解析我们学习AI大模型必然是想找到高薪的工作下面这些面试题都是总结当前最新、最热、最高频的面试题并且每道题都有详细的答案面试前刷完这套面试题资料小小offer不在话下这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门