Agent不只进化技能,还开始进化“如何进化”

发布时间:2026/7/24 15:36:35
Agent不只进化技能,还开始进化“如何进化” 许多自我改进 agent 会根据失败轨迹重写 task skill但诊断、检索、分配搜索预算和执行编辑的流程通常预先写死。MetaSkill-Evolve把这套“如何改进”的规则也做成可编辑的文件五个 agent 共用冻结的 Gemma-4 31B不做微调只在 task skill 与分支本地 meta-skill 两个时间尺度上迭代。OfficeQA 的留出测试准确率从无 skill 的 31.78% 升至 55.32%增加23.54 个百分点。这一结果来自三个 benchmark 的受控实验并不等于 agent 已具备无边界的自我进化能力。[图1agent skill 改进的四种模式]展示了从无 skill、静态 skill、单层进化到 MetaSkill-Evolve 的四种设置前三种要么不进化要么只进化 task skill 而固定改进方法MetaSkill-Evolve 则在分支层面配置包含五个组件的 meta-skill用同一个五 agent 流水线同时改写 task skill 和 meta-skill。瓶颈进化了半天进化的方式却没进化过在配备外部 skill 的 agent 系统中一个常见做法是闭环改进agent 执行任务记录失败轨迹再启动分析、提议、执行的流水线重写 skill 文件。EvoSkill、GEPA、SkillWeaver 等系统都沿用了这一路径让 task skill 从 s₀ 进化到 s₁、s₂。但深究这些系统会发现两个被混为一谈的量。第一个是当前技能的效用U(s)即这个skill在验证集上的得分。第二个是元生产力P(m|s)即沿着当前分支的改进策略m这个分支能多稳定地产生更强的后代。两者并不等价一个今天分数很高的skill可能在一个元策略已经枯竭的分支里存在后续迭代再也生不出更好的子代一个目前分数平平的skill却可能因为配了一套特别擅长处理逻辑错误的改进策略反而是一条更值得深入探索的路线。MetaSkill-Evolve 把只优化 U(s) 而不更新 P(m|s) 视为固定元流程的局限遇到反复出现、现有诊断方式处理不好的失败时分支无法调整自己的改进规则。这里是该方法的设计动机而非对所有既有系统实际表现的普遍判定。五个 Markdown 文件如何同时改 task skill 和 meta-skillMetaSkill-Evolve 为每个进化分支引入分支本地的 meta-skill m与 task skill s 共同构成状态 b(s,m,h)。m 不是模型配置而是五个 Markdown 文件m(ψ, σ, α, π, ε)分别约束改进流水线的一个环节ψ是诊断策略驱动Analyzer agent对失败轨迹打标签和写分析σ是共享策略决定Retriever agent如何跨分支检索有价值的灵感α是分配策略让Allocator agent根据近期进展动态决定每轮生成多少个子代候选π是编辑提案例策略为Proposer agent提供如何将诊断转化为具体文本编辑的规范ε是执行策略指导Evolver agent将提案写入磁盘并验证结果。这五个文件与 task skill 文件格式相同都是 agent 可读取的 SKILL.md 文档。因此驱动 task skill 进化的五个 agent即 Analyzer、Retriever、Allocator、Proposer、Evolver也可以用同一条流水线改写 meta-skill 文件。快速循环每轮选取一个前沿父分支用当前 meta-skill m 驱动 task skill s 的一次进化慢速循环每隔 H 轮才触发汇总最近 H 个后代的元生产力估计 P̂(m|s) 与失败标签构造“元失败轨迹”再将五 agent 流水线作用到五个 meta-skill 文件上。这是一层有界递归改进规则进入与 task skill 相同的迭代闭环但没有再引入“元-元 skill”五 agent 的角色和连接关系保持固定也没有增加模型或目标函数。更关键的是分支之间不是孤立进化的。当一个分支在诊断算术错误方面逐渐形成更精细的标签体系时另一个分支可以通过跨分支检索共享到这一经验。元技能并不全局统一每个分支携带亲系本地的改进策略只在灵感检索时相互渗透这让不同分支的“改进风格”可以分化——一个分支可能发展出针对表格抽取失败的大幅重写风格另一个则培养出针对算术推理的保守增量修改风格。[图2系统概览]展示了分支状态如何进入五 agent 流水线输出如何写回 SQLite 节点图以及前沿选择如何从图中提取下一个父节点。前沿选择不只选分数高的更选“还能继续变强”的如果只按当前任务技能分数选父分支搜索很快会锁死在得分高但后代已经停滞的节点上。MetaSkill-Evolve的前沿选择使用复合评分η₁Uᵥ η₂P̂ᵥ η₃Nᵥ。第一项是当前技能效用鼓励利用已验证的好方案第二项是元生产力估计值把计算资源引向那些还能稳定产出有效后代的分支即使其当前技能分数不是最高第三项Nᵥ 1/(1已选次数)是一个访问冷却项——一个被反复选中的节点必须比未被选中的同级节点表现显著更好才能再次被选这防止了预算被某个高分支垄断。三项平衡的结果是用质量-多样性的方式保持探索的广度而不依赖预设的谱系过滤规则。进入档案库的每个节点必须严格满足∆U 0——只有后代在验证集上比父代有净增益才具备作为未来父分支的资格。分数持平或退化的子代虽然不进入候选池但仍保留在进化DAG中供检索器读取这意味着一个失败的编辑仍然可以作为“反面教材”被未来的提案器引用。实验三个基准两次跃升单一模型撑起全局实验覆盖了OfficeQA、SealQA和ALFWorld三个能力取向不同的agent基准。所有五个流水线agent共用一个完全冻结的Gemma-4 31B骨干模型不存在任何微调或模型容量扩充。[表1主要结果]展示了四个条件下三个基准的留出测试准确率。单层进化和MetaSkill-Evolve在OfficeQA和SealQA上分别相对无技能基线大幅提升且元技能进化环节带来了额外的增益。在OfficeQA上四个条件——无技能、静态技能、单层进化、MetaSkill-Evolve——的留出测试准确率依次是31.78%、36.09%、48.94%、55.32%。每一步都是净增益配备静态skill提升了4.31个百分点单层进化在此基础上再提12.85个百分点而开启慢速循环进行元技能进化又追加了6.38个百分点。端到端相对无技能的提升幅度达到23.54个百分点。SealQA上的轨迹类似无技能29.17%、静态29.41%、单层37.21%、MetaSkill-Evolve45.26%。元技能进化环节单独贡献了8.05个百分点。三个评价点的单调递增表明从“有技能”到“进化技能”再到“进化进化方法”每个设计决策都产生了独立的收益。ALFWorld 呈现的是另一种情况。Gemma-4 31B 在无 skill 条件下已达到 92.31% 的成功率静态 skill 回落至 90.38%单层进化恢复到 92.31%MetaSkill-Evolve 达到94.23%。绝对增益只有 1.92 个百分点。该论文的消融中冻结慢速循环或移除跨分支检索都会回到 92.31%因此在这项任务和这组设置下慢速循环与跨分支共享解释了这部分增益这不能外推为接近性能上限时唯一有效的优化方式。[图3三个基准上的端到端留出测试准确率]柱状图对比了无技能、静态技能、单层进化和MetaSkill-Evolve在三个基准上的表现红色标注为相对于无技能的增益幅度OfficeQA和SealQA的增量最为突出。拿走一个组件暴露每种技能权重消融实验进一步揭示五个元技能组件的角色在不同领域间发生了明显转移。在OfficeQA上分配策略α是核心——移除α准确率从55.32%骤降到35.58%降幅接近20个百分点。OfficeQA的失败分布中包含关联的算术错误群α决定在经历过停滞时扩大每轮子代预算是产生一个成功候选孩子的先决条件。编辑提案策略π的贡献紧随其后移除π后降幅达17.7个百分点。在SealQA上核心却转移到了编辑提案策略π——去掉π使准确率从45.26%跌至36.84%降幅超过8个百分点。密封性问题的增益依赖于每一条编辑的具体内容和准确性而不在于候选数量的多寡。ALFWorld 上同样由 π 占主导移除后准确率从 94.23% 降至 86.54%仅移除跨分支检索则回到单层进化基线 92.31%。这组消融说明在该设置下跨分支共享是 MetaSkill-Evolve 相对单层进化的关键增益来源且其效果需要检索策略 σ 与提案策略 π 配合。[图4在两个QA基准上的组件消融]蓝色多边形展示了移除诊断策略ψ、检索策略σ、分配策略α或提案策略π后准确率的退化幅度虚线环为完整MetaSkill-Evolve和静态技能的参考水平。元更新频率的敏感性也值得注意。将慢速循环的触发间隔H从2扩大到4再到8保持元更新总次数不变OfficeQA的准确率从48.94%先跌到41.35%再滑落到39.84%对陈旧元策略的容忍度极低SealQA和ALFWorld在H2和4时基本持平直到H8才出现轻微下滑。每2轮触发一次慢循环是跨三个基准的最佳选择更宽的间隔容易让元技能的批量改写覆盖掉快速循环中已经自行修复的有效编辑。这套框架不是无界递归的通用自我改进引擎。它只进化一层 meta-skill不进化五 agent 流水线自身的角色分工和连接关系实验也只覆盖三个特定 benchmark。更开放、周期更长、反馈更嘈杂的真实任务是否仍能复现这些收益原文没有给出证据。ALFWorld 的 1.92 个百分点增益提示当基座模型在某任务上已接近该测试集的上限可供 skill 进化挖掘的空间会很小。价值在于把改进行为拆成两层agent 学会做什么与 agent 调整如何改进自己可以复用相同的数据结构、模型和流水线只是运行在不同时间尺度、使用不同的选择信号。对需要维护 skill 演化流程的工程团队而言更值得验证的是这套分层能否在自己的任务、预算与反馈噪声下稳定复现而不是把三个 benchmark 的结果直接当作通用结论。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】