拓冰建站拓冰建站
首页 / 资讯中心 / 正文

DENSE:将智能体轨迹提炼为面向自我改进的证据驱动捷径树

DENSE:将智能体轨迹提炼为面向自我改进的证据驱动捷径树arXiv编号:arXiv:2609.21423v1 [cs.AI]摘要线上部署的大模型智能体会产出海量执行轨迹,但任务专属验证器、专家标注成本高昂,难以大规模获取。本文研究:在没有事后任务结果标签的前提下,如何从原始轨迹中提炼可复用反馈信息,利用轨迹内部的局部进展、故障恢复、未完成需求等证据。提出DENSE(Distilling Evidence from Nested Subtask Executions,从嵌套子任务执行中提炼证据),将轨迹证据组织为证据驱动嵌套捷径树。DENSE压缩冗余尝试,利用恢复证据跨层级调和各类问题;对已完成分支做摘要,同时对未解决分支做展开;把可复用进展与剩余待完成义务建立关联。本文同时提出REFIT评测协议:源轨迹配对评测,在看不到事后任务结果标签的条件下对比不同反馈;重置环境与模型上下文,使用反馈对同一任务重新发起尝试。在Terminal‑Bench 2.1基准上,DENSE在四款被测接收模型上,在所有非特权反馈方法中取得最高严格通过率。相对原始首轮执行,严格通过率提升7.12‑15.64个百分点;重跑时接收方模型token观测消耗降低19.0‑43.6%。基于GPT‑5.5的消融实验证实:嵌套子任务分析、捷径构建、问题调和三者组合才能拿到完整增益。实验表明,可以依靠证据驱动的轨迹复用来实现智能体自我迭代,降低对外部监督的依赖。关键词智能体轨迹蒸馏;自我改进;嵌套子任务;捷径树;无标签反馈;REFIT协议;Terminal‑Bench目录引言DENSE:证据驱动的捷径树2.1 问题设定与总览2.2 构建嵌套子任务2.3 带证据的尝试过程压缩2.4 通过恢复证据调和问题2.5 渲染未完成需求义务REFIT:评估轨迹信息价值3.1 配对重跑实验3.2 可用信息定义3.3 下游效用指标实验4.1 实验设置4.1.1 任务4.1.2 接收方模型4.1.3 执行配置4.1.4 反馈生成模型4.1.5 评测指标与覆盖率4.2 对比方法4.3 任务性能结果4.4 消融实验
分享:

看完干货,该让你的企业上线了

免费需求沟通 · 48 小时内出具建站方案 · 河南本地可上门