【快读系列】skill的方方面面
【快读系列】skill的方方面面概述skill的生命周期基于三个问题的探究这篇文章我们得到了什么剩下的一些疑问概述本文是对《From Raw Experience to Skill Consumption: A Systematic Study of Model-Generated Agent Skills》的学习和整理。这篇文章是从skill相关的what层面出发探究why然后回到how。首先作者将skill的生命周期划分为三步1. experience generation2. skill extraction3. skill consumption这是属于what层面。然后作者追问1. skill真的一直起效吗2. 如果不是的话在什么时候起效3.是什么导致了它有时候起效有时候无效这是属于why层面。最后作者提出了一个叫做meta-skill的概念这里的meta是指它是一个指导skill提取的skill。这是属于how层面。skill的生命周期这张图以可视化的方式更加形象的展示了skill生命周期中的三步已经比较浅显易懂了。对这幅图中的额外的两点信息加以强调。第一点是在整个周期中有两处用到了model做任务时候的model称之为Target Model从轨迹中提取skill的model称之为Extractor Model。这两者理论上可以不加思索的用自己方便的但是是一个组合变量组关于这一点会有两个问题1. 用model A作为 Extractor Model理论上用model A作为Target Model会更加合适但实际上真的是吗需要用实验数据来做支撑。2.用model A作为Extractor Model, 如果用model B作为Target Model是否会存在指标明显下降的问题这涉及到一个泛化性是否足够的问题。另外一个点是作者提出了两个定量的指标Extraction efficacy, 将它定义为使用提取器提取到的skill前后的指标变化的平均值猜测这个平均应该是在两个维度上来做一个是不同的benchmark另外一个是不同的target model。读到后面的论文可以回来验证一下。Target evolvability则是指来自不同Extractor model提取到的skill, 在该Target model上在不同benmark上获得score提升的平均值。这个平均是在不同的benmark和不同的target model上的一个二维度平均它体现的是target model有多强以及有多鲁棒。基于三个问题的探究作者提出了三个问题1. skill真的有效吗不同的benchmark, targets model, extractors2. 如果有效的话到底什么在起效生命周期三步的作用事实上作者的做法是对有效的结果再进一步的探究一些细节的消融实验3. 能否对第二步skill提取步骤提出一个提取skill的skill这篇文章我们得到了什么第一次接触到study类型的文章。之前还有另外一篇是《Are Transformers Effective for Time Series Forecasting》貌似引用量很高。它是我遇到的提出一个范式优化一个范式提出一个问题(也即近几年流行的benchmark和datasets)之外的第四类文章。这篇文章由于结论并不是100%的下结论因此对于实际指导有一定的限制反倒是作者如何分析如何自圆其说如何把事情做的系统有理有据值得学习实际生活和工作中可能就是这样自圆其说即可。如果遇到实验结果behave uniformly该如何讲这个故事。我感觉第一个问题是很好设计饰演的额是一组l ∗ m ∗ n l*m*nl∗m∗n的实验。那么第二个问题和第三个问题该如何做呢可以学习学习。agent的skill是有一个相对来说属于规范的协议标准https://github.com/agentskills/agentskills剩下的一些疑问study文章和消融实验的区别是什么我感觉study的维度会更高它通过消融实验的方式来达到尝试对大家普遍关心或者还没意识到问题的一些分析。但是消融实验反倒是大家针对自己方法、模型中低纬度的超参的一些对比。某种程度上消融实验可以不看只是为了证明自己的合理性甚至可以放在附录但是study的问题要求普遍吸引人有价值一点。agent的harness有相关的规范的协议标准吗c的