@rohanpaul_ai: 智能体可以积累数百种技能,但性能并未相应提升,这使得技能整合与复用成为一个比简单生成更多技能更大的问题。
摘要
一篇名为'ContinualSkillBench'的研究论文发现,LLM智能体从延续上下文和反馈中获益更多,而不是维护显式技能库,其中顺序执行显示出16.9%的相对增益,但上下文学习往往优于技能维护。
查看缓存全文
缓存时间: 2026/08/24 22:00
智能体可以积累数百种技能,却不会成比例地提升能力,这使得技能整合与复用问题比单纯生成更多技能更为关键。
若希望智能体在重复工作中持续提升,保留其上下文与反馈信息已有实质价值;自主技能创建机制目前仍不稳定,仅在真正需要复用流程的场景中可靠。
智能体能从经验中学习,但本研究发现,显式技能库的表现尚未稳定优于单纯传递上下文与反馈的方式。
ContinualSkillBench测试框架为智能体提供5个领域各100个连续任务,允许其保留反馈并更新可复用技能,并与从零开始解决每个任务的模式进行对比。
在15组模型-领域测试中,顺序执行在14组中提升了标准化奖励值,整体相对增益达16.9%。
但消融实验改变了结论:在法律、金融与医疗领域的GPT-5.3-Codex测试中,纯上下文学习的平均标准化奖励为0.605,而显式技能维护模式仅为0.602。
可见大部分增益实际源于上下文与反馈的传递,而非智能体稳定抽象出可复用技能。
– arxiv.org/abs/2608.03874
标题:《ContinualSkillBench:LLM智能体的能力是否真能持续进化?》
相似文章
ContinualSkillBench:LLM智能体能否真正进化其能力?
介绍了ContinualSkillBench,一个用于LLM智能体上下文内持续技能学习的动态评估框架,表明虽然顺序执行能提升性能,但当前方法难以将经验巩固为稳健、可迁移的技能。
SkillLearnBench:面向真实任务代理技能生成的持续学习方法基准
SkillLearnBench 推出首个评估 LLM 代理持续技能学习的基准,覆盖 20 项真实任务,结果显示尚无方法全面领先,单纯扩大模型规模也无法保证技能提升。
SkillCorpus: 整合与评估面向真实世界LLM智能体的开放技能生态
SkillCorpus 提出了一个框架,用于整合、精选和评估面向LLM智能体的开放技能生态,通过检索增强的技能集成,在多个基准测试中展示了一致的性能提升。
@rohanpaul_ai: 代理技能之所以有效,有一个非常具体的原因:它们将杂乱的过去经验转化为代理可以遵循的干净流程……
该论文解释说,代理技能通过将过去经验转化为干净的流程来提高性能,其中技能版本比Workflow Memory高出6.06个百分点,主要通过程序锚定。
并非所有技能都有帮助:衡量与修复智能体知识
本文指出,在LLM智能体中简单积累技能可能导致性能倒退,因为对某些任务有益的技能反而会损害其他任务。作者提出Assay框架,该框架衡量每个技能的因果贡献,并对每个任务进行掩码处理,在不更新权重的情况下,在AppWorld和τ-bench上取得了最先进的结果。