@rohanpaul_ai: 智能体可以积累数百种技能,但性能并未相应提升,这使得技能整合与复用成为一个比简单生成更多技能更大的问题。

X AI KOLs Following 论文

摘要

一篇名为'ContinualSkillBench'的研究论文发现,LLM智能体从延续上下文和反馈中获益更多,而不是维护显式技能库,其中顺序执行显示出16.9%的相对增益,但上下文学习往往优于技能维护。

智能体可以积累数百种技能,但性能并未相应提升,这使得技能整合与复用成为比简单生成更多技能更大的问题。 如果你希望智能体在重复工作中改进,保留其上下文和反馈已经很有用;除了可复用流程真正重要的地方,自主技能创建仍然不可靠。 智能体可以从经验中变得更好,但本文发现,显式技能库尚未一致优于延续上下文和反馈。 ContinualSkillBench为智能体提供了5个领域中每个领域的100个相关任务,允许它们保留反馈并更新可复用技能,并与从头解决每个任务进行比较。 顺序执行在15个模型-领域设置中的14个中提高了归一化奖励,总体相对增益为16.9%。 但消融实验改变了结论:在GPT-5.3-Codex上,跨法律、金融和医疗保健领域,纯上下文学习平均归一化奖励为0.605,而显式技能维护为0.602。 因此,大部分增益似乎来自延续上下文和反馈,而不是来自智能体可靠地抽象可复用技能。 – arxiv.org/abs/2608.03874 标题:"ContinualSkillBench: 智能体能否真正进化其能力?"
查看原文
查看缓存全文

缓存时间: 2026/08/24 22:00

智能体可以积累数百种技能,却不会成比例地提升能力,这使得技能整合与复用问题比单纯生成更多技能更为关键。

若希望智能体在重复工作中持续提升,保留其上下文与反馈信息已有实质价值;自主技能创建机制目前仍不稳定,仅在真正需要复用流程的场景中可靠。

智能体能从经验中学习,但本研究发现,显式技能库的表现尚未稳定优于单纯传递上下文与反馈的方式。

ContinualSkillBench测试框架为智能体提供5个领域各100个连续任务,允许其保留反馈并更新可复用技能,并与从零开始解决每个任务的模式进行对比。

在15组模型-领域测试中,顺序执行在14组中提升了标准化奖励值,整体相对增益达16.9%。

但消融实验改变了结论:在法律、金融与医疗领域的GPT-5.3-Codex测试中,纯上下文学习的平均标准化奖励为0.605,而显式技能维护模式仅为0.602。

可见大部分增益实际源于上下文与反馈的传递,而非智能体稳定抽象出可复用技能。

– arxiv.org/abs/2608.03874

标题:《ContinualSkillBench:LLM智能体的能力是否真能持续进化?》

相似文章

并非所有技能都有帮助:衡量与修复智能体知识

arXiv cs.CL

本文指出,在LLM智能体中简单积累技能可能导致性能倒退,因为对某些任务有益的技能反而会损害其他任务。作者提出Assay框架,该框架衡量每个技能的因果贡献,并对每个任务进行掩码处理,在不更新权重的情况下,在AppWorld和τ-bench上取得了最先进的结果。