揭秘代理技能:为何有效——直至失效
摘要
本文研究了技能增强LLM代理性能的条件,通过受控实验分析成功与失败因素,并提出了技能使用模式的分类法。
arXiv:2608.14036v1 Announce Type: new
Abstract: 技能已发展成为在推理时通过结构化知识包增强LLM代理的一种实用且有效的方法。然而,现有评估主要衡量技能是否提高聚合任务成功率,留下了一个更根本的问题未充分探索:\emph{\textbf{技能何时有效,为何有效,又在何处失效?}} 通过在不同基准、代理工具和LLM上的受控实验,我们隔离了表示、结果标注、检索难度和技能跨框架鲁棒性的影响。为了进一步回答这个问题,我们设计了一项对比研究,结合受控定量实验和配对轨迹分析。我们对来自受控实验的8,135条试验记录进行标准化,并从240条开放编码记录中保留了238个有效的唯一标签。我们将这些观察整合成三个高级类别和十二种技能使用模式的分类法:当有噪声的轨迹成为稳定执行的程序锚点时,技能有效。技能在匹配比较中比Workflow Memory提高了6.06分。程序锚点占技能案例的65.7%,而显式知识注入仅占4.5%,表明技能是稳定行动而非注入缺失事实。检索是一个单独的瓶颈:随着池规模从5增长到100,实际使用精度从29.6%下降到3.3%。混淆的干扰项损害离线识别,但下游成功保持稳定;精确的基础真值调用既非充分也非必要。技能在脆弱的假设、不兼容的上下文或适应不足时失效。这些发现将评估超越聚合成功率,并指导可靠的自我进化代理。
查看缓存全文
缓存时间: 2026/08/17 10:01
# 它们为何有效——直到失效 来源:https://arxiv.org/html/2608.14036 ## 解密智能体技能:它们为何有效——直到失效 感谢:预印本。Zhiyuan Jiang1,∗,‡ Fangrui Huang3,∗ Hanwen Xing4 Xander Wu3 Yipeng Gao4 Rui Cao5 Mengdi Wang1,† Shilong Liu1,† Yijiang Li2,† 1普林斯顿大学 2加州大学圣地亚哥分校 3斯坦福大学 4南加州大学 5约翰斯·霍普金斯大学 ∗同等贡献;†通讯作者。‡研究于普林斯顿大学实习期间完成 ###### 摘要 技能已成为一种实用且有效的方法,通过结构化知识包在推理时增强大语言模型智能体。然而,现有评估大多仅衡量技能是否提升整体任务成功率,而一个更根本的问题仍未得到充分探讨:*技能何时起作用?为何有效?在何处失效?*通过在多种基准测试、智能体框架和大语言模型上进行控制实验,我们分离了表征、结果标注、检索难度以及技能跨框架鲁棒性的影响。为进一步解答此问题,我们设计了一项结合控制定量实验与配对轨迹分析的对比研究。我们对来自控制实验的8,135条试验记录进行了标准化处理,并从240条开放编码记录中保留了238个有效唯一标签。我们将这些观察归纳为三个高级类别和十二种技能使用模式的分类体系:当嘈杂的轨迹转变为稳定执行的程序性锚点时,技能便发挥作用。在匹配对比中,技能比工作流记忆提升6.06个百分点。程序性锚定占技能使用案例的65.7%,而显式知识注入仅占4.5%,表明技能的作用在于稳定行为而非注入缺失事实。检索是另一个瓶颈:当技能池从5个扩展到100个时,实际使用精度从29.6%降至3.3。易混淆的干扰项会损害离线识别能力,但下游任务成功率仍保持稳定;精确的真值调用既非充分条件也非必要条件。技能在脆弱假设、不兼容情境或适应不足的情况下会失效。这些发现将评估从整体成功率推进,并为可靠的自我进化智能体提供指导。 参见标题(a)技能与程序记忆流程。 参见标题(b)三重实验技能检索评估。 图1:实验流程。 上:技能与程序记忆对比。我们在固定Docker环境中执行每项任务,收集成功与失败轨迹,形成固定预算的组合网格。相同的轨迹池被提炼为工作流记忆或可复用的SKILL.md,随后在相同协议下对匹配任务进行评估。 下:技能检索。每项任务与一个包含其真值技能和k−1个真实干扰项(随机、相似或不相似)的候选池配对。匹配池通过三种流程独立评估:(A) 基于嵌入的排序(不执行任务),(B) 显式智能体选择(无Docker执行或验证),(C) 完整池真实执行(任务验证后解析技能使用)。(A)和(B)的输出不传递至(C)。 图2:轨迹混合与实验臂的分类标签分布。 堆叠条形图显示原始数据、工作流记忆和技能在六种源轨迹混合(从5s0f到0s5f)下的轨迹级标签。标签分为三个高级类别;各模式百分比详见附录表11(https://arxiv.org/html/2608.14036#A1.T11)。 ## 1 引言 大语言模型智能体正日益被期望通过经验持续改进,而非每次从头解决任务。因此,近期智能体系统开始存储并复用先前执行的轨迹:环境配置序列、工具使用模式、调试流程以及早期运行中发现的验证步骤。这种转变对工具使用型智能体尤为具有吸引力,因为重复失败通常并非源于高阶推理能力不足,而在于反复重新发现相同的程序细节。在诸多记忆形式中,*技能*已成为一种特别引人注目的抽象概念。技能并非简单的执行记录,而是对操作内容、检查要点及陷阱规避的紧凑描述。相较于存储原始执行轨迹或直接的工作流记忆,技能具有三大优势:可将嘈杂经验压缩为更短上下文、将程序性知识标准化为稳定格式,并可能实现跨相关任务的知识迁移。 尽管技能具有重要意义,现有研究仅通过整体任务成功率来评估技能:若技能增强型智能体解决更多任务,则认为该技能有用。尽管此类评估证实了技能确实重要,却未能揭示*其重要性的根本原因*。具体而言,它们无法解释:技能加载前后智能体行为发生何种本质变化、技能指导稳定了执行过程的哪些部分、为何同一技能可能对某一任务有益而对另一任务有害。这导致领域内对技能设计与改进仍停留在经验性认知:技能常通过启发式迭代、提示调优或针对特定基准的试错进行编写、检索与修订,而非基于对技能真正价值的原理性理解。 因此,我们探讨*技能何时起作用、为何有效以及在何处失效*,超越了*技能是否有效*这一初步问题。我们的核心贡献是构建了技能效用与失效的分类体系,并提出一种使技能效应可观测的配对研究方法论。总体而言,该方法通过对比有无技能访问的匹配执行,分析两者在技能使用流程中的分岔点,包括先前经验如何表征、跨智能体框架转移、检索与调用。这种对比视角使我们能够将增益与失败归因于具体机制而非仅整体结果,并为技能使用的深入研究及最终自动化生成可靠技能提供了更严谨的基础。 此视角表明,技能效用不能仅通过端到端成功率理解,而必须沿技能使用流程的各个阶段分析。具体而言,我们围绕四个问题组织研究:(1) 将相同先前经验表征为标准化技能,是否与注入为直接程序记忆存在差异;(2) 技能增益是源于底层经验本身,还是来自显式成功/失败标注;(3) 提炼的程序性指导在跨智能体框架转移时是否仍保持有效;(4) 技能池规模与混淆度如何影响检索与下游执行。 通过全面的控制实验与对比轨迹分析,我们发现技能在将嘈杂先前经验转化为紧凑程序性指导时最为有用。主导机制并非知识注入(4.5%),而是*程序性锚定*(65.7%):技能帮助智能体遵循更可靠的配置步骤、工具序列、实现流程和验证检查。与此一致,技能减少了多项执行层失败,包括环境配置错误、输出格式不匹配、服务生命周期问题和shell命令损坏。相比之下,直接工作流记忆暴露出一个互补缺陷:虽保留了有用的程序性证据,但携带了无关探索、失败分支和冗长过程噪声,可能导致超时或执行偏离。 然而,结果也显示技能并非普遍有益。技能仍需在适当情境中被检索、解释和应用。我们的检索实验表明,检索质量无法简化为顶层选择准确率。难负例干扰项会显著降低显式技能选择准确率,但下游执行并非与检索准确率一一对应:选择正确技能并不保证任务成功,而相关的非真值技能仍可提供有用的程序性支持。这揭示了技能的第二个失效边界:即使池中存在有用技能,智能体仍可能因技能被检索至错误程序上下文、仅被表面调用、或不足以克服任务级执行瓶颈(如超时、数值精度、依赖缺失及脆弱实现需求)而失败。 这些发现促成了技能使用的生命周期视角。当先前经验被提炼为可复用的程序性锚点,并在兼容情境中被检索与调用时,技能便发挥作用。当提炼的指导存在噪声、过度特异、与当前任务不匹配,或未经适应而机械遵循时,技能便会失效。因此,基于技能的自我改进不仅是积累更多记忆的问题,更是构建能够可靠生成、检索和应用程序抽象能力的智能体的问题。 总体而言,我们的贡献可概括如下: - • 我们系统分析了*技能何时有效、为何起作用以及在何处失效*,将技能评估从整体成功率转向技能改变智能体行为的机制。 - • 我们引入了对比轨迹分析方法来研究技能效应。我们对8,135条试验记录进行标准化处理,对240条采样轨迹进行开放编码,并将238个有效唯一标签归纳为三个高级类别和十二种技能使用模式的分类体系。 - • 我们进行了控制性的技能与工作流实验,分离了相同先前经验在表现为直接程序记忆或提炼技能时的不同行为。结果显示技能主要作为程序性锚点发挥作用,而工作流记忆常保留冗长探索、失败分支和过程噪声。 - • 我们联合分析了检索与下游执行,表明检索准确率本身无法解释任务成功。技能失效不仅发生在检索遗漏正确制品时,也发生在检索到的指导存在程序不兼容、调用力度不足,或无法克服执行瓶颈时。 表1:工作流记忆与技能注入在轨迹混合下的任务成功率。灰色行表示原始数据基线。绿色、红色及无色单元格分别表示高于、低于及等于相应原始数据基线的值;粗体标记各混合设置下的行内最大值。混合标签表示成功(s)与失败(f)源轨迹数量。Terminal-Bench-Pro比率在每种条件下使用130次试验,基础设施或验证器错误计为失败。 ## 2 相关工作 ### 2.1 大语言模型智能体的记忆复用 近期研究将记忆视为使大语言模型智能体适应跨任务与交互的机制。早期系统存储并检索情景经验、反思或交互历史以支持未来规划与决策。此方向已扩展至结构化外部记忆、检索增强经验复用、程序记忆管理,以及将情景观察压缩为知识中心结构的任务无关记忆图谱。近期综述将智能体记忆描述为“写入-管理-读取”循环,并指出了整合、检索、矛盾处理与评估方面的持续挑战。相关工作线从记忆*发生了什么*转向复用*如何行动*。工作流记忆将过去轨迹总结为面向未来任务的行动级流程。基于技能的系统通过将可复用流程存储为一等制品(包括可执行程序、脚本、技能目录或分层技能知识库)使此类程序知识更加显式。近期研究进一步探讨了执行过程中的技能激活与选择,以及通过经验进行的自动技能发现、修订与演化。然而,技能仍常通过整体任务成功率评估,掩盖了它们与更广泛程序记忆的差异及其在特定执行中起效或失效的原因。我们通过将技能与程序记忆对比,并将其效应归因于表征、检索、调用、转移与抽象等阶段来填补这一空白。 ### 2.2 智能体行为评估基准 现有智能体基准为研究智能体行为提供了自然场景。通用工具使用与计算机使用基准评估多步决策、工具调用与环境交互。软件与终端基准尤为重要,因为它们需要在文件、测试和环境状态上进行长程执行。特别是Terminal-Bench提供真实命令行任务、隔离环境与基于测试的验证,非常适合观察程序性
相似文章
揭秘智能体技能:为何有效,直到失效
本文探讨了 LLM 智能体中的技能为何通过程序性锚定稳定执行而有效,同时指出了检索瓶颈和脆弱假设等局限性。
@dair_ai: 一篇揭示代理技能的优秀论文。
这篇论文通过分析8,135次标准化试验,揭示了代理技能的本质,挑战了技能主要向模型注入知识的假设。
并非所有技能都有帮助:衡量与修复智能体知识
本文指出,在LLM智能体中简单积累技能可能导致性能倒退,因为对某些任务有益的技能反而会损害其他任务。作者提出Assay框架,该框架衡量每个技能的因果贡献,并对每个任务进行掩码处理,在不更新权重的情况下,在AppWorld和τ-bench上取得了最先进的结果。
SkillMaster:迈向大语言模型智能体的自主技能掌握
本文介绍了 SkillMaster,一种训练框架,使大语言模型智能体能够通过轨迹知情审查和反事实效用评估,自主地创建、优化和选择技能。
LLM智能体系统中技能的规模化定律
本文识别了LLM智能体系统中技能库的两个耦合规模化定律:路由准确率随库大小呈对数衰减,执行动态表现出救援效应。这些定律在15个模型和超过百万次决策中得到验证,且定律指导的优化显著提升了性能。