揭秘智能体技能:为何有效,直到失效
摘要
本文探讨了 LLM 智能体中的技能为何通过程序性锚定稳定执行而有效,同时指出了检索瓶颈和脆弱假设等局限性。
查看缓存全文
缓存时间: 2026/08/19 11:58
论文页面 - 揭秘智能体技能:为何有效,又何时失效
来源:https://huggingface.co/papers/2608.14036
摘要
技能通过程序化锚定主要以稳定执行过程的方式增强大语言模型智能体,而非注入缺失知识,但检索瓶颈与脆弱假设限制了其效果。
技能(https://huggingface.co/papers?q=Skills)已成为在推理时通过结构化知识包增强大语言模型智能体(https://huggingface.co/papers?q=LLM%20agents)的实用有效方法。然而现有评估主要衡量技能(https://huggingface.co/papers?q=skills)是否提升整体任务成功率,留下一个更根本的问题未充分探讨:\textbf{技能何时起效、为何有效以及在何处失效?}通过在不同基准测试、智能体框架和大语言模型上进行控制实验,我们分离了表征、结果标注、检索难度(https://huggingface.co/papers?q=retrieval%20difficulty)与技能跨框架鲁棒性(https://huggingface.co/papers?q=cross-framework%20robustness)的影响。为深入解答该问题,我们设计了一项对比研究(https://huggingface.co/papers?q=contrastive%20study),结合控制性定量实验与配对轨迹分析(https://huggingface.co/papers?q=trajectory%20analysis)。我们标准化了8,135条控制实验记录,从240条开放编码记录中保留238个有效唯一标签。这些观察被归纳为三大类共十二种技能使用模式:当杂乱轨迹成为稳定执行过程的程序化锚点时,技能即发挥作用。技能(https://huggingface.co/papers?q=Skills)在匹配对比中比工作流记忆(https://huggingface.co/papers?q=Workflow%20Memory)提升6.06分。程序化锚定(https://huggingface.co/papers?q=Procedural%20anchoring)占技能案例的65.7%,而显式知识注入仅占4.5%,表明技能(https://huggingface.co/papers?q=skills)主要稳定行动而非注入缺失事实。检索是独立瓶颈:当候选池从5个增至100个时,实际使用精度从29.6%降至3.3%。易混淆干扰项损害离线识别,但下游成功率保持稳定;精确调用真实情况既非充分条件亦非必要条件。技能在脆弱假设、不兼容情境或适应不足时会失效。这些发现使评估超越整体成功率,为构建可靠的自演进智能体提供指导。
查看arXiv页面 (https://arxiv.org/abs/2608.14036)查看PDF (https://arxiv.org/pdf/2608.14036)项目页面 (https://zhiyuanjiang04.github.io/demystify-agent-skills)GitHub1 (https://github.com/zhiyuanjiang04/demystify-agent-skics)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.14036)
通过智能体获取本文:
hf papers read 2608.14036
尚未安装最新CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本文的模型0
无关联模型
在模型README.md中引用 arxiv.org/abs/2608.14036 以从此页面关联。
引用本文的数据集0
无关联数据集
在数据集README.md中引用 arxiv.org/abs/2608.14036 以从此页面关联。
引用本文的空间0
无关联空间
在空间README.md中引用 arxiv.org/abs/2608.14036 以从此页面关联。
包含本文的收藏夹0
无包含本文的收藏夹
将本文添加到收藏夹 (https://huggingface.co/new-collection) 以从此页面关联。
相似文章
揭秘代理技能:为何有效——直至失效
本文研究了技能增强LLM代理性能的条件,通过受控实验分析成功与失败因素,并提出了技能使用模式的分类法。
并非所有技能都有帮助:衡量与修复智能体知识
本文指出,在LLM智能体中简单积累技能可能导致性能倒退,因为对某些任务有益的技能反而会损害其他任务。作者提出Assay框架,该框架衡量每个技能的因果贡献,并对每个任务进行掩码处理,在不更新权重的情况下,在AppWorld和τ-bench上取得了最先进的结果。
@dair_ai: 一篇揭示代理技能的优秀论文。
这篇论文通过分析8,135次标准化试验,揭示了代理技能的本质,挑战了技能主要向模型注入知识的假设。
@rohanpaul_ai: 代理技能之所以有效,有一个非常具体的原因:它们将杂乱的过去经验转化为代理可以遵循的干净流程……
该论文解释说,代理技能通过将过去经验转化为干净的流程来提高性能,其中技能版本比Workflow Memory高出6.06个百分点,主要通过程序锚定。
SkillMaster:迈向大语言模型智能体的自主技能掌握
本文介绍了 SkillMaster,一种训练框架,使大语言模型智能体能够通过轨迹知情审查和反事实效用评估,自主地创建、优化和选择技能。