揭秘智能体技能:为何有效,直到失效

Hugging Face Daily Papers 论文

摘要

本文探讨了 LLM 智能体中的技能为何通过程序性锚定稳定执行而有效,同时指出了检索瓶颈和脆弱假设等局限性。

技能已通过结构化的知识包成为增强 LLM 智能体推理时表现的实用且有效的方法。然而,现有评估主要衡量技能是否提高聚合任务成功率,一个更基本的问题仍未充分探讨:\textbf{技能何时有帮助,为何有效,以及何处失效?}通过跨各种基准、智能体框架和 LLM 的对照实验,我们隔离了表示、结果注释、检索难度和技能跨框架鲁棒性的影响。为深入回答这一问题,我们设计了一项对比研究,结合对照定量实验与配对轨迹分析。我们标准化了 8,135 条对照实验记录,并从 240 条开放编码记录中保留 238 个有效唯一标签。我们将这些观察整合为一个包含三个高级类别和十二种技能使用模式的分类体系:当噪声轨迹成为稳定执行的程序性锚定时,技能有效。在匹配比较中,技能比工作流记忆提高 6.06 分。程序性锚定占技能案例的 65.7\%,而显式知识注入仅占 4.5\%,表明技能是稳定行动而非注入缺失事实。检索是一个单独的瓶颈:当池从 5 增长到 100 时,实际使用精度从 29.6\% 下降到 3.3\%。易混淆的干扰项会损害离线识别,但下游结果保持稳定;精确的真实情况调用既非充分也非必要。技能在脆弱假设、不兼容上下文或适应不足时失效。这些发现将评估从聚合成功率提升,并指导可靠的自我进化智能体。
查看原文
查看缓存全文

缓存时间: 2026/08/19 11:58

论文页面 - 揭秘智能体技能:为何有效,又何时失效

来源:https://huggingface.co/papers/2608.14036

摘要

技能通过程序化锚定主要以稳定执行过程的方式增强大语言模型智能体,而非注入缺失知识,但检索瓶颈与脆弱假设限制了其效果。

技能(https://huggingface.co/papers?q=Skills)已成为在推理时通过结构化知识包增强大语言模型智能体(https://huggingface.co/papers?q=LLM%20agents)的实用有效方法。然而现有评估主要衡量技能(https://huggingface.co/papers?q=skills)是否提升整体任务成功率,留下一个更根本的问题未充分探讨:\textbf{技能何时起效、为何有效以及在何处失效?}通过在不同基准测试、智能体框架和大语言模型上进行控制实验,我们分离了表征、结果标注、检索难度(https://huggingface.co/papers?q=retrieval%20difficulty)与技能跨框架鲁棒性(https://huggingface.co/papers?q=cross-framework%20robustness)的影响。为深入解答该问题,我们设计了一项对比研究(https://huggingface.co/papers?q=contrastive%20study),结合控制性定量实验与配对轨迹分析(https://huggingface.co/papers?q=trajectory%20analysis)。我们标准化了8,135条控制实验记录,从240条开放编码记录中保留238个有效唯一标签。这些观察被归纳为三大类共十二种技能使用模式:当杂乱轨迹成为稳定执行过程的程序化锚点时,技能即发挥作用。技能(https://huggingface.co/papers?q=Skills)在匹配对比中比工作流记忆(https://huggingface.co/papers?q=Workflow%20Memory)提升6.06分。程序化锚定(https://huggingface.co/papers?q=Procedural%20anchoring)占技能案例的65.7%,而显式知识注入仅占4.5%,表明技能(https://huggingface.co/papers?q=skills)主要稳定行动而非注入缺失事实。检索是独立瓶颈:当候选池从5个增至100个时,实际使用精度从29.6%降至3.3%。易混淆干扰项损害离线识别,但下游成功率保持稳定;精确调用真实情况既非充分条件亦非必要条件。技能在脆弱假设、不兼容情境或适应不足时会失效。这些发现使评估超越整体成功率,为构建可靠的自演进智能体提供指导。

查看arXiv页面 (https://arxiv.org/abs/2608.14036)查看PDF (https://arxiv.org/pdf/2608.14036)项目页面 (https://zhiyuanjiang04.github.io/demystify-agent-skills)GitHub1 (https://github.com/zhiyuanjiang04/demystify-agent-skics)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.14036)

通过智能体获取本文:

hf papers read 2608.14036

尚未安装最新CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本文的模型0

无关联模型

在模型README.md中引用 arxiv.org/abs/2608.14036 以从此页面关联。

引用本文的数据集0

无关联数据集

在数据集README.md中引用 arxiv.org/abs/2608.14036 以从此页面关联。

引用本文的空间0

无关联空间

在空间README.md中引用 arxiv.org/abs/2608.14036 以从此页面关联。

包含本文的收藏夹0

无包含本文的收藏夹

将本文添加到收藏夹 (https://huggingface.co/new-collection) 以从此页面关联。

相似文章

并非所有技能都有帮助:衡量与修复智能体知识

arXiv cs.CL

本文指出,在LLM智能体中简单积累技能可能导致性能倒退,因为对某些任务有益的技能反而会损害其他任务。作者提出Assay框架,该框架衡量每个技能的因果贡献,并对每个任务进行掩码处理,在不更新权重的情况下,在AppWorld和τ-bench上取得了最先进的结果。