技能的价值是什么?结构感知的智能体技能 Shapley 估值
摘要
本文介绍了 SkillSV,一个结构感知的 Shapley 风格框架,用于对智能体技能的内部单元进行估值,并考虑依赖关系和层次结构。它在智能体基准上展示了更好的忠实度、可操作性和解释质量。
arXiv:2608.04562v1 公告类型:新
摘要:智能体技能日益通过自动化反馈循环进行优化,产生长结构化的工件,其内部价值仍然不清楚。我们研究技能估值:在固定智能体和留出任务分布下,将信用分配给固定技能的内部单元,例如规则、示例、脚本和启发式方法。技能估值不同于数据或提示跨度估值,因为技能单元是结构化的:它们可能依赖其他单元,属于文档层次结构,触发智能体行为,并消耗有限的提示上下文。我们引入了 SkillSV,一个结构感知的 Shapley 风格技能估值框架。SkillSV 将技能编译为单元、依赖关系和层次结构,从而只评估有效的反事实技能。它使用配对删除和长度中性填充来区分内容价值与上下文成本,并使用基于回滚预算的估计器来估计噪声智能体评估的结果值。在四个智能体基准上,我们评估了 SkillSV 的忠实度、可操作性和解释性:它恢复了单元交互,保持了聚合技能提升,并指导了安全的剪枝和压缩。
查看缓存全文
缓存时间: 2026/08/06 07:42
# 技能价值几何?智能体技能的结构感知 Shapley 估值 来源:https://arxiv.org/html/2608.04562 Tao Li¹ Junfeng Liu² Qinghua Zhao³ Yifan Li² Lei Wang² Bo Shao⁴ Xuejun Liu¹ Linjun Shou⁴ ¹南京航空航天大学 ²鹏城实验室 ³合肥大学 ⁴微软 ###### 摘要 智能体技能越来越多地由自动化反馈循环进行优化,产生长而结构化的产物,但其内部价值仍不明确。我们研究*技能估值*:在固定智能体和留出任务分布下,将固定技能内部单元(如规则、示例、脚本和启发式)的贡献进行归属。技能估值不同于数据或提示片段估值,因为技能单元是结构化的:它们可能依赖其他单元、属于文档层级、触发智能体行为,并消耗有限的提示上下文。我们提出 **SkillSV**,一个结构感知的 Shapley 风格技能估值框架。SkillSV 将技能编译为单元、依赖关系和层级结构,从而只评估有效的反事实技能。它使用配对删除和长度中性填充来将内容价值与上下文成本分离,并通过带 rollout 预算的估计器来估计带噪声的智能体评估结果。在四个智能体基准上,我们评估了 SkillSV 的*保真性*、*可操作性*和*可解释性*:它能恢复单元交互、保持聚合技能提升,并指导安全剪枝和压缩。 *关键词*:智能体技能 ⋅ Shapley 值 ⋅ 功劳分配 ⋅ LLM 智能体 ⋅ 提示压缩 ## 1 引言 智能体技能是可复用产物,将 LLM 推理转化为具体流程 [Ding et al. (2026)](https://arxiv.org/html/2608.04562#bib.bib41)。自动化优化器越来越多地编写技能,在执行反馈下提出并接受编辑 [Agrawal et al. (2026)](https://arxiv.org/html/2608.04562#bib.bib26);[Yang et al. (2026a)](https://arxiv.org/html/2608.04562#bib.bib28);[Ni et al. (2026)](https://arxiv.org/html/2608.04562#bib.bib27);[Yuksekgonul et al. (2024)](https://arxiv.org/html/2608.04562#bib.bib25);[Yang et al. (2026b)](https://arxiv.org/html/2608.04562#bib.bib29);[Alzubi et al. (2026)](https://arxiv.org/html/2608.04562#bib.bib30)。这些循环提升了总体分数,但返回的是一个很长的技能,其功劳分配是一个黑盒。技能中的每一部分价值几何?我们关注技能内估值,即将技能性能归因于其内部单元(例如规则或脚本)。这种细粒度视角至关重要,因为技能本质上是在可编辑单元粒度上进行优化、调试和演进的 [Ren et al. (2026)](https://arxiv.org/html/2608.04562#bib.bib40)。为了使技能价值有良好定义,我们固定三个要素:待评估的技能产物、目标智能体,以及带有指标的留出任务分布。 > 参见图注 > 图 1:为什么扁平化估值会错误评估智能体技能,以及 SkillSV 如何修复这一问题。 尽管现有文献成功地将功劳分配给训练数据 [Ghorbani and Zou (2019)](https://arxiv.org/html/2608.04562#bib.bib6);[Wang and Jia (2023)](https://arxiv.org/html/2608.04562#bib.bib8);[Maleki et al. (2013)](https://arxiv.org/html/2608.04562#bib.bib9);[Lin et al. (2025)](https://arxiv.org/html/2608.04562#bib.bib17),或将贡献归因于特定模型参数 [Ghorbani and Zou (2020)](https://arxiv.org/html/2608.04562#bib.bib18);[Liu et al. (2023)](https://arxiv.org/html/2608.04562#bib.bib10);[Mohammadi (2024)](https://arxiv.org/html/2608.04562#bib.bib11);[Xu et al. (2026)](https://arxiv.org/html/2608.04562#bib.bib20);[Huang et al. (2026)](https://arxiv.org/html/2608.04562#bib.bib19),但这些范式无法无缝迁移到智能体技能。技能不是单一数据点或提示,而是一个结构化产物,可能结合 Markdown 层级、触发器、规则、示例、脚本和辅助文件。这种不匹配带来了两个挑战(图 1)。 **挑战一:结构反事实。** 技能单元的联盟并不自动构成有效技能。删除一个单元可能留下悬空引用、未定义符号、缺失脚本,或与引导语分离的片段。对这种残缺产物进行评分,衡量的是智能体对畸形技能的鲁棒性,而非被删除单元的价值。因此,技能估值需要一种方法,将产物编译为单元、依赖关系和层级结构,并且只评估那些仍然读起来像真实技能的反事实。 **挑战二:预算受限的 rollout 估计。** 即使是有效的反事实,评分的代价也很高。每个联盟都必须渲染为技能,交给智能体,在留出任务上运行并验证。由于任务难度主导了许多单单元差异,估计结果噪声很大。此外,删除一个单元既改变了智能体可用的信息,也改变了提示长度,因此得分变化可能反映内容、上下文占用,或两者兼有。 **为什么现有方法会失效。** 这两个挑战解释了为什么扁平化的消融式归因对技能具有误导性。同样的问题也影响扁平化的 Shapley 式估值:对任意子集取平均,会给不是有效技能产物的上下文分配功劳 [Ghorbani and Zou (2019)](https://arxiv.org/html/2608.04562#bib.bib6);[Kwon and Zou (2022)](https://arxiv.org/html/2608.04562#bib.bib7)。留一法(LOO)是最简单的失败案例 [Cook (1977)](https://arxiv.org/html/2608.04562#bib.bib38)。如果存留单元依赖于被删除的单元,LOO 衡量的是破坏而非贡献。 我们提出 **SkillSV**,一个面向智能体技能的结构感知估值框架。它将技能编译为单元、依赖关系和层级结构;在可行插入顺序上定义 Shapley 式单元值;并在固定预算下通过配对删除/
相似文章
Skill-RM: 通过智能体技能统一异构评估标准
Skill-RM 提出了一种统一的奖励建模框架,将奖励计算视为结构化的智能体任务,实现了动态证据聚合和跨多种应用的一致评估,优于传统的评判基线。
SkillEval:将智能体技能质量分解为可解释的信号
SkillEval 提出了一种可解释框架,通过将技能文档表示投影到固定的评分方向上,将智能体技能质量分解为不同的语义属性,从而支持对技能文档的诊断和有针对性的修订。
SkillFlow:自主智能体终身技能发现与演化基准测试
SkillFlow 推出了一个涵盖20个任务家族共166项任务的基准测试,用于评估自主智能体在终身学习协议下,随时间推移发现、修复并维护技能的能力。实验揭示了主流模型之间存在显著的能力差距:Claude Opus 4.6 通过技能演化获得了显著提升,而其他模型的收益有限甚至为负。
RESOURCE2SKILL:从人类创建的多模态资源中提炼可执行智能体技能
RESOURCE2SKILL是一个框架,它将教程视频、代码仓库、文章和工件等多模态资源提炼为层次化的SkillWiki中的可执行智能体技能,相比无技能智能体,将智能体性能提升了11.9个百分点。
智能体技能评估与演进:框架与基准
本综述系统性地审视了智能体系统的技能演进与评估,将演进归类为四种范式,并分析了六个以技能为中心的基准类别,以识别结构性差距和开放方向。