技能的价值是什么?结构感知的智能体技能 Shapley 估值

arXiv cs.AI 论文

摘要

本文介绍了 SkillSV,一个结构感知的 Shapley 风格框架,用于对智能体技能的内部单元进行估值,并考虑依赖关系和层次结构。它在智能体基准上展示了更好的忠实度、可操作性和解释质量。

arXiv:2608.04562v1 公告类型:新 摘要:智能体技能日益通过自动化反馈循环进行优化,产生长结构化的工件,其内部价值仍然不清楚。我们研究技能估值:在固定智能体和留出任务分布下,将信用分配给固定技能的内部单元,例如规则、示例、脚本和启发式方法。技能估值不同于数据或提示跨度估值,因为技能单元是结构化的:它们可能依赖其他单元,属于文档层次结构,触发智能体行为,并消耗有限的提示上下文。我们引入了 SkillSV,一个结构感知的 Shapley 风格技能估值框架。SkillSV 将技能编译为单元、依赖关系和层次结构,从而只评估有效的反事实技能。它使用配对删除和长度中性填充来区分内容价值与上下文成本,并使用基于回滚预算的估计器来估计噪声智能体评估的结果值。在四个智能体基准上,我们评估了 SkillSV 的忠实度、可操作性和解释性:它恢复了单元交互,保持了聚合技能提升,并指导了安全的剪枝和压缩。
查看原文
查看缓存全文

缓存时间: 2026/08/06 07:42

# 技能价值几何?智能体技能的结构感知 Shapley 估值
来源:https://arxiv.org/html/2608.04562

Tao Li¹  Junfeng Liu²  Qinghua Zhao³  Yifan Li²  Lei Wang²  Bo Shao⁴  Xuejun Liu¹  Linjun Shou⁴  
¹南京航空航天大学  ²鹏城实验室  ³合肥大学  ⁴微软

###### 摘要

智能体技能越来越多地由自动化反馈循环进行优化,产生长而结构化的产物,但其内部价值仍不明确。我们研究*技能估值*:在固定智能体和留出任务分布下,将固定技能内部单元(如规则、示例、脚本和启发式)的贡献进行归属。技能估值不同于数据或提示片段估值,因为技能单元是结构化的:它们可能依赖其他单元、属于文档层级、触发智能体行为,并消耗有限的提示上下文。我们提出 **SkillSV**,一个结构感知的 Shapley 风格技能估值框架。SkillSV 将技能编译为单元、依赖关系和层级结构,从而只评估有效的反事实技能。它使用配对删除和长度中性填充来将内容价值与上下文成本分离,并通过带 rollout 预算的估计器来估计带噪声的智能体评估结果。在四个智能体基准上,我们评估了 SkillSV 的*保真性*、*可操作性*和*可解释性*:它能恢复单元交互、保持聚合技能提升,并指导安全剪枝和压缩。

*关键词*:智能体技能 ⋅ Shapley 值 ⋅ 功劳分配 ⋅ LLM 智能体 ⋅ 提示压缩

## 1 引言

智能体技能是可复用产物,将 LLM 推理转化为具体流程 [Ding et al. (2026)](https://arxiv.org/html/2608.04562#bib.bib41)。自动化优化器越来越多地编写技能,在执行反馈下提出并接受编辑 [Agrawal et al. (2026)](https://arxiv.org/html/2608.04562#bib.bib26);[Yang et al. (2026a)](https://arxiv.org/html/2608.04562#bib.bib28);[Ni et al. (2026)](https://arxiv.org/html/2608.04562#bib.bib27);[Yuksekgonul et al. (2024)](https://arxiv.org/html/2608.04562#bib.bib25);[Yang et al. (2026b)](https://arxiv.org/html/2608.04562#bib.bib29);[Alzubi et al. (2026)](https://arxiv.org/html/2608.04562#bib.bib30)。这些循环提升了总体分数,但返回的是一个很长的技能,其功劳分配是一个黑盒。技能中的每一部分价值几何?我们关注技能内估值,即将技能性能归因于其内部单元(例如规则或脚本)。这种细粒度视角至关重要,因为技能本质上是在可编辑单元粒度上进行优化、调试和演进的 [Ren et al. (2026)](https://arxiv.org/html/2608.04562#bib.bib40)。为了使技能价值有良好定义,我们固定三个要素:待评估的技能产物、目标智能体,以及带有指标的留出任务分布。

> 参见图注  
> 图 1:为什么扁平化估值会错误评估智能体技能,以及 SkillSV 如何修复这一问题。

尽管现有文献成功地将功劳分配给训练数据 [Ghorbani and Zou (2019)](https://arxiv.org/html/2608.04562#bib.bib6);[Wang and Jia (2023)](https://arxiv.org/html/2608.04562#bib.bib8);[Maleki et al. (2013)](https://arxiv.org/html/2608.04562#bib.bib9);[Lin et al. (2025)](https://arxiv.org/html/2608.04562#bib.bib17),或将贡献归因于特定模型参数 [Ghorbani and Zou (2020)](https://arxiv.org/html/2608.04562#bib.bib18);[Liu et al. (2023)](https://arxiv.org/html/2608.04562#bib.bib10);[Mohammadi (2024)](https://arxiv.org/html/2608.04562#bib.bib11);[Xu et al. (2026)](https://arxiv.org/html/2608.04562#bib.bib20);[Huang et al. (2026)](https://arxiv.org/html/2608.04562#bib.bib19),但这些范式无法无缝迁移到智能体技能。技能不是单一数据点或提示,而是一个结构化产物,可能结合 Markdown 层级、触发器、规则、示例、脚本和辅助文件。这种不匹配带来了两个挑战(图 1)。

**挑战一:结构反事实。** 技能单元的联盟并不自动构成有效技能。删除一个单元可能留下悬空引用、未定义符号、缺失脚本,或与引导语分离的片段。对这种残缺产物进行评分,衡量的是智能体对畸形技能的鲁棒性,而非被删除单元的价值。因此,技能估值需要一种方法,将产物编译为单元、依赖关系和层级结构,并且只评估那些仍然读起来像真实技能的反事实。

**挑战二:预算受限的 rollout 估计。** 即使是有效的反事实,评分的代价也很高。每个联盟都必须渲染为技能,交给智能体,在留出任务上运行并验证。由于任务难度主导了许多单单元差异,估计结果噪声很大。此外,删除一个单元既改变了智能体可用的信息,也改变了提示长度,因此得分变化可能反映内容、上下文占用,或两者兼有。

**为什么现有方法会失效。** 这两个挑战解释了为什么扁平化的消融式归因对技能具有误导性。同样的问题也影响扁平化的 Shapley 式估值:对任意子集取平均,会给不是有效技能产物的上下文分配功劳 [Ghorbani and Zou (2019)](https://arxiv.org/html/2608.04562#bib.bib6);[Kwon and Zou (2022)](https://arxiv.org/html/2608.04562#bib.bib7)。留一法(LOO)是最简单的失败案例 [Cook (1977)](https://arxiv.org/html/2608.04562#bib.bib38)。如果存留单元依赖于被删除的单元,LOO 衡量的是破坏而非贡献。

我们提出 **SkillSV**,一个面向智能体技能的结构感知估值框架。它将技能编译为单元、依赖关系和层级结构;在可行插入顺序上定义 Shapley 式单元值;并在固定预算下通过配对删除/

相似文章

Skill-RM: 通过智能体技能统一异构评估标准

Hugging Face Daily Papers

Skill-RM 提出了一种统一的奖励建模框架,将奖励计算视为结构化的智能体任务,实现了动态证据聚合和跨多种应用的一致评估,优于传统的评判基线。

SkillFlow:自主智能体终身技能发现与演化基准测试

Hugging Face Daily Papers

SkillFlow 推出了一个涵盖20个任务家族共166项任务的基准测试,用于评估自主智能体在终身学习协议下,随时间推移发现、修复并维护技能的能力。实验揭示了主流模型之间存在显著的能力差距:Claude Opus 4.6 通过技能演化获得了显著提升,而其他模型的收益有限甚至为负。

智能体技能评估与演进:框架与基准

arXiv cs.CL

本综述系统性地审视了智能体系统的技能演进与评估,将演进归类为四种范式,并分析了六个以技能为中心的基准类别,以识别结构性差距和开放方向。

@op7418: https://x.com/op7418/status/2065232309310427565

X AI KOLs Timeline

This article discusses the concept of Skills in the AI agent ecosystem, arguing that Skills are more than prompts—they are packaged capabilities that externalize human expertise into reusable workflow units. The author shares design principles and case studies from building popular Skills.