SkillCorpus: 整合与评估面向真实世界LLM智能体的开放技能生态
摘要
SkillCorpus 提出了一个框架,用于整合、精选和评估面向LLM智能体的开放技能生态,通过检索增强的技能集成,在多个基准测试中展示了一致的性能提升。
arXiv:2607.15557v1 声明类型:新论文
摘要:智能体技能,即打包了可复用过程知识的 SKILL.md 文件,是扩展 LLM 智能体能力的流行机制。公共代码仓库中托管着大量且不断增长的此类文件,然而这些工件碎片化、冗余且质量参差不齐,其实际价值尚不明确。一个核心问题仍未解决,即如何将这个开源的 SKILL.md 生态整合成一个可用的语料库,以及其在真实世界智能体任务上的收益边界。我们提出了 SkillCorpus,一个大规模聚合、精选、匹配和评估开放技能生态的框架。它通过多阶段流水线从约82.1万个爬取的技能中筛选出96,401个技能,这些技能按照16类分类法和三个质量维度(实用性、鲁棒性、安全性)进行组织,并配有一个微调的检索与选择堆栈来匹配任务相关技能。我们在三个基准测试(SkillsBench、GDPVal、QwenClawBench)、两个测试框架和两个开放主干模型上进行了端到端评估,并进行了前沿鲁棒性检查。集成 SkillCorpus 在所有三个基准测试中均取得了一致的提升,其中在 SkillsBench 上提升最大(+7.5个百分点)。操作性分析将提升归因于覆盖边界和测试框架边界。据我们所知,SkillCorpus 是第一个端到端地说明经过策划和检索服务的社区语料库何时能改善真实智能体任务、何时不能的完整论述。数据集、模型和代码将在论文被接收后发布。
查看缓存全文
缓存时间: 2026/07/20 09:34
# SkillCorpus:整合与评估面向真实世界LLM智能体的开放技能生态系统 **来源:** https://arxiv.org/html/2607.15557 Yanze Wang¹,²,³\equalcontrib, Pengfei Yao¹,²\equalcontrib, Tianyi Sun¹,²,³, Chuanrui Hu¹,²¹¹项目负责人\., Yan Xiao¹,², Yunyun Han¹,², Jun Sun³\corresponding, Yafeng Deng¹,²\corresponding ###### 摘要 智能体技能(Agent skills)——一种将可重用的程序化知识打包为SKILL.md文件、供LLM智能体使用的方式——已成为扩展智能体能力的热门机制。公开仓库中已托管大量且不断增长的技能文件,但这些产物碎片化、冗余且质量参差不齐,其实际价值尚不明确。一个核心问题依然悬而未决:如何将这一开源SKILL.md生态系统整合为一个可用的统一语料库,以及它在真实世界智能体任务中能带来多大的收益。我们提出**SkillCorpus**,一个大规模聚合、整理、匹配并评估开放技能生态系统的框架。它通过多阶段流水线,从约821,000个爬取技能中筛选出96,401个技能,按16类分类法和三个质量维度(实用性、鲁棒性、安全性)组织,并搭配一个微调的检索与选择模块,用于匹配任务相关技能。我们在三个基准(SkillsBench、GDPVal、QwenClawBench)、两个智能体框架和两个开放基础模型上进行端到端评估,并辅以前沿鲁棒性检查。集成SkillCorpus在所有三个基准上均取得一致性能提升,在SkillsBench上增幅最大(+7.5个百分点)。操作分析将增益归因于覆盖边界和框架边界。据我们所知,SkillCorpus是首个端到端阐述经过整理、检索服务的社区语料库何时能改善真实智能体任务、何时不能的工作。数据集、模型和代码将在接收后发布。 ## 1 引言 大语言模型越来越多地充当自主智能体,编排长期可执行任务,而非仅回答独立查询(Yao等人,2023 (https://arxiv.org/html/2607.15557#bib.bib1); Shinn等人,2023 (https://arxiv.org/html/2607.15557#bib.bib2); Park等人,2023 (https://arxiv.org/html/2607.15557#bib.bib3))。然而,在复合真实工作负载上,即使是最强的前沿系统仍存在可测量的局限(Merrill等人,2026 (https://arxiv.org/html/2607.15557#bib.bib26); OpenAI,2025b (https://arxiv.org/html/2607.15557#bib.bib30))。仅靠原始模型缩放难以弥合这一差距。越来越多的共识将智能体能力视为一个分层系统,其中冻结的基础模型与外部技能及加载并执行技能的智能体框架配对(Anthropic,2025a (https://arxiv.org/html/2607.15557#bib.bib16))。技能打包了在推理时调用的可重用程序化知识。与不透明、更新缓慢的模型权重或短暂的上下文内示例不同,技能是可解释且模块化的。相同的外部化与检索模式在工具使用中已很成熟,智能体在此模式下从大型API库中检索并调用函数(Qin等人,2024 (https://arxiv.org/html/2607.15557#bib.bib7); Patil等人,2023 (https://arxiv.org/html/2607.15557#bib.bib8)),最近的模型上下文协议(MCP)进一步标准化了对外部工具和资源的访问(Hou等人,2025 (https://arxiv.org/html/2607.15557#bib.bib9); Lin等人,2025 (https://arxiv.org/html/2607.15557#bib.bib10))。技能将此模式从外部工具调用扩展到程序化知识本身。工业级框架现已常规性地接入技能文件(Anthropic,2025b (https://arxiv.org/html/2607.15557#bib.bib32); OpenAI,2025a (https://arxiv.org/html/2607.15557#bib.bib33)),围绕SKILL.md规范(Anthropic,2025a (https://arxiv.org/html/2607.15557#bib.bib16))的社区生态系统已形成,涵盖数千个公开仓库。这种丰富性是否真的能提升智能体在真实任务上的性能,以及需要付出何种努力才能实现,这些问题仍未解决。与任务一对一配对的精心整理技能平均能提高通过率,但每领域的效应差异显著(Li等人,2026b (https://arxiv.org/html/2607.15557#bib.bib18)),而未经验证的社区库可能无法提升性能,甚至不如无技能基线(Li等人,2025 (https://arxiv.org/html/2607.15557#bib.bib19); Liu等人,2026b (https://arxiv.org/html/2607.15557#bib.bib20))。两大障碍有待克服。 首先,据我们所知,尚无可公开再发布的语料库同时具备广泛聚合、严格质量控制和开放再分发许可。现有产物仅来自一两个源渠道(Li等人,2025 (https://arxiv.org/html/2607.15557#bib.bib19); Liu等人,2026b (https://arxiv.org/html/2607.15557#bib.bib20)),而那些进行质量筛选的语料库也未展现大规模广泛覆盖的证据(Liang等人,2026 (https://arxiv.org/html/2607.15557#bib.bib17))。 其次,社区语料库在真实智能体任务上的下游价值在很大程度上未被刻画。先前评估要么将任务与手工挑选的完美技能配对而非使用部署的语料库(Li等人,2026b (https://arxiv.org/html/2607.15557#bib.bib18)),要么在模拟环境中运行(Liang等人,2026 (https://arxiv.org/html/2607.15557#bib.bib17)),要么通过单一框架在有限源上测量实际使用情况(Liu等人,2026b (https://arxiv.org/html/2607.15557#bib.bib20))。为弥合这两大障碍,我们提出**SkillCorpus**,一个统一的端到端框架,将开放的SKILL.md生态系统整合为经过整理、可部署的语料库,并在真实世界智能体任务上对其进行评估——从而能够衡量社区技能何时能帮助真实智能体,以及何时不能。我们的贡献有三方面: - **• 框架。** 我们统一了开放SKILL.md生态系统的聚合、整理、匹配和真实世界评估,将支离破碎、冗余且质量参差不齐的社区技能池转化为可大规模复用的整理基础。 - **• 开放资源。** 我们发布最终的96,401技能语料库(从约821,000个原始文件中整理得出)、其微调的检索与选择模块、以及完整的整理、训练和评估代码,均经过许可证审计且100%符合OSI许可——一个完全开放、生态系统规模的技能增强智能体研究资源。 - **• 发现。** 在三个真实世界智能体基准、独立框架和开放至前沿基础模型上进行评估(§4 (https://arxiv.org/html/2607.15557#S4)),我们发现集成SkillCorpus能一致提升智能体性能,其增益受语料库覆盖率和框架调节,刻画了社区技能的实际效用与局限。 ## 2 相关工作 ### 2.1 技能获取与整理 关于技能层的工作根据技能进入系统的时间点而有所不同。一条路径是在运行时获取技能,即智能体在解决任务的过程中获取。Voyager通过环境探索增长技能库(Wang等人,2024 (https://arxiv.org/html/2607.15557#bib.bib4)),Toolformer以自监督方式训练模型调用工具(Schick等人,2023 (https://arxiv.org/html/2607.15557#bib.bib6)),ToolLLM和Gorilla将API调用扩展到大型工具库(Qin等人,2024 (https://arxiv.org/html/2607.15557#bib.bib7); Patil等人,2023 (https://arxiv.org/html/2607.15557#bib.bib8)),最近的智能体进化工作让智能体重新设计自己的脚手架(Zhou等人,2026 (https://arxiv.org/html/2607.15557#bib.bib14); Lin等人,2026 (https://arxiv.org/html/2607.15557#bib.bib15))。所有这些都建立在智能体框架脚手架之上(Yao等人,2023 (https://arxiv.org/html/2607.15557#bib.bib1); Shinn等人,2023 (https://arxiv.org/html/2607.15557#bib.bib2))。 另一条路径(本文所属)是在智能体运行之前准备技能。我们在摄取时整理社区贡献的语料库,以便运行时系统拥有一个值得信赖的库可供使用。这种摄取时整理反映了语言模型训练中的数据质量工作,其中去重(Lee等人,2022 (https://arxiv.org/html/2607.15557#bib.bib36))和基于质量的数据选择(Zhou等人,2023 (https://arxiv.org/html/2607.15557#bib.bib37))比原始规模更能改善下游模型。 已发布的社区技能语料库侧重点各不相同。Liang等人(2026 (https://arxiv.org/html/2607.15557#bib.bib17))(与本文工作同期)发布了一个20万技能的 ontology,按五个质量规则评级,并通过技能关系图链接。它衡量在模拟环境中的收益,技能是从每个基准自己的专家轨迹中综合得出,而非在由部署语料库服务的真实任务上衡量。Li等人(2025 (https://arxiv.org/html/2607.15557#bib.bib19))将一个3.6万未经整理的库与四阶段检索流水线配对,仅通过产物密度信号隐式处理质量。Ling等人(2026 (https://arxiv.org/html/2607.15557#bib.bib21))提供了一个较小整理集的数据驱动刻画。这些发布均未报告源许可证审计,因此其再分发权利未解决。先前工作也未将这些逐技能评分与下游操作角色联系起来。我们引入一个紧凑的三维度框架,该框架选择可实现维度分离的度量而非规则覆盖,并直接刻画其操作信号(§4.6 (https://arxiv.org/html/2607.15557#S4.SS6))。 ### 2.2 技能检索与评估 技能检索架构涵盖从词汇和稠密召回至学习的技能路由器(Zheng等人,2026 (https://arxiv.org/html/2607.15557#bib.bib24)),并得到专用检索基准(Cho等人,2026 (https://arxiv.org/html/2607.15557#bib.bib23))、语料库规模缩放分析(Chen等人,2026 (https://arxiv.org/html/2607.15557#bib.bib22))和依赖感知组合(Liu等人,2026a (https://arxiv.org/html/2607.15557#bib.bib25))的支持。一条互补的工作线强调技能编排和上下文注入而非检索本身。Li等人(2026a (https://arxiv.org/html/2607.15557#bib.bib28))将能力树检索与基于DAG的编排结合,规模约为20万。Meng等人(2026 (https://arxiv.org/html/2607.15557#bib.bib29))报告在SkillsBench上通过技能图加紧凑编译获得+11.7%的增益。然而,该增益是针对先前最先进的注入方法而非无技能或社区语料库基线衡量的,因此不能直接与我们的端到端Δ比较。检索方面报告的是其自身整理池上的排序指标,而非任务结果。我们的栈在其服务的去重语料库上进行微调,并添加一个LLM选择器,在注入前读取完整的技能正文,其独立检索性能和端到端任务通过率影响均被直接测量。 在评估方面,Li等人(2026b (https://arxiv.org/html/2607.15557#bib.bib18))刻画了完美技能的有效性,Liu等人(2026b (https://arxiv.org/html/2607.15557#bib.bib20))报告了大规模未整理库的收益递减。两者均未在可部署的检索与选择模块下,跨多个真实世界基准评估单个社区整理语料库。§4 (https://arxiv.org/html/2607.15557#S4) 通过跨基准、跨框架、多基础模型的端到端任务增益测量填补了这一空白。 ## 3 SkillCorpus **见图1** **图1:SkillCorpus框架。** 构建语料库(顶部),我们从公共源渠道聚合社区SKILL.md文件,通过六阶段漏斗筛选出包含96,401个技能的语料库,按16类分类法和三个质量维度组织。使用语料库(底部),微调的检索与选择模块将技能与传入任务匹配,智能体端到端运行所选技能。示例演示了一个真实任务从请求到结果的完整流程,我们在三个真实世界基准、两个智能体框架和开放至前沿基础模型上评估此流水线。 SkillCorpus是一个统一的端到端框架,将开放SKILL.md生态系统转化为经过整理、可部署的语料库,并测量其对真实世界智能体任务的影响。如图1所示,它分为四个阶段:生态系统聚合与整理成语料库(§3.1–§3.3)、通过微调的检索与选择模块匹配任务相关技能(§3.4),以及在真实世界智能体任务上进行端到端评估(§4 (https://arxiv.org/html/2607.15557#S4))。 ### 3.1 多源聚合与整理流水线 语料库的价值在于其覆盖范围,横跨整个公共生态系统而非单一渠道。爬取由一个单一的机器可读源注册表驱动,包含62个源,详见附录A.6 (https://arxiv.org/html/2607.15557#A1.SS6)。该注册表涵盖五种摄取机制:直接克隆仓库、awesome列表抓取、市场索引API、站点地图爬取和JSON目录,每种机制均汇入一个共享的发现入口点。我们的爬取收集了约821,000个原始SKILL.md文件。经过源选择和仓库级去重后,25,159个GitHub仓库进入六阶段流水线,最终整理出发布的活跃集。图1 (https://arxiv.org/html/2607.15557#S3.F1) 可视化了该流水线。每个技能遵循Anthropic (2025a (https://arxiv.org/html/2607.15557#bib.bib16)) 的SKILL.md约定——一个可选的Markdown正文和可执行资源;阶段1–2应用结构过滤器(解析和长度/格式)。阶段3进行去重。阶段4运行LLM评判器,输出三维度质量评分和19个安全/质量标志。阶段5应用安全硬门控加OSI许可过滤器(表5 (https://arxiv.org/html/2607.15557#A1.T5))。阶段6附加源先验收缩、1024维检索嵌入和索引条目。解析和去重占据漏斗的主要部分,其余过滤器贡献几个百分点。 #### 双层去重(阶段3)。 去重是漏斗中最陡的缩减(283,844 → 101,111,-64%),分两层。精确层合并了169,465个内容指纹和名称指纹的重复项,占阶段输入的59.7%,反映了生态系统跨仓库复制相同产物的程度。语义层将每个幸存者嵌入(1024维),标记余弦相似度高于0.90的对,自动合并高于0.995的对。66,751个边界对由LLM评判器裁决,确认25.4%的对并合并13,268个近乎重复的技能。由此产生的低重叠分布也使得检索栈可以在语料库本身上训练。 ### 3.2 三维度质量框架 我们将技能质量分解为三个维度,每个维度捕捉一个不同的关注点,而非将其合并为一个单一复合指标或一个扁平的多维列表。这些维度服务于整理和检索排序,其中安全维度还额外充当发布门控(如§4.6 (https://arxiv.org/html/2607.15557#S4.SS6) 所述)。 #### 三个维度。 **实用性维度**仅对描述进行评分,询问任务类别是否具有清晰的范围、明确的触发条件和适用条件。**鲁棒性维度**对正文内容及其与描述承诺的一致性进行评分。若正文内部一致但悄然提供了比承诺更窄的内容,则在此扣分。**安全维度**捕捉伤害和风险,类别包括提示注入、命令注入、凭据泄露和不安全执行。设计上,实用性和鲁棒性维度独立评分。描述级别的问题仅影响实用性,正文级别的问题...
相似文章
OpenSkillEval:自动审计面向LLM智能体的开放技能生态系统
OpenSkillEval是一个自动评估框架,用于审计LLM智能体在多个下游任务中使用的开源技能。通过使用超过600个动态生成的任务和30项技能,作者发现技能的可用性并不保证有效使用,其收益在很大程度上取决于模型和框架。
SkillRet:面向 LLM 智能体技能检索的大规模基准
本文提出了 SkillRet,这是一个用于评估 LLM 智能体技能检索的大规模基准,旨在解决从大型技能库中选择相关技能的挑战。该基准提供了包含超过 17,000 项技能的 dataset,并证明针对特定任务的微调能显著提升检索性能。
SkillLearnBench:面向真实任务代理技能生成的持续学习方法基准
SkillLearnBench 推出首个评估 LLM 代理持续技能学习的基准,覆盖 20 项真实任务,结果显示尚无方法全面领先,单纯扩大模型规模也无法保证技能提升。
SkillCAT:对比性评估与拓扑感知的LLM智能体技能自我进化
SkillCAT是一个无需训练的LLM智能体技能自我进化框架,通过三个阶段解决单轨迹偏差、未经验证的合并和全语料库加载等问题:对比因果提取、评估增强进化和拓扑感知任务执行,在基准测试上实现高达40.40%的提升。
SkillMaster:迈向大语言模型智能体的自主技能掌握
本文介绍了 SkillMaster,一种训练框架,使大语言模型智能体能够通过轨迹知情审查和反事实效用评估,自主地创建、优化和选择技能。