SkillCenter:面向自主AI Agent的大规模源基技能库

arXiv cs.AI 论文

摘要

介绍SkillCenter,这是目前最大的面向AI Agent的开放技能库,包含216,938个结构化、源基的技能,覆盖24个领域。该库通过自动化流水线构建,并使用了基于LLM的质量门控(SkillGate)。该库结合了同行评审技能和社区技能,强调可追溯性和离线可搜索性。

arXiv:2607.07676v1 公告类型:新 摘要:自主AI Agent可以在有限的人工审核下执行复杂任务,但它们往往缺乏扎实的操作知识,使其输出不仅可执行,而且正确、安全、可维护。我们介绍了SkillCenter,据我们所知,这是按总数计算最大的开放Agent技能库:包含216,938个结构化技能,涵盖24个领域包。通过SkillGate过滤的流水线贡献了114,565个基于来源的技能,这些技能来自同行评审期刊、ArXiv以及超过24,000个技术来源,并与来自GitHub和ClawHub市场的102,373个社区技能整合。我们展示了构建流水线子集的端到端框架:多源获取、基于LLM的质量门控(SkillGate)、模板驱动生成、迭代源基化以及质量控制发布。源基化是一种可追溯性保证:每个保留的声明都映射到其来源中的确切引用。所有技能都以离线可搜索的SQLite FTS5包形式提供。
查看原文
查看缓存全文

缓存时间: 2026/07/09 07:57

# SkillCenter: 面向自主AI智能体的大规模源溯源技能库
来源: https://arxiv.org/html/2607.07676
Tianming Sha¹, Yue Zhao², Lichao Sun³, Yushun Dong⁴,†  
¹Stony Brook University, ²University of Southern California, ³Lehigh University, ⁴Florida State University  
[email protected], [email protected], [email protected], [email protected]  
†通讯作者  
![[Uncaptioned image]](https://arxiv.org/html/2607.07676v1/figures/lab_logo.png)  
\thetitle  
\theauthor  
![[Uncaptioned image]](https://arxiv.org/html/2607.07676v1/x1.png)

**摘要**
自主AI智能体能够在有限人工审核的情况下执行复杂任务,但它们往往缺乏扎实的操作知识,使其输出不仅是可执行的,而且是正确、安全且可维护的。我们引入了SkillCenter,据我们所知,这是目前规模最大的开放技能库,总计包含216,938个结构化技能,覆盖24个领域包。经过SkillGate过滤的管道贡献了114,565个源溯源技能,这些技能来自同行评审期刊、ArXiv以及超过24,000个技术来源,并与来自GitHub和ClawHub市场的102,373个社区技能整合。我们展示了构建该管道子集的端到端框架:多源采集、基于LLM的质量门(SkillGate)、模板驱动生成、迭代源溯源以及质量控制发布。源溯源是一种可追溯性保证:每个保留的声明都对应其来源中的准确引文。所有技能均以离线可搜索的SQLite FTS5包形式提供。

GitHub: https://github.com/LabRAI/SkillCenter  
Hugging Face: https://huggingface.co/datasets/Tommysha/skillcenter-bundles

## 1 引言

当开发者要求AI智能体“实现认证模块”时,智能体通常能够产生可运行的结果。但该结果是否正确、安全且可维护,则是另一回事。随着大语言模型(LLM)和自主智能体接管从业者过去手动执行的任务,一种质量差距随之出现:智能体获得自主性的速度,快于它获得人类经验曾提供的操作判断力的速度。我们认为,**技能**——定义为结构化、可检索、源溯源的操作知识单元——可以作为缩小这一差距的基础设施。本文介绍了SkillCenter,一个包含216,938个此类技能、覆盖24个领域包的库,以及一个用于大规模生成、验证和分发技能的自动化框架。

### 1.1 感受编码与感受研究

2025年2月,Andrej Karpathy创造了术语“感受编码”[12 (https://arxiv.org/html/2607.07676#bib.bib1)],用于描述一种工作流程:开发者用自然语言表达意图,LLM编写代码,开发者仅根据程序是否看起来能运行来接受或拒绝输出,而不进行逐行审查。像GitHub Copilot这样的代码生成工具已存在多年;这个术语命名了一种更新的态度——愿意停止阅读生成的代码。它之所以流行,是因为它描述了一种已经广泛存在的实践。这个想法迅速迁移。OpenAI研究员Jakub Pachocki和Mark Chen将同样的逻辑应用于科学探究,标称为“感受研究”[19 (https://arxiv.org/html/2607.07676#bib.bib10)]:让AI智能体处理文献综述、数据分析和甚至初步草稿,而人类研究者进行引导。研究者不再是移取试剂的那个人,而是决定移取哪种试剂的人。这些方法也引起了学术界关注;EASE 2026的VibeX 2026研讨会是专门研究它们的会议之一[30 (https://arxiv.org/html/2607.07676#bib.bib2)]。业界也在同步推进:OpenAI与Ginkgo Bioworks的合作将GPT-5模型与自主实验室配对,以大规模设计和运行生物实验[18 (https://arxiv.org/html/2607.07676#bib.bib3)]。实际上,人类角色正在从执行任务转向指导任务。

### 1.2 自主性频谱

向智能体执行工作的转变并非一蹴而就。我们将其描述为四个阶段的自主性频谱:

1. **纯人工阶段**。从业者编写所有代码、运行所有实验并审查所有输出。机器是被动的执行环境。
2. **LLM辅助阶段**。GitHub Copilot、ChatGPT及类似系统的工具建议补全、回答问题并起草简短段落。人类保留完全的编辑控制权,在接受任何建议前进行审查。
3. **智能体执行阶段**。集成开发智能体(Claude Code、Cursor、Windsurf及其在科学领域的对应物[39 (https://arxiv.org/html/2607.07676#bib.bib6)])接收高级任务(“实现认证模块”、“分析RNA-seq数据集”),并在最小人工干预下生成多文件、多步骤的输出。人类选择性审查。
4. **自主智能体阶段**。多智能体系统将复杂目标分解为子任务,委派给专门子智能体,并跨工具、API和环境编排执行[34 (https://arxiv.org/html/2607.07676#bib.bib38)]。OpenClaw智能体框架[20 (https://arxiv.org/html/2607.07676#bib.bib4)](一个用于构建技能组合助手和自动化智能体的开源框架)和OPAL[17 (https://arxiv.org/html/2607.07676#bib.bib5)]是早期例子。在OpenClaw的架构中,智能体从注册表中的离散技能原语组合任务特定行为,使得这些原语的可用性和质量成为首要问题。在此阶段,人类参与仅限于目标设定、定期审计和异常处理。

在每个阶段,智能体的独立决策能力增强,而人类监督减少。当人类编写代码时,数十年的培训和制度知识隐含地约束了解空间;当智能体编写代码时,这些约束必须明确化。因此,自主性频谱也是风险频谱:人类参与越少,系统越依赖于智能体可获取的知识的质量。

### 1.3 执行能力与正确性

现代LLM是能干的代码生成器。给定一个格式良好的提示,LLM可以生成一个解析数据集、训练模型并将结果写入磁盘的Python模块,该模块通常能首次运行无错误。然而,成功执行是质量的弱信号:现实世界问题解决的基准测试表明,能运行的代码仍可能无法解决根本问题[11 (https://arxiv.org/html/2607.07676#bib.bib33)]。该模块可能静默泄露内存、使用弃用的API、忽略数据中的边界情况、应用不适当的统计测试,或引入通过所有现有测试的安全漏洞。在科学语境中,生成的分析可能使用有效但次优的方法,或未能校正多重比较。执行成功与实质正确性是不同的属性。

经验、指导、代码审查和制度标准传统上弥合了这一差距。在智能体执行范式中,这些机制要么缺失,要么以不同的时间尺度运作:资深工程师花费三十分钟的代码审查,与智能体数秒内生成功能的速率相矛盾。因此,自主性造成了紧张关系。**智能体越自主,它就越需要扎实的知识来约束其行为**。然而,正是使智能体有用的自主性,将人类从传统上应用这类知识的位置中移除。

当前的缓解策略分为两类。人工在环审查是有效的,但不可扩展:审查瓶颈与智能体输出成比例增长。检索增强生成(RAG)改善了事实基础,但操作的是原始文档块,这些块可能包含噪音、矛盾或无关内容。智能体仍需决定如何处理检索到的段落,这一决定需要它缺乏的操作判断力。两种方法各自都无法独立扩展。

### 1.4 为什么需要技能

我们将**技能**定义为结构化、可检索、源溯源的操作知识单元。每个技能编码一条特定的可操作指导(最佳实践、常见陷阱、验证技术、配置建议),并附有元数据,包括其领域、证据来源、质量分数和适用条件。技能与RAG文档块在几个重要方面不同:

- **结构化**。技能有定义的模式(标题、描述、适用性、证据、分数),而RAG块是源文档的任意子串。
- **质量门控**。每个技能通过基于LLM的质量门进行评分(清晰度、准确性和可操作性——内部QA信号,非外部验证);RAG块继承其来源的质量,无独立评估。
- **可操作性**。技能编写为可直接在任务执行中由智能体应用;RAG块提供上下文,由智能体自行解释和操作化。
- **评分**。技能携带数值质量分数,允许智能体优先采用高置信度指导;RAG系统通常按相关性而非质量排序。

可重用的技能集合已存在于机器人、游戏AI、LLM智能体框架以及社区市场(如ClawHub[4 (https://arxiv.org/html/2607.07676#bib.bib9)])中,我们在第5节(https://arxiv.org/html/2607.07676#S5)中进行了调研。现有库存在三个局限性:

1. **手动编写**。技能由手工编写,使得创建过程缓慢且昂贵。领域专家可能需要花费数小时从文献中提炼单个技能。
2. **规模有限**。最大的公开可用集合包含数百到数千个技能,远不足以覆盖通用智能体所需的知识广度。
3. **覆盖范围狭窄**。大多数集合专注于单一领域(如软件工程、机器人操作),无法跨现代智能体预期处理的多样化任务进行迁移。

这些库未能跟上需求。随着智能体在更多领域部署并获得更多自主性,需要扎实操作知识来防止错误的情况呈组合增长,手动策划无法扩展以满足需求。这激发了需要自动化、源溯源、多领域且能够扩展到数十万技能的方法,这也是本工作的目标。

### 1.5 我们的贡献

本文做出三项主要贡献:

1. **SkillCenter库**。我们发布了216,938个技能,覆盖24个领域包,其中114,565个由SkillGate管道生成,102,373个来自公开GitHub仓库和ClawHub市场,规模比之前的开放技能集合大一个数量级以上。第2.1节(https://arxiv.org/html/2607.07676#S2.SS1)给出了按来源和领域的完整分类。
2. **端到端自动化框架**。我们提出了一个完整的、持续运行的技能生产管道,涵盖多源采集、基于LLM的质量门(SkillGate)、模板驱动生成、迭代源溯源以及带完整审计轨迹的质量控制发布,无需人工干预即可摄取新来源并生成新技能。
3. **离线可搜索分发系统**。我们将语料库打包为按领域拆分的SQLite FTS5包[29 (https://arxiv.org/html/2607.07676#bib.bib7)],支持无网络接入时对技能标题进行离线关键词搜索。自动项目类型检测机制识别给定项目的相关领域,`bundle-install --auto`命令将适当的技能包集成到智能体工作流中。预构建包可在Hugging Face¹¹¹https://huggingface.co/datasets/Tommysha/skillcenter-bundles [9 (https://arxiv.org/html/2607.07676#bib.bib8)]获取,完整框架在GitHub上开源²²²https://github.com/LabRAI/SkillCenter。

## 2 SkillCenter语料库

本节分析语料库:其规模和领域组成(第2.1节(https://arxiv.org/html/2607.07676#S2.SS1))、学术(第2.2节(https://arxiv.org/html/2607.07676#S2.SS2))和技术(第2.3节(https://arxiv.org/html/2607.07676#S2.SS3))来源、整合的社区包(第2.4节(https://arxiv.org/html/2607.07676#S2.SS4))、去重与冗余(第2.5节(https://arxiv.org/html/2607.07676#S2.SS5))、质量分数(第2.6节(https://arxiv.org/html/2607.07676#S2.SS6))以及搜索与智能体集成层(第2.7节(https://arxiv.org/html/2607.07676#S2.SS7))。

### 2.1 语料库概览

SkillCenter库包含216,938个已发布技能,组织为24个领域包,来自三大类别:研究(90,084个技能,41.5%)、技术(24,481个技能,11.3%)和社区(102,373个技能,47.2%)。研究和技术包(114,565个技能)由SkillGate管道(第3节(https://arxiv.org/html/2607.07676#S3))从55,199个独立来源文档生成;社区类别整合了两个外部收集的大型集合:GitHub SkillMD(通过代码搜索从公共仓库挖掘的90,984个`.skill.md`文件)和ClawHub社区市场(11,389个技能)。图1(https://arxiv.org/html/2607.07676#S2.F1)可视化了这些类别的相对规模,表1(https://arxiv.org/html/2607.07676#S2.T1)提供了每个领域的完整分类。所有技能均为英文。管道生产的技能带有质量分数,范围1到5,由GPT-5.2在发布门控期间分配;平均分为3.91(两个整合的集合使用不同的评分标准,因此不包含在此平均值中)。

图1: SkillCenter库的矩形式树图可视化。面积与技能数量成比例。该库包含管道生产的研究(41.5%)和技术(11.3%)包,以及整合的社区类别(GitHub SkillMD和ClawHub市场,占47.2%)。

##### 术语。本报告中反复出现的几个术语:

- **来源**:原始输入文档(网页、README、论文、论坛帖子、仓库)。管道子集有55,199个来源,整个库有94,722个不同来源。
- **生成的技能**:在质量过滤前由LLM管道产生的技能。**已发布技能**:通过发布门控并随发布的包一起提供的技能。
- **技能种类**:技能捕捉的方面(例如`paper.experiment`、`paper.method`或默认技术模板);一个来源可产生多种种类。
- **领域配置**(13个):框架输入规范,定义某个主题领域的来源路由、主机列表和搜索参数。
- **领域包**(24个):已发布的SQLite数据库,对技能进行分组;21个由领域配置生产,3个为整合的社区包。短语“超过24,000个技术来源”指生产技术技能的不同GitHub、网络和论坛来源文档。

表1: 全SkillCenter库(216,938个技能)按领域包的语料汇总。研究和技术包由SkillGate管道(第3节(https://arxiv.org/html/2607.07676#S3))生产;社区类别整合了两个外部收集的集合:GitHub SkillMD(通过代码搜索从公共仓库挖掘的`.skill.md`文件)和ClawHub社区市场。之前的“其他期刊”包(23,692个技能)已被分解为其子刊(Nature系列)和一个剩余类别。计数已再次验证。

相似文章

SkillNet:创建、评估并连接AI技能

Papers with Code Trending

SkillNet 提供了一个开放的基础设施,通过统一的本体系统地积累和迁移 AI 技能,在多个领域展现了智能体性能的显著提升。

SkillRet:面向 LLM 智能体技能检索的大规模基准

arXiv cs.AI

本文提出了 SkillRet,这是一个用于评估 LLM 智能体技能检索的大规模基准,旨在解决从大型技能库中选择相关技能的挑战。该基准提供了包含超过 17,000 项技能的 dataset,并证明针对特定任务的微调能显著提升检索性能。