Scientific Agent Skills: 面向研究代理的程序性知识库

arXiv cs.CL 论文

摘要

本文介绍了 Scientific Agent Skills,一个开源库,包含16个科学领域的163项程序性知识技能,旨在帮助AI研究代理执行可辩护的分析。

arXiv:2609.00065v1 公告类型:新 摘要:一个语言模型代理在分析实验时通常能返回可运行代码。但分析是否可辩护则是另一个问题。可辩护的分析取决于程序性选择:该领域接受哪种测试、哪种标识符命名空间是权威的,以及结果必须附带哪些注意事项。我们推出 Scientific Agent Skills,一个开源库,包含16个实践领域的163项此类程序,涵盖基因组学、化学信息学、医学影像、研究设计和科学传播。每个技能都是一个围绕版本化、人类可读的指令文件构建的目录。代理仅在任务需要时加载该文件;目录中通常还包含参考材料和可运行脚本。我们未进行任务级评估,也未报告主机选择率。采用开源许可,可在 https://github.com/K-Dense-AI/scientific-agent-skills 获取。
查看原文
查看缓存全文

缓存时间: 2026/09/02 05:44

# 科研代理的程序性知识库
来源:https://arxiv.org/html/2609.00065

## 科研代理技能:面向研究代理的程序性知识库
Vinayak Agarwal、Yuhuan He、Darshil Patel、Aubrey M. Brueckner
所属机构:K-Dense, Inc.
日期:2026年8月30日

### 摘要
要求语言模型代理分析实验时,它通常会返回可运行的代码。但分析结果是否站得住脚,则是另一个问题。一项经得起推敲的分析依赖于程序性选择:该领域接受哪种检验方法、哪个标识符命名空间具有权威性,以及结果必须附带哪些注意事项。我们推出“科研代理技能库”——一个包含163项此类程序的开源库,涵盖16个实践领域,包括基因组学、化学信息学、医学影像、研究设计与科学交流。每个技能都是围绕一个版本化、人类可读的指令文件构建的目录。代理仅在任务需要时加载该文件;目录中通常还包含参考材料和可运行脚本。我们未进行任务级评估,也未报告宿主选择率。该库采用开源许可证,可通过以下地址获取:https://github.com/K-Dense-AI/scientific-agent-skills。

![未标题图片](https://arxiv.org/html/2609.00065v1/figures/graphical_abstract.png)

## 1 引言
研究人员要求编码代理分析RNA测序实验时,通常会得到可运行的代码。但能否获得站得住脚的分析,则是另一个问题。例如,代理可能在未进行多重检验校正的情况下比较组别;对表示实验失败的-999999值列进行平均处理;将BED区间的零起始坐标视为从1开始计数;或从忽略了治疗混淆协变量的模型中报告风险比。每种错误都可能产生看似合理的代码,却使分析在特定条件下失效。相关惯例均有文档记载:多重检验校正是标准做法[1],技术性混淆会影响高通量分析[2],BED及相关格式采用明确的坐标约定[3],遗漏协变量会导致Cox模型治疗估计偏差[4],而电子表格转换基因符号的问题已扩散至已发表的研究中[5]。

一项针对真实科学请求的代理评估发现,在所有模型中,科学准确性均低于沟通能力,且过度主张是最常见的失败类型[6]。反复出现的问题具有程序性:代理需要领域特定的惯例来指定适用哪种检验、哪个标识符命名空间具有权威性,以及结果必须附带哪些注意事项。这些知识分散在包文档、报告指南、标准和各领域的隐性实践之中。为每个任务重新发现这些知识代价高昂,因此可以一次记录下来。科学界已为人类记录了此类知识。报告指南如ARRIVE[7]和MIQE[8]的存在,正是因为在已发表文献中反复出现同样的程序性错误[9]。Agent Skills[10]是一种为代理记录此类程序性知识的惯例。

技能是一个包含Markdown指令文件的目录,文件带有一个简短的YAML头部,可选地附带参考文档、可执行脚本和静态资源。代理宿主会扫描其已加载的技能,并将每个技能的名称和简短描述保留在其系统提示中。仅当任务看似需要该技能时,才会读取完整的指令文件。该规范未指定运行时、API或服务。由于该规范基于文件,技能可在不同宿主间移植,并可作为文本进行审查。

本文介绍“科研代理技能库”[11]——一个包含163个技能的开源库,由我们构建和维护,涵盖生物学、化学、医学、物理科学和科学交流领域的研究工作流程。我们撰写了其中大部分(附录B),因此这是对我们自身成果的描述,而非独立审计。第2节和第3节描述了技能的定义及库的内容,以便读者判断其是否与自身工作相关。随后,我们衡量了文档文件的两个属性:保留在上下文中的简短描述在词汇上的区分度(第4节),以及库中示例工作流所命名的技能是否能放入上下文窗口(第5节)。我们根据固定版本的仓库树重新计算所有数量,而非直接采用我们文档中的数据。第6节说明了哪些已测量、哪些未测量。附录包含完整的描述性统计、测量约定以及验证与范围记录。

这是一篇资源介绍论文:其目的在于介绍该库,而非验证安装任何单个技能的效果。我们已在https://www.k-dense.ai/benchmarks发布了几个技能的基准测试,但这些研究并未验证整个集合。每个技能都需要在其领域内针对适当的任务和结果进行评估,由本文所代表的社区进行更广泛的独立工作仍然是必要的。我们报告的两个测量是文档语料库的属性:它们说明了选择困难所在及选择成本,而非代理选择得有多好。

### 1.1 相关工作
近期系统为自主化学[12]、层次化多代理生物信息学分析[13]和端到端研究自动化[14]编写和运行科学代码;其他系统则在共享工具层上打包生物医学研究工作流[15]。编码代理也在仓库规模任务[16]和科学编程[17]上接受评估。对数据驱动发现基准的错误分析发现,大多数失败属于执行但语义不正确的程序,通常是因为错误使用了领域特定工具,而非无法运行的程序[18]。

先前的方法通过语料库检索[19]、工具接口[20, 21]或代理自身积累的例程[22]将知识放入模型上下文。技能与检索不同,因为每个技能是一个经过编写的程序,而非一个段落;与工具不同,因为技能不提供可供调用的运行时。检索在长上下文中可能性能下降[23],因此第2节中的分层设计影响了库的运作方式,而不仅仅是其呈现方式。

近期研究探讨了技能库如何构建、编目和评估[24, 25, 26],其增长过程中如何表现[27],当代理必须从大量未经筛选的集合中检索自身技能时会发生什么[28],以及当其工具层已返回严格、经过模式验证的观察结果时会发生什么[29]。两者都报告了效益逐渐趋近于无技能得分的情况,在第一种情况下,一旦代理必须自行选择技能,效益就会下降。因此,第4节衡量了保留在上下文中的简短描述的独特性。

其他工作则将代理可加载的指令文件视为攻击面[30, 31, 32, 33, 34, 35]。附录E将该库的安全材料置于此背景下。附录A将技能与工作流引擎和数据标准联系起来,后者解决了管道中相同的程序性问题。

## 2 代理技能是什么
技能是一个目录。它至少包含`SKILL.md`:一个YAML头部,后跟为代理而非人类读者编写的Markdown指令。头部限于六个字段:`name`、`description`、`license`、`compatibility`、`allowed-tools`和`metadata`。任何其他顶层键都是规范错误。规范建议三个传统子目录:`references/`用于附加文档,`scripts/`用于代码,`assets/`用于模板和静态资源,同时允许其他文件和目录。

我们采用更严格的布局,每个技能内部仅允许`SKILL.md`和那三个子目录(附录D)。附录B描述了目录结构和指令文件内容,并展示了技能的分发形式。

对于我们自己撰写的技能,我们的创作工作流通常始于语言模型草稿。然后我们手动审查文本,并在技能工作流的环境可用时,测试其基本功能。我们在了解技能何时有效、何时无效时不断修订每个技能,借鉴我们自身的使用经验、社区反馈和外部贡献。这些步骤是创作和维护,而非领域验证;附录E说明了自动化检查涵盖的内容。

### 2.1 渐进式披露
该设计使几乎所有库内容都不进入常驻上下文。根据规范的披露模型,代理宿主在启动时读取每个已安装技能的`name`和`description`到其系统提示中。宿主在这些条目周围添加的内容因宿主而异,如第6节所述。当代理判断技能相关时,指令主体才会被读取;参考文档仅当指令主体指向它时才被读取。

披露模型分为三个层级,大小相差数个数量级(图1)。在整个库中,常驻层为14,246个令牌,每个技能中位数为67个令牌。常驻层背后的完整指令文件总计482,506个令牌,每个文件中位数为2,857个令牌。这些指令文件背后的参考文档总计2,480,674个令牌,分布在1,033个文件中。因此,83.7%的库文档除非被激活的技能指向,否则保持未读状态。在整个库可用的情况下,常驻上下文的占用成本仅为2,963,180个令牌语料库的0.48%,或200,000个令牌参考窗口的7.1%。这种低常驻成本允许宿主提供163个专业程序,而不会用当前任务不需要的程序填满其上下文窗口。

分层延迟了成本;它并未消除成本。代理从未读取的层级无法为其选择提供信息,因此整个库的路由仅依赖于常驻层。参考材料仅在真实任务期间保持延迟时,才节省上下文。第4节和第5节衡量了这些约束。这两个测量描述的是文档布局而非代理轨迹:它们显示了选择的成本及可能困难之处,而非任何代理是否选择正确。附录A说明了这些数字所依赖的分词器和语料库定义。

参考图注 **图1**:在标签v2.65.0下测量的三个披露层级的令牌成本,沿假设的任务路径显示。这些是语料库测量,而非代理轨迹。选择技能使用已处于常驻上下文中的描述,因此不会增加文档令牌;第4节单独处理该步骤。累计总数假设了一个中位数技能和一个中位数参考文件。第5节则计算库的文档化工作流的成本。

## 3 库涵盖的内容
库在`skills/`下按每个技能一个目录组织,该层级之上没有强制分组。我们自身的文档以三种不同且部分重叠的方式对技能进行分组,但没有一种能划分库。为了报告,我们为每个技能分配一个主要类别。这种分类法是我们的报告约定,并非仓库的属性。附录C提供了完整的分类法和每个类别的计数。

在该标签下,163个技能横跨16个类别,最大的是“科学交流与图表”、“科学计算与数据工程”以及“基因组学与序列分析”。105个技能在`scripts/`下提供可执行代码,154个技能提供参考文档(图2)。

![图2:每个类别的技能数,按技能是否在scripts/下提供文件划分。](https://arxiv.org/html/2609.00065v1/figures/skills_per_category_scripts.png)

库包含四种跨类别的常见技能类型:
- **包工作流**:记录如何正确使用特定的科学软件包,例如用于单细胞分析的Scanpy[36]或用于差异表达的PyDESeq2[37];其内容最接近权威文档。
- **数据检索**技能处理针对命名资源的标识符解析和查询构建;仅`database-lookup`一个技能就记录了跨9个领域的78个数据库,其中57个无需凭证,18个需要密钥(图3)。
- **研究平台与实验室自动化**技能涉及仪器和平台接口。它们是最可能需要凭证的组别:整个库中有29个技能命名了27个类似凭证的环境变量之一。
- **方法与判断**技能编码程序而非工具,例如数据存在前的研究设计与随机化、样本量论证[38]、检验选择、假设检验以及显著性阈值的解释[39],以及不确定性和单位传播。这一组最难评估,因为其价值最不类似于文档查询。附录C对所有四种类型进行了更详细的描述。

![图3:database-lookup技能在标签v2.65.0下记录的78个数据库。 (A) 按领域划分的数据库,使用技能自身的分组,我们已根据磁盘上的参考文件进行了核对。(B) 按凭证需求划分的数据库。](https://arxiv.org/html/2609.00065v1/figures/database_lookup_breakdown.png)

相似文章

K-Dense-AI/scientific-agent-skills

GitHub Trending (daily)

K-Dense-AI 发布了“Scientific Agent Skills”,这是一个开源的技能集合,包含 135 项技能,旨在帮助 AI 代理在基因组学和药物发现等领域执行复杂的科学工作流程。它支持多种 AI 模型,并通过 Agent Skills 标准与 Cursor 和 Claude Code 等工具集成。

agentskills/agentskills

GitHub Trending (daily)

Agent Skills 是 Anthropic 提出的一项开放标准,用于将专业知识和工作流程打包到可移植、版本控制的文件夹中,AI 代理可以按需加载这些文件夹,从而在最小化上下文开销的情况下实现领域专业知识和可重复执行的任务。

SkillCenter:面向自主AI Agent的大规模源基技能库

arXiv cs.AI

介绍SkillCenter,这是目前最大的面向AI Agent的开放技能库,包含216,938个结构化、源基的技能,覆盖24个领域。该库通过自动化流水线构建,并使用了基于LLM的质量门控(SkillGate)。该库结合了同行评审技能和社区技能,强调可追溯性和离线可搜索性。