SkillSmith: 将智能体技能编译为边界引导的运行时接口

arXiv cs.AI 论文

摘要

SkillSmith是一个边界优先的编译器-运行时框架,从LLM智能体技能中提取细粒度的操作边界,使智能体能够动态访问仅相关的组件,在SkillsBench基准测试上减少了57.44%的求解阶段令牌使用量和42.99%的思考迭代次数。

arXiv:2605.15215v1 公告类型:新 摘要:近期,技能已在基于大型语言模型(LLM)的智能体系统中得到广泛应用,涵盖多个领域。在现有框架中,技能通常在匹配到运行时任务后被注入到智能体推理循环中作为上下文指导,从而实现专门的任务求解能力。我们发现这种执行范式引入了两个主要冗余来源:无关上下文注入和重复的技能特定推理与规划。为此,我们提出了SkillSmith,一个边界优先的编译器-运行时框架,它将技能包离线编译为最小的可执行接口。通过从技能中提取细粒度的操作边界,SkillSmith使智能体能够在运行时动态访问和执行仅相关的组件,从而最大限度地减少不必要的上下文注入和冗余推理开销。在SkillsBench基准测试上的评估表明,与使用原始技能相比,SkillSmith将求解阶段令牌使用量减少了57.44%,思考迭代次数减少了42.99%,求解时间减少了50.57%(快了2.02倍),以及令牌比例相关的货币成本减少了57.44%。此外,由更强模型生成的编译产物可以被更小或更高效的运行时模型重用,从而在原始技能解释失败的情况下提高任务准确率。源代码和数据可在https://github.com/AetherHeart-AI/Aeloon获取。
查看原文
查看缓存全文

缓存时间: 2026/05/18 06:30

# SkillSmith:将智能体技能编译为边界引导的运行时接口
来源:https://arxiv.org/html/2605.15215
徐度灵¹ ²陈铮¹ 潘再峰³ 关嘉伟² 董东¹ 李佳霖¹ 浦邦铮¹
¹天心科技股份有限公司,上海,中国
²中国人民大学,北京,中国
³加州大学圣地亚哥分校,加州,美国
\{duling, zchen, dongd, lijialin, bzpu\}@aetherheart.com
[email protected]
[email protected]

###### 摘要

近年来,*技能(skills)*在基于大语言模型(LLM)的智能体系统中被广泛应用于各个领域。在现有框架中,技能通常在匹配到运行时任务后,作为上下文指导注入智能体的推理循环中,从而实现专门的任务解决能力。我们发现,这种执行范式引入了两大冗余来源:无关上下文注入和重复的技能特定推理与规划。为此,我们提出SkillSmith,一种边界优先的编译器-运行时框架,它将技能包离线编译为最小可执行接口。通过从技能中提取细粒度的操作边界,SkillSmith使智能体能够在运行时动态访问并仅执行相关的组件,从而最小化不必要的上下文注入和冗余推理开销。在SkillsBench基准上的评估中,与使用原始技能相比,SkillSmith在求解阶段减少了57.44%的令牌使用量、42.99%的思考迭代次数、50.57%的求解时间(速度提升2.02倍),以及57.44%的按令牌计费货币成本。此外,由更强模型生成的编译产物可被更小或更高效的运行时模型重用,在原始技能解释失败的情况下提升任务准确率。源代码和数据可从 https://github.com/AetherHeart-AI/Aeloon 获取。

## 1 引言

基于大语言模型(LLM)的AI智能体近期因其通过推理、规划、工具使用和迭代执行解决现实世界任务的能力而受到广泛关注 (Yao et al., 2022b; Wei et al., 2022; Yao et al., 2023; Schick et al., 2023; Qin et al., 2023; Madaan et al., 2023; Shinn et al., 2023)。这类系统在编程、数学问题求解和日常办公流程等领域展现出强大的性能 (Yao et al., 2022a; Wang et al., 2023)。近期,*技能(skills)*这一概念因其强大的性能和可移植性在智能体社区迅速流行 (Patil et al., 2024; Li et al., 2026)。技能代表了开发者编写的用于处理特定类别任务的专业知识,通常作为可复用的包分发,包含一个SKILL.md指令文件以及辅助资源(如脚本、模板、配置文件、示例和支持参考资料)。

在当前的智能体框架中,技能通常以指令上下文的形式集成到ReAct风格的推理循环中 (Yao et al., 2022b),如图1所示。当模型判断当前运行时任务与某个技能匹配时,智能体会检索并将完整的技能信息注入模型上下文。模型随后基于注入的材料进行推理以规划下一步执行步骤,选择并调用适当的动作或工具,观察反馈结果,并重复这一推理-动作循环,直到任务完成。

尽管技能对专门任务有效,但大型技能包也引入了显著的运行时冗余。图1总结并说明了两种冗余来源。第一种是*无关技能上下文*。在现有智能体系统中,一旦选定技能,整个技能包(包括SKILL.md文件和捆绑资源)通常会在执行前被注入模型上下文。然而,只有其中一部分信息实际与当前运行时任务相关。在SkillsBench (Li et al., 2026) 的七个任务中,智能体每次执行加载约17.8K源令牌,其中9.1K令牌(51.21%)最终与观察到的执行过程无关。这表明相当一部分运行时上下文消耗来自不必要的技能内容。第二种是*重复的技能推理*。加载技能后,模型反复解释技能指令并在线重建执行策略。我们发现,使用同一技能的不同任务显示出平均45.5%的推理轨迹相似度。这种相似性表明,对于同一技能,模型在理解技能和针对不同运行时任务重新生成高度相似的执行计划上反复耗费计算资源。

图1:启用技能的智能体执行路径及其两种冗余来源。

我们认为,这两种冗余来源都源于现有技能系统中缺乏显式的运行时边界。目前,技能被视为整体式的文本资源,必须在线上反复解释,导致智能体在不同任务中重新加载无关上下文并重建相似执行结构。

受传统编译系统中离线转换与运行时执行分离思想的启发,我们探索是否可以将部分解释过程转移到离线。然而,与常规程序不同,自然语言技能包在结构、语义和操作形式上高度异构。有些技能主要充当描述性操作手册,而另一些则类似于可执行工作流、程序性检查清单或工具操作指南。因此,技能无法可靠地降低为单一标准化的中间表示,并应用固定的前端到后端编译流程。

为应对这一挑战,我们提出SkillSmith,一种针对智能体技能的边界优先编译器-运行时框架。SkillSmith并非将技能编译为统一的工作流IR,而是将其编译为显式的运行时边界契约:捕获技能中操作上有用部分的最小可执行接口。编译器分析技能局部的能力结构,提取可本地编译的片段,并将其转换为规范化的运行时产物,公开可执行操作符、输入要求、策略约束、验证证据和回退路径。这些边界契约成为智能体消费的运行时表示,能够实现选择性公开和执行,同时避免对原始技能源的重复解释。

在运行时,SkillSmith通过渐进式公开使用此边界契约。智能体首先看到一个紧凑的技能句柄和边界摘要;只有在智能体选择编译后的技能后,详细的操作符、策略和回退内容才会被公开。共享的运行时随后选择相关操作符,检查策略约束,在安全时执行类型化操作,在直接执行不当时返回指导,并在需要进一步推理时回退到保留的源材料。

在代表性的智能体框架和运行时模型上,平均跨越SkillsBench的七个任务,与原始技能相比,SkillSmith在求解阶段减少了57.44%的令牌使用量、42.99%的推理/LLM调用次数、50.57%的求解时间(速度提升2.02倍),以及57.44%的按令牌计费货币成本。相对于近期将技能编译到异构LLM和智能体框架的技能虚拟机SkVM (Chen et al., 2026),SkillSmith减少了46.49%的令牌、47.04%的求解时间和18.67%的调用次数。在任务准确率方面,SkillSmith在原始技能成功案例上未引入可观察的正确性回归,并且通过使用更强模型编译的产物,在中等规模运行时模型上进一步提升了任务成功率。

我们的贡献如下:

- • 我们识别了基于技能的智能体系统引入的两大运行时冗余来源:无关技能上下文注入和针对相似执行计划的重复推理。
- • 我们提出了SkillSmith,一种边界优先的编译器-运行时框架,将技能包编译为最小的可执行运行时单元。
- • 我们在一个难度分层的代表性SkillsBench任务集上证明,SkillSmith显著减少了令牌消耗、推理延迟和模型推理迭代次数,同时保持甚至提升了任务准确率。

## 2 相关工作

**智能体技能与程序性知识。**  近期智能体系统越来越多地将领域程序打包为可复用技能:包含一个SKILL.md文件、脚本、模板和支持参考资料的目录 (Anthropic, 2025, 2026a)。这种格式使智能体能够按需访问专门程序性知识,而无需用户在每次对话中重复相同的指令。SkillsBench (Li et al., 2026) 进一步将技能建立为一等评估工件,将多样化任务与精心策划的技能包和确定性验证器配对。这些系统表明技能是有用的复用单元,但它们主要将技能视为由智能体在运行时加载和解释的上下文资源。SkillSmith则针对执行层:它将技能规范转换为结构化的工作流工件,能够在调用之间执行、检查和恢复。

**LLM智能体与面向工具编排。**  LLM智能体通常依赖模型作为在线控制器。ReAct (Yao et al., 2022b) 将推理与工具动作交错进行,而AutoGPT (Significant Gravitas, 2023) 推广了自主任务分解。工具使用方面的工作如Toolformer (Schick et al., 2023)、ToolLLM (Qin et al., 2023) 和Gorilla (Patil et al., 2024) 改进了API或工具选择。智能体框架如AutoGen (Wu et al., 2023) 和Magentic-One (Fourney et al., 2024) 组合多个智能体和工具来解决复杂任务。这些方法提供了灵活的编排,但具体的执行路径通常由智能体在线规划和修订。相比之下,SkillSmith将可复用的技能理解移出重复的运行时推理,移入一个可复用的工作流工件。

**约束化和程序辅助执行。**  相关的一线工作通过将部分计算委托给结构化基板来减少自由形式的模型执行。PAL (Gao et al., 2023) 使用生成的Python程序进行推理任务;LMQL (Beurer-Kellner et al., 2023) 通过查询级控制流约束语言模型程序;SayCan (Ahn et al., 2022) 将语言模型选择植根于机器人能力;Voyager (Wang et al., 2023) 为开放式的具身任务存储可复用的程序。这些工作遵循相同的原则:并非任务的每个部分都应保留为开放式的LLM推理。然而,它们侧重于程序辅助推理、约束生成、机器人技能选择或累积代码库,而不是将通用的智能体技能包编译为可恢复的工作流运行时。

**LLM程序的编译与运行时系统。**  多项系统将编程语言和运行时思想引入LLM应用。DSPy (Khattab et al., 2023) 通过为目标指标优化提示和示例来编译声明式LM流水线。SGLang (Zheng et al., 2024) 提供了一个前端和运行时,用于结构化语言模型程序的高效执行。工作流运行时如LangGraph为手动指定的智能体图提供持久化和检查点 (LangChain, 2026)。近期的技能运行时工作如SkVM (Chen et al., 2026) 探索了针对智能体技能的编译器风格优化,强调通过能力剖析、技能重写、环境绑定、并发提取和运行时优化实现跨异构模型和框架的可移植性。SkillSmith与这些工作互补:它不是优化提示流水线、推理运行时或跨框架可移植性,而是将技能规范编译为可执行的工作流工件,以便在智能体工作空间内进行高效且可恢复的执行。

**定位。**  现有系统要么将技能视为运行时上下文、评估技能是否帮助智能体、编排在线智能体推理、优化提示或生成流水线,要么为开发者编写的图提供工作流运行时。SkillSmith关注不同层面:将可复用的技能规范转换为结构化的、植根于源的可恢复工作流工件。这减少了重复的技能解释,同时保留了对真正需要生成的步骤进行选择性LLM调用的能力。

## 3 方法

图2:SkillSmith系统概览。

SkillSmith将技能视为可编译的能力规范,而非提示片段。其核心设计选择是*边界优先编译*:SkillSmith将每个技能包编译为一个显式的运行时契约,该契约捕获工件的策略治理贡献边界、调用接口、执行条件和回退责任。

该契约(而非工作流IR)是公开的编译目标;工作流图、调度器提取和参考索引是用于构造该接口的内部降级产物。该契约使技能执行显式化,而不要求编译后的工件涵盖整个任务,从而允许智能体将编译后的技能行为与正常推理和回退工具相结合。图2将此设计置于完整的编译时和运行时流水线中;本节的其余部分将详细阐述边界感知公式。

### 3.1 技能包作为编译输入

SkillSmith的编译输入是一个技能包以及编译后工件将使用的运行时上下文。我们将输入标记为

X = (P, T, E, Π),

其中P是技能包,T是可用的工具接口,E描述执行环境,Π指定编译策略(如沙箱、缓存重用以及是否允许任务绑定适配)。

一个技能包定义为

P = (d, A, m, h)。

这里d是入口SKILL.md文档,A = {a_i}_{i=1}^n

相似文章

Formal Skill: 面向高效精准LLM智能体的可编程运行时技能

arXiv cs.AI

本文介绍了Formal Skill,这是一种面向LLM智能体的运行时原生抽象,它将可重用流程编码为可执行状态机,配有JSON元数据、Python执行器和钩子控制的逻辑。还介绍了一个名为FairyClaw的开源实现,在Harness-Bench上展示了具有竞争力的性能,且减少了token使用量。

SkillGen:经过验证的推理时代理技能合成

arXiv cs.LG

本文介绍了 SkillGen,这是一个多智能体框架,通过对比成功和失败的轨迹来合成和验证可复用的推理时大语言模型(LLM)代理技能。该方法确保技能可审计,并通过实证验证其对代理性能具有净正面影响。

SkillOpt:自我进化智能体技能的执行策略

Hugging Face Daily Papers

SkillOpt 引入了一种系统化的文本空间优化器,用于智能体技能。该优化器将技能训练为智能体的外部状态,具有稳定的更新和零部署推理开销,在多个基准测试和执行环境中实现了卓越性能。

SkillSmith:学习组合参数化技能与文本知识

arXiv cs.CL

本文介绍了SkillSmith,这是一种增强型LLM,能够对前缀权重和文本知识进行推理,从而实现指令引导的新参数化技能合成,其性能优于仅文本和仅权重的基线方法。