SkillZip:面向可扩展智能体技能库的契约保持图压缩

arXiv cs.CL 论文

摘要

本文介绍了 SkillZip,一种契约保持的图压缩框架,它在章节级别压缩智能体技能库,在保留过程性契约和依赖闭包的同时,提高了检索和压缩效率。

arXiv:2608.05604v1 公告类型:新 摘要:大型语言模型(LLMs)日益充当智能体的角色,其过程性知识存储在可复用的技能包中,并在推理时加载。随着技能库的增长,一个核心挑战是在有限的上下文预算下提供最小且充分的可执行上下文。现有系统难以在低于整个技能的水平上复用例程,难以在压缩过程中保留过程性契约,难以保持压缩后的例程可执行且可扩展,也难以随技能演进更新压缩后的库。这些挑战揭示了单元不匹配:技能以包的形式被检索,以文本形式被压缩,并且在检索后才转换为执行图,而可靠的复用需要带有契约的过程性单元。我们提出 SkillZip,一种执行感知的过程性抽象框架,它在章节级图上执行契约保持的压缩。SkillZip 将重复出现的契约有效模式重写为可逆的移植宏,同时保留边界签名、依赖闭包、验证器可达性和源代码级展开。在推理时,它加载一个紧凑且依赖闭合的上下文,并仅在需要时展开宏。ReZip 进一步集成新技能,并利用执行证据修正有风险的宏。在技术和具身智能体基准上的综合实验1表明,SkillZip 持续优于最强基线,最高提升 12.2 个百分点,同时实现 3.46 倍压缩比,依赖保留率达到 99.2%,验证器可达率达到 98.7%。扩展性分析进一步证实,在从 200 到 100K 个技能的技能库中,检索性能稳健。
查看原文
查看缓存全文

缓存时间: 2026/08/07 07:51

# 面向可扩展智能体技能库的契约保持图压缩 来源:https://arxiv.org/html/2608.05604 ###### 摘要。大语言模型(LLMs)越来越多地充当智能体,其程序性知识存储在可复用的技能包中,并在推理时加载。随着技能库不断增长,一个核心挑战是如何在有限的上下文预算下暴露最小且足够的可执行上下文。现有系统难以在技能包整体级别以下复用例程、在压缩过程中保持程序性契约、保持压缩例程可执行且可扩展,以及随着技能演进更新压缩库。这些挑战揭示了一个单元错配问题:技能以包的形式被检索,以文本形式被压缩,并且仅在检索后才被转换为执行图,而可靠的复用需要一种承载契约的程序性单元。我们提出SkillZip,一种执行感知的程序性抽象框架,它对节级图执行契约保持压缩。SkillZip将反复出现的契约有效动机(motif)重写为可逆的移植宏,同时保留边界签名、依赖闭包、验证器可达性和源码级扩展。在推理时,它会水合(hydrate)一个紧凑、依赖封闭的上下文,并且仅在需要时扩展宏。ReZip进一步整合新技能,并使用执行证据修订有风险的宏。在技术和具身智能体基准上的综合实验表明,SkillZip在每项直接可比设置中始终优于最强基线,最高提升12.2个百分点,同时实现了3.46倍的压缩比、99.2%的依赖保留率和98.7%的验证器可达性。扩展性分析进一步确认了在从200到100K技能规模范围内的稳健检索。 LLM智能体、智能体技能、程序性记忆、图压缩、技能检索 ††版权:无

## 1. 引言 参见图1。具有代表性的技能库工作流。大语言模型(LLMs)正越来越多地被用作与工具和环境交互的智能体(Yao等,2022(https://arxiv.org/html/2608.05604#bib.bib34);Qin等,2024(https://arxiv.org/html/2608.05604#bib.bib37))。在这些场景中,任务成功通常取决于程序性知识而非事实性知识,例如如何规范化电子表格或验证工件是否正确。因此,智能体技能已作为LLM智能体的外部程序性记忆层出现(Xu和Yan,2026(https://arxiv.org/html/2608.05604#bib.bib4);Li等,2026b(https://arxiv.org/html/2608.05604#bib.bib3))。技能包将指令、支持资源以及执行和验证规则存储在一个可编辑的工件中,并在推理时加载(Xu和Yan,2026(https://arxiv.org/html/2608.05604#bib.bib4)),从而使程序可以在不重新训练的情况下变更。在推理时,技能提供者从库中选择与任务相关的程序,并将其暴露给智能体。随着库的增长,提供者必须在更多重叠包之间进行区分,同时避免不完整或冗余的上下文。这引出了一个核心问题:技能提供者如何在紧凑的上下文预算内检索并暴露最小且足够的可执行上下文?现有解决方案将每个技能包作为一个整体进行检索。然而,技能并不是一个原子文本单元,而是一组功能节(sections)的集合,例如意图、操作、验证器和输出。因此,系统应检索最小的执行完整子集,而不是从头到尾阅读每个相关技能。连同其类型化依赖和验证器钩子,它们定义了技能的程序性契约:该程序暴露什么、它如何执行,以及其效果如何被验证。当任务需要多个技能时,这个问题变得更加突出,因为它们有用的程序可能重叠。例如,*Clean CSV*和*Pivot Tables*技能可能共享模式推断、表头规范化和行数验证,而其下游操作和验证器不同。系统不应反复加载每个完整包,而应仅检索一次共享的、契约兼容的程序,并仅添加任务特定的节。 现有方法中的挑战。大多数现有技能库系统可以被视为遵循“检索-压缩-执行”流水线。在这种范式中,智能体首先检索相关的技能包或元数据,可选地压缩所选的技能内容以降低提示成本,然后为所选技能构建任务时执行上下文或图。虽然这提高了模块化和词元效率,但仍存在几个挑战。 挑战1:复用粒度不匹配。现有的渐进式披露和技能图系统(Xu和Yan,2026(https://arxiv.org/html/2608.05604#bib.bib4);Liu等,2026(https://arxiv.org/html/2608.05604#bib.bib8);Zeng等,2026(https://arxiv.org/html/2608.05604#bib.bib10)),如图1(https://arxiv.org/html/2608.05604#S1.F1)(a)所示,使用整个技能作为检索单元。它们减少了加载的包数量,但无法仅选择每个包内相关的程序。例如,一个规范化表头并验证行数的查询同时匹配*Clean CSV*和*Pivot Table*技能,因为它们包含相同的例程。因此,技能级检索器会加载两个包,尽管任务只需要它们共享的节。相反,在节级检索该例程可以避免不相关的下游操作,从而减少多余上下文和重叠技能之间的歧义。随着库的增长,这种歧义会加剧,因为每个重叠包都会作为另一个粗略候选进入检索。 挑战2:压缩下的契约保持。当前的技能压缩方法(Gao等,2026(https://arxiv.org/html/2608.05604#bib.bib14);Xing等,2026(https://arxiv.org/html/2608.05604#bib.bib15);Wang等,2026(https://arxiv.org/html/2608.05604#bib.bib13)),如图1(https://arxiv.org/html/2608.05604#S1.F1)(b)所示,通过重写、瘦身或将内容编码为紧凑的文本或序列表示来缩短技能。这些方法直接优化词元预算,但它们保留的结构主要是文本或潜在的,而不是显式的程序性契约。对于可执行技能,文本接近并不意味契约等价:一个压缩后的技能可以保持与原始措辞接近,但掩盖了前置条件、守卫分支或验证器钩子。例如,上述两个相关技能包含几乎相同的加载例程,但它们服务于不同的验证器;将它们压缩为相似片段可能会模糊不兼容的检查,并使生成的程序不安全地执行。 挑战3:持久可执行压缩。一些任务时执行图系统(Bai等,2026(https://arxiv.org/html/2608.05604#bib.bib11);Liu等,2026(https://arxiv.org/html/2608.05604#bib.bib8);Li等,2026a(https://arxiv.org/html/2608.05604#bib.bib43)),如图1(https://arxiv.org/html/2608.05604#S1.F1)(c)所示,将已选择的技能组织成显式程序图,并支持执行过程中的验证或修复。然而,这些图是在检索之后、在已经选定的技能之上构建的,因此库本身并未存储为持久的压缩结构。因此,反复出现的加载和验证例程在每次涉及它的任务中都会被重新发现和重新验证,而不是被压缩到之后执行所信任的单元中。 挑战4:执行感知的维护。技能库不是静态的,因为新技能揭示了反复出现的程序,而执行轨迹揭示了哪些抽象是可靠或危险的(Mi等,2026(https://arxiv.org/html/2608.05604#bib.bib12);Ouyang等,2026(https://arxiv.org/html/2608.05604#bib.bib20))。一次性压缩器既无法识别仅在后续技能到来后才变得可复用的例程,也无法修订反复触发扩展、验证器失败或下游修复的宏。例如,后来的电子表格技能可能将周期对齐和余额检查确立为可复用的例程,而涉及公式的任务可能暴露一个缺少必需验证器的通用导出宏。因此,压缩应随着库的增长和执行证据的积累而得到维护。 这些挑战揭示了一个共同的单元错配。当前的技能提供系统检索整个技能包、压缩技能文本,并且仅在检索后构建执行图,即针对三个不同单元做出三个决策。对于智能体技能,它们应该针对同一对象:一个承载契约的节子图,其程序性契约在检索、压缩和执行中都得以保留。当压缩缩短了例程,同时保留了该契约的接口、执行和验证方面时,我们称之为契约保持压缩。源指针被单独保留,以便例程在需要时可扩展回其原始节。 贡献。在本文中,我们提出了SkillZip,一种用于可扩展智能体技能库的契约保持图压缩框架,如图1(https://arxiv.org/html/2608.05604#S1.F1)(d)所示。SkillZip将基本表示单元从整个技能包更改为以源为根基、承载契约的节级单元,并通过程序性依赖连接。在此统一表示之上,SkillZip通过契约保持压缩执行执行感知的程序性抽象,即,仅当重复出现的子图的程序性契约保持显式且可恢复时,才将其重写为可复用宏。生成的图为暴露可复用例程和水合任务特定可执行上下文提供了公共基础。 为解决复用粒度不匹配,SkillZip执行Sec2-Graph,它将每个技能包打开为以源为根基的节节点。它将具有不同执行角色(例如,意图、输入、操作、验证器和输出)的功能节表示为可复用的程序单元,使技能内部组件可见,而无需手动分割技能库。 为在压缩下保持程序性契约,SkillZip引入了MotifZip,一种契约保持压缩器,它挖掘重复出现的节级动机(motif),并且仅在其边界签名、依赖闭包、验证器可达性和源扩展得以保留时才将它们提升为移植宏节点。因此,每个宏都是可逆重写,而不是有损摘要。 为使压缩例程可执行且可扩展,SkillZip采用PathHydrate,在查询时在压缩图上进行路由。它构建紧凑、依赖封闭的程序性子图,在必要时修复缺失的执行角色,并以最低充分级别渲染每个宏,包括名称、契约、大纲或完整源码。 为在库演进时维护压缩,SkillZip引入了ReZip,它随着新技能和执行轨迹的到来增量更新压缩图。它对于兼容区域复用现有宏,将重复出现的契约有效残差提升为新宏,并使用执行证据来增加水合细节、拆分或淘汰有风险的宏。 总之,SkillZip的优势可简要概括如下:

- •节级程序性记忆。SkillZip将以源为根基、承载契约的节组织为程序性记忆的可复用单元,并将每个技能表示为基于它们的可执行图。该表示在保留执行角色、依赖、验证器和来源的同时,暴露了内部复用。
- •契约保持的宏压缩。SkillZip将重复出现的程序性动机替换为移植宏节点,同时保留边界契约、依赖闭包、验证器可达性和可逆的源扩展。
- •预算化的可执行上下文水合。SkillZip从压缩库中检索紧凑、依赖封闭的程序性子图,并且仅在执行需要更多细节时逐步扩展宏。
- •执行感知的增量维护。SkillZip通过新技能匹配、残差动机提升和有风险的宏修订来增量更新其宏字典,使压缩后的程序与执行证据保持一致。
- •有效性、效率和可扩展性。(a)SkillZip作为一个即插即用的程序性记忆层,在六个LLM后端上、在技术和具身基准中均无需后端特定微调即可运行。(b)SkillZip实现了3.46倍的压缩比和71.0%的活跃存储减少,同时保留了99.2%的依赖和98.7%的验证器可达性。其检索优势在库从200扩展到100K技能时依然存在。(c)SkillZip在每项直接可比设置中均取得了最佳终端任务性能,在ALFWorld上比最强基线SkillDAG高出最多12.2个百分点。

## 2. 相关工作

智能体技能与程序性记忆。工具增强智能体通过提示、学习工具调用和大型API集合,将LLM推理与外部操作相结合(Yao等,2022(https://arxiv.org/html/2608.05604#bib.bib34);Schick等,2023(https://arxiv.org/html/2608.05604#bib.bib35);Li等,2023(https://arxiv.org/html/2608.05604#bib.bib36);Qin等,2024(https://arxiv.org/html/2608.05604#bib.bib37))。除单个调用外,可复用的程序性知识使智能体能够积累可执行程序、将反馈提炼为经验,或从先前的轨迹中检索工作流(Wang等,2023(https://arxiv.org/html/2608.05604#bib.bib39);Shinn等,2023(https://arxiv.org/html/2608.05604#bib.bib40);Zhao等,2024(https://arxiv.org/html/2608.05604#bib.bib41);Wang等,2024(https://arxiv.org/html/2608.05604#bib.bib42))。Agent Skills(Xu和Yan,2026(https://arxiv.org/html/2608.05604#bib.bib4))将此思想形式化为包含指令、脚本、参考和资源的可部署包。近期研究通过统一分类法组织了更广泛的技能生命周期(Zhou,2026(https://arxiv.org/html/2608.05604#bib.bib59)),刻画了真实世界技能生态系统中的冗余和安全性属性(Ling等,2026(https://arxiv.org/html/2608.05604#bib.bib60)),并从网络交互或异构科学资源中获取可复用技能(Zheng等,2025(https://arxiv.org/html/2608.05604#bib.bib58);Shen等,2026(https://arxiv.org/html/2608.05604#bib.bib56))。系统和基准进一步在规模上研究技能创建、管理、检索、生成和兼容性(Li等,2026a(https://arxiv.org/html/2608.05604#bib.bib43);Liang等,2026b(https://arxiv.org/html/2608.05604#bib.bib44);Li等,2026b(https://arxiv.org/html/2608.05604#bib.bib3);Cho等,2026(https://arxiv.org/html/2608.05604#bib.bib5);Su等,2026(https://arxiv.org/html/2608.05604#bib.bib6);Zhou等,2026a(https://arxiv.org/html/2608.05604#bib.bib7);Han等,2026(https://arxiv.org/html/2608.05604#bib.bib45))。总体而言,这些研究将技能确立为持久的程序性记忆,但它们通常复用整个技能包,并较少建模跨技能反复出现的内部程序。

技能检索与执行。大型技能库中的一个主要挑战是在保持执行上下文连贯的同时检索有用的技能。先前工作通过在全量文本之前逐步加载技能元数据(Xu和Yan,2026(https://arxiv.org/html/2608.05604#bib.bib4))、通过依赖、分组、冲突或特化来组织技能(Liu等,2026(https://arxiv.org/html/2608.05604#bib.bib8);Zeng等,

相似文章

SkillSmith: 将智能体技能编译为边界引导的运行时接口

arXiv cs.AI

SkillSmith是一个边界优先的编译器-运行时框架,从LLM智能体技能中提取细粒度的操作边界,使智能体能够动态访问仅相关的组件,在SkillsBench基准测试上减少了57.44%的求解阶段令牌使用量和42.99%的思考迭代次数。

SkillOpt:自我进化智能体技能的执行策略

Hugging Face Daily Papers

SkillOpt 引入了一种系统化的文本空间优化器,用于智能体技能。该优化器将技能训练为智能体的外部状态,具有稳定的更新和零部署推理开销,在多个基准测试和执行环境中实现了卓越性能。

经验压缩谱:统一LLM Agent的记忆、技能与规则

arXiv cs.CL

本文提出经验压缩谱,这是一个统一框架,将agent记忆、技能发现和基于规则的系统沿单一递增压缩轴集成(情景记忆5-20倍,程序性技能50-500倍,声明性规则1000倍以上)。工作识别出一个关键缺口——‘缺失对角线’——表明现有系统在固定压缩级别运行,缺乏自适应跨级别支持,并阐述了可扩展全谱agent学习系统的设计原则。