SkillGLoW:用于长时任务流中自我改进代理的程序族技能整合

arXiv cs.AI 论文

摘要

SkillGLoW 是一种用于LLM代理的方法,它将技能组织成程序族,以增强在长时任务上的自我改进,相比基线展示了显著的性能提升。

arXiv:2609.02217v1 Announce Type: new 摘要:LLM代理越来越多地通过编写和重用文本技能来自我改进,这些技能要么保存在一个全局文档中,要么保存在一个扁平的每任务条目池中,尽管大多数证据来自结构相似任务的领域。在每项任务需要不同解决方案的长期工作负载中,这两种形式以相反的方式失败:文档退化为通用规范,而池膨胀且其条目绑定到编写它们的实例。我们认为缺失的重用单元是一组相关任务共享的解决过程,并围绕它构建了SkillGLoW(全局-局部交织):任务从自身执行编写的局部技能被聚合成程序族,并压缩成去实例化的全局先验,而它们持有的实例细节是按任务重新生成的而非存储;提交门仅在真实执行显示它不会降低部署库的性能时才接受先验。在四个基准测试(数学推理、终端自动化、软件修复和具身控制)和三个模型上,先验比无技能基线平均提高了17.2分(困难),在所有12次持续改进运行中均获得正收益,使用局部重新生成时为18.0,而库每个程序族只保存一个先验,比每任务池紧凑3.6倍。在相同协议下,GLoW在21个单元中的15个上领先于已发布的单文档优化器。未经修改,该库将未见的ALFWorld任务的成功率从73.9%提升到83.9%,证明转移的是过程而非任务记忆。
查看原文
查看缓存全文

缓存时间: 2026/09/03 06:02

# SkillGLoW:面向长时程任务流的自改进智能体的过程族技能整合
来源:https://arxiv.org/html/2609.02217

###### 摘要
大型语言模型智能体越来越多地通过编写和重用文本技能来自我改进,这些技能或保存为单个全局文档,或保存为按任务组织的扁平池;尽管大部分证据来自结构相似的任务领域。在需要不同解决方案的长时程工作负载中,这两种形式以相反的方式失效:文档退化为泛化规则,而技能池膨胀且其条目固化于编写它们的实例。我们认为缺失的复用单元是一簇相关任务共享的解决过程,并围绕此构建了 SkillGLoW(全局-局部交织)框架:任务从自身执行中编写的局部技能被聚合成过程族,并压缩为去实例化的全局先验;同时,它们所携带的实例细节会为每个任务重新生成而非存储;提交门控仅在实际执行证明其不会降低已部署库的性能时,才接受一个先验。在四个基准测试(数学推理、终端自动化、软件修复和具身控制)和三个模型上,这些先验平均比无技能基线提升了 17.2 个百分点(困难设置),在所有 12 个持续改进运行中均取得正增益;结合局部再生后增益为 18.0 个百分点,同时库中每个过程族仅保留一个先验,比按任务组织的池紧凑 3.6 倍。在相同协议下,GLoW 在 21 个单元格中有 15 个超越了已发布的单文档优化器。未经修改的库将未见 ALFWorld 任务的成功率从 73.9% 提升至 83.9%,证明迁移的是过程而非任务记忆。

1 新加坡国立大学,新加坡
2 先进智能与计算研究所,新加坡

## 1 引言

参见标题  
图 1:在异构长时程工作负载上,单文档和平库技能组织方式的失败模式,以及 GLoW 在其间整合的过程族单元。

随着基础模型和智能体框架的成熟,大型语言模型智能体正从短期、封闭的任务转向更长时程、更复杂的环境(Yao 等 2023;Shinn 等 2023;Liu 等 2024;Mialon 等 2024;Jimenez 等 2024;Merrill 等 2026)。此类任务很快超出固定提示和人工编写技能的能力范围,因此近期系统从自身执行轨迹中提炼可复用技能(Zhou 等 2026a;Lin 等 2026;Ni 等 2026),并将成功或失败经验写入通过提示注入复用的文档(Kang 等 2026;Yang 等 2026a;Zhou 等 2025)。一旦技能被持续生成、修订和复用,一个更根本的问题浮现:*智能体应以何种形式组织和维护这些技能?*

SkillsBench 提供了直接证据。人工策划的技能将通过率提升了 16.2 个百分点,而模型仅根据任务描述自行编写的技能,其表现比无技能基线*低* 1.3 个百分点(Li 等 2026a)。因此,近期的经验驱动方法将技能建立在实际执行轨迹上,但其证据集中在结构相似的任务上;对于长时程工作负载,跨任务转移的仅有元级经验(Kim 等 2026)。

每种组织形式都隐含地假设了任务分布。单个全局文档假设大多数任务共享一个主导过程;按任务的技能库假设旧条目可以整体重用。这两个假设在结构相似的领域大致成立,但在具有异构解决方案的长时程工作负载上同时失效(图 1):不存在主导过程,且很少有旧条目能适用于新任务(Kim 等 2026;Cao 等 2026),这种模式在通过检索查询池时依然存在(§4.3)。两种失败都指向一个缺失的复用单元,一个介于单个文档和单个条目之间的单元。解决方案因实例而异,但任务并非孤立的。相似的任务构成族并共享一个解决过程,而每个实例携带有仅在执行中显现的局部约束。共享的过程可跨任务转移;实例细节则不能。组织方案应兼顾两者。

基于此观察,我们提出了 **SkillGLoW**(全局-局部交织;GLoW),一个分层的技能组织框架(图 2)。GLoW 将执行证据分组为过程族,并将技能分为两层。全局层将每个族的共享过程压缩为稳定的先验以指导搜索;局部层则根据每个任务自身的执行反馈重新生成,提供先验无法携带的实例细节,并作为下一轮整合的输入。两者在解决时结合,在整合时分离。全局先验在解决过程中保持冻结,仅在离线时修订,且修订仅在不降低实际执行中部署库的性能时才被提交。

我们在三个模型上、跨四个基准测试评估了 GLoW:数学推理、终端自动化、软件修复和具身控制,共进行 12 个持续改进运行,其中多设置协议区分了冻结先验和任务内再生的贡献。提交的先验平均比无技能基线提升了 17.2 个百分点,在所有 12 个运行中均取得正增益;而部署的库每个过程族仅保留一个先验,而非每个任务一个,比按任务组织的池紧凑 3.6 倍。我们的贡献如下:
- • 我们在相同流上测量了所有三种先验组织形式——单文档、按任务的池以及带检索的池(§4.3);每种形式的增益都低于族整合,从而识别出缺失的复用单元:一簇任务共享的解决过程。
- • 我们提出了 GLoW,它采用过程族作为此单元,并通过实际执行门控长期更新(§3.1–§3.5)。
- • 我们表明,在相同的运行中,冻结先验将未见具身任务的平均成功率从 73.9% 提升至 83.9%,表明被整合的是可复用的过程而非任务记忆。

图 2:GLoW 概览。每个任务的局部技能被封装为一张技能卡;卡片被聚合成过程族并压缩为候选全局先验;候选先验仅通过基于验证器的门控在真实下游执行中被提交;在执行时,冻结先验与新生成的局部技能交织。

## 2 相关工作

#### 技能构建与优化
智能体技能是在推理时复用的程序性知识(Schick 等 2023;Li 等 2026a;Zhou 等 2026b)。早期研究让智能体通过环境探索发现可执行代码形式的技能(Wang 等 2023;Zheng 等 2025);与我们最接近的系统则将技能写为文本。AutoSkill 在由一个负责增删的评判器管辖的长期对话中挖掘候选技能(Yang 等 2026b),而 Trace2Skill(Ni 等 2026)和更早的 ExpeL(Zhao 等 2024)则在提炼前汇集了许多轨迹,因为单轨迹摘要会过拟合。SkillOpt 将单个技能文档训练为冻结智能体的外部状态,仅当其提升在留出集上的性能时才允许编辑,并将其范围限定于单一领域(Yang 等 2026a)。此类技能属于更广泛的一类将文本视为可优化参数的研究,无论是通过提示优化器(Yuksekgonul 等 2025;Khattab 等 2024;Yang 等 2024a)、自我反馈优化(Madaan 等 2023),还是上下文压缩(Kang 等 2026)。在该方向中,优化对象只需在一个分布上有效;而我们的方法必须在任务族上成立。这些方法询问如何生成更好的技能;我们询问生成的技能应以何种粒度维护。

#### 技能组织、转移与抽象
大多数系统将技能存储在单层中,要么是一个持续重写的文档(Yang 等 2026a),要么是一个扁平的可检索库(Yang 等 2026b;Zhou 等 2025),并依赖检索和治理:ReMe 使用评判器去重并剪枝低效用条目(Cao 等 2026)。同样的粒度问题贯穿于过程记忆研究,其存储单元涵盖可复用工作流(Wang 等 2025b)、提炼的过程(Fang 等 2026)、推理轨迹(Ouyang 等 2026b)、跨领域经验条目(Tang 等 2025)和测试时草稿本(Suzgun 等 2025)。这些证据主要来自结构相似的任务;放松假设后,跨领域检索会引发负迁移,其中抽象记忆比任务特定细节迁移效果更好(Kim 等 2026)。XSkill 在架构上最接近,将动作级经验流与任务级技能流配对,两者都基于视觉观察用于多模态工具使用(Jiang 等 2026)。它的局部组件从过去的记录中检索并适应;而我们的局部组件来自当前任务自身的反馈,且永不写回。

#### 生命周期与多技能维护
第三条研究线关注技能系统在长期使用下的维护。SkillOS 将自我演进视为库治理,冻结执行器并学习库何时应改变(Ouyang 等 2026a)。SkillGraph 为检索添加了先决条件结构(Li 等 2026b);其他研究将治理扩展到运行时循环和多智能体环境(Lin 等 2026;Pan 等 2026;Zhang 等 2026;Du 等 2025)。所有这些方法都将困难转移到何时以及如何编辑条目,并且都需要一个效用评分器,无论是学习的还是手工设定的。GLoW 不保留此类策略:全局层每轮都从该轮的局部证据重新推导,因此保留性从整合中自然产生,而接受与否仅取决于测量的下游执行表现。

## 3 方法

### 3.1 问题表述
我们将*技能*定义为插入智能体上下文的自然语言过程。给定一个冻结智能体 π、一个任务 x、一个技能上下文 s 和一个执行框架 h,一次执行返回一个轨迹和一个验证器分数 (τ_x(s), r_x(s)) = h(π, x, s),其中 r_x(s) ∈ [0, 1]。也就是说,改变 s 是我们控制冻结智能体行为的唯一手段,而 r_x 是衡量效果的唯一可靠指标。

GLoW 维护一个已提交的全局先验库 G = {G_base, G_1, ..., G_K},其中每个 G_k 携带一个任务族共享的过程结构,且 K 远小于历史任务数量。对于一个任务 x,系统从 G 中回忆相关的先验:
G_x = Recall(G, x) = G_base ⊕ G_{k(x)}, (1)
其中 ⊕ 表示上下文拼接,G_base 无条件注入,G_{k(x)} 是通过相似性回忆的族先验(§3.5)。

一个“本地化”模块生成一个任务局部技能 L_x = Localize(Δτ_x, r_x),其中 Δτ_x 收集 x 的连续轨迹之间的差异,r_x 表示相应的验证器分数;L_x 仅依赖当前任务自身的执行反馈,不查询历史库,也不写入长期库。

GLoW 的目标是在任务流上构建并维护 G,以最大化组合上下文的期望执行值:
max_G E_{x∼D} [ r_x( Recall(G, x) ⊕ L_x ) ], (2)
其中 D 表示流的任务分布。库的大小由族结构而非流决定,因为整合为每个族维护一个先验(§3.3),所以 |G| 跟踪的是发现的相异过程数量,而非已见任务数量。

优化公式 (2) 是困难的,因为 r_x 是一个黑箱,G 的粒度未知,且语言压缩是有损的;§3.2–§3.5 依次解决这些问题(算法 1)。

算法 1 GLoW:对任务流的一次遍历  
0:智能体 π,框架 h,流 D,轮数 T,子轮数 J  
0:已提交先验库 G  
1: G ← {G_base}  
2:for t = 1 to T do  
3:  阶段 1 *局部证据*; C ← ∅  
4:  for j = 1 to J do  
5:    for all 任务 x ∈ D do  
6:      G_x ← Recall(G, x)  ▷ 在该轮次内冻结  
7:      (τ_x, r_x) ← h(π, x, G_x)  
8:      repeat  
9:        L_x ← Localize(Δτ_x, r_x)  
10:       C ← C ∪ {(x, Δτ_x, r_x, L_x)}  
11:   until C 收敛或达到最大子轮数  
12: 阶段 2 *族整合与先验更新*  
13: F ← Cluster( C )  // 将技能卡聚合成过程族  
14: for each 族 F_k in F do  
15:   candidate ← Compress( F_k )  
16:   if Verify( candidate ) then  // 在真实下游执行中验证  
17:     G ← (G \ {G_{k(x)}}) ∪ {candidate}  // 提交更新的先验  
18:   end  
19: end  
20:end

相似文章

SkillFlow:自主智能体终身技能发现与演化基准测试

Hugging Face Daily Papers

SkillFlow 推出了一个涵盖20个任务家族共166项任务的基准测试,用于评估自主智能体在终身学习协议下,随时间推移发现、修复并维护技能的能力。实验揭示了主流模型之间存在显著的能力差距:Claude Opus 4.6 通过技能演化获得了显著提升,而其他模型的收益有限甚至为负。

MASkills:多智能体LLM系统的持续技能优化

arXiv cs.AI

MASkills 提出了一个持续学习框架,通过智能体技能优化多智能体LLM系统,使用基于技能的信用分配和层次聚合来提升在 HotpotQA 和 GAIA 等任务上的性能。

SKILL.state: 可扩展的长期智能体技能

arXiv cs.AI

SKILL.state为基于LLM的智能体引入了一种运行时架构,该架构使用可变执行状态而非不断增长的对话历史,从而在长期任务中提高准确性并减少令牌使用。