SKILL.state: 可扩展的长期智能体技能
摘要
SKILL.state为基于LLM的智能体引入了一种运行时架构,该架构使用可变执行状态而非不断增长的对话历史,从而在长期任务中提高准确性并减少令牌使用。
arXiv:2608.26263v1 宣布类型:新
摘要:大型语言模型(LLMs)越来越多地充当自主智能体,执行复杂的、长期运行的程序性技能。现有的智能体运行时通过持续追加观测、动作和中间推理痕迹到不断增长的对话历史来维护执行,这在长期任务中会导致延迟退化和上下文污染故障。我们提出SKILL.state,一种运行时架构,它用显式的、可变的执行状态替代仅追加的对话历史。在每个执行步骤中,模型只接收不可变的技能规范、当前结构化的执行状态和最新观测。中间推理在产生经过验证的状态更新后立即被丢弃,防止提示随着执行历史而增长。在不同的数据集、模型和执行环境中,SKILL.state提高了任务准确性,同时显著减少了累计令牌消耗。我们的结果表明,显式的执行状态是一种有效的、架构无关的抽象,用于可扩展的长期智能体技能。
查看缓存全文
缓存时间: 2026/08/28 09:34
# SKILL.state:可扩展长周期智能体技能
来源:https://arxiv.org/html/2608.26263
作者:Priyanka Tiwari, Jonghyun Chung
机构:Google LLC / 普渡大学
###### 摘要
大型语言模型(LLM)正日益作为自主智能体,执行复杂、长周期的程序化技能。现有的智能体运行时通过持续向不断增长的对话历史中追加观察、动作和中间推理轨迹来维持执行,这在长时间运行中会导致延迟加剧和上下文污染错误。我们提出SKILL.state,一种运行时架构,用显式的、可变的执行状态替代了只追加的对话历史。在每个执行步骤中,模型仅接收不可变的技能规范、当前结构化执行状态和最新观察。中间推理在产生经验证的状态更新后即被丢弃,从而阻止提示随着执行历史而增长。在多种数据集、模型和执行环境中,SKILL.state在提升任务准确性的同时显著降低了累积token消耗。我们的结果表明,显式执行状态是一种有效且架构无关的抽象,可用于实现可扩展的长周期智能体技能。
## 1 引言
大型语言模型(LLM)已从被动的语言接口迅速演变为能够进行迭代推理、工具使用和与外部环境交互的自主系统(Yao等人, 2022;Schick等人, 2023;Qin等人, 2024;Wu等人, 2023)。近期研究进一步证明,这些能力可以封装为可重用的程序化技能,使智能体能够通过模块化的专门行为组合来执行软件工程、工作流自动化、网络交互和科学发现(Badhe等人, 2026)。随着智能体越来越多地执行长时间运行的过程,执行本身成为一个系统问题,而非纯粹的推理问题。
现代智能体运行时几乎普遍采用对话式执行模型。在每个执行步骤中,语言模型接收原始的技能规范以及不断增长的先前推理、动作、观察和工具输出的记录(Yao等人, 2022;Mialon等人, 2023)。尽管记忆系统通过摘要或检索缓解了上下文增长(Packer等人, 2023;Wang等人, 2023;Zhong等人, 2023),但它们保留了相同的执行语义:未来的决策是基于过去执行的文本重构,而不是基于当前执行状态的明确表示。
这种设计为长周期程序化技能引入了根本性的限制。提示大小随执行长度增长,增加了token消耗和推理成本(Liu等人, 2024;Xiao等人, 2024a)。历史观察和过时的推理在它们不再相关后很久仍嵌入在上下文中,要求模型不断区分当前事实与历史遗留。因此,执行正确性越来越依赖于从累积的文本历史中重构状态。
本文,我们引入SKILL.state,一种将程序化技能执行重新构建为显式状态转换,而非对话历史累积的运行时架构。图1概述了所提出的运行时。在执行步骤t,语言模型仅接收三个输入:A_t = (P, Σ_t, O_t) (1),其中P表示不可变的程序规范,Σ_t是结构化执行状态,O_t是来自环境的最新观察。在产生经验证的状态更新后,中间推理轨迹被丢弃,仅保留更新后的执行状态。因此,执行严格依赖于当前世界状态,而非重放历史轨迹。
为验证此假设,我们在合成和真实世界的基准测试上对SKILL.state进行了评估:SkillExecBench,一个专为长周期程序化技能执行设计的受控基准测试,涵盖扩展、噪声和状态恢复场景;InterCode CTF(Yang等人, 2023),涉及交互式Linux终端利用;以及Sierra τ-Bench(Yao等人, 2024),评估基于复杂数据库API的多轮客户服务工作流。实验结果表明,显式执行状态通过保持有界的提示大小,同时削减token消耗,并超越基于历史和基于压缩的基线,显著提高了长周期程序化技能的可扩展性。
我们的贡献总结如下:
- 我们提出SKILL.state,一种通过显式结构化执行状态执行程序化技能的运行时架构,其中中间推理在每个步骤后被丢弃,证明其具有严格有界的 O(1) 提示占用和 O(T) 的累积token复杂度。
- 我们提出SkillExecBench,并在公共基准测试(InterCode CTF 和 Sierra τ-Bench)上进行评估,用于在顺序、有状态环境中评估长周期程序化技能执行。
- 跨多个执行周期和运行时基线,我们证明了以状态为中心的执行在维持有竞争力的任务性能的同时,在专有和开放权重模型上都显著减少了提示增长和累积token消耗。
## 2 相关工作
本节将SKILL.state与先前关于程序化技能、长周期智能体的记忆架构、对话状态跟踪和长上下文推理的工作进行定位;在每种情况下,对比在于先前的工作管理对话历史,而我们将其移除。
### 2.1 用于LLM智能体的程序化技能
现有关于可重用程序化技能的研究主要关注技能发现、表示、组合和安全威胁建模(Badhe等人, 2026;Badhe and Tiwari, 2026)。我们的工作则专注于技能被选中后,很大程度上未被探索的执行机制。
### 2.2 长周期智能体的记忆架构
长周期智能体架构通常通过情景检索(Park等人, 2023)或持久存储(Chhikara等人, 2025;Zhong等人, 2024)来保留对话语义。这些方法使得执行状态隐式地分布在累积的日志中。SKILL.state则相反,将执行隔离到一个显式的、可变的运行时状态中,消除了从文本历史中反复重构世界模型的需要。像LangGraph这样的框架使用辅助结构化状态来协调跨智能体节点的工作流。然而,这些系统仍然依赖对话记录作为主要的推理基础。SKILL.state通过在产生有效的状态转换后立即丢弃中间推理轨迹来替代这个基础。
### 2.3 对话状态跟踪
对话状态跟踪(DST)在面向任务对话的多轮对话中维护用户槽位值(Williams等人, 2013;Henderson等人, 2014;Rastogi等人, 2020;Wu等人, 2019;Heck等人, 2020;Hosseini-Asl等人, 2020)。虽然DST和SKILL.state都维护结构化表示,但它们在执行机制上存在根本差异:DST在准静态对话中,伴随着完整的对话记录跟踪辅助状态,而SKILL.state将结构化状态视为充分统计量,丢弃对话历史,以便在具有有界提示占用的动态环境中执行自主技能。
### 2.4 上下文管理与长上下文推理
语言模型在长上下文上的检索能力会下降(Liu等人, 2024;Zhang等人, 2024),这促使了流式注意力(Xiao等人, 2024b)和提示压缩技术(Jiang等人, 2023;Li等人, 2023)的发展。SKILL.state并非试图处理或压缩扩展的对话历史,而是通过维护下一步计算所需的标准执行状态,从根本上阻止了历史的累积。
## 3 SKILL.state
当前的LLM智能体运行时通过反复将推理轨迹、动作、观察和工具输出追加到不断增长的对话历史中来执行程序化技能。因此,执行状态隐式地表示在自然语言中,必须在每次交互时由语言模型重构。随着执行周期的增加,提示大小和过时信息的量都单调增长,使得执行越来越依赖于解释历史文本,而非维护当前世界状态。
SKILL.state将程序化技能执行重新构建为一个显式状态转换过程。它不将执行表示为只追加的对话,而是将每个执行步骤定义为:
A_t = (P, Σ_t, O_t) (2)
其中P是不可变的程序规范,Σ_t是步骤t的结构化执行状态,O_t是从环境接收到的最新观察。语言模型永远不会接收先前的观察、先前的动作或先前的推理轨迹。图1说明了这个执行周期。在每个步骤中,运行时从(P, Σ_t, O_t)构建提示,调用语言模型,确定性地验证提议的状态转换,更新执行状态,执行所选动作,并使用更新后的状态重复此过程。
图1:SKILL.state 架构概览。
### 3.1 执行状态与模式编写
与对话式运行时不同,SKILL.state将执行状态视为一等运行时抽象。状态仅包含未来执行所需的信息,并使用为领域定义的结构化模式表示。模式是按领域编写一次,而非按任务编写;例如,在InterCode CTF基准测试的所有100个多样化挑战实例中,智能体重用一个静态的5字段模式(discovered_flags, tested_hypotheses, active_files, working_dir, cmd_summary)。
### 3.2 推理与状态转换
推理被严格用作产生状态转换和选择下一个动作的中间计算。给定当前执行上下文(P, Σ_t, O_t),语言模型生成:
(R_t, ΔΣ_t, a_t) (3)
其中R_t表示多步链式思维推理轨迹,ΔΣ_t是结构化状态更新(一个包含关键变异和删除的JSON字典),a_t是要执行的动作。关键的是,步骤内的多步推理在生成期间是完全完整的,以支持复杂的演绎规划。然而,一旦状态转换被验证并应用,推理轨迹R_t就被永久丢弃,并且永远不会出现在后续的提示中。
执行状态根据以下公式更新:
Σ_{t+1} = Σ_t ⊕ ΔΣ_t (4)
其中⊕表示运行时的字典合并运算符,具有空值删除语义。此模型将瞬时推理投影到持久化结构状态中,只允许未来执行所需的信息在交互中存活。
算法1 SKILL.state 运行时
1: 程序规范 P,初始状态 Σ_0
2: 对于 t = 0, ..., T 执行
3: 接收最新观察 O_t
4: 构建提示 (P, Σ_t, O_t)
5: 使用LLM生成 (R_t, ΔΣ_t, a_t)
6: 验证 ΔΣ_t
7: Σ_{t+1} ← Σ_t ⊕ ΔΣ_t
8: 执行 a_t
9: 结束循环
### 3.3 复杂度分析
令 T 表示执行周期。对于对话式运行时,提示长度随着累积的交互历史增长,|C_t| = O(t),导致累积token复杂度为:
∑_{t=1}^{T} |C_t| = O(T²) (5)
相比之下,SKILL.state仅维护程序规范、结构化执行状态和最新观察:
|P_t| = O(|P| + |Σ| + |O|) (6)
这在渐进意义上是有界的,并且独立于先前已执行的回合数 t。因此,累积提示复杂度随执行周期严格线性增长:
∑_{t=1}^{T} |P_t| = O(T) (7)
由此产生的运行时将执行从重构历史转向维护当前执行状态的显式、经验证的表示。
## 4 评估基准
### 4.1 SkillExecBench(受控诊断测试平台)
SkillExecBench通过提供具有确定性真实世界状态转换的顺序程序任务,将执行机制与开放式的启发式搜索分离:
- 环境1(仓库管理):一个跟踪500个独立货架的离散物理库存领域。动作包括Store、Ship、Move和Wait。此环境测试模型在长周期中维护独立、非重叠状态变量的能力,其中早期观察会离开上下文窗口。
- 环境2(软件仓库):一个深度嵌套的、关联的Git分支、提交、拉取请求和CI测试状态的关系图。动作包括CherryPick、Merge、RunTests、CreateRelease和Rollback。具有密集依赖性,其中单个动作(例如,合并一个PR)会根本性地改变目标分支和相关PR的状态,测试对纠缠图的复杂结构推理能力。
### 4.2 公共交互式基准
为了评估SKILL.state在具有复杂搜索、生成和工具使用的真实世界、非确定性任务上的性能,我们在两个公共基准测试上进行了评估:
- InterCode CTF(Yang等人, 2023):一套100个Linux bash夺旗挑战,涵盖逆向工程、取证、密码学和二进制利用。智能体在Docker容器中执行bash命令。相似文章
SkillOpt:自我进化智能体技能的执行策略
SkillOpt 引入了一种系统化的文本空间优化器,用于智能体技能。该优化器将技能训练为智能体的外部状态,具有稳定的更新和零部署推理开销,在多个基准测试和执行环境中实现了卓越性能。
Formal Skill: 面向高效精准LLM智能体的可编程运行时技能
本文介绍了Formal Skill,这是一种面向LLM智能体的运行时原生抽象,它将可重用流程编码为可执行状态机,配有JSON元数据、Python执行器和钩子控制的逻辑。还介绍了一个名为FairyClaw的开源实现,在Harness-Bench上展示了具有竞争力的性能,且减少了token使用量。
SkillDAG:大规模LLM技能选择中的自进化类型化技能图
介绍了SkillDAG,一种用于大规模LLM技能选择的自进化类型化有向图,它建模了技能间关系,并允许智能体在执行过程中查询和演化该图,在ALFWorld和SkillsBench上优于基线。
SkillGate: 长期视野智能体的策略内技能训练
SkillGate 通过使用执行和技能命名令牌的独立信用通道,解决了AI智能体技能选择中的选择器信用饥饿问题,提高了成功率并减少了长期任务中误导性技能的暴露。
SkillLens:面向成本高效型大模型智能体的自适应多粒度技能复用
本文提出了 SkillLens,这是一种用于大模型智能体自适应多粒度技能复用的分层框架,在基准任务中展示了更高的准确性和成本效益。