多行动,少决策:技能引导的自适应动作分块用于长期任务LLM代理
摘要
本文提出'Space',一种技能引导的自适应动作分块方法,用于长期任务LLM代理,将成功率提高7.0%–31.3%,并将LLM决策轮次减少高达78.9%。
arXiv:2609.02042v1 公告类型:新
摘要:大型语言模型(LLM)代理用于长期交互任务,通常遵循ReAct风格的协议,每轮LLM输出一个基本动作。虽然这支持频繁的重新规划,但对于长期任务效率低下,因为许多轮次用于常规动作序列。一个自然的替代方案是让代理输出可变长度的动作块。然而,使用标准强化学习天真地训练这种策略会失败:代理要么退化为单一动作行为,要么过度承诺于过长的序列。这两种失败有一个共同的根本原因:无法学习块边界。我们提出SPACE,通过从轨迹诱导的编程技能中蒸馏块边界监督来解决这一挑战。我们从成功的轨迹中诱导两级编程技能,其中子技能边界作为直接的块边界监督。然后,通过混合在策略/离策略优化和块感知信用分配,将这种时间结构蒸馏到基本动作-块策略中。在ALFWorld和ScienceWorld上的实验表明,SPACE在每个设置中将成功率提高7.0%-31.3%(相比最强基线),同时将平均LLM决策轮次减少高达78.9%。
查看缓存全文
缓存时间: 2026/09/03 06:14
# 多行动,少决策:基于技能引导的自适应动作分块在长周期LLM智能体中的应用 来源:https://arxiv.org/html/2609.02042 Can Jin¹ 机构:罗格斯大学 Jinman Zhao 机构:多伦多大学 Jiahao Wu 机构:香港理工大学 Yang Zhou 机构:罗格斯大学 Zhepeng Wang 机构:亚马逊 Zhendong Wang 机构:微软 Mu Zhou 机构:罗格斯大学 Dimitris N. Metaxas 机构:罗格斯大学 ###### 摘要 用于长周期交互任务的大型语言模型(LLM)智能体通常遵循ReAct风格的协议,在每轮LLM交互中输出一个基础动作。虽然这实现了频繁的重新规划,但对于需要花费多轮执行常规动作序列的长周期任务而言效率低下。一个自然的替代方案是让智能体输出可变长度的动作分块。然而,使用标准强化学习来训练这样的策略会失败:智能体要么退化为单一动作行为,要么过度依赖过长的动作序列。这两种失败都有一个共同的根本原因:无法学习分块边界。我们提出了 **SPACE**(基于技能引导的策略与自适应分块执行),通过从轨迹诱导的程序化技能中蒸馏分块边界监督信息来解决这一挑战。我们从成功的轨迹中诱导出两层程序化技能,其中子技能边界作为直接的分块边界监督。然后通过带有分块感知信用分配的混合策略内/策略外优化,将这种时间结构蒸馏到基础动作-分块策略中。在ALFWorld和ScienceWorld上的实验表明,SPACE在每种设置下比最强基线提升了7.0%–31.3%的成功率,同时将平均LLM决策轮次减少了高达78.9%。 ††脚注:通讯作者:[[email protected]](mailto:[email protected]),[[email protected]](mailto:[email protected]) ## 1 引言 LLM智能体正越来越多地应用于长周期交互任务,它们通常遵循ReAct风格的逐步协议:对当前状态进行推理,执行一个基础动作,观察环境反馈,然后选择下一个动作(Yao et al., 2023 (https://arxiv.org/html/2609.02042#bib.bib32))。该协议允许频繁的重新规划,而最近的强化学习方法进一步改进了这种多轮设置下的优化(Zhou et al., 2024 (https://arxiv.org/html/2609.02042#bib.bib37); Chen et al., 2025 (https://arxiv.org/html/2609.02042#bib.bib3); Feng et al., 2025 (https://arxiv.org/html/2609.02042#bib.bib5))。然而,在长周期任务中,这种精细的时间粒度行动会变得受限。先前的研究表明,逐步交互可能导致短视行为、放大复合误差(Zhu et al., 2025 (https://arxiv.org/html/2609.02042#bib.bib38)),并将智能体困在重复循环或无效命令中(Xie et al., 2024 (https://arxiv.org/html/2609.02042#bib.bib29))。这就引出了一个自然的问题:LLM智能体是否应该始终以单个基础动作的粒度来行动? 图 1:朴素多动作强化学习的失败模式。可变长度的GRPO要么退化为单一动作决策,要么过度依赖过长的分块,这促使了显式分块边界监督的需求。 最直接的替代方案是将动作空间扩展为可变长度的动作序列,并让策略自由决定每轮输出多少个基础动作。这个想法与机器人学和强化学习(RL)中的时间抽象和动作分块相关(Zhao et al., 2023 (https://arxiv.org/html/2609.02042#bib.bib35); Li et al., 2025 (https://arxiv.org/html/2609.02042#bib.bib9); Yang et al., 2024 (https://arxiv.org/html/2609.02042#bib.bib30); Li et al., 2026a (https://arxiv.org/html/2609.02042#bib.bib7); Li et al., 2026b (https://arxiv.org/html/2609.02042#bib.bib8); Bu et al., 2025 (https://arxiv.org/html/2609.02042#bib.bib2))。一个自然的尝试是使用标准RL目标(如GRPO)来训练这种可变长度策略。然而,如图 1 (https://arxiv.org/html/2609.02042#S1.F1) 所示,这种朴素的方法无法可靠地学习有意义的动作分块。相反,它表现出两种不同的失败模式:策略要么退化为单一动作行为,要么过度依赖过长的动作序列,从而损害任务成功。这些失败指向一个共同的根本原因:在稀疏的终端奖励下,RL信号不包含关于分块边界应放置在何处的信息。缺乏这种监督,策略就无法区分哪些动作应该被组合在一起,开环执行应该持续多久,以及智能体何时应该暂停以获取新的观察。因此,核心挑战不在于实现多动作输出,而在于**学习动作分块边界**。 我们的关键洞察是,成功的轨迹已经包含了监督这些边界所需的结构。先前的工作表明,复杂的智能体行为通常可以分解为结构化的、可参数化的程序化技能(Liu et al., 2024 (https://arxiv.org/html/2609.02042#bib.bib10); Wang et al., 2024b (https://arxiv.org/html/2609.02042#bib.bib22); Wang et al., 2024a (https://arxiv.org/html/2609.02042#bib.bib19); Wang et al., 2025b (https://arxiv.org/html/2609.02042#bib.bib23); Yu et al., 2025 (https://arxiv.org/html/2609.02042#bib.bib33); Ni et al., 2026 (https://arxiv.org/html/2609.02042#bib.bib13))。通过将成功轨迹分割为有序的子技能调用组成的复合技能,每个子技能边界标记了一个动作分块的结束和下一个分块的开始。这提供了仅靠终端奖励无法提供的分块边界监督。 基于这一洞察,我们提出了 **SPACE**(**S**kill-guided **P**olicy with **A**daptive **C**hunk **E**xecution),它将程序化技能的时间结构蒸馏到基础动作-分块策略中。SPACE从成功轨迹中诱导出两层程序化技能,其中每个复合技能分解为有序的子技能调用,其边界标记了自然的分块划分。在训练期间,我们交替进行基础动作-分块展开和技能增强展开;后者被扩展为分块级的监督目标,将子技能边界转换为直接的训练信号。然后通过策略内分块学习和来自扩展轨迹的策略外蒸馏来优化策略,两者都由分块感知的信用分配引导。在部署时,学习到的策略直接生成可变长度的动作分块,无需依赖技能库。 在ALFWorld和ScienceWorld上的实验,对已见和未见数据集进行评估,表明SPACE始终比基于提示和RL的强基线实现了更好的性能-效率权衡。具体而言,SPACE将任务成功率提高了7.0%–31.3%,同时将LLM决策轮次减少了7.4%–78.9%,并且仅使用最强基线26.6%的训练步骤就达到了其最终性能。总的来说,这些发现表明学习可变长度的动作分块是构建高效且能力强的长周期LLM智能体的关键要素。 我们的主要贡献是: - ★问题识别。我们确定了可变长度动作分块是LLM智能体的一个关键但尚未充分探索的能力,并表明标准RL目标无法学习有意义的分块,揭示了核心挑战在于学习分块边界。 - ★技能引导的分块学习。我们提出了SPACE,它通过带有分块感知信用分配的混合策略内/策略外优化,将程序化技能中的子技能边界蒸馏到基础动作-分块策略中。 - ★强大的实证结果。在ALFWorld和ScienceWorld上,SPACE在成功率方面持续优于基于提示和RL的基线,同时减少了LLM决策轮次和所需的训练步骤。 - ★深入分析。消融实验证实两个组件都是必要的,学习到的分块策略实现了显著更好的训练效率,并且通过分块级的最优N搜索(best-of-NN search)实现了更高效的测试时扩展。 ## 2 相关工作 #### 用于LLM智能体的强化学习。 基于可验证奖励的强化学习(RLVR)(Shao et al., 2024 (https://arxiv.org/html/2609.02042#bib.bib15))已成为训练多轮LLM智能体的核心范式。最近的方法通过层级(Zhou et al., 2024 (https://arxiv.org/html/2609.02042#bib.bib37))、留一法(Chen et al., 2025 (https://arxiv.org/html/2609.02042#bib.bib3))和基于组的优势(Feng et al., 2025 (https://arxiv.org/html/2609.02042#bib.bib5))来改进信用分配,以及轮级奖励塑造(Wei et al., 2025 (https://arxiv.org/html/2609.02042#bib.bib24))和逐步进度归因(Wang et al., 2025a (https://arxiv.org/html/2609.02042#bib.bib20))。其他工作超越了单集优化,利用跨集训练用于测试时探索(Jiang et al., 2025 (https://arxiv.org/html/2609.02042#bib.bib6))或回顾性反思与记忆(Zhang et al., 2026 (https://arxiv.org/html/2609.02042#bib.bib34); Wu et al., 2026 (https://arxiv.org/html/2609.02042#bib.bib26); Wu et al., 2024 (https://arxiv.org/html/2609.02042#bib.bib25); Yang et al., 2026 (https://arxiv.org/html/2609.02042#bib.bib31); Lu et al., 2026 (https://arxiv.org/html/2609.02042#bib.bib11); Zhou et al., 2026 (https://arxiv.org/html/2609.02042#bib.bib36))。然而,所有这些方法都在ReAct风格的每轮单动作范式内运作;相比之下,我们专注于学习*可变长度动作分块*——改变行动的时间粒度,使得LLM轮次能够摊销多个基础动作。 #### 决策中的动作分块。 动作分块植根于选项框架(Sutton et al., 1999 (https://arxiv.org/html/2609.02042#bib.bib18)),并通过ACT(Zhao et al., 2023 (https://arxiv.org/html/2609.02042#bib.bib35))在模仿学习中普及,最近通过Q-分块(Q-chunking)(Li et al., 2025 (https://arxiv.org/html/2609.02042#bib.bib9))扩展到在线RL,用于在长周期稀疏奖励任务中高效探索,以及SEAR(Nagy et al., 2026 (https://arxiv.org/html/2609.02042#bib.bib12))用于更大的分块大小。我们的工作在设置上有所不同:我们研究的是具有*离散文本基础动作*的LLM智能体的可变长度分块,其中分块边界必须在稀疏终端奖励下从交互历史中推断。与连续控制设置不同,固定长度的分块在这里不足,因为合适的分块粒度随文本上下文持续变化;因此,我们开发了一个直接学习可变长度动作分块的LLM策略。 #### 技能抽象与技能增强学习。 一系列不断增长的工作通过引入可重用技能或经验抽象来改进智能体。许多方法使用文本或声明性技能作为提示时的指导,包括SkillAct(Liu et al., 2024 (https://arxiv.org/html/2609.02042#bib.bib10))、AutoManual(Chen et al., 2024 (https://arxiv.org/html/2609.02042#bib.bib4))、Trace2Skill(Ni et al., 2026 (https://arxiv.org/html/2609.02042#bib.bib13)),而SkillRL(Xia et al., 2026 (https://arxiv.org/html/2609.02042#bib.bib28))和RetroAgent(Zhang et al., 2026 (https://arxiv.org/html/2609.02042#bib.bib34))将可重用技能整合到RL训练中。另一条线将技能程序化地表示为可执行代码:CodeAct(Wang et al., 2024b (https://arxiv.org/html/2609.02042#bib.bib22))作为一种动作接口,Voyager(Wang et al., 2024a (https://arxiv.org/html/2609.02042#bib.bib19))维护一个可执行库,以及ASI(Wang et al., 2025b (https://arxiv.org/html/2609.02042#bib.bib23))从轨迹中诱导程序化技能。这种表示比文本表示更具结构性、可参数化和可验证性,自然地支持分解和重用。我们的方法在概念上与该方向相关,但有一个关键区别:程序化技能仅作为*训练时的教师*,其子技能结构被蒸馏到一个扁平化的多动作策略中,该策略在无需额外人工标注的情况下学习可重用的分块边界。 ## 3 方法 我们的方法分为四个步骤。我们首先形式化可变长度动作分块,并将其与标准单动作协议进行对比(§3.1 (https://arxiv.org/html/2609.02042#S3.SS1)),然后描述如何从成功轨迹中诱导的程序化技能提供分块边界监督(§3.2 (https://arxiv.org/html/2609.02042#S3.SS2))。接下来,我们介绍混合展开,将技能级的时间结构蒸馏到基础动作-分块策略中(§3.3 (https://arxiv.org/html/2609.02042#S3.SS3)),最后呈现一个分块感知的优化目标,将策略内学习与策略外蒸馏相结合(§3.4 (https://arxiv.org/html/2609.02042#S3.SS4))。图 2 (https://arxiv.org/html/2609.02042#S3.F2) 给出了概览。 图 2:SPACE概览。SPACE从成功轨迹中诱导程序化技能,将技能调用扩展为基础动作分块用于混合训练,并部署一个无技能库访问的基础动作-分块策略。 ### 3.1 问题形式化 我们将交互式文本基础环境建模为部分可观察马尔可夫决策过程(POMDP)$\mathcal{M}=(\mathcal{S},\mathcal{A},\mathcal{T},\mathcal{G},\mathcal{O})$,其中 $\mathcal{S}$ 是状态空间,$\mathcal{A}$ 是允许的基础动作集合,$\mathcal{T}$ 表示转移动力学,$\mathcal{G}$ 是任务空间,$\mathcal{O}$ 是观察空间。在每个情节开始时,提供一个场景 $s_0 \in \mathcal{S}$、一个文本基础任务 $g \in \mathcal{G}$ 和一个初始观察 $o_0 \in \mathcal{O}$。在执行一个基础动作 $a_t \in \mathcal{A}$ 后,环境根据 $T(s_{t+1} \mid s_t, a_t) \in \mathcal{T}$ 进行转移,并返回一个新的观察 $o_{t+1} \in \mathcal{O}$。智能体基于其文本交互历史 $h_t = (g, o_0, a_0, o_1, \ldots, a_{t-1}, o_t)$ 选择动作。在RLVR设置中,环境仅返回一个终端二元奖励,指示任务失败或成功。传统的语言智能体逐步行动,在每轮LLM交互中采样一个单一动作 $a_t \sim \pi_\theta(\cdot \mid h_t)$,其中 $\pi_\theta$ 是策略。该协议是稳健的,因为智能体在每个动作后都会观察环境,但对于长周期任务效率低下,因为在这些任务中,许多轮次花费在执行常规动作序列上,而不是做出新的决策。 #### 可变长度动作分块。 我们不再每轮输出一个单一动作,而是允许策略在每个LLM决策轮次生成一个**动作分块**——一个可变长度的基础动作序列。令 $i$ 索引LLM决策,$t_i$ 表示进行决策 $i$ 的基础环境步骤。策略输出 $u_i = (a_{i,1}, a_{i,2}, \ldots, a_{i,L_i}) \sim \pi_\theta(\cdot \mid h_{t_i})$,其中 $1 \leq L_i \leq K$,$K$ 是允许的最大分块长度。诱导的分块动作空间定义为 $\mathcal{U}_K = \bigcup_{\ell=1}^K \mathcal{A}^\ell$。一旦生成 $u_i$,执行器会按顺序应用其组成动作,而无需额外的LLM轮次,直到分块完成或遇到无效动作。如果执行了 $\ell_i \leq L_i$ 个动作,LLM会在下一个决策点 $t_{i+1} = t_i + \ell_i$ 进行决策。我们的目标是学习一个策略 $\pi_\theta$,能够自适应地输出可变长度的动作分块,以在长周期任务中平衡探索与利用。
相似文章
SkillLens:面向成本高效型大模型智能体的自适应多粒度技能复用
本文提出了 SkillLens,这是一种用于大模型智能体自适应多粒度技能复用的分层框架,在基准任务中展示了更高的准确性和成本效益。
SkillMaster:迈向大语言模型智能体的自主技能掌握
本文介绍了 SkillMaster,一种训练框架,使大语言模型智能体能够通过轨迹知情审查和反事实效用评估,自主地创建、优化和选择技能。
技能并非通用:面向LLM智能体的模型感知技能对齐
本文提出MASA框架,该框架在不修改模型权重的情况下,通过分层进化和模型条件重写器将技能适配到每个LLM骨干网络,相比基线方法最高提升25.8个点。
@vintcessun: 别让长程 Agent 每走一步都停下来问 LLM;真正该学的是何时连续行动,何时重新观察。 https://arxiv.org/abs/2609.02042 SPACE 从成功轨迹归纳两层参数化技能,把子技能边界变成动作块监督,再以混合在…
SPACE 通过从成功轨迹归纳两层参数化技能,将子技能边界作为动作块监督,训练长程 LLM Agent 自适应输出可变长原子动作序列;在 ALFWorld 和 ScienceWorld 上成功率提升 7.0%–31.3%,决策轮次最多降低 78.9%。
MASkills:多智能体LLM系统的持续技能优化
MASkills 提出了一个持续学习框架,通过智能体技能优化多智能体LLM系统,使用基于技能的信用分配和层次聚合来提升在 HotpotQA 和 GAIA 等任务上的性能。