SAPO:用于智能体强化学习的单次展开自回归策略优化

arXiv cs.AI 论文

摘要

SAPO 是一种用于智能体强化学习的低内存、高计算效率框架,它在单个自回归骨干中共享策略和价值函数,在 ALFWorld 和 WebShop 的实验中表现优于 PPO 和 GRPO。

arXiv:2608.19842v1 公告类型:新 摘要:智能体强化学习 (RL) 已成为大型语言模型后训练的关键阶段。现有的无评论家、组相对方法通过多次展开估计策略优势,避免了传统近端策略优化 (PPO) 的巨大内存开销,并在长期交互任务中实现了强劲表现。尽管成功,但最近的研究揭示了三个局限性:(1) 缺乏显式的价值泛化和有效的时间信用分配;(2) 在长期复杂任务中存在潜在的优势坍缩;(3) 需要在采样预算和策略性能之间进行昂贵的权衡。在这项工作中,我们提出了单次展开自回归策略优化 (SAPO),这是一种低内存、高计算效率的框架,其中策略和价值函数共享一个自回归骨干。SAPO 利用大型语言模型 (LLMs) 的自回归结构,在不同的因果边界处生成策略和价值预测,同时共享参数,并独立优化 PPO 目标和辅助的在策略 SARSA 目标。为了稳健地估计每个回合的贡献,我们进一步引入了一个轨迹级广义优势估计器,它结合了 lambda-returns 和批量归一化。在 ALFWorld 和 WebShop 上使用 Qwen2.5-1.5B/7B 的实验表明,SAPO 训练稳定,并且平均分别比 PPO 和 GRPO 高出 +15.1 和 +12.1 个百分点,同时消除了独立评论家模型的内存成本,并将每次迭代的运行时间比 PPO 减少了 33.2%。
查看原文
查看缓存全文

缓存时间: 2026/08/21 10:06

# SAPO:面向智能体强化学习的单次 rollout 自回归策略优化
来源:https://arxiv.org/html/2608.19842
Lang Feng11footnotemark:1Affiliation:Bo AnAffiliation:Nanyang Technological University, Singaporedyliang@stu\.xmu\.edu\.cn,lang005@e\.ntu\.edu\.sg,ylliu@xmu\.edu\.cn,Yunlong LiuThanks:Corresponding authorAffiliation:Xiamen University, China
###### 摘要
智能体强化学习(RL)已成为大型语言模型后训练阶段的关键环节。现有的无评论家、组相对优势方法通过多次 rollout 估计策略优势,避免了传统近端策略优化(PPO)的大量内存开销,并在长期交互任务上取得了优异性能。尽管这些方法取得了成功,近期研究揭示了三个局限性:(1)缺乏显式的值泛化能力和有效的时间信用分配;(2)在长期复杂任务中存在潜在的优势坍塌问题;(3)需要在采样预算和策略性能之间进行高昂的权衡。本文提出单次 rollout 自回归策略优化(SAPO),这是一个低内存、计算高效的框架,其中策略和价值函数共享单个自回归骨干网络。SAPO 利用大语言模型的自回归结构,在共享参数的情况下,于不同的因果边界生成策略和价值预测,同时独立优化 PPO 目标和辅助的在策略 SARSA 目标。为了鲁棒地估计每一轮的贡献,我们进一步引入了轨迹级广义优势估计器,该估计器结合了λ回报与批量归一化。在 ALFWorld 和 WebShop 上使用 Qwen2.5-1.5B/7B 的实验表明,SAPO 训练稳定,相比 PPO 和 GRPO 分别取得了+15.1 和+12.1 个百分点的平均性能提升,同时消除了独立评论家模型的内存成本,并将每次迭代运行时间比 PPO 缩短了 33.2%。(续)
## 1 引言
智能体强化学习(RL)的最新进展已将大型语言模型从被动的文本生成器转变为能够进行长期交互的智能体,例如推理、工具使用、网页搜索和代码执行任务。大规模 RL 后训练在数学推理和编码方面取得了显著改进[17 (https://arxiv.org/html/2608.19842#bib.bib1), 5 (https://arxiv.org/html/2608.19842#bib.bib2), 7 (https://arxiv.org/html/2608.19842#bib.bib3)],同时像 Search-R1 这样的交互系统表明,策略可以通过多轮动作学习获取外部信息[8 (https://arxiv.org/html/2608.19842#bib.bib4)]。这些成功表明,直接从环境反馈中学习正成为迈向更自主、更通用语言智能体的关键途径。
大多数智能体 RL 方法建立在近端策略优化(PPO)或其无评论家、组相对优势变体之上。传统 PPO 通过学习的价值函数和广义优势估计(GAE)提供令牌级或轮次级的信用分配,但通常需要具有显著内存和计算预算的策略规模评论家[13 (https://arxiv.org/html/2608.19842#bib.bib5), 21 (https://arxiv.org/html/2608.19842#bib.bib6)]。GRPO 通过对同一任务的多个采样结果进行归一化来避免这个评论家[17 (https://arxiv.org/html/2608.19842#bib.bib1)]。然而,近期研究揭示了三个局限性。首先,当一组中的所有 rollout 获得相同或几乎相同的奖励时——在稀疏反馈和长期失败下这越来越常见——归一化的优势消失,导致零梯度或优势坍塌区域[29 (https://arxiv.org/html/2608.19842#bib.bib7)]。其次,将轨迹级组优势均匀地分配给所有生成的令牌提供了薄弱的时间信用分配,并且无法跨状态、提示或策略迭代泛化价值估计;学习的评论家可以识别出组相对估计器遗漏的低价值重复或错误前缀[30 (https://arxiv.org/html/2608.19842#bib.bib8), 31 (https://arxiv.org/html/2608.19842#bib.bib9), 7 (https://arxiv.org/html/2608.19842#bib.bib3)]。第三,组相对估计存在不利的计算-质量权衡:小组产生嘈杂的基线,而更大的小组仅通过成倍增加 rollout 成本并在长而长度可变的智能体轨迹中施加同步屏障来提高稳定性[3 (https://arxiv.org/html/2608.19842#bib.bib10), 6 (https://arxiv.org/html/2608.19842#bib.bib11)]。
几项工作试图缓解这些问题。DAPO 通过动态采样、非对称裁剪和令牌级策略损失改进了组相对学习,但仍依赖于多次 rollout 和组统计[29 (https://arxiv.org/html/2608.19842#bib.bib7)]。ReMax 和 RLOO 使用贪婪或留一法基线消除了评论家,而 VinePPO 通过蒙特卡洛延续估计中间价值;这些方法减少了训练状态内存,但保留了粗糙的信用分配或引入了额外的生成成本[12 (https://arxiv.org/html/2608.19842#bib.bib12), 2 (https://arxiv.org/html/2608.19842#bib.bib13), 9 (https://arxiv.org/html/2608.19842#bib.bib14)]。相反,Open-Reasoner-Zero、VC-PPO 和 VAPO 恢复了显式的价值模型,并证明训练良好的评论家可以显著改善长期推理,特别是通过评论家预训练和改进的 GAE[7 (https://arxiv.org/html/2608.19842#bib.bib3), 30 (https://arxiv.org/html/2608.19842#bib.bib8), 31 (https://arxiv.org/html/2608.19842#bib.bib9)]。然而,这些方法维护了一个独立的、通常是策略规模的价值网络。Hydra-PPO 部分共享了冻结的骨干网络,但仍然需要特定于角色的适配器和头部,其完全共享变体揭示了潜在的策略-价值干扰[15 (https://arxiv.org/html/2608.19842#bib.bib15)]。POISE 通过一个轻量级探针重用演员的隐藏状态,但需要跨 rollout 估计[3 (https://arxiv.org/html/2608.19842#bib.bib10)],而 SAO 通过异步单次 rollout 训练实现,同时依赖一个单独预训练的评论家并进行更频繁的价值更新[6 (https://arxiv.org/html/2608.19842#bib.bib11)]。因此,具有显式时间价值估计的高效单次 rollout 学习仍然未得到解决。
为了解决这个问题,我们提出了单次 rollout 自回归策略优化(SAPO),这是一个轻量级的 RL 框架,它保留了基于价值的学习,而无需维护单独的评论家或依赖多次 rollout。SAPO 基于一个简单的观察:演员-评论家学习所需的信息流自然遵循语言生成的因果顺序。价值估计应在采取动作之前总结状态,而评估该动作可能还需要以已生成的内容为条件。这种对齐允许在同一个自回归流中的适当位置表达策略生成和价值估计,并通过因果掩码强制执行其不同的条件上下文。因此,同一个骨干网络可以生成动作并学习泛化的价值估计,同时重用其参数和中间计算。SAPO 从而调和了现有方法中两个相互竞争的目标:它保留了演员-评论家算法的显式价值泛化和时间信用分配,同时接近了无评论家、组相对优化所追求的内存和计算效率。因此,其核心贡献不仅仅是权重共享,而是自回归建模与演员-评论家学习之间的对应关系,从而在单一因果模型内实现高效的基于价值的优化。
我们在 ALFWorld 和 WebShop 上使用 Qwen2.5-1.5B 和 Qwen2.5-7B 骨干模型评估了 SAPO。SAPO 从每个提示的一次 rollout 开始稳定训练,并将任务成功率相比传统 PPO 和 GRPO 分别提高了+15.1 和+12.1 个百分点。它同时消除了独立评论家的内存占用,并将每次迭代运行时间比 PPO 减少了 33.2%。我们的贡献有三方面。
- • 我们引入了单次 rollout 自回归演员-评论家架构,通过因果边界读出联合表示和训练策略与价值函数。
- • 我们开发了一种轨迹级优势估计器,该估计器结合了λ回报与批量归一化,实现了无需组相对采样的显式轮次级信用分配。
- • 我们在长期智能体任务上证明了这种统一框架在性能、训练稳定性、内存效率和运行时间效率方面实现了有利的组合。
## 2 相关工作
智能体 RL 将具有可验证奖励的强化学习从单轮响应优化扩展到多轮决策,使大语言模型智能体能够从在外部环境中采取动作的后果中学习。一个突出的研究方向建立在无评论家、组相对优化之上。GRPO [17 (https://arxiv.org/html/2608.19842#bib.bib1)] 用提示内结果比较取代了学习的价值基线,这一表述被 DeepSeek-R1 [5 (https://arxiv.org/html/2608.19842#bib.bib2)] 采用,并由 DAPO [29 (https://arxiv.org/html/2608.19842#bib.bib7)] 通过动态采样和非对称裁剪、GSPO [33 (https://arxiv.org/html/2608.19842#bib.bib17)] 通过序列级重要性比率、以及 GVPO [32 (https://arxiv.org/html/2608.19842#bib.bib18)] 通过方差感知梯度加权进行了改进。这种范式已被扩展到交互环境:Search-R1 [8 (https://arxiv.org/html/2608.19842#bib.bib4)] 和 DeepResearcher [34 (https://arxiv.org/html/2608.19842#bib.bib19)] 优化迭代检索,ToRL [11 (https://arxiv.org/html/2608.19842#bib.bib20)] 和 WebSailor [10 (https://arxiv.org/html/2608.19842#bib.bib21)] 训练工具使用和网页导航,RAGEN [25 (https://arxiv.org/html/2608.19842#bib.bib22)] 刻画了多轮训练中的优化不稳定性。长期任务也激发了更具结构性的信用机制。ARChER [35 (https://arxiv.org/html/2608.19842#bib.bib23)] 和 HiPER [14 (https://arxiv.org/html/2608.19842#bib.bib24)] 跨时间尺度分解规划和执行,AgentGym-RL [26 (https://arxiv.org/html/2608.19842#bib.bib25)] 逐步增加交互视野,IGPO [23 (https://arxiv.org/html/2608.19842#bib.bib26)] 从搜索过程中的信息增益中推导密集内在奖励。
以效率为导向的 LLM RL 沿着无评论家优势估计、策略与价值函数之间的参数共享以及系统级执行发展。ReMax [12 (https://arxiv.org/html/2608.19842#bib.bib12)] 和 RLOO [2 (https://arxiv.org/html/2608.19842#bib.bib13)] 用贪婪或留一法基线取代了学习的价值,而 GRPO [17 (https://arxiv.org/html/2608.19842#bib.bib1)] 在每个提示组内归一化奖励。消除价值网络减少了参数和优化器状态,但这些估计器需要额外的解码轨迹,并且不提供跨状态的价值泛化。VinePPO [9 (https://arxiv.org/html/2608.19842#bib.bib14)] 通过分支蒙特卡洛延续获得中间价值估计,同样是以评论家训练换取增加的 rollout 计算。参数共享方法在减少模型复制的同时保留了显式的价值学习。Hydra-PPO [15 (https://arxiv.org/html/2608.19842#bib.bib15)] 在冻结骨干网络上放置策略和价值适配器;J-Hydra [15 (https://arxiv.org/html/2608.19842#bib.bib15)] 进一步共享了可训练的适配器,但两个目标之间存在潜在干扰。POISE [3 (https://arxiv.org/html/2608.19842#bib.bib10)] 使用轻量级探针从演员隐藏状态预测回报,但依赖跨 rollout 构建来将价值估计与被评估的轨迹解耦。SAO [6 (https://arxiv.org/html/2608.19842#bib.bib11)] 通过异步单次 rollout 收集解决了 rollout 利用不足的问题,同时保留了一个单独预训练的评论家并进行更频繁的价值更新。HybridFlow [18 (https://arxiv.org/html/2608.19842#bib.bib27)] 则通过模型放置、重分片和调度改进分布式执行,这独立于优势估计器。SAPO 的独特之处在于在一个因果自回归模型中联合表示策略、状态价值和动作价值,从而消除了组采样和单独的评论家骨干网络,同时保留了显式的时间信用分配。
## 3 预备知识
#### 多轮智能体 RL。我们考虑基于 LLM 的智能体与环境进行多轮交互的 RL,其中交互过程被建模为有限视野马尔可夫决策过程(MDP)。给定一个任务实例 x ∈ p(X)\\boldsymbol\{x\}\\in p(X),在每一轮 t=1,2,...,Tt=1,2,\\ldots,T,智能体策略 πθ\\pi_\{\\theta\} 观测一个状态 st∈S\\boldsymbol\{s\}_\{t\}\\in\\mathcal\{S\} 并生成一个文本动作 at∈A\\boldsymbol\{a\}_\{t\}\\in\\mathcal\{A\},然后转换到下一个状态 st+1∈S\\boldsymbol\{s\}_\{t+1\}\\in\\mathcal\{S\},同时产生一个标量奖励 rt∈Rr_\{t\}\\in\\mathbb\{R\}。交互展开为一条轨迹 τ=\{(s1,a1,r1),(s2,a2,r2),...,(sT,aT,rT)\}\\boldsymbol\{\\tau\}=\\{(\\boldsymbol\{s\}_\{1\},\\boldsymbol\{a\}_\{1\},r_\{1\}),(\\boldsymbol\{s\}_\{2\},\\boldsymbol\{a\}_\{2\},r_\{2\}),\.\.\.,(\\boldsymbol\{s\}_\{T\},\\boldsymbol\{a\}_\{T\},r_\{T\})\\},其中 T T 表示交互轮次中的轨迹长度。在实际任务如 ALFWorld 中,智能体为每个观测生成一个响应作为其动作。这个响应被结构化在  和 <action> 标签内,前者包含推理过程,而后者指定了在环境中执行的实际动作。值得注意的是,对于大多数任务设置,奖励信号是稀疏且延迟的,例如,环境仅在轨迹终止后提供一个结果奖励 R(τ)R(\\boldsymbol\{\\tau\})。
### 3.1 组相对策略优化
近期面向 LLM 的智能体 RL 方法普遍采用组相对策略优化范式。给定一个任务实例 x\\boldsymbol\{x\},旧策略 πθold\\pi_\\{\\theta_\\{\\rm old\\}\\} 采样一组 N 个候选轨迹 Gx=\{τ1,τ2,...,τN\}\\mathcal\{G\}_\\{x\}=\\{\\boldsymbol\{\\tau\\}_\\{1\\},\\boldsymbol\{\\tau\\}_\\{2\\},\\ldots,\\boldsymbol\{\\tau\\}_\\{N\\}\\},其中每个轨迹对应一次完整的 rollout。每个轨迹 τi\\boldsymbol\{\\tau\\}_\\{i\\} 获得一个标量奖励 R(τi)R(\\boldsymbol\{\\tau\\}_\\{i\\}),该奖励反映了生成结果的总体质量或成功度。在 PPO [16 (https://arxiv.org/html/2608.19842#bib.bib16)] 中,策略使用评论家网络学习优势函数 A(st,at)A(\\boldsymbol\{s\\}_\\{t\\},\\boldsymbol\{a\\}_\\{t\\}),而基于组的 RL 仅使用采样组内的统计信息计算优势:A(τi)=GroupNormalization({R(τi)}i=1N)A(\\boldsymbol\{\\tau\\}_\\{i\\})=\\mathtt\{GroupNormalization\\}(\\{R(\\boldsymbol\{\\tau\\}_\\{i\\})\\}_\\{i=1\\}^\\{N\\})。在 GRPO [17 (https://arxiv.org/html/2608.19842#bib.bib1)] 中,优势通过将每个轨迹奖励与组奖励 ({R(τi)}i=1N)(\\{R(\\boldsymbol\{\\tau\\}_\\{i\\})\\}_\\{i=1\\}^\\{N\\}) 的均值和方差进行归一化来评估。这种基于采样的估计器减少了传统 PPO 中评论家架构引入的内存和计算开销。
### 3.2 近端策略优化
近端策略优化(PPO)是

相似文章

面向智能体强化学习的单次生成异步优化

Hugging Face Daily Papers

本文提出了单次生成异步优化(SAO),以解决异步强化学习在智能体任务中的稳定性和离策略挑战,在编码和推理基准测试上优于GRPO及其变体。SAO已部署在GLM-5.2模型的智能体强化学习流程中。

软自适应策略优化

Papers with Code Trending

SAPO引入了一个平滑、温度控制的门控机制,以自适应地减弱强化学习中的离策略更新,与使用硬裁剪的方法相比,提升了训练稳定性和性能。

GAGPO:广义优势分组策略优化

arXiv cs.AI

GAGPO提出了一种无评论家的强化学习方法,在多方交互的自主任务中,利用非参数分组价值代理进行步级信用分配,在ALFWorld和WebShop上超越了强基线模型。

Z.ai的稳定异步强化学习(13分钟阅读)

TLDR AI

本文介绍了单rollout异步优化(SAO)技术,用于解决LLM后训练中异步RL的稳定性和异策略挑战,并证明SAO在智能体编码和推理基准测试上持续优于GRPO。