RTPO:用于稳定智能体强化学习训练的反序回合策略优化
摘要
论文提出了反序回合策略优化(RTPO)来稳定多轮智能体强化学习训练,通过将展开组织为反序树并按反序执行回合级更新,展示了相较于基线的改进。
arXiv:2608.18682v1 公告类型:新
摘要:用强化学习训练多轮智能体工作流使得大型语言模型能够执行复杂推理、使用外部工具并进行超出单轮设置的迭代搜索。然而,多轮强化学习训练仍然高度不稳定,随着轮次增加常导致严重的性能下降。通过理论分析,我们识别出三个紧密耦合的不稳定来源:展开-训练上下文不匹配、在稀疏终端奖励下的弱回合级信用分配,以及在不同策略版本下优化短和长轨迹时的异步策略漂移。我们表明这些问题在扁平化轨迹优化中具有共同的结构性起源,并通过统一的反序回合公式解决它们。我们提出反序回合策略优化(RTPO),它将多轮展开组织为稀疏反序树,并按时间反序执行回合级策略更新,使每个决策与其下游延续对齐。RTPO实现了因果一致的回合级信用分配和在线延续以控制异步漂移。我们提供理论保证,表明在所提出的回合级公式下,RTPO消除了上下文不匹配和异步漂移,减少了信用偏差,并收敛到递归最优性。在多轮智能体强化学习基准上的实验显示,RTPO在轨迹级和回合级基线上分别改进了21.50%和10.76%,突显了其在支持更稳定的工具使用智能体训练方面的潜力。
查看缓存全文
缓存时间: 2026/08/20 10:19
# 用于稳定智能体强化学习训练的反向回合策略优化 来源:https://arxiv.org/html/2608.18682 ## RTPO:用于稳定智能体强化学习训练的反向回合策略优化 余谷 (Yugu Li) 所属机构:计算机与信息技术学院 所属机构:阿德莱德大学 所属机构:澳大利亚南澳州阿德莱德 5000 电子邮箱:[[email protected]](mailto:[email protected]) 吉米·曹 (Jimmy Cao) 所属机构:计算机与信息技术学院 所属机构:阿德莱德大学 所属机构:澳大利亚南澳州阿德莱德 5000 电子邮箱:[[email protected]](mailto:[email protected]) 乔蒋林 (Jianglin Qiao) 所属机构:计算机科学学院 (ACFR) 所属机构:悉尼大学 所属机构:澳大利亚新南威尔士州坎珀当 2050 电子邮箱:[[email protected]](mailto:[email protected]) 胡思怡 (Siyi Hu) 所属机构:电气工程、计算机与数学科学学院 (EECMS) 所属机构:科廷大学 所属机构:澳大利亚西澳大利亚州本特利 6102 电子邮箱:[[email protected]](mailto:[email protected]) ###### 摘要 使用强化学习训练多轮智能体工作流,使大型语言模型能够执行复杂推理、使用外部工具并进行超越单轮设定的迭代搜索。然而,多轮强化学习训练仍然高度不稳定,通常会随着轮数增加导致严重的性能下降。通过理论分析,我们识别出三个紧密耦合的不稳定来源: rollout–训练 上下文不匹配、在稀疏终端奖励下微弱的回合级信用分配,以及在短轨迹和长轨迹在不同策略版本下进行优化时的异步策略漂移。我们证明这些问题在扁平化轨迹优化中具有共同的结构性根源,并通过统一的反向回合形式化来解决它们。我们提出了 **反向回合策略优化 (Reverse-Turn Policy Optimization, RTPO)**,该方法将多轮 rollout 组织为稀疏的反向树,并按时间逆序执行回合级策略更新,使每个决策与其下游的延续对齐。RTPO 使得因果一致的回合级信用分配和在策略延续成为可能,以控制异步漂移。我们提供理论保证,证明在所提的回合级形式化下,RTPO 消除了上下文不匹配和异步漂移,减少了信用偏差,并收敛至递归最优性。在多轮智能体强化学习基准测试上的实验表明,RTPO 相较于轨迹级和回合级基线分别提升了 21.50% 和 10.76%,凸显了其支持工具使用智能体更稳定训练的潜力。 ## 1 引言 强化学习已成为大型语言模型后期训练的核心范式,特别是当监督来自最终结果奖励而非密集的基于令牌的标签时。通过基于结果的优化,强化学习鼓励诸如规划、自我反思和验证等行为,在单轮数学推理和代码生成任务中取得了强劲成果。受这些进展的推动,近期研究将强化学习扩展到多轮智能体工作流,特别是**工具集成推理 (Tool-Integrated Reasoning, TIR)**,其中智能体在多个回合中迭代推理、调用工具、接收反馈并完善其行为。尽管前景广阔,多轮工作流的强化学习训练仍然不稳定:在短工作流上性能提升的模型,往往在轮数增加时性能下降。这种性能下降不仅仅由于序列变长;它被跨回合的时间依赖性所放大,其中每个决策都会重塑上下文、环境状态和未来的决策分布。现有方法部分缓解了这一问题,但对其成因的分析有限。轨迹级方法(如PPO、GRPO和GSPO)保留了扁平化轨迹范式。回合分解方法(如SeeUPO)提高了更新粒度,但仍然依赖于扁平化的历史记录。基于树的方法(如TreeGRPO和ARPO)使用共享前缀或分支 rollout,但其优势估计并未完全与每个回合对下游延续的因果贡献对齐。总体而言,不稳定性的来源在训练流程层面仍被探讨不足,且现有方法(详见附录A)并未联合解决其共同根源。 在本文中,我们提供理论分析,识别出三个耦合的不稳定来源:**rollout与训练之间的上下文不匹配**(破坏了生成与优化的回合级上下文之间的一致性);**微弱的回合级信用分配**(稀疏的终端奖励掩盖了单个决策的贡献);以及**异步策略漂移**(短轨迹和长轨迹在不断演化的策略的不同版本下进行优化)。尽管这些问题源于训练流程的不同组件,但我们证明它们具有共同的结构性根源。我们在图1中展示了这些来源,并在第2节中进行形式化分析。 **核心挑战**。基于我们的理论分析,我们提出:如何通过确保rollout–训练一致性、回合级信用分配以及控制异步策略漂移来稳定回合级训练,从而提升多轮智能体强化学习的性能?为应对这一挑战,我们提出了**反向回合策略优化 (RTPO)**,一个用于稳定多轮智能体强化学习训练的策略优化框架,理论细节见第3节。其核心思想是将采样交互形式化为稀疏树,并按时间逆序优化回合级策略,通过反向最优性保证将后续回合的延续价值传播回早期回合。通过为每个回合构建兄弟延续,RTPO在匹配的下游条件下估计回合级优势。这消除了扁平化轨迹优化导致的上下文不一致性,通过因果动作对齐减少了回合级信用偏差,并通过在策略延续控制了异步策略漂移。 我们的贡献有四点: (i) 我们识别出多轮智能体强化学习中耦合的不稳定来源:上下文不匹配、微弱的回合级信用以及异步策略漂移。 (ii) 我们提供理论分析,表明这些来源在扁平化轨迹优化中具有共同的结构性根源。 (iii) 我们提出RTPO,一个具有稀疏反向树、回合级在策略更新以及关于递归最优性、上下文一致性和减少信用偏差的理论保证的反向回合策略优化框架。 (iv) 我们在多轮智能体强化学习基准测试上验证了RTPO,它优于包括GRPO、TreeGRPO、ARPO和SeeUPO在内的强基线,同时进一步稳定了训练流程。 > 图 1:在多轮智能体强化学习中识别出的训练不稳定性源于:(A) rollout–训练上下文不匹配,(B) 仅基于轨迹的信用分配,以及 (C) 长时域策略漂移。 ## 2 理论分析:训练不稳定性 我们认为多轮强化学习训练的不稳定性源于 **rollout–训练不匹配**:rollout通常在截断或摘要的上下文中生成,而训练则在拼接的完整历史上下文中重新计算似然比。这种差异会偏差策略优化,并在长时域中恶化。此外,扁平化的完整历史形式化仅提供轨迹级信用,导致终端奖励掩盖了各个回合。当轨迹异步生成时,这种不匹配进一步引发策略漂移,因为在较旧策略下生成的长轨迹可能在策略已通过较短轨迹更新后才被优化。 基于这些观察和见解,我们将多轮交互建模为分层马尔可夫决策过程。给定初始提示 q,回合 k 包含模型响应 l_k 和环境反馈 f_k,产生轨迹 (q, l_0, f_0, ..., l_{n-1}, f_{n-1})。回合级状态为 S_k = (q, l_0, f_0, ..., l_{k-1}, f_{k-1}),回合级动作为响应 l_k。每个响应以自回归方式生成为 l_k = (a_{k,1}, ..., a_{k,T_k}),其中令牌级状态为 s_{k,t} = (S_k, a_{k,<t}),环境快照为 snap_k。轨迹级奖励为 R = r_K,其中 r_k = 1 当且仅当最终回合正确回答了查询,否则为 0。 **不稳定性的结构性来源**。我们证明,轨迹级方法(如PPO)和回合级分解方法(如SeeUPO)均采用**扁平化轨迹形式化**,其中完整的交互序列 (q, l_0, f_0, ..., l_{K-1}, f_{K-1}) 被视为一个扁平化的“大动作”空间。这种形式化导致三个结构性缺陷: 1. **上下文不匹配**:在rollout生成期间,动作 a_{k,t} 在上下文 (S_k, a_{k,<t}) 下被采样。然而,在训练期间,为了计算优势估计,似然比 π_θ(a|s) / π_ref(a|s) 通常需要重新评估每个动作在**相同上下文 s**下的概率。但在轨迹级优化中,上下文在训练时由**拼接的历史** (q, l_0, f_0, ..., l_k, f_k, ..., l_{K-1}, f_{K-1}) 形成,这与生成时使用的上下文不同。这种上下文不匹配打破了生成与优化的一致性,使优势估计产生偏差。 2. **微弱的回合级信用分配**:由于奖励是稀疏且终端性的,轨迹级优势估计 A_k^H = Q_k^H - V_k^H 无法区分各个回合 k 对最终回报的贡献。所有回合共享相同的回报 R,导致信用分配信号微弱,尤其是对于早期回合。 3. **异步策略漂移**:由于rollout在当前策略 π_θ 下采样,但训练使用梯度更新策略,因此在 rollout 收集和梯度计算之间,策略已发生变化。对于短轨迹,策略偏移较小;对于长轨迹,策略在生成过程中可能已显著变化,导致策略漂移,即 rollout 所依据的策略与优化时使用的策略不同。 这些缺陷并非独立,而是源于共同的结构性根源:**将回合序列视为单个扁平化轨迹**,从而破坏了回合级的因果结构和在策略一致性。 ## 3 RTPO:反向回合策略优化 为解决上述挑战,我们提出 **反向回合策略优化**。核心思想是将多轮交互形式化为**稀疏反向树**,并按**时间逆序**优化策略,以确保回合级信用分配的因果一致性和在策略延续。 **形式化**:我们将 rollout 路径表示为一棵树。根节点是初始提示 q。每个回合 k 从状态 S_k 开始,选择一个动作(响应)l_k,然后环境反馈 f_k 产生新的状态 S_{k+1}。因此,一条完整的轨迹是从根节点到叶子节点(回合 K-1)的路径。传统的轨迹级方法将这条路径视为一个序列。RTPO 则将其视为一棵树,其中每个节点(状态)可以有多个子节点(不同的可能动作/响应),但 rollout 只采样一条路径(主干)。为了进行回合级优化,RTPO 在每个回合 k 处进行**兄弟分叉**:从主干在状态 S_k 处,生成多个额外的 rollout(兄弟),这些兄弟使用当前策略从 S_k 开始继续生成动作和交互,直到终止。 **反向优化**:在得到树结构后,RTPO 从最后一个回合 (K-1) 开始向前优化。对于回合 K-1,其价值估计很简单,因为它是最后一个回合,其 Q 值就是即时奖励。然后,我们将其价值估计传播到回合 K-2,依次向前,直到回合 0。这种逆序传播确保了每个回合的价值估计都基于其**下游延续的真实价值**。 具体来说,对于回合 k 的某个动作 l_k,其 Q 值估计为: Q̂_k(l_k) = r_k + γ^{τ_k} * F̂_k 其中 τ_k 是回合 k 的时间步长,γ 是折扣因子,r_k 是回合 k 的即时奖励(通常为 0,直到最后一个回合),F̂_k 是对从状态 S_{k+1} 开始的**延续价值**的估计。 **延续价值估计**:F̂_k 是通过在状态 S_{k+1} 处生成的 G-1 个兄弟 rollout 来估计的。每个兄弟 rollout j 从 S_{k+1} 开始,使用当前策略 π_θ(或一个略微更新的策略)继续生成动作,直到终止,获得累积奖励 R_j。然后,F̂_k = (1/(G-1)) * Σ_j R_j(如果γ=1)或考虑折扣。关键点是,这些兄弟 rollout 是从**同一个状态 S_{k+1}** 采样的,因此它们提供了在给定相同下游起点下延续价值的无偏估计。这消除了上下文不匹配,因为兄弟 rollout 的起点 S_{k+1} 与主干在生成 l_k 后达到的状态一致。 **回合级策略更新**:一旦我们为回合 k 的候选动作(来自树)估计了优势 A_k = Q̂_k - V̂_k,我们就可以使用策略梯度方法(如PPO)来更新策略,使得优势高的动作更可能被选择。然后,我们将更新后的策略用于生成更早回合(k-1, k-2, ...)的兄弟 rollout,从而实现逆序优化。 **理论保证**:我们证明RTPO提供了以下保证: - **上下文一致性**:由于兄弟 rollout 从与主干相同的状态分叉,避免了训练时上下文与生成时上下文不匹配的问题。 - **因果信用分配**:通过逆序优化,每个回合的价值评估直接依赖于其下游延续的真实(估计)价值,从而实现了因果一致的信用分配。 - **控制策略漂移**:通过分阶段更新策略并在每个回合使用更新后的策略生成兄弟 rollout,RTPO 控制了策略漂移的程度。更正式地,我们证明在逆序优化框架下,策略更新是“在策略”的,因为用于评估的兄弟 rollout 是由正在优化的策略(或其一个版本)生成的。 - **递归最优性**:在理想情况下(无限样本),RTPO 会收敛到递归最优策略,即每个回合的策略都是对下游策略最优反应的最优响应。 ## 4 实验结果与分析 **实验设置**:我们使用 Qwen3-8B 作为 RTPO 和所有基线的主干模型进行主要实验,在所有多轮智能体强化学习 rollout 中启用 Qwen3 的思考模式。我们将 RTPO 与轨迹级方法(包括 GRPO)以及回合/树级信用方法(包括 ARPO、TreeGRPO 和 SeeUPO)进行比较。我们考虑了 12 个实验,涵盖全面的数学和知识推理基准测试,其中智能体使用外部计算和网络搜索工具进行多轮强化学习训练。所有方法均在 VeRL 中实现,使用 vLLM 进行 rollout 生成,使用 FSDP 进行分布式训练。我们使用任务准确率、工具调用统计、对数概率比较、回合级信用效应以及在策略与离策略输出的命中率来评估训练性能和稳定性。详细的实验设置(包括基础模型、基线、数据集、配置和评估指标)见附录D。实现细节(包括伪代码、源代码、训练细节和 Qwen3 聊天模板)见附录E。 ### 4.1 主要结果 我们比较了 RTPO 与轨迹级方法 GRPO 以及回合级方法 SeeUPO、TreeGRPO 和 ARPO 在多个基准测试上的表现。结果总结如下:
相似文章
过程奖励引导的树状展开实现高效多轮强化学习
提出PaTR,一个过程奖励引导的自适应树状展开框架,用于LLM智能体的多轮强化学习。它选择性地从有希望的中间状态进行分支,并剪枝死胡同路径,在相同训练预算下,在SWE-Bench上最高提升+5.0,在FrozenLake上提升+9.3。
StepPO:面向智能体强化学习的步骤对齐策略优化
StepPO 引入了一种面向智能体强化学习的步骤中心范式,该范式将策略优化与智能体决策粒度对齐,在多轮交互任务中优于以令牌为中心的方法。
基于信息增益的展开策略优化:面向多轮LLM智能体的自适应树结构展开方法
提出了IGRPO框架,该框架基于中间状态的信息性为多轮LLM智能体自适应分配展开预算,将自适应树结构探索与策略学习相统一。在七个搜索增强型问答基准上的实验表明,该框架一致优于基线方法。
A^2TGPO:具有自适应回合级裁剪的代理回合组策略优化
本文介绍了 A^2TGPO,这是一种针对代理式大语言模型(LLMs)的强化学习方法,它利用自适应回合级裁剪和信息增益归一化来改善多轮交互中的过程信用分配。
DRIFT: 解耦轨迹展开与重要性加权微调以实现高效多轮优化
本文提出DRIFT框架,该框架结合离线轨迹与重要性加权监督微调,高效实现与强化学习相当的多轮交互学习性能。