过程奖励引导的树状展开实现高效多轮强化学习
摘要
提出PaTR,一个过程奖励引导的自适应树状展开框架,用于LLM智能体的多轮强化学习。它选择性地从有希望的中间状态进行分支,并剪枝死胡同路径,在相同训练预算下,在SWE-Bench上最高提升+5.0,在FrozenLake上提升+9.3。
arXiv:2607.15610v1 公告类型:新
摘要:强化学习(RL)已成为训练LLM智能体的关键方法,但GRPO/RLOO等流行方法依赖多个独立采样的完整轨迹来进行优势估计。在长周期智能体任务中,这种均匀的展开策略可能将预算浪费在无信息的死胡同尝试上,而有希望的中间状态却得不到充分探索。智能体轨迹的多轮结构,包含交错的行动和观测,自然支持将一组轨迹组织成一棵树,其中每个轮次作为探索的决策点。这一视角将有效探索重新定义为决定在何处分支的问题。我们提出了过程评分器引导的自适应树状展开(PATR),一种用于多轮智能体RL的质量感知展开框架。PATR使用适合任务的过程反馈来评分部分轨迹,从有希望的状态选择性地分支,重用共享前缀,并保守地停止退化路径以减少无效采样。由此产生的展开组与标准策略优化兼容,同时在相同训练预算下提供更高效的探索。我们在FrozenLake和具有挑战性的SWE-Bench上评估了PATR,后者此前尚未被树状展开智能体RL方法充分探索。实验表明,PATR在SWE-Bench上性能提升高达+5.0分,在FrozenLake上提升+9.3分,突出了过程引导的树状展开作为可扩展多轮RL的一种有效策略。
查看缓存全文
缓存时间: 2026/07/20 09:34
# 过程奖励引导的自适应树展开:面向高效多轮强化学习
**来源:** https://arxiv.org/html/2607.15610
Xintong Li¹, Sha Li², Yuwei Zhang¹, Changlong Yu², Rongmei Lin², Hongye Jin², Shuyi Guan³, Xin Liu², Linwei Li², Qingyu Yin², Jingbo Shang¹
¹加州大学圣地亚哥分校
²亚马逊
³麻省理工学院校友
{xil240,jshang}@ucsd.edu
[email protected]
###### 摘要
强化学习(RL)已成为训练大语言模型智能体的关键方法,但GRPO/RLOO等主流方法依赖于多次独立采样的完整轨迹进行优势估计。在长周期智能体任务中,这种均匀展开策略可能将预算浪费在无信息的死胡同尝试上,而具有前景的中间状态却得不到充分探索。智能体轨迹的多轮结构——动作与观察交替出现——天然支持将轨迹组组织成树形结构,其中每一轮作为决策点进行探索。这一视角将有效探索重新定义为决定在何处分支的问题。我们提出**过程评分引导的自适应树展开(PaTR)**,一种面向多轮智能体RL的、注重质量的展开框架。PaTR利用任务适配的过程反馈来评估部分轨迹,从有前景的状态选择性分支,复用共享前缀,并保守地终止退化路径以减少采样浪费。生成的展开组仍可与标准策略优化兼容,同时在相同训练预算下提供更高效的探索。我们在FrozenLake和具有挑战性的SWE-Bench上评估了PaTR,后者在以往的树展开智能体RL方法中尚未得到充分探索。实验表明,PaTR在SWE-Bench上提升性能高达+5.0+5.0个百分点,在FrozenLake上提升+9.3+9.3个百分点,凸显了过程引导的树展开作为可扩展多轮RL有效策略的价值。
---
**过程奖励引导的自适应树展开:面向高效多轮强化学习**
Xintong Li¹*, Sha Li², Yuwei Zhang¹, Changlong Yu², Rongmei Lin², Hongye Jin², Shuyi Guan³, Xin Liu², Linwei Li², Qingyu Yin², Jingbo Shang¹
¹加州大学圣地亚哥分校
²亚马逊
³麻省理工学院校友
{xil240,jshang}@ucsd.edu
[email protected]
## 1 引言
大语言模型(LLM)越来越多地被训练为智能体,通过与环境的多轮交互(包括工具使用、反馈和外部观察)来解决问题[Yao et al., 2022 (https://arxiv.org/html/2607.15610#bib.bib48); Schick et al., 2023 (https://arxiv.org/html/2607.15610#bib.bib49); Shinn et al., 2023 (https://arxiv.org/html/2607.15610#bib.bib50)]。诸如GRPO [Shao et al., 2024 (https://arxiv.org/html/2607.15610#bib.bib2)]之类的强化学习(RL)已成为提升此类智能体能力的标准方法。然而,目前大多数GRPO风格的智能体训练仍然依赖于独立采样的完整轨迹[Li et al., 2026a (https://arxiv.org/html/2607.15610#bib.bib51)]。这种展开策略将计算均匀分配给各条轨迹,而不考虑其中间质量。对于长周期智能体任务,这种均匀分配可能将预算浪费在无信息的轨迹上(如重复的工具使用循环),而具有前景的中间状态却得不到充分探索。结果,展开组可能包含冗余或低价值的轨迹,导致探索效率低下和优势估计噪声偏大。
(见图1说明)
**图1:PaTR概览。** 任务适配的过程评估器评估部分轨迹,并通过扩展、保留和剪枝引导自适应展开。最终展开组使用任务奖励进行标准GRPO优化。
最近的研究开始通过树形结构化采样、动态分支和步骤级反馈来改进展开生成。在单轮推理中,基于树的方法复用共享前缀并从中间状态探索多个后续分支,这表明展开构建本身可以成为RL训练的重要组成部分[Surana et al., 2026 (https://arxiv.org/html/2607.15610#bib.bib46); Xing et al., 2025 (https://arxiv.org/html/2607.15610#bib.bib47)]。这一想法对于多轮智能体更为关键,因为每个动作都会改变未来上下文,而最终奖励往往稀疏或延迟[Feng et al., 2026 (https://arxiv.org/html/2607.15610#bib.bib4); Djuhera et al., 2026 (https://arxiv.org/html/2607.15610#bib.bib15)]。尽管如此,现有的多轮树展开方法在如何引导探索方面存在关键局限。一类方法围绕高熵的工具使用步骤进行分支[Dong et al., 2025b (https://arxiv.org/html/2607.15610#bib.bib1), a (https://arxiv.org/html/2607.15610#bib.bib17)],或利用基于价值的不确定性估计来分配展开预算[Cao et al., 2026 (https://arxiv.org/html/2607.15610#bib.bib16)]。虽然这些信号鼓励探索,但它们并不直接衡量部分轨迹是否在朝着任务目标取得有意义的进展。另一类方法应用每轮搜索来选取每一步得分最高的动作[Djuhera et al., 2026 (https://arxiv.org/html/2607.15610#bib.bib15)],这可能会使展开分布偏离当前策略,并丢弃信息丰富的负面示例。这些局限促使我们提出一种分配预算时基于过程级轨迹质量、同时保留多样化结果(包括失败结果)用于策略学习的展开机制。
我们提出**过程评分引导的自适应树展开(PaTR)**,一种面向多轮智能体RL的成本效益型展开生成框架,它将更多展开预算分配给有前景的部分轨迹,同时提前终止无前景的轨迹。对于每个训练实例,PaTR构建一个部分轨迹树,而不是从头开始独立采样完整轨迹。我们定期使用任务自适应过程评估器评估活动分支,并将其路由到三条路径之一:高评分分支通过从相同中间状态采样多个子分支进行*扩展*;中等评分分支*存活*到下一次迭代;低评分或退化分支被提前*剪枝*。剪枝的分支不会被丢弃,而是保留下来,以保持展开多样性并作为策略优化的负例。由于子分支继承其父分支的前缀,PaTR自然复用了共享计算,并在相当的采样预算下生成信息量更丰富的展开轨迹。然后,我们在生成的展开组上采用标准GRPO策略优化,使用相同的最终奖励,避免直接针对辅助过程评估器进行优化。
我们在FrozenLake和更具挑战性的SWE-Bench上评估了PaTR。FrozenLake提供了一个可控测试平台,其中过程质量可以通过简单的进展启发式方法进行评估;而SWE-Bench则评估过程引导的树展开是否能支持现实的长周期编码智能体任务。实验表明,PaTR在SWE-Bench上提升性能高达+5.0+5.0个百分点,在FrozenLake上提升+9.3+9.3个百分点,凸显了过程引导的展开构建对高效多轮RL的价值。
我们的贡献总结如下:
- • 我们提出**PaTR**,一种过程引导的自适应树展开框架,它扩展有前景的部分轨迹,保留存活分支,并剪枝退化路径。
- • 我们保持PaTR与GRPO兼容:仅使用过程反馈进行展开分配,而使用标准最终奖励优化策略。
- • 我们在FrozenLake和SWE-Bench上验证了PaTR,显示出相比GRPO和其他展开生成基线的一致提升。
## 2 相关工作
#### 面向智能体RL的自适应展开生成。GRPO [Shao et al., 2024 (https://arxiv.org/html/2607.15610#bib.bib2)] 以及后续的基于RL的推理和智能体方法,如DeepSeek-R1 [Guo et al., 2025 (https://arxiv.org/html/2607.15610#bib.bib3)] 和ARPO [Dong et al., 2025b (https://arxiv.org/html/2607.15610#bib.bib1)],通常为每个任务采样多条轨迹,并从最终奖励计算组相对优势。最近的工作通过结构化或自适应采样改进了这一展开过程。ARPO [Dong et al., 2025b (https://arxiv.org/html/2607.15610#bib.bib1)] 和AEPO [Dong et al., 2025a (https://arxiv.org/html/2607.15610#bib.bib17)] 围绕高熵工具使用步骤进行分支;ATPO [Cao et al., 2026 (https://arxiv.org/html/2607.15610#bib.bib16)] 在医疗对话中使用不确定性估计分配展开预算;TSR [Djuhera et al., 2026 (https://arxiv.org/html/2607.15610#bib.bib15)] 在训练时展开生成中应用树搜索。基于树的推理方法,如思维树 [Yao et al., 2023 (https://arxiv.org/html/2607.15610#bib.bib12)]、RAP [Hao et al., 2023 (https://arxiv.org/html/2607.15610#bib.bib13)] 和树搜索智能体 [Koh et al., 2024 (https://arxiv.org/html/2607.15610#bib.bib14)],也探索多个后续分支,但主要用于推理时的解决方案选择。我们的工作遵循训练时展开的视角,但使用过程级质量分数(而非仅熵或不确定性)来引导分支扩展。
#### 过程反馈与步骤级监督。过程奖励模型(PRM)在逐步验证工作中引入,如PRM [Lightman et al., 2024 (https://arxiv.org/html/2607.15610#bib.bib24)]、Math-Shepherd [Wang et al., 2024 (https://arxiv.org/html/2607.15610#bib.bib25)] 和Skywork PRM [He et al., 2025 (https://arxiv.org/html/2607.15610#bib.bib26)],为多步推理提供了中间质量估计。几种方法将这类信号纳入训练目标:PRIME [Cui et al., 2025 (https://arxiv.org/html/2607.15610#bib.bib27)] 推导隐式过程奖励;iStar [Liu et al., 2025 (https://arxiv.org/html/2607.15610#bib.bib28)] 在智能体训练中学习步骤级奖励;WS-GRPO [Mundada et al., 2026 (https://arxiv.org/html/2607.15610#bib.bib29)] 构建弱监督前缀奖励;Step-GRPO [Li et al., 2026b (https://arxiv.org/html/2607.15610#bib.bib23)] 通过结构化过程监督修改GRPO。LLM作为裁判的方法 [Zheng et al., 2023 (https://arxiv.org/html/2607.15610#bib.bib30)] 提供了灵活的替代方案,适用于特定任务PRM不可用的情况,尤其是对于开放式的智能体任务(其中中间进展难以手动指定)。相比之下,我们的方法仅使用过程反馈来分配展开预算,保持策略目标和最终奖励不变。
## 3 预备知识
### 3.1 多轮智能体强化学习
我们考虑面向语言智能体的强化学习,这些智能体通过多轮与外部系统交互来完成任务。给定任务提示xx,经过tt轮后,智能体观察到历史ht=\(x,a1,o1,...,at,ot\),其中at是智能体动作,ot是相应的观察。策略采样下一个动作为at+1∼πθ\(⋅∣ht\)。一条完整的展开轨迹τ=\(x,a1,o1,...,aT,oT\)在终止时获得最终奖励rout\(τ\)。在智能体任务中,这个奖励往往稀疏或延迟,使得展开轨迹质量对策略优化至关重要[Wang et al., 2025 (https://arxiv.org/html/2607.15610#bib.bib52)]。
### 3.2 组相对策略优化
GRPO [Shao et al., 2024 (https://arxiv.org/html/2607.15610#bib.bib2)] 为每个任务采样一组GG条展开轨迹,并计算组归一化奖励,避免了学习价值函数的需要。对于任务xx的展开组中的轨迹τi,最终优势为:
Aiout=riout−μout\(x\)σout\(x\)+ε, (1)
其中riout=rout\(τi\),μout\(x\)和σout\(x\)是该组内最终奖励的均值和标准差。策略通过裁剪的重要性加权目标进行优化:
L\(θ\)=Ex[1G∑i=1G1|τi|∑t=1|τi|min\(ρi,t\(θ\)Aiout, clip\(ρi,t\(θ\),1−ε,1+ε\)Aiout\)], (2)
其中ρi,t\(θ\)=πθ\(ai,t∣hi,t−1\)πθold\(ai,t∣hi,t−1\)是重要性比率。由于优势是相对于采样组计算的,策略学习直接依赖于展开组的质量。然而,标准GRPO从初始任务状态独立采样完整轨迹,而不考虑中间轨迹质量。
## 4 PaTR:过程评分引导的自适应树展开
我们提出**PaTR**(Process-scorer guided Adaptive Tree Rollout),一种面向多轮智能体RL的成本效益型展开生成框架,它将更多展开预算分配给有前景的部分轨迹,并提前终止无前景的轨迹,从共享前缀生成具有多样化结果的组。给定任务提示xx,PaTR构建一个部分轨迹树,并使用中间过程评估器自适应分配展开预算。完整过程总结在算法1 (https://arxiv.org/html/2607.15610#alg1)中。
### 4.1 自适应树构建
PaTR为每个任务提示xx初始化B0个从当前策略采样的活动分支。令A和C分别表示活动分支和已完成分支的集合。在每次迭代中,每个活动分支最多前进KK个交互步骤。在此间隔内终止的分支(例如,成功完成或达到最大步骤预算)将从A移动到C。对于每个剩余的活动分支τit在步骤t(t∈{K,2K,3K,...}),过程评估器Sφ生成一个标量分数:
sit=Sφ\(x,τit\)∈[0,1], (3)
其中分数越高表示部分轨迹越有前景,值得进一步探索。评分后,每个活动分支根据其过程分数被路由到三条路径之一:**扩展**、**存活**或**剪枝**。
**扩展**。高评分分支被选入扩展集E⊆A。对于每个选中的分支τit,PaTR从相同中间状态采样M个子分支:
τit,m∼πθ\(⋅∣x,τit\), m=1,...,M。 (4)
这些子分支共享父分支前缀,并探索不同的后续路径,使PaTR能够将额外样本分配给有前景的中间状态。然后从A中移除父分支,并由其子分支替换。
**存活**。中等评分的分支保持活动状态。它们在下一次迭代中再前进KK步,并用更新的过程分数重新评估。
**剪枝**。当分支τit的过程分数显著低于当前活动集时,PaTR终止该分支:sit<maxj∈A sjt−δ,其中δ是剪枝阈值。被剪枝的分支不会相似文章
TRACE:一种用于高效智能体强化学习的统一展开预算分配框架
TRACE是一个统一的展开预算分配框架,通过基于前缀信息性在树状展开中动态分配资源,增强多轮智能体强化学习中的奖励对比。它在Multi-Hop QA等智能体基准测试上提升了效率和准确性。
ProcessThinker: 通过基于展开的过程奖励增强多模态大语言模型推理
ProcessThinker 引入了一种实用的后训练流程,无需训练显式的过程奖励模型即可提供步骤级的过程奖励。它利用基于展开的奖励为多模态大语言模型中的多步推理提供密集的信用分配,在视频基准测试上持续提升性能。
基于信息增益的展开策略优化:面向多轮LLM智能体的自适应树结构展开方法
提出了IGRPO框架,该框架基于中间状态的信息性为多轮LLM智能体自适应分配展开预算,将自适应树结构探索与策略学习相统一。在七个搜索增强型问答基准上的实验表明,该框架一致优于基线方法。
EfficientRollout:用于RL推演的系统感知自推测解码
EfficientRollout是一个系统感知的自推测解码框架,通过使草稿模型适应不断变化的策略并优化推测解码机制,加速LLM的强化学习推演,将延迟降低高达19.6%。
CacheRL:基于缓存回滚和混合奖励的多轮工具调用智能体
CacheRL训练用于多步工具调用任务的小型智能体基础模型,通过缓存回滚和混合奖励塑造,以100倍更少的计算量实现了92%的过程准确率(接近GPT-5的94%),并在知识迁移、缓存感知奖励以及迭代SFT/GRPO训练方面进行了创新。