Gated-BEPO:面向大型语言模型智能体的置信门控贝尔曼信用分配
摘要
Gated-BEPO 是一种针对 LLM 智能体的新型信用分配方法,它利用贝尔曼不动点估计从经验回放图中推导出步骤级信用,并通过置信门将步骤级信用与回合级信用自适应地融合。在 WebShop、ALFWorld 和视觉 Sokoban 上的实验表明,相对于现有无评论家方法,该方法具有一致性的改进。
arXiv:2608.06861v1 公告类型:新
摘要:在长时域环境中训练大型语言模型智能体,需要将稀疏的最终结果归因于各个动作。现有的无评论家方法将轨迹级奖励均匀地分配到各个步骤,而近期方法通过匹配重复状态构建步骤级分组,并比较组内动作。前者无法区分失败轨迹中的有效动作与成功轨迹中的无效动作。后者依赖于直接从个体轨迹结果中得出的步骤信用,并采用固定权重与回合级信用进行融合。我们提出 Gated-BEPO,该方法从经验回放图中推导步骤级信用。对于每个回放组,Gated-BEPO 构建一个经验图,并通过均值备份贝尔曼不动点估计节点值,该不动点反映了当前策略的经验动作分布。然后,我们使用广义优势估计沿着每条采样轨迹累积这些时间差分残差,得到步骤级贝尔曼优势,同时捕捉即时和后续影响。为了自适应地融合回合级和步骤级信用,置信门仅在具有多个观测后继状态的状态下纳入贝尔曼信用,否则使用回合级信用。在 WebShop、ALFWorld 和视觉 Sokoban 上的实验表明,在语言模型和视觉-语言模型上均表现出一致的改进,而诊断性消融实验支持了贝尔曼不动点价值估计的有效性,并表明步骤级信用应被选择性地而非均匀地纳入最终优势。
查看缓存全文
缓存时间: 2026/08/10 07:59
# 面向大型语言模型智能体的置信门控贝尔曼信用分配
Source: https://arxiv.org/html/2608.06861
###### 摘要
在长时程环境中训练大型语言模型智能体,需要将稀疏的最终结果产生的信用分配给各个动作。现有的无评论家(critic-free)方法将轨迹级奖励均匀地传播到每一步,而近期的方法则通过匹配重复状态来构建步级分组,并比较每个分组内的动作。前者无法在失败轨迹中区分有效动作与成功轨迹中的无效动作。后者依赖于直接从单个轨迹结果中推导出的步级信用,并与情节级信用进行固定权重融合。我们提出 Gated-BEPO,它从经验轨迹图中推导出步级信用。对于每个轨迹分组,Gated-BEPO 构建一个经验图,并通过均值备份贝尔曼不动点估计节点值,该不动点反映了当前策略的经验动作分布。然后,我们使用广义优势估计将这些时序差分残差沿每条采样轨迹累积,得到能够捕捉即时与后续影响的步级贝尔曼优势。为了自适应地融合情节级与步级信用,一个置信门仅在具有多个观测后继状态的状态处纳入贝尔曼信用,而在其他情况下使用情节级信用。在 WebShop、ALFWorld 和视觉 Sokoban 上的实验表明,在语言模型和视觉-语言模型上均取得了一致的改进,而诊断性消融实验支持了贝尔曼不动点价值估计的有效性,并表明步级信用应选择性地而非均匀地融入最终优势中。
††footnotetext:代码:https://github.com/Y-Claw/Gated-BEPO.git
## 引言
大型语言模型越来越多地被用作交互式智能体,它们可以浏览网页界面、在具身环境中操作物体,并解决多步规划任务 (Yao et al. 2023 (https://arxiv.org/html/2608.06861#bib.bib36); Qin et al. 2024 (https://arxiv.org/html/2608.06861#bib.bib19); Shinn et al. 2023 (https://arxiv.org/html/2608.06861#bib.bib25); Wang et al. 2024 (https://arxiv.org/html/2608.06861#bib.bib31))。与静态文本生成不同,这些场景要求智能体在观察到稀疏的任务结果之前,在长时程内与环境交互 (Arjona-Medina et al. 2019 (https://arxiv.org/html/2608.06861#bib.bib2); Pignatelli et al. 2024 (https://arxiv.org/html/2608.06861#bib.bib17); Harutyunyan et al. 2019 (https://arxiv.org/html/2608.06861#bib.bib8))。因此,信用分配对于智能体训练至关重要,因为一个早期动作可能只有在许多后续交互之后才会影响成功 (Zhang2026 (https://arxiv.org/html/2608.06861#bib.bib38); Tan et al. 2026 (https://arxiv.org/html/2608.06861#bib.bib30))。无评论家方法(如 GRPO)避免了学习评论家的成本和稳定性问题,但它们通常通过将相同的结果派生优势分配给每一步来优化轨迹级回报 (Shao et al. 2024 (https://arxiv.org/html/2608.06861#bib.bib24); Chen et al. 2025 (https://arxiv.org/html/2608.06861#bib.bib4); Yu et al. 2025 (https://arxiv.org/html/2608.06861#bib.bib37))。这种粗略的归因可能会减慢学习速度并限制最终性能,因为它会强化成功轨迹中的无效动作,同时惩罚失败轨迹中的有用动作。如图1 (https://arxiv.org/html/2608.06861#Sx1.F1) 所示,GRPO 改进更慢,且收敛到的成功率远低于其他方法。
参见说明图1:ALFWorld 成功率 (Qwen2.5-1.5B)。
参见说明图2:代表性无评论家方法中的信用分配。Gated-BEPO 提供细粒度的步级信用,通过共享的下游状态传播信息,评估经验预期回报,并使用置信门控在局部证据较弱时稳定贝尔曼信用。
因此,除了轨迹级归因之外,近期的一些智能体强化学习方法试图从轨迹分组中构建细粒度的步级信号 (Zhang2026 (https://arxiv.org/html/2608.06861#bib.bib38); Tan et al. 2026 (https://arxiv.org/html/2608.06861#bib.bib30))。一些近期方法利用不同轨迹中的重复观测或历史来构建步级分组,以实现更细粒度的信用分配。GiGPO 和 HGPO 通过状态匹配或历史感知匹配来比较同一步分组中的动作 (Feng et al. 2026 (https://arxiv.org/html/2608.06861#bib.bib7); He et al. 2026 (https://arxiv.org/html/2608.06861#bib.bib9))。GAGPO 则构建一个分组回报代理,并通过 TD/GAE 风格的时间优势进行传播 (Zhu et al. 2026 (https://arxiv.org/html/2608.06861#bib.bib39))。然而,这些方法并未明确考虑跨轨迹共享的下游转移结构。GraphGPO 通过合并不同轨迹中的共享观测来构建状态转移图,并使用到观测到的成功终止状态的最短路径的倒数作为状态价值信号 (Cheng et al. 2026 (https://arxiv.org/html/2608.06861#bib.bib5))。然而,当相同的观测对应不同的潜在状态时,这种构建可能会遭受感知混叠问题 (Brafman and Shani2004 (https://arxiv.org/html/2608.06861#bib.bib3))。此外,现有方法并未使用局部比较证据来决定何时应用步级信用以及保留多少情节级信用。
为了解决这些局限性,我们提出了 Gated-BEPO,这是贝尔曼估计策略优化(BEPO)的一种门控变体,用于从经验轨迹图中进行无评论家步级信用分配。对于每个轨迹分组,Gated-BEPO 将相同的观测状态合并为一个经验状态图,并使用均值备份贝尔曼不动点来估计当前策略下图节点的值。贝尔曼评估之后,Gated-BEPO 计算不动点时序差分残差,并使用广义优势估计将其沿每条轨迹传播。通过这种方式,Gated-BEPO 通过减少轨迹级估计噪声并降低对感知混叠的敏感性,保留了图聚合的优势。
此外,局部价值比较需要经验替代方案,而其可靠性也应决定它们对策略更新的影响强度。因此,Gated-BEPO 使用图置信门来控制不动点信用的可用性和相对贡献。在没有多个观测后继状态的状态下,局部图无法为比较替代转移提供经验基础;因此,不动点优势被抑制,学习依赖于完整的分组相对结果优势。在存在观测分支的状态下,不动点优势被激活并赋予更大的相对权重,而结果贡献被减少但作为稳定的全局信号保留。这种基于置信度的混合防止了不受支持的局部估计影响策略,并防止受支持的步级信用被轨迹级结果淹没。
为了使这些区别具体化,表1 (https://arxiv.org/html/2608.06861#Sx1.T1) 总结了代表性无评论家步级信用估计器之间的关键差异。图2 (https://arxiv.org/html/2608.06861#Sx1.F2) 则对比了这些方法在四种轨迹模式下的表现,说明均匀结果信用、状态匹配和图距离信用在哪些情况下可能不足。它还展示了 Gated-BEPO 如何将行为策略评估与证据门控的步级信用相结合来处理这些情况。
表 1:无评论家步级信用估计器比较。
总体而言,我们的贡献总结如下。
参见说明图3:Gated-BEPO 优势计算流程概述。Gated-BEPO 构建经验轨迹图,推导不动点步级信用,应用与结果信用的置信门控混合,并将得到的记录优势广播到有效的响应令牌。
- 我们提出了一种无评论家的贝尔曼不动点估计器,用于推导状态值并帮助减少信用估计中的噪声。
- 我们引入了置信门控信用混合,利用局部图证据来门控贝尔曼信用,并决定如何平衡结果级和步级信用。这可以防止不受支持的局部估计引入噪声,并防止可靠的步级信用被粗略的结果信号淹没。
- 我们在匹配的训练和评估协议下,在 WebShop、ALFWorld 和视觉 Sokoban 上评估了 Gated-BEPO。实验表明,在 Qwen2.5 文本和视觉-语言主干网络上均表现出强劲的性能,成功率比最强方法高出最多 4.1 个百分点,消融实验支持了贝尔曼不动点信号、置信门以及平衡的结果-步级融合的重要性。
## 相关工作
##### 基于结果的信用分配。
大型语言模型智能体将语言模型从静态预测扩展到与外部环境的多步交互 (Liu et al. 2024 (https://arxiv.org/html/2608.06861#bib.bib13); Schick et al. 2023 (https://arxiv.org/html/2608.06861#bib.bib21))。近期工作使用自生成的交互轨迹和在线强化学习来训练或自我改进网络智能体 (Patel et al. 2024 (https://arxiv.org/html/2608.06861#bib.bib16); Qi et al. 2025 (https://arxiv.org/html/2608.06861#bib.bib18); Wei et al. 2025b (https://arxiv.org/html/2608.06861#bib.bib33))。这种训练通常依赖于轨迹级结果 (Christiano et al. 2017 (https://arxiv.org/html/2608.06861#bib.bib6); Stiennon et al. 2020 (https://arxiv.org/html/2608.06861#bib.bib27); Ouyang et al. 2022 (https://arxiv.org/html/2608.06861#bib.bib15))。无评论家的分组相对目标避免了学习评论家并降低了训练成本,但它们根据最终回报分配信用 (Ahmadian et al. 2024 (https://arxiv.org/html/2608.06861#bib.bib1))。过程监督可以提供更细粒度的步级标签 (Lightman et al. 2024 (https://arxiv.org/html/2608.06861#bib.bib12)),但它需要外部标注或过程奖励模型。这些局限性促使我们寻找一种无评论家方法,它可以从稀疏的环境奖励和智能体自身的轨迹结构中恢复信息丰富的步级信用,而无需人工步骤标签或辅助学习奖励/价值模型。
##### 步级信用分配。
近期的智能体强化学习方法寻求更细粒度的信用分配,同时保留基于组的优化优势 (Kazemnejad et al. 2025 (https://arxiv.org/html/2608.06861#bib.bib11))。回合级奖励设计和分层轨迹分解为多轮或结构复杂的智能体推导出更细粒度的信号 (Wei et al. 2025a (https://arxiv.org/html/2608.06861#bib.bib32); Luo et al. 2025 (https://arxiv.org/html/2608.06861#bib.bib14))。GiGPO (Feng et al. 2026 (https://arxiv.org/html/2608.06861#bib.bib7)) 通过匹配重复的锚定状态构建步级分组,并结合情节级和步级相对优势。HGPO (He et al. 2026 (https://arxiv.org/html/2608.06861#bib.bib9)) 通过将步骤分配到多个历史感知分组并自适应地聚合其优势来解决上下文不一致问题。GAGPO (Zhu et al. 2026 (https://arxiv.org/html/2608.06861#bib.bib39)) 构建一个分组回报代理,并将其用于 TD/GAE 风格的时间优势。GraphGPO (Cheng et al. 2026 (https://arxiv.org/html/2608.06861#bib.bib5)) 将轨迹聚合为状态转移图,并根据图距离目标下朝向目标的进展分配边信用。总体而言,这些方法要么从轨迹回报中推导步级信用而不建模共享的下游转移结构,要么依赖乐观的图距离值,这在感知混叠下可能不稳定。它们还缺乏一种基于证据的机制来联合决定何时局部步级信用是可靠的,以及应保留多少情节级信用。
## 方法
### 问题设置
我们考虑一个由 π_θ 参数化的大型语言模型智能体。对于初始任务实例 x,智能体在每个交互步骤生成一个环境动作,并接收下一个文本观测和环境奖励。一条轨迹为
τ=(s_0,a_0,r_0,s_1,...,s_{T−1},a_{T−1},r_{T−1},s_T), (1) 其中 s_t 是一个可哈希键,源自于环境提供的观测(文本环境中为文本,视觉环境中为图像),a_t 是一个完整的语言模型响应,被解释为环境动作,r_t 是转移奖励。对于每个任务实例,我们从相同的初始状态采样一个包含 K 条轨迹的轨迹组。我们将每个环境步骤 (s_t,a_t,r_t,s_{t+1}) 称为一个轨迹记录。其标量优势由构成 a_t 的有效响应令牌共享。
### 方法概述
如图3 (https://arxiv.org/html/2608.06861#Sx1.F3) 所示,Gated-BEPO 通过置信门控混合,将分组相对结果优势与不动点步优势相结合。当没有观察到不同的后继状态时,该门使方法完全依赖于结果信用。一旦观察到局部比较证据,它就激活不动点优势并降低结果贡献的权重。
对于轨迹记录 i,设 u(i) 标识其任务级轨迹分组,s_i 为其源状态,s'_i 为其后继(或一个吸收终止状态 ⊥)。我们定义其混合优势为
\widehat{A}_i = η_i \widehat{A}_i^{out} + w ρ(s_i) \widehat{A}_i^{FP}, (2) 其中 \widehat{A}_i^{out} 是一个分组相对结果优势,\widehat{A}_i^{FP} 是一个不动点步优势,ρ(s_i)∈{0,1} 是一个图置信门,η_i 是一个互补的结果权重,w 控制步信号的贡献。
### 经验图与贝尔曼不动点
对于每个轨迹分组,独立地,我们将相同的观测合并为一个共享状态。由此产生的经验图保留了观测到的转移多重性。具体来说,令
E(s) = {(r_i,s'_i): s_i = s} (3) 为从状态 s 出发的出边转移多重集。具有相同起始和结束状态的多个记录将被计为不同的边。
我们直接从经验图中估计状态值,无需学习评论家。终止转移通向表示成功、失败或截断的结果类型吸收状态,其值设为零。我们使用以下均值贝尔曼备份来更新每个非终止状态 (Sutton1988 (https://arxiv.org/html/2608.06861#bib.bib28)):
V^{(k+1)}(s) = \frac{1}{|E(s)|} \sum_{(r,s') \in E(s)} [r + \gamma V^{(k)}(s')]. (4) 其中 k 表示贝尔曼备份迭代次数。对转移多重集 E(s) 上的这些贝尔曼目标进行平均,可以估计当前策略下的预期回报。当 γ<1 时,公式4 (https://arxiv.org/html/2608.06861#Sx3.E4) 中的算子在有限经验图上是收缩的,因此具有唯一不动点。我们用蒙特卡洛回报初始化迭代,并运行贝尔曼相似文章
面向长视界语言智能体的里程碑引导策略学习
本文介绍了 BEACON,这是一种旨在改善长视界语言智能体的信用分配和采样效率的里程碑引导策略学习框架。在 ALFWorld、WebShop 和 ScienceWorld 等基准测试上,该框架表现出显著优于 GRPO 和 GiGPO 的性能提升。
MileGPO:基于局部证据的里程碑推理用于长期LLM代理的图策略优化
MileGPO提出了一种用于长期LLM代理信用分配的方法,该方法利用基于局部证据的里程碑推理,并在ALFWorld和WebShop基准测试中实现了最先进的性能。
BiPACE: 面向LLM智能体的双模拟引导策略优化与动作反事实估计
BiPACE提出了一种即插即用的优势估计器,用于修复LLM智能体逐步分组强化学习中的状态-动作信用分配错配问题。该方法利用双模拟引导的状态聚类和动作反事实估计,在ALFWorld、WebShop和TextCraft基准上,配合Qwen2.5模型实现了显著的性能提升。
GAGPO:广义优势分组策略优化
GAGPO提出了一种无评论家的强化学习方法,在多方交互的自主任务中,利用非参数分组价值代理进行步级信用分配,在ALFWorld和WebShop上超越了强基线模型。
通过反事实推理路径减少信用分配方差
提出隐式行为策略优化(IBPO),一种基于反事实比较的信用分配框架,通过将稀疏的终端奖励转化为对步骤敏感的学习信号,提升了大型语言模型在多步推理任务中的训练稳定性和性能。