面向长视界语言智能体的里程碑引导策略学习

arXiv cs.CL 论文

摘要

本文介绍了 BEACON,这是一种旨在改善长视界语言智能体的信用分配和采样效率的里程碑引导策略学习框架。在 ALFWorld、WebShop 和 ScienceWorld 等基准测试上,该框架表现出显著优于 GRPO 和 GiGPO 的性能提升。

arXiv:2605.06078v1 发布类型:新文章 摘要:虽然长视界智能体任务要求语言智能体执行数十个连续决策,但使用强化学习训练此类智能体仍然充满挑战。我们确定了两个根本原因:信用错配(即由于终端失败而导致正确的早期动作受到惩罚)以及采样低效(即成功的轨迹稀缺导致学习信号几乎完全丢失)。我们引入了一种名为 BEACON 的里程碑引导策略学习框架,利用长视界任务的组合结构来确保精确的信用分配。BEACON 在里程碑边界处对轨迹进行分段,在段内应用时间奖励塑造以奖励部分进展,并在双尺度上估算优势值,以防止远处的失败污染对局部动作的评估。在 ALFWorld、WebShop 和 ScienceWorld 上,BEACON 始终优于 GRPO 和 GiGPO。值得注意的是,在长视界的 ALFWorld 任务中,BEACON 达到了 92.9% 的成功率,几乎是 GRPO 53.5% 成功率的两倍,同时将有效样本利用率从 23.7% 提高到了 82.0%。这些结果确立了基于里程碑锚定的信用分配作为训练长视界语言智能体的有效范式。代码请访问 https://github.com/ZJU-REAL/BEACON。
查看原文
查看缓存全文

缓存时间: 2026/05/08 07:11

# 基于里程碑引导的长视界语言智能体策略学习

**来源:** https://arxiv.org/html/2605.06078  
**作者:** Yuchen Yan, Hongxing Li, Teng Pan, Dingming Li, Ruiqing Zhang, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen

###### 摘要

尽管长视界智能体任务要求语言智能体执行数十个顺序决策,但使用强化学习训练此类智能体仍然具有挑战性。我们识别出两个根本原因:**信用错误归因(credit misattribution)**,即由于最终失败导致正确的早期动作受到惩罚;以及**样本效率低下(sample inefficiency)**,即稀缺的成功轨迹导致学习信号几乎完全丢失。我们引入了一种名为 **BEACON** 的基于里程碑引导的策略学习框架,该框架利用长视界任务的结构化组合特性来确保精确的信用分配。BEACON 在里程碑边界处分割轨迹,在片段内部应用时序奖励塑形以奖励部分进度,并在双尺度上估计优势以阻止远处的失败污染对局部动作的评估。在 ALFWorld、WebShop 和 ScienceWorld 上,BEACON  consistently 优于 GRPO 和 GiGPO。值得注意的是,在长视界 ALFWorld 任务中,BEACON 取得了 92.9% 的成功率,几乎是 GRPO 53.5% 成功率的两倍,同时将有效样本利用率从 23.7% 提升至 82.0%。这些结果确立了以里程碑为锚点的信用分配作为训练长视界语言智能体的有效范式。代码可在 https://github.com/ZJU-REAL/BEACON 获取。

机器学习,ICML

## 1 引言

大型语言模型智能体在多样化环境中执行复杂任务方面展现出了显著能力(Yao et al., 2023; Schick et al., 2023),包括网页导航(Zhou et al., 2023; Deng et al., 2023)、具身控制(Ahm et al., 2022; Huang et al., 2022; Wang et al., 2025b)以及科学实验(Boiko et al., 2023; Brana et al., 2023)。这些智能体必须执行跨越数十个步骤的决策序列,且成功与否仅在任务完成时确定。通过强化学习训练此类智能体已显示出潜力(Zhang et al., 2025a; Ouyang et al., 2022a),然而当前的策略优化方法随着任务视界的增长难以扩展,表现出随着决策序列变长性能系统性崩溃的现象。

这种崩溃源于轨迹级优化的两个根本局限性,该方法将轨迹视为扁平的动作序列,并仅基于终端结果分配信用。第一个问题是**信用错误归因**:轨迹中的所有动作仅根据终端结果接收相同的好处。当后续动作导致失败时,正确的早期动作会受到惩罚;由于下游随机性的影响,同一动作在不同轨迹中收到相反的梯度信号,导致梯度冲突。第二个问题是**样本效率低下**:随着任务视界延伸,成功轨迹变得日益稀缺,导致大多数样本产生零奖励。此外,那些完成了大量子目标但最终失败轨迹收到的零奖励与完全失败相同,浪费了有意义的进展。

我们在 ALFWorld(Shridhar et al., 2021)上验证了这些局限性:GRPO(Shao et al., 2024)在短任务上达到 77% 的成功率,但在长任务上降至 54%,超过 40% 的梯度更新包含矛盾信号。此外,在轨迹级优化下,39% 的采样轨迹至少完成了一个子目标,但未贡献任何学习信号。

![Figure 1](https://arxiv.org/html/2605.06078#S1.F1)
**图 1:BEACON 概述及性能预览。** 左图:GRPO 根据终端结果分配统一信用,当后续动作失败时惩罚正确的早期动作;BEACON 在里程碑处分割轨迹并在双尺度上估计优势。右图:在 ALFWorld 上,GRPO 随着任务视界增加性能急剧下降,而 BEACON 在所有视界下均保持稳健性能。

旨在提供更密集信用分配的现有方法引入了自身的局限性。过程奖励模型(Lightman et al., 2023; Wang et al., 2024)需要昂贵的步骤级标注,并存在奖励黑客攻击的风险(Gao et al., 2022)。蒙特卡洛价值估计(Kazemnejad et al., 2024)需要在每个决策点进行多次滚动,倍增计算成本。GiGPO(Feng et al., 2025)通过识别轨迹中的重复状态构建步骤级比较组,但其有效性取决于状态的重复性,这在长视界设置中随着智能体向任务完成推进而减弱。

我们观察到,长视界智能体任务已经表现出可利用的结构:它们分解为由**里程碑**界定的阶段,这些里程碑是状态转换点,在此处子目标的达成使得先前的执行历史在很大程度上变得无关紧要。这种近似的马尔可夫性质使得信用可以在阶段间解耦,然而轨迹级方法完全忽略了这一点。

我们引入了**基于里程碑引导的策略学习框架(BEACON)**,它利用任务结构来解决信用错误归因和样本效率低下的问题。其核心思想是在里程碑边界处分割轨迹,并在片段级别而非轨迹级别进行信用分配。给定一个轨迹,BEACON 首先从可验证的状态变化中识别里程碑,并相应地将轨迹分割为片段。在每个片段内,时序奖励塑形为更接近里程碑完成的动作分配更高的信用,将稀疏的终端信号转化为奖励部分进度的密集反馈。在片段之间,双尺度优势估计在轨迹和片段两个层面计算优势。轨迹级优势捕捉全局任务性能,而片段级优势仅比较达到相同里程碑的轨迹,从而将局部动作质量与后续片段引入的方差隔离开来。这种分解确保了早期片段中的正确动作不会因后续片段的失败而受罚,直接解决了信用错误归因问题。

我们在 ALFWorld(Shridhar et al., 2021)、WebShop(Yao et al., 2022)和 ScienceWorld(Wang et al., 2022)上评估了 BEACON。BEACON 在所有基准测试中均优于 GRPO,且随着任务视界的延长,改进效果愈发显著:在 ALFWorld 上,相对于 GRPO 的相对收益从短任务的 26.2% 扩大到长任务的 73.6%。在长任务上,BEACON 取得 92.9% 的成功率,而 GRPO 为 53.5%。分析显示,BEACON 从部分成功中恢复了学习信号:有效样本利用率从 23.7% 提升至 82.0%。此外,与在 oracle 轨迹上的监督微调相比,BEACON 取得 91.4% 的成功率,证明了其增益源于策略优化而非对里程碑的模仿。

总之,我们的贡献如下:
- 本工作确定了信用错误归因和样本效率低下是轨迹级优化的根本局限性,表明随着任务视界的延长,超过 40% 的梯度更新包含矛盾信号。
- 我们提出了 BEACON,这是一个在里程碑边界处分割轨迹、在片段内应用时序奖励塑形并在双尺度上估计优势以将局部动作质量与后续失败隔离的框架。
- 在 ALFWorld、WebShop 和 ScienceWorld 上的实验展示了依赖于视界的改进,相对于 GRPO 的相对收益从 26.2% 扩展到 73.6%,样本利用率从 23.7% 提升至 82.0%。

## 2 扁平轨迹优化中的失败

我们首先通过实证建立轨迹级策略优化随着任务视界延长而系统性失败的事实,然后通过梯度分析诊断潜在原因。实验使用 Qwen2.5-1.5B-Instruct(Qwen et al., 2025)在 ALFWorld 上运行 GRPO,根据最优轨迹长度对任务进行分层:短($L^* \leq 4$)、中($5 \leq L^* \leq 7$)和长($L^* > 7$)(详情见第 4.1 节)。图 1(右)显示 GRPO 的性能从短任务的 76.7% 下降到长任务的 53.5%。

![Figure 2](https://arxiv.org/html/2605.06078#S2.F2)
**图 2:扁平轨迹优化中的失败。** (a) GRPO 训练期间的样本分布。尽管取得了有意义的进展,部分成功仍产生零梯度。(b) 梯度冲突分析。矛盾信号导致有效学习信号崩溃。

#### 样本效率低下

图 2 (a) 显示了训练期间采样轨迹的分布。我们将轨迹分为三类:完全成功(绿色),即完成任务;部分成功(橙色),即完成至少一个里程碑但最终任务失败;以及完全失败(灰色),即未达成任何里程碑。部分成功在整个训练过程中 consistently 占样本的 39-47%,然而在 GRPO 下,它们收到的零奖励与完全失败相同。与此同时,完全成功比例低于 27%,意味着超过 73% 的样本未产生学习信号。这种对部分进展的浪费严重限制了学习效率。

#### 信用错误归因

即使对于那些确实提供信号的轨迹,信用分配也是错误的。图 2 (b) 揭示了第二种病理:由矛盾信用分配引起的梯度腐败。我们测量了**矛盾动作比率(CAR)**,定义为在不同轨迹中尽管在相同状态下执行但接收到相反符号优势的动作所占的比例。CAR 峰值超过 40%,表明近一半针对重复状态-动作对的梯度更新指向冲突方向。因此,有效学习信号(抵消后剩余的梯度比例)崩溃至 20% 以下(详细计算见附录 C.2)。根本原因是轨迹级优势混淆了动作质量与下游随机性:当后续动作成功时,同一正确动作获得正信用,而失败时则获得负信用。

#### 要点

扁平轨迹优化存在两个叠加的问题。样本效率低下丢弃了来自部分成功的学習信号,而信用错误归因破坏了剩余的信号。随着视界延长,这两个问题都会恶化:长任务的成功率更低(增加部分成功),并且有更多机会让下游方差破坏信用分配。解决这些失败需要利用轨迹级方法所忽略的组合结构。

## 3 基于里程碑锚定的策略优化

我们引入 BEACON,这是一个利用长视界任务组合结构来解决第 2 节中确定的信用分配失败的框架。BEACON 分三个阶段运行:在里程碑边界处分割轨迹、在片段内塑形奖励以及在双尺度上估计优势。

![Figure 3](https://arxiv.org/html/2605.06078#S3.F3)
**图 3:BEACON 框架。** 上部:轨迹分割将滚动结果在里程碑边界处划分为片段;时序奖励衰减(因子 $\gamma$)为更接近里程碑完成的动作分配更高的信用。下部:双尺度优势估计通过比较终端结果计算轨迹级优势(左),通过比较里程碑匹配组内的回报计算片段级优势(中),并结合两个尺度进行最终信用分配(右)。

### 3.1 预备知识

我们考虑一个马尔可夫决策过程 $(\mathcal{S}, \mathcal{A}, \mathcal{P}, \mathcal{R}, \gamma)$,其中语言智能体策略 $\pi_\theta$ 通过与环境交互产生轨迹 $\tau=\{(s_t, a_t)\}_{t=1}^T$。智能体接收稀疏的终端奖励 $R(\tau) \in \{0, 1\}$,指示任务成功与否。我们假设可以访问一个里程碑指示器 $\Phi: \mathcal{S} \times \mathcal{A} \times \mathcal{S} \rightarrow \{0, 1\}$,当转换完成语义子目标时返回 1,否则返回 0。关键在于,$\Phi$ 不需要学习模型或人工标注——它检测来自环境反馈的可观察状态变化。在交互式环境中,此类信号通常可用:在 ALFWorld 中,$\Phi$ 检测对象状态变化,如成功拾取或加热完成;在 WebShop 中,$\Phi$ 识别向目标产品推进的页面转换;在 ScienceWorld 中,环境提供显式的子目标信号,$\Phi$ 直接消耗这些信号。

### 3.2 轨迹分割

长视界任务自然地分解为由里程碑状态界定的阶段。给定轨迹 $\tau$,对每个转换应用 $\Phi$ 得到里程碑时间戳 $\mathcal{M}=\{t_1, ..., t_K\}$,其中 $K$ 是达到的里程碑数量。设定 $t_0=0$ 和 $t_{K+1}=T$,我们将 $\tau$ 分割为 $K+1$ 个片段:
$$ \text{Seg}_k = \{(s_t, a_t) : t_{k-1} < t \leq t_k\}, \quad k=1, \dots, K+1 $$

### 3.3 片段内时序奖励塑形

对于片段 $\text{Seg}_k$,我们定义动作 $a_t$ 的即时奖励为:
$$ r_t = \gamma^{t_k - t} \mathbb{I}[\Phi(s_{t-1}, a_t, s_t) = 1] $$
其中 $\mathbb{I}[\cdot]$ 是指示函数,$\gamma \in (0, 1)$ 是时序衰减因子。仅当片段以完成的里程碑结束时,该片段才获得正奖励。这种设计有两个特性:(1) 已完成片段中的所有动作均接收正奖励,使得从部分成功中学习成为可能;(2) 更接近里程碑完成的动作接收更高的信用,鼓励高效执行。

### 3.4 双尺度优势估计

时序奖励塑形提供了密集信号,但并未完全解决信用错误归因:早期片段中的动作仍可能通过轨迹级比较受到后续片段结果的影响。我们通过双尺度优势估计来解决这个问题。

#### 轨迹级优势

对于为同一任务采样的 $G$ 个轨迹组 $\{\tau_i\}_{i=1}^G$,轨迹级优势遵循 GRPO:
$$ A_i^{\text{traj}} = \frac{R(\tau_i) - \mu}{\sigma + \epsilon}, \quad (4) $$
其中 $\mu$ 和 $\sigma$ 是该组终端奖励的均值和标准差。

#### 片段级优势

轨迹级比较无论位置如何都向所有动作分配相同的信用。为了将局部动作质量与下游方差隔离,我们仅比较达到相同里程碑的轨迹中的片段性能。定义里程碑 $k$ 的比较组为 $\mathcal{G}_k = \{i : K_i \geq k\}$,其中 $K_i$ 是轨迹 $\tau_i$ 达到的里程碑数量。片段回报为:
$$ R_k^{(i)} = \sum_{t \in \text{Seg}_k^{(i)}} r_t. \quad (5) $$

*注:原文在此处截断,后续内容未提供。*

相似文章

Gated-BEPO:面向大型语言模型智能体的置信门控贝尔曼信用分配

arXiv cs.AI

Gated-BEPO 是一种针对 LLM 智能体的新型信用分配方法,它利用贝尔曼不动点估计从经验回放图中推导出步骤级信用,并通过置信门将步骤级信用与回合级信用自适应地融合。在 WebShop、ALFWorld 和视觉 Sokoban 上的实验表明,相对于现有无评论家方法,该方法具有一致性的改进。

BiPACE: 面向LLM智能体的双模拟引导策略优化与动作反事实估计

arXiv cs.CL

BiPACE提出了一种即插即用的优势估计器,用于修复LLM智能体逐步分组强化学习中的状态-动作信用分配错配问题。该方法利用双模拟引导的状态聚类和动作反事实估计,在ALFWorld、WebShop和TextCraft基准上,配合Qwen2.5模型实现了显著的性能提升。

PolicyBank:为LLM智能体演进策略理解

arXiv cs.CL

PolicyBank提出了一种记忆机制,使LLM智能体能够通过迭代交互和纠正反馈自主改进对组织策略的理解,弥补导致系统性行为偏离真实需求的规范差距。该工作引入了一个系统化测试平台,并展示PolicyBank能够解决高达82%的策略差距对齐失败,显著超越现有记忆机制。

GAGPO:广义优势分组策略优化

arXiv cs.AI

GAGPO提出了一种无评论家的强化学习方法,在多方交互的自主任务中,利用非参数分组价值代理进行步级信用分配,在ALFWorld和WebShop上超越了强基线模型。