PlanPO:面向多轮代理式大语言模型的群体规划感知策略优化
摘要
PlanPO是一种强化学习方法,它为多轮代理式大语言模型引入了从粗到细的优势信号,在ALFWorld、WebShop和SciWorld等基准测试中,性能比GRPO提高了27.2%。
arXiv:2608.17289v1 公告类型:新
摘要:群体相对策略优化已成为训练多轮交互任务中代理式大语言模型的关键范式。然而,大多数现有变体未能区分成功轨迹之间的优势,即使这些轨迹在交互效率上存在显著差异。例如,迂回的成功常被赋予相同的结果奖励,导致优势崩溃和严重的性能瓶颈。为此,我们提出了群体规划感知策略优化(PlanPO),这是一种简单而有效的强化学习方法,用于学习超越特定任务高质量行为模式的泛化规划能力。具体而言,PlanPO引入了从粗到细的优势信号,这些信号捕获了基于为同一任务采样的成功轨迹的轨迹级长度和回合级响应长度的相对差异。在群体相对优化结构中,这使得代理能够从高质量的展开中主动学习涵盖交互规划和文本生成的泛化且审慎的行为,而不会退化为简单的长度最小化。实验表明,PlanPO在挑战性多轮基准ALFWorld、WebShop和SciWorld上平均比GRPO提高了27.2%,优于最近的高性能基线,同时增加的训练成本可忽略不计。
查看缓存全文
缓存时间: 2026/08/19 09:57
# PlanPO:面向多轮智能体LLMs的群体规划感知策略优化
来源:https://arxiv.org/html/2608.17289
###### 摘要
群体相对策略优化已成为在多轮交互任务中训练智能体大型语言模型(LLMs)的关键范式。然而,大多数现有方法即使在成功轨迹之间存在显著的交互效率差异时,也无法区分其优势值。例如,迂回曲折的成功轨迹往往被赋予相同的结果奖励,导致优势值坍塌和严重的性能瓶颈。为此,我们提出**群体规划感知策略优化(PlanPO)**,这是一种简单而有效的强化学习方法,旨在学习超越任务特定高质量行为模式的通用规划能力。具体而言,PlanPO引入了从粗到细的优势信号,这些信号基于针对同一任务采样的成功轨迹,捕捉了轨迹级长度和轮次级响应长度内的相对差异。在群体相对优化框架下,这使得智能体能够从高质量的展开中主动学习跨越交互规划和文本生成的通用审慎行为,而不会退化为简单的长度最小化。实验表明,PlanPO在具有挑战性的多轮基准测试ALFWorld、WebShop和SciWorld上平均比GRPO提升了27.2%,在产生可忽略的额外训练成本的同时,超越了近期的强力基线。
## 引言
大型语言模型(LLMs)在广泛的复杂多轮任务中展现了显著进步,包括信息检索、网页导航、代码生成和具身交互。近期工作越来越多地探索具有可验证结果奖励的智能体强化学习(RL),特别是群体相对策略优化(GRPO),用于微调Qwen2.5等开源LLMs,从而增强LLM智能体在多轮任务中的能力。然而,策略内(on-policy)智能体RL的一个核心挑战在于,在提升数据利用率的同时,丰富展开轨迹的奖励信号。许多早期研究通过引入价值模型(如评论家网络和过程奖励模型PRMs)来评估轮次级行为,以解决此问题。然而,这些模型可能引入估计偏差或代理偏差,并产生显著的内存开销。近期的群体优化方法则转而挖掘信息性展开,以构建轮次级奖励信号并获得可区分的优势值。例如,HiPER通过子任务分解计算轨迹片段的多个回报,而GiGPO通过识别重复锚点状态来构建基于动作空间的步级优势信号。其他方法,如R3L和GVPO,则通过失败反思和多样的代码执行反馈建立轮次级信用分配。然而,大多数方法依赖于劳动密集型的手工设计和经验启发式规则,限制了它们在不同任务设置中的通用性。因此,成功展开组内的优势值坍塌仍然难以以一种广泛适用的方式缓解。
这引发了如何以简单、有效且更具任务通用性的方式,为长视野任务丰富由展开驱动的训练信号的问题。我们首先重新审视群体展开中一个自然可用但未被充分利用的信号,即轮次级交互轨迹和token级生成响应的长度分布。图1(https://arxiv.org/html/2608.17289#Sx1.F1)直观地说明了这一思想。具体而言,我们的关键观察是,智能体RL中的许多低效性表现为过长的交互或生成长度。在多轮交互中,智能体可能在状态间犹豫不决、重复访问相似观察或陷入死循环,最终才完成任务。类似的token级文本响应问题也会出现:给定相同的问题或轮次级观察,采样的响应可能生成正确动作,但仍包含不必要的冗长、迂回甚至逻辑错误的推理痕迹。然而,无论是低效的轮次还是推理token,它们仍然可能像更优的解法一样,共享相同的结果奖励。关键在于,将这类异构的成功视为同等偏好,会削弱可区分的信号和底层能力,同时允许噪声展开降低训练质量并施加显著的性能瓶颈。
为解决此问题,我们提出**群体规划感知策略优化(PlanPO)**,这是一种基于群体的、有效的强化学习方法,用于学习超越特定计划行为的通用规划能力。具体而言,在针对同一任务采样的成功轨迹集合中,PlanPO通过轮次级轨迹长度和token级响应长度对结果奖励进行归一化,构建从粗到细的密集奖励信号。PlanPO不是直接累加这些密集奖励,而是分别计算它们的相对优势,并通过加权公式进行组合,从而保留不同粒度上的区分信息。此外,与通用的基于长度的奖励塑形不同,PlanPO仅在群体相对结构下,对成功的展开执行多尺度长度归一化。因此,成功完成是进行群体长度归一化的前提。经验表明,这些以成功为条件的相对优势有助于智能体获得可推广的规划行为,超越特定的高质量轨迹,而不仅仅是模仿任务特定的成功模式。
**图1:** 左图:成功的展开具有不同的信息量。达到相同任务目标的展开可能在长度、直接性和推理质量上存在显著差异,而最优策略可能揭示更复杂和可通用的能力。右图:使用Qwen2.5-1.5b模型在ALFWorld、WebShop和SciWorld环境中归一化后的平均性能比较。
我们在三个具有挑战性的多轮基准测试ALFWorld、WebShop和SciWorld上评估PlanPO,使用Qwen2.5-1.5B-Instruct和Qwen2.5-7B-Instruct模型。PlanPO在产生可忽略的额外训练成本的同时,持续超越近期强力基线,具体而言,平均比GRPO提升了27.2%,并在ALFWorld的分布外任务上实现了24.3%的显著增益。广泛的消融实验和分析进一步验证了其有效性和泛化性。
我们的贡献有三方面:
- • 我们指出成功展开的异质性是群体相对优化中的关键瓶颈,其中冗余的轮次和推理会掩盖展开质量,从而限制策略学习。
- • 我们提出PlanPO,它构建了以成功为条件的长度归一化优势,鼓励智能体学习超越特定行为模式的规划感知能力。
- • 我们证明PlanPO在ALFWorld、WebShop和SciWorld上持续超越近期强力基线,同时产生可忽略的额外训练成本。
## 预备知识
#### 多轮智能体RL。我们考虑基于LLM的智能体与环境进行多轮交互的强化学习,其交互过程被建模为一个有限视界的马尔可夫决策过程(MDP)。给定任务实例 $\boldsymbol{x} \in p(X)$,在每个轮次 $t=1,2,\ldots,T$,智能体策略 $\pi_{\theta}$ 观察状态 $\boldsymbol{s}_t \in \mathcal{S}$,生成文本动作 $\boldsymbol{a}_t \in \mathcal{A}$,然后转移到下一个状态 $\boldsymbol{s}_{t+1} \in \mathcal{S}$,同时产生标量奖励 $r_t \in \mathbb{R}$。交互过程形成一条轨迹 $\boldsymbol{\tau}=\{(\boldsymbol{s}_1,\boldsymbol{a}_1,r_1),(\boldsymbol{s}_2,\boldsymbol{a}_2,r_2),\ldots,(\boldsymbol{s}_T,\boldsymbol{a}_T,r_T)\}$,其中 $T$ 表示轨迹的交互轮次长度。在如ALFWorld等实际任务中,智能体为每个观察生成一个响应作为动作。该响应在<thought>和<action>标签内构建,前者包含推理过程,后者指定在环境中执行的实际动作。值得注意的是,对于大多数任务设置,奖励信号是稀疏且延迟的,例如环境仅在轨迹终止后才提供结果奖励 $R(\boldsymbol{\tau})$。
### 群体相对策略优化
近期的LLM智能体强化学习方法通常采用群体相对策略优化范式。给定任务实例 $\boldsymbol{x}$,旧策略 $\pi_{\theta_{\rm old}}$ 采样一组 $N$ 个候选轨迹 $\mathcal{G}_x=\{\boldsymbol{\tau}_1,\boldsymbol{\tau}_2,\ldots,\boldsymbol{\tau}_N\}$,其中每个轨迹对应一次完整的展开。每个轨迹 $\boldsymbol{\tau}_i$ 接收一个标量奖励 $R(\boldsymbol{\tau}_i)$,反映生成结果的总体质量或成功与否。与PPO中使用评论家网络学习优势函数 $A(\boldsymbol{s}_t,\boldsymbol{a}_t)$ 不同,基于群体的RL仅使用采样群体内的统计数据计算优势:$A(\boldsymbol{\tau}_i)=\mathtt{GroupNormalization}\left(\{R(\boldsymbol{\tau}_i)\}_{i=1}^N\right)$。在GRPO中,优势通过将每个轨迹奖励与群体奖励 $\{R(\boldsymbol{\tau}_i)\}_{i=1}^N$ 的均值和方差进行归一化来评估。这种基于采样的估计器降低了传统PPO中评论家架构引入的内存和计算开销。
**图2:** PlanPO概览。左图:针对同一任务采样的展开可以通过质量和截然不同的交互路径及文本响应达到相同结果。中图:PlanPO分别使用轨迹长度和响应长度将结果转换为以成功为条件的轨迹级和轮次级分数。右图:这两个分数在同一任务群体内分别进行归一化,并组合成从粗到细的优势值,用于策略优化。
## 面向多轮智能体LLMs的群体规划感知策略优化
我们提出**群体相对规划感知策略优化(PlanPO)**,这是一种简单有效的群体相对强化学习方法,用于学习超越任务特定高质量展开的高层规划策略。我们首先阐述动机,然后介绍从粗到细的优势设计,最后给出策略优化损失和理论分析。
### 动机
如图2(https://arxiv.org/html/2608.17289#Sx2.F2)右侧所示,对于同一任务,一些展开通过短而连贯的交互路径达到目标,而另一些则涉及冗余的状态转移,甚至进入循环和死胡同。在轮次级,冗长的推理也可能引入不一致或误导性的中间声明。例如,如图所示,给定一个任务或轮次观察,尽管最终采样的动作“从台面1拿取土豆1”都是正确的,但思考过程“我已经拿过土豆……”将其视为已发生。此类情况在展开中很常见,却引入了幻觉或逻辑不一致的推理痕迹。
我们应如何量化成功展开的质量?现有解决方案可能引入事后反思或智能体验证器模型,但这些信号通常成本高昂且具有启发性。上述观察促使我们利用多尺度展开长度作为初始信号。然而,无条件的基于长度的奖励塑形会退化为无意义的长度最小化,甚至扭曲LLMs的表示空间。相反,我们的目标是比较性地学习成功展开中的计划行为,同时促进任务通用的规划能力,而非拟合任务特定的模式。这一目标自然地与群体相对策略优化保持一致。下面我们逐步构建上述条件优势信号。
### 轨迹长度归一化优势
为实现此目标,我们首先在轨迹(或回合)级实例化以成功为条件的长度信号。对于具有相同结果奖励的成功展开,轨迹长度可作为环境交互规划效率的粗略代理。因此,我们仅对成功展开按轨迹长度归一化结果奖励,并计算条件群体相对优势。形式化地,给定任务实例 $\boldsymbol{x}$,策略 $\pi_{\theta_{\rm old}}$ 从相同初始状态 $\boldsymbol{s}_0$ 采样 $N$ 条轨迹 $\{\boldsymbol{\tau}_1,\boldsymbol{\tau}_2,\ldots,\boldsymbol{\tau}_N\}$。每个展开轨迹表示为 $\boldsymbol{\tau}_i=\{(\boldsymbol{s}_{i,1},\boldsymbol{a}_{i,1},r_{i,1}),(\boldsymbol{s}_{i,2},\boldsymbol{a}_{i,2},r_{i,2}),\ldots,(\boldsymbol{s}_{i,T_i},\boldsymbol{a}_{i,T_i},r_{i,T_i})\}$,其中 $T_i$ 表示第 $i$ 条轨迹的轮次数。在我们的任务设置中,当任务目标达成时,每条轨迹仅接收终端结果奖励 $R(\boldsymbol{\tau}_i)=10$。然后我们将采样轨迹及其奖励的轨迹级群体表示为:$\mathcal{G}_x^E=\{(\boldsymbol{\tau}_1,R(\boldsymbol{\tau}_1)),(\boldsymbol{\tau}_2,R(\boldsymbol{\tau}_2)),\ldots,(\boldsymbol{\tau}_N,R(\boldsymbol{\tau}_N))$。相似文章
面向进度与可靠性的智能体强化学习组策略优化
ProGPO是一种免学习评论器的方法,用于LLM智能体基于组的RL中的步骤级优势估计,它使用精确前缀动作比较和基于rollout的状态势,以改善长视界任务上的信用分配。在ALFWorld和WebShop上使用Qwen2.5模型的实验表明,它优于现有的智能体RL基线。
GAGPO:广义优势分组策略优化
GAGPO提出了一种无评论家的强化学习方法,在多方交互的自主任务中,利用非参数分组价值代理进行步级信用分配,在ALFWorld和WebShop上超越了强基线模型。
LambdaPO: 面向推理语言模型的Lambda风格策略优化
引入LambdaPO,一种新颖的强化学习框架,它通过将优势估计分解为成对偏好比较并添加语义密度奖励来改进GRPO,从而在数学推理任务上取得了更好的性能。
APPO: 智能体过程策略优化
APPO通过使用细粒度决策点和过程级优势缩放来改进分支决策和信用分配,从而提升LLM智能体的多轮工具使用能力,在13个基准测试中比基线高出近4个百分点。
StepPO:面向智能体强化学习的步骤对齐策略优化
StepPO 引入了一种面向智能体强化学习的步骤中心范式,该范式将策略优化与智能体决策粒度对齐,在多轮交互任务中优于以令牌为中心的方法。