PGPO:面向多轮智能体任务的势引导策略优化
摘要
PGPO 提出势引导策略优化用于多轮智能体任务,使得在 LLM 后训练中实现更细粒度的信用分配,并在 ALFWorld 和 WebShop 基准测试上展示出强劲结果。
arXiv:2609.02236v1 公告类型:新
摘要:基于组的强化学习(RL)已成为 LLM 后训练的有效范式,但在具有稀疏终端奖励的多轮智能体任务中,它通常为中间动作提供粗糙的信用分配。为了获得更细粒度的信用分配,最近的工作如 GiGPO 引入了中间动作的步骤级优势。然而,这些步骤级信号仍然依赖于每个单独轨迹的最终结果。因此,失败轨迹内的动作可能仍然区分度不足,导致有效动作可能收到与错误动作相同的不利信用。在这项工作中,我们提出了用于多轮智能体任务的势引导策略优化(PGPO)。PGPO 从每个展开组内的锚点状态组回报统计中估计经验状态势。然后,它从相邻状态之间的势差中推导动作优势,实现跨轨迹信用传播。这提供了更细粒度的步骤级信用分配,特别是在失败轨迹内。在 ALFWorld 和 WebShop 上的实验显示,相对于最近的基于组的 RL 方法,整体性能强劲。进一步分析提供的证据表明,PGPO 以可忽略的训练开销产生更具信息性的失败侧信用信号。
查看缓存全文
缓存时间: 2026/09/03 06:03
# PGPO: 多轮智能体任务中的势能引导策略优化 来源:https://arxiv.org/abs/2609.02236 查看PDF (https://arxiv.org/pdf/2609.02236) > 摘要:基于群组的强化学习(RL)已成为大语言模型后训练的有效范式,但在具有稀疏终端奖励的多轮智能体任务中,它往往为中间动作提供粗粒度的信用分配。为获得更细粒度的信用分配,近期工作如GiGPO为中间动作引入了步级优势值。然而,这些步级信号仍然依赖于每个单独轨迹的最终结果。因此,失败轨迹中的动作可能仍然难以有效区分,导致有效动作可能与错误动作获得相同的不利信用。在本研究中,我们为多轮智能体任务提出了势能引导策略优化(PGPO)。PGPO通过每个展开组内锚状态组的回报统计数据来估计经验状态势能,然后从相邻状态间的势能差异中推导出动作优势值,从而实现跨轨迹的信用传播。这提供了更细粒度的步级信用分配,尤其是在失败轨迹中。在ALFWorld和WebShop上的实验表明,与近期基于群组的RL方法相比,PGPO展现出强大的整体性能。进一步分析提供了证据,表明PGPO能够生成更具信息量的失败侧信用信号,且训练开销可忽略不计。 ## 提交历史 来自:郑宇尧 [查看邮件 (https://arxiv.org/show-email/0022beab/2609.02236)] **[v1]** 2026年9月2日 周三 07:44:16 UTC (2,881 KB)
相似文章
GAGPO:广义优势分组策略优化
GAGPO提出了一种无评论家的强化学习方法,在多方交互的自主任务中,利用非参数分组价值代理进行步级信用分配,在ALFWorld和WebShop上超越了强基线模型。
PlanPO:面向多轮代理式大语言模型的群体规划感知策略优化
PlanPO是一种强化学习方法,它为多轮代理式大语言模型引入了从粗到细的优势信号,在ALFWorld、WebShop和SciWorld等基准测试中,性能比GRPO提高了27.2%。
面向进度与可靠性的智能体强化学习组策略优化
ProGPO是一种免学习评论器的方法,用于LLM智能体基于组的RL中的步骤级优势估计,它使用精确前缀动作比较和基于rollout的状态势,以改善长视界任务上的信用分配。在ALFWorld和WebShop上使用Qwen2.5模型的实验表明,它优于现有的智能体RL基线。
面向长周期代理任务的进度条件组策略优化
提出进度条件组策略优化(ProGPO),通过在组内所有样本均失败时使用首次访问的观察覆盖率,克服长周期代理任务中的信用分配问题,在ALFWorld和WebShop上提升了性能。
A^2TGPO:具有自适应回合级裁剪的代理回合组策略优化
本文介绍了 A^2TGPO,这是一种针对代理式大语言模型(LLMs)的强化学习方法,它利用自适应回合级裁剪和信息增益归一化来改善多轮交互中的过程信用分配。