GenPO++: 生成式策略优化与无雅可比似然比

arXiv cs.LG 论文

摘要

GenPO++ 提出了一种可逆生成式策略优化框架,该框架在高阶可逆 ODE 求解器中使用历史状态作为辅助记忆,从而为强化学习中的流式策略实现精确反演和无雅可比似然比计算。它在大规模控制、微调和真实世界机器人任务上取得了有竞争力的性能,同时提高了稳定性和效率。

arXiv:2606.06967v1 Announce Type: new 摘要:生成式策略提供具有表现力的多模态动作分布,使其在复杂连续控制任务的强化学习(RL)中具有吸引力。其中,基于流的策略尤其受欢迎,因为它们通过确定性传输图生成动作。然而,将此类生成式策略应用于基于似然的在策略学习仍受限于评估已执行动作概率的困难。现有的流 RL 方法要么用近似替代品替换真实动作密度比(可能引入有偏更新),要么通过虚拟动作增强恢复精确似然(这会扩大策略空间并增加计算量)。在这项工作中,我们提出 GenPO++,一种可逆生成式策略优化框架,该框架在高阶可逆 ODE 求解器中使用历史状态作为辅助记忆,在不改变原始动作维度的情况下实现精确反演。由此得到的生成式策略图的对数行列式仅由固定的求解器系数决定,从而实现精确且无雅可比的似然比计算。这种设计保留了生成式流策略的表现力,同时避免了动作比偏差和虚拟动作开销。我们在大规模仿真控制、微调和真实世界机器人操作任务上评估了 GenPO++,其在实现竞争性或更优性能的同时,提升了训练稳定性和计算效率,优于最先进的在策略 RL 方法。
查看原文
查看缓存全文

缓存时间: 2026/06/08 09:19

# GenPO++:无雅可比似然比的生成策略优化
来源: https://arxiv.org/html/2606.06967
柯虎1∗ 舒彤丁1 潘鑫陶1 景雅王1 叶施1†

1上海科技大学

\{huke2024, dingsht, taopx2022\}@shanghaitech\.edu\.cn \{wangjingya, shiye\}@shanghaitech\.edu\.cn

###### 摘要

生成策略能够提供具有表现力的多模态动作分布,使其在复杂连续控制任务的强化学习(RL)中颇具吸引力。其中,基于流的策略尤为突出,因为它们通过确定性的传输映射生成动作。然而,将此类生成策略应用于基于似然的在线策略学习仍然受限,原因在于难以评估已执行动作的概率。现有的流强化学习方法要么用近似替代项替换真实的动作密度比,这可能会引入偏置更新;要么通过虚拟动作增强恢复精确似然,但这会扩大策略空间并增加计算量。在这项工作中,我们提出了GenPO++,一种可逆生成策略优化框架,该框架在高阶可逆ODE求解器中使用历史状态作为辅助记忆,在不改变原始动作维度的情况下实现精确反演。由此产生的生成策略映射的对数行列式仅由固定的求解器系数决定,从而能够实现精确且无需雅可比矩阵的似然比计算。这种设计保留了生成流策略的表现力,同时避免了动作比偏置和虚拟动作开销。我们在大规模仿真控制、微调和真实世界机器人操作任务上评估了GenPO++,与最先进的在线策略强化学习方法相比,它取得了具有竞争力或更优的性能,同时提高了训练稳定性和计算效率。

## 1 引言

参考图例图1:FPO、GenPO和GenPO++的比较。FPO依赖于可能带有偏置的ELBO代理比,而GenPO通过虚拟动作增强获得精确反演,但代价是动作空间扩大。GenPO++用求解器历史状态替代虚拟动作,实现精确反演和无需雅可比矩阵的似然比计算,同时保留原始动作维度。强化学习(RL)在连续控制领域取得了强劲性能,通常采用简单的高斯策略和基于似然的稳定更新,如PPO(Schulman等人,2017 (https://arxiv.org/html/2606.06967#bib.bib61))。然而,高斯策略的表现力有限:它们通常表示单峰动作分布,在处理具有多模态动作选择、丰富接触动力学或非连续动作流形的任务时可能遇到困难。基于扩散和流模型的生成策略提供了一种有前景的替代方案。扩散策略(Chi等人,2023 (https://arxiv.org/html/2606.06967#bib.bib20))、Diffuser(Janner等人,2022 (https://arxiv.org/html/2606.06967#bib.bib42))、用于离线RL的扩散策略(Wang等人,2022 (https://arxiv.org/html/2606.06967#bib.bib27);Ajay等人,2022 (https://arxiv.org/html/2606.06967#bib.bib43))以及流匹配模仿策略(Rouxel等人,2024 (https://arxiv.org/html/2606.06967#bib.bib18))已经表明,生成模型可以表示丰富的条件动作分布并捕捉多样化的行为模式。流匹配和整流流进一步提供了高效的确定性采样器,使其成为可扩展控制和策略微调的有吸引力的选择(Lipman等人,2023 (https://arxiv.org/html/2606.06967#bib.bib1),2022 (https://arxiv.org/html/2606.06967#bib.bib98);Liu等人,2022 (https://arxiv.org/html/2606.06967#bib.bib97))。

尽管取得了这些进展,但将良好的生成采样器转变为有效的在线策略仍然困难。关键障碍不在于动作生成本身,而在于评估新策略下已执行动作的概率。这种状态-动作似然比是裁剪策略更新、KL控制和熵正则化所必需的。对于高斯策略,该比率是封闭形式的。对于扩散和流策略,采样器通常是离散化的神经ODE或去噪过程:精确反演可能很复杂,而精确密度评估可能需要神经网络雅可比行列式或代价高昂的迹估计器(Song等人,2020b (https://arxiv.org/html/2606.06967#bib.bib7))。这在生成策略的表现力与使在线策略学习稳定的基于似然的机制之间造成了鸿沟。

近期方法取得了重要进展,但仍存在关键局限性。流策略优化(FPO)(McAllister等人,2025 (https://arxiv.org/html/2606.06967#bib.bib120))通过将真实动作密度比替换为易处理的基于ELBO的代理项来避免显式密度计算。这使得流策略的优化变得可行,但当当前策略和旧策略的变分差距不同时,代理比可能与真实概率比存在差异。因此,裁剪和正则化应用于近似目标。GenPO(Ding等人,2025 (https://arxiv.org/html/2606.06967#bib.bib119))采取了一条互补的路线,通过使用精确扩散反演和虚拟动作增强来构建可逆生成策略。这实现了精确的似然比计算,但会将有效动作维度加倍,引入冗余的探索变量,改变标准的流/扩散采样过程,并增加计算开销。同时,诸如EDICT(Wallace等人,2023 (https://arxiv.org/html/2606.06967#bib.bib90))、BDIA(Zhang等人,2024 (https://arxiv.org/html/2606.06967#bib.bib94))和BELM(Wang等人,2024a (https://arxiv.org/html/2606.06967#bib.bib92))等精确反演方法展示了如何使扩散轨迹可逆以用于重建和编辑,但它们并未直接为连续控制提供高效的策略更新机制。

在这项工作中,我们提出了GenPO++,一个可逆流策略优化框架,用于具有表现力生成策略的基于似然的在线策略学习。我们的关键观察是,精确反演所需的辅助记忆不必是独立的虚拟动作。相反,它可以从高阶ODE积分中自然产生的求解器历史状态获得。基于这一观察,GenPO++构建了一个可逆的高阶流策略求解器,其逆形式是封闭可得的。更重要的是,策略映射的对数行列式与神经速度网络无关,仅取决于固定的求解器系数。这在不改变原始动作维度的情况下,实现了精确且无需雅可比矩阵的似然比。

GenPO++具有几个实际优势。首先,它避免了虚拟动作增强,因此保留了原始动作表示,这对于微调预训练的监督流或扩散策略非常重要。其次,它避免了重复的神经网络雅可比行列式计算,减少了精确似然生成策略方法中出现的训练时间开销。第三,通过使用精确似然比而非ELBO代理项,它在近似的目标可能偏离真实已执行动作分布的情况下,提高了训练稳定性。

我们在大规模仿真控制、策略在线微调和真实世界机器人操作任务上评估了GenPO++。在这些设置中,与高斯PPO、扩散策略微调、FPO和GenPO相比,GenPO++取得了具有竞争力或更优的性能,同时提高了稳定性并减少了推理或学习开销。我们的贡献总结如下:

- **在线策略生成强化学习的详细分析**。我们识别了将基于流的生成策略应用于在线策略RL的核心障碍:在执行动作收集后,必须准确评估其概率比。我们将近似的ELBO比率目标如何偏离真实动作密度比进行了形式化,并解释了虚拟动作精确反演方法为何引入冗余策略维度和额外计算。
- **高阶可逆生成策略**。我们提出了GenPO++,一种高阶可逆生成策略,它用历史状态替代独立的虚拟动作。由此产生的转移具有封闭形式的反演,保留了原始动作维度,并具有与神经速度场无关的固定系数对数行列式,从而能够实现精确且无需雅可比矩阵的似然比计算。我们进一步将更新与Adams–Bashforth积分联系起来,并推导了其局部截断误差。
- **仿真和真实世界评估**。我们在大规模仿真基准、模仿到RL的微调任务以及真实世界的灵巧手操作任务中进行了实验,展示了相比先前生成策略优化方法更优的稳定性、效率和最终性能。

## 2 相关工作

### 2.1 扩散和基于流的生成模型

扩散模型将生成过程公式化为从噪声到数据的迭代变换,通常通过学习与预定义去噪动力学相关的逆向去噪过程(Sohl-Dickstein等人,2015 (https://arxiv.org/html/2606.06967#bib.bib4);Ho等人,2020 (https://arxiv.org/html/2606.06967#bib.bib3);Song等人,2020b (https://arxiv.org/html/2606.06967#bib.bib7))。确定性变体和概率流视角,如DDIM(Song等人,2020a (https://arxiv.org/html/2606.06967#bib.bib2))和基于分数的概率流ODE,进一步将扩散采样与连续时间传输联系起来(Song等人,2020a (https://arxiv.org/html/2606.06967#bib.bib2),b (https://arxiv.org/html/2606.06967#bib.bib7))。基于流的生成模型提供了一种紧密相关的传输视角,其中样本通过将粒子从简单基分布移动到目标分布(通过可逆或连续时间映射)来生成(Rezende and Mohamed,2015 (https://arxiv.org/html/2606.06967#bib.bib105);Dinh等人,2016 (https://arxiv.org/html/2606.06967#bib.bib106);Kingma and Dhariwal,2018 (https://arxiv.org/html/2606.06967#bib.bib124);Chen等人,2018 (https://arxiv.org/html/2606.06967#bib.bib125);Grathwohl等人,2018 (https://arxiv.org/html/2606.06967#bib.bib126))。流匹配最近作为一种可扩展的方式出现,用于训练连续时间生成流,而无需基于仿真的最大似然训练。它不是优化精确似然,而是通过回归源样本和目标样本之间的条件传输方向来学习速度场(Lipman等人,2022 (https://arxiv.org/html/2606.06967#bib.bib98))。条件流匹配和最优传输流匹配将此思想推广到更广泛的耦合策略,并通常产生更简单的传输路径(Tong等人,2023 (https://arxiv.org/html/2606.06967#bib.bib127))。整流流进一步强调笔直的传输轨迹和高效生成(Liu等人,2022 (https://arxiv.org/html/2606.06967#bib.bib97)),而随机插值则提供了一个统一框架,连接扩散、随机动力学和确定性流(Albergo等人,2025 (https://arxiv.org/html/2606.06967#bib.bib128))。这些发展使得流模型对策略学习具有吸引力,因为它们可以表示富有表现力的多模态条件动作分布,同时通常需要比标准随机扩散采样器更少的采样步骤。

流策略的实际行为深受用于离散化底层连续时间动力学的数值求解器的影响。高阶求解器重用过去的模型评估以提高轨迹精度或减少函数评估次数,如DPM-Solver(Lu等人,2022 (https://arxiv.org/html/2606.06967#bib.bib100))、DEIS(Zhang and Chen,2023 (https://arxiv.org/html/2606.06967#bib.bib101))、UniPC(Zhao等人,2023 (https://arxiv.org/html/2606.06967#bib.bib102))和EDM风格求解器(Karras等人,2022 (https://arxiv.org/html/2606.06967#bib.bib103))所示。除了采样效率之外,离散化的求解器还定义了从潜在噪声到生成样本的传输映射,当需要似然评估、潜在恢复或策略比率计算时,其可逆性变得重要。经典的归一化流,包括NICE(Dinh等人,2014 (https://arxiv.org/html/2606.06967#bib.bib129))、RealNVP(Dinh等人,2016 (https://arxiv.org/html/2606.06967#bib.bib106))、Glow(Kingma and Dhariwal,2018 (https://arxiv.org/html/2606.06967#bib.bib124))、连续归一化流(Chen等人,2018 (https://arxiv.org/html/2606.06967#bib.bib125);Grathwohl等人,2018 (https://arxiv.org/html/2606.06967#bib.bib126))以及残差流模型,如i-ResNet和Residual Flows(Behrmann等人,2019 (https://arxiv.org/html/2606.06967#bib.bib130);Chen等人,2019 (https://arxiv.org/html/2606.06967#bib.bib132)),通过将可逆性构建到模型架构中来获得可处理的似然。最近的扩散反演方法,包括EDICT(Wallace等人,2023 (https://arxiv.org/html/2606.06967#bib.bib90))、BDIA(Zhang等人,2024 (https://arxiv.org/html/2606.06967#bib.bib94))和BELM(Wang等人,2024a (https://arxiv.org/html/2606.06967#bib.bib92)),则研究如何通过耦合变换或双向求解器设计使采样轨迹本身可逆。这些工作强调了可逆生成映射的重要性,但它们主要针对密度建模、采样或图像反演而设计,而非在线策略似然比优化。相比之下,流策略需要一个求解器,它同时支持跨大批量回滚的高效动作生成、稳定反演和易处理的似然比。

### 2.2 强化学习的生成策略

强化学习旨在通过与环境的交互来学习策略(Sutton and Barto,2018 (https://arxiv.org/html/2606.06967#bib.bib88))。与标准高斯策略相比,生成策略提供了更富有表现力的条件动作分布类别,并能更好地捕捉多模态行为。它们在模仿学习和离线决策中表现出色,包括用于行为克隆的扩散策略(Chi等人,2023 (https://arxiv.org/html/2606.06967#bib.bib20);Reuss等人,2023 (https://arxiv.org/html/2606.06967#bib.bib23))、轨迹生成和规划(Janner等人,2022 (https://arxiv.org/html/2606.06967#bib.bib42);Ajay等人,2022 (https://arxiv.org/html/2606.06967#bib.bib43))、离线行为建模(Wang等人,2022 (https://arxiv.org/html/2606.06967#bib.bib27);Chen等人,2022 (https://arxiv.org/html/2606.06967#bib.bib29))以及离线演员-评论家学习(Hansen-Estruch等人,2023 (https://arxiv.org/html/2606.06967#bib.bib31);Kang等人,2024 (https://arxiv.org/html/2606.06967#bib.bib32))。然而,在在线RL中部署生成策略更具挑战性,因为策略必须从奖励反馈而非监督动作标签中改进。

现有的在线生成策略方法主要是在离线RL下开发的。一条工作线将生成策略视为富有表现力的演员,并使用基于值或演员-评论家的目标进行优化,包括结合SAC或TRPO的归一化流策略(Mazoure等人,2020 (https://arxiv.org/html/2606.06967#bib.bib110);Tang and Agrawal,2018 (https://arxiv.org/html/2606.06967#bib.bib109))、DACER(Wang等人,2024b (https://arxiv.org

相似文章

GraphPO:面向推理模型的基于图策略优化

arXiv cs.CL

GraphPO 是一种新颖的基于图的强化学习框架,它将轨迹表示为一个有向无环图,合并语义等价的推理路径,以减少冗余探索并改进大型推理模型的信用分配。

生成式OOD正则化的基于模型的策略优化

arXiv cs.LG

介绍 GORMPO,一种密度正则化的离线强化学习算法,使用生成式密度建模将策略更新限制在高密度区域,在真实世界医疗数据集上实现17%的提升,并超越最先进的基线模型。

基于梯度外推的策略优化

arXiv cs.LG

本文介绍了基于梯度外推的策略优化(GXPO),这是一种仅使用三次反向传播即可在大型语言模型(LLM)的强化学习训练中近似多步前瞻的方法。它在保持固定活跃阶段成本的同时,在数学基准测试上展示了优于标准 GRPO 的推理性能。

组熵控制策略优化

Hugging Face Daily Papers

本文提出组熵控制策略优化(GEPO),一种轻量级扩展GRPO的方法,利用组熵进行熵条件非对称优势塑造,解决了基于强化学习的大语言模型对齐过程中不同任务间的异质熵区域问题。实验表明,相比GRPO和近期熵控制方法,GEPO在多项基准测试中均取得一致提升。