LC-GRPO:利用朗之万校正弥合基于流的GRPO训练-推理差距

arXiv cs.LG 论文

摘要

本文介绍了LC-GRPO,一种带有朗之万校正的基于流的GRPO框架,通过将随机训练轨迹与确定性ODE采样对齐来弥合训练与推理之间的差距,从而在SD3.5、FLUX.1-Dev和HunyuanVideo等模型上提升奖励优化效果。

arXiv:2608.05600v1 公告类型:新 摘要:基于流的生成模型通常通过求解确定性常微分方程(ODE)进行采样,而在线强化学习需要随机轨迹来进行策略探索和优化。因此,现有的用于流模型的GRPO方法在训练期间用随机微分方程(SDE)替换推理时的ODE。尽管ODE和SDE在连续时间上共享相同的边际分布,但它们的有限步离散化结果可能差异很大。特别是,随着探索噪声的增加,SDE轨迹通常会变得模糊,从而导致用于强化学习的样本与测试时ODE采样器生成的样本之间存在不匹配。我们提出了LC-GRPO,一种带有朗之万校正的基于流的GRPO框架。每个轨迹转移步骤首先执行一个与推理对齐的ODE欧拉步,然后应用一个随机朗之万校正,以目标边际分布为目标,针对所得的时间步。所需的得分直接从流速度中恢复,无需额外的得分模型,而所得的转移仍然是一个各向同性高斯分布,具有易于处理的似然用于策略优化。我们从理论上证明,在适当条件下,一步朗之万校正可以减少不完美ODE欧拉步的Wasserstein误差。在匹配的随机性水平下,我们进一步证明,所提出的转移可以比反向SDE的标准欧拉-马鲁亚马离散化更精确。在SD3.5-Medium、FLUX.1-Dev和HunyuanVideo上的实验表明,LC-GRPO在文本到图像和文本到视频任务中一致地提升了奖励优化效果,保持了生成质量,并显著缩小了随机训练轨迹与确定性测试时ODE推理之间的差距。
查看原文
查看缓存全文

缓存时间: 2026/08/07 07:51

# LC-GRPO:借助朗之万修正弥合基于流的GRPO训练-推理差距 来源:https://arxiv.org/html/2608.05600 ###### 摘要 基于流的生成模型通常通过求解确定性常微分方程(ODE)进行采样,而在线强化学习需要随机轨迹以实现策略探索和优化。因此,现有的针对流模型的GRPO方法在训练期间用随机微分方程(SDE)替代推理时的ODE。尽管ODE和SDE在连续时间下具有相同的边际分布,但它们的有限步离散化可能差异显著。尤其是,随着探索噪声增大,SDE轨迹往往变得模糊,导致用于强化学习的样本与测试时ODE采样器生成的样本之间出现不匹配。我们提出LC-GRPO,一种带有朗之万修正的基于流的GRPO框架。每个轨迹转移首先执行与推理对齐的ODE欧拉步,然后施加一个针对所得时间步边际分布的随机朗之万修正。所需分数直接从流速度中通过Tweedie公式恢复,无需额外的分数模型,而所得转移仍是各向同性高斯分布,具有可用于策略优化的可解析似然。我们理论上证明,在适当条件下,一步朗之万修正能够降低不完美ODE欧拉步的Wasserstein误差。在匹配的随机性水平下,我们进一步证明所提出的转移比反向SDE的标准Euler–Maruyama离散化更精确。在SD3.5-Medium、FLUX.1-Dev和HunyuanVideo上的实验表明,LC-GRPO一致地改善了文本到图像和文本到视频任务中的奖励优化,保持生成质量,并显著缩小了随机训练轨迹与确定性测试时ODE推理之间的差距。 ## 1 引言 流匹配和修正流模型已成为视觉生成的强大基础,通过确定性常微分方程(ODE)采样支持高质量的文本到图像和文本到视频合成(Liu等人,2022(https://arxiv.org/html/2608.05600#bib.bib27);Lipman等人,2022(https://arxiv.org/html/2608.05600#bib.bib23);Esser等人,2024(https://arxiv.org/html/2608.05600#bib.bib10);Kong等人,2024(https://arxiv.org/html/2608.05600#bib.bib18))。与随机扩散采样相比,这些模型学到的近似直线的输运路径使得仅用较少的采样步数就能实现精确生成,因此对大规模视觉模型尤其具有吸引力。随着其生成能力的提升,利用外部反馈进行后训练对于使其适应难以仅通过监督学习捕获的目标变得越来越重要,这些目标包括人类偏好、视觉质量、组合正确性和精确文本渲染。诸如DDPO以及更近期的组相对策略优化(GRPO)等在线强化学习方法提供了一种直接优化来自生成样本的不可微奖励的途径(Black等人,2024(https://arxiv.org/html/2608.05600#bib.bib2);Liu等人,2026a(https://arxiv.org/html/2608.05600#bib.bib25);Xue等人,2025(https://arxiv.org/html/2608.05600#bib.bib45))。这个问题并非视觉生成所独有:训练-推理差距也出现在LLM的RL后训练中,其中分离的推理和训练栈可能引入数值和算法上的不一致,导致用于数据收集的轨迹策略与正在优化的策略不同(Qi等人,2025(https://arxiv.org/html/2608.05600#bib.bib30);Wasti等人,(https://arxiv.org/html/2608.05600#bib.bib41);Yao等人,2025(https://arxiv.org/html/2608.05600#bib.bib47);Liang等人,2026(https://arxiv.org/html/2608.05600#bib.bib22))。 参见说明 参见说明 图1:LC-GRPO的性能。顶部:朗之万修正缩小了随机RL轨迹与测试时ODE推理之间的差距,如步骤0所示,使LC-GRPO实现了最小的训练-评估差距。底部:在DrawBench上的评估结果(Saharia等人,2022(https://arxiv.org/html/2608.05600#bib.bib33))。 然而,将在线强化学习应用于流模型会引入训练与推理之间的根本性不匹配。在测试时,流模型通常通过求解确定性反向时间ODE来采样。而强化学习需要能够从相同状态探索多个动作且其转移似然可评估的随机策略。因此,现有的基于流的GRPO方法在轨迹生成期间用理论上等价的反向时间随机微分方程(SDE)替代推理ODE。在连续时间下,ODE和SDE具有相同的边际分布。但在实践中,两个过程都必须使用少量采样步进行离散化,其有限步行为可能差异显著。用于SDE轨迹的Euler–Maruyama离散化会同时累积来自离散化漂移和注入布朗噪声的误差,而测试时ODE采样则遵循更干净的确定性轨迹。我们通过LC-GRPO——一种基于朗之万修正的基于流的GRPO框架——来解决这一矛盾。LC-GRPO不直接模拟反向SDE,而是让每个轨迹转移首先执行与推理采样器相同的ODE欧拉更新。然后我们对所得时间戳处的边际分布施加一步朗之万修正。所需分数通过Tweedie公式直接从流速度获得,因此该修正不需要额外的分数模型。这种预测-修正结构将输运与探索分离:ODE步保留推理时的采样轨迹,而朗之万步引入随机性并修正目标边际附近的局部采样误差。重要的是,所得转移仍是具有可解析密度的各向同性高斯分布,因此可以直接用作GRPO目标中的随机策略。朗之万步长自然控制策略探索的量。我们为该设计提供了理论依据。在强对数凹性和分数平滑性条件下,我们证明只要ODE欧拉步存在非零误差,适当选择的朗之万修正就能严格降低其到目标边际的Wasserstein距离。我们进一步在匹配的随机性水平下将朗之万修正采样与标准反向SDE的Euler–Maruyama步进行比较。在温和的正则性条件和显式比较条件下,两种方法的误差具有相同的渐近阶,但朗之万修正步的Wasserstein误差前导项严格更小。这些结果形式化了这样一个直觉:随机探索不必然以牺牲推理ODE所实现的采样精度为代价。 我们使用SD3.5-Medium(Esser等人,2024(https://arxiv.org/html/2608.05600#bib.bib10))、FLUX.1-Dev(Labs,2024(https://arxiv.org/html/2608.05600#bib.bib19))和HunyuanVideo(Kong等人,2024(https://arxiv.org/html/2608.05600#bib.bib18))在图像和视频生成上评估LC-GRPO。实验涵盖视觉文本渲染、人类偏好对齐、多奖励优化和视频质量优化。在这些设置中,LC-GRPO相比Flow-GRPO、DanceGRPO和系数保持采样一致地改善了优化奖励,同时在辅助图像和视频指标上保持了有利的奖励-质量权衡。它还产生了明显更清晰的随机轨迹,并实现了训练轨迹与ODE评估奖励之间最小的差异。这些收益是在与基线匹配或更有利的轨迹计算预算下获得的。总而言之,我们的主要贡献如下: 1. 1.我们确定有限步SDE离散化是基于流的GRPO中训练-推理差距的核心来源,并展示了它对轨迹质量和奖励对齐的不利影响。 2. 2.我们提出LC-GRPO,它将推理对齐的ODE输运与保分布的朗之万修正相结合,以提供精确、随机且似然可解析的强化学习轨迹。 3. 3.我们为所提出的修正建立了理论保证,并在文本到图像和文本到视频强化学习任务中展示了一致的改进。 ## 2 相关工作 我们首先回顾扩散模型和流模型的对齐方法,包括利用外部反馈的后训练和推理时引导,然后重点讨论在基于流的GRPO和LLM RL后训练中弥合训练-推理差距。 #### 扩散模型和流模型的RL。 在事后训练中对齐扩散模型和流模型通常遵循三种策略之一。(1)直接奖励反向传播,通过可微奖励函数反向传播来微调模型(Clark等人,2024(https://arxiv.org/html/2608.05600#bib.bib4);Prabhudesai等人,2023(https://arxiv.org/html/2608.05600#bib.bib29))。(2)奖励增强回归损失,将外部反馈与扩散回归目标相结合。这些包括奖励加权回归(RWR)(Lee等人,2023(https://arxiv.org/html/2608.05600#bib.bib20);Dong等人,2023(https://arxiv.org/html/2608.05600#bib.bib8));直接偏好优化(DPO),它利用配对偏好数据与二元人类反馈奖励(Rafailov等人,2023(https://arxiv.org/html/2608.05600#bib.bib32);Wallace等人,2024(https://arxiv.org/html/2608.05600#bib.bib37);Yang等人,2024(https://arxiv.org/html/2608.05600#bib.bib46));以及DiffusionNFT(Zheng等人,2025(https://arxiv.org/html/2608.05600#bib.bib49)),它通过纳入具有密集连续奖励的负样本来推广DPO。(3)PPO风格策略梯度方法,从早期方法如DPOK(Fan等人,2023(https://arxiv.org/html/2608.05600#bib.bib11))和DDPO(Black等人,2024(https://arxiv.org/html/2608.05600#bib.bib2))到近期用于扩散和流模型的GRPO扩展(Liu等人,2026a(https://arxiv.org/html/2608.05600#bib.bib25);Xue等人,2025(https://arxiv.org/html/2608.05600#bib.bib45);Deng等人,2026(https://arxiv.org/html/2608.05600#bib.bib5);Savani等人,2026(https://arxiv.org/html/2608.05600#bib.bib34);Ding和Ye,2025(https://arxiv.org/html/2608.05600#bib.bib7))。除模型后训练外,补充性的推理时对齐方法利用依赖于时间的分类器或从下游目标导出的梯度来引导扩散和流采样(Song等人,2020b(https://arxiv.org/html/2608.05600#bib.bib36);Dhariwal和Nichol,2021(https://arxiv.org/html/2608.05600#bib.bib6);Chung等人,2022(https://arxiv.org/html/2608.05600#bib.bib3);Yuan等人,2023(https://arxiv.org/html/2608.05600#bib.bib48);Guo等人,2024(https://arxiv.org/html/2608.05600#bib.bib12);2026(https://arxiv.org/html/2608.05600#bib.bib13))。 #### 基于流的GRPO中的训练-推理差距。 近期工作探索减少基于流的GRPO中随机训练轨迹与确定性推理采样器之间的不匹配。MixGRPO(Li等人,2025(https://arxiv.org/html/2608.05600#bib.bib21))在轨迹中集成SDE和ODE采样以提高训练效率。CPS(Wang和Yu,2025(https://arxiv.org/html/2608.05600#bib.bib39))则采用DDIM采样来改善样本质量。SAGE-GRPO(Zheng等人,2026(https://arxiv.org/html/2608.05600#bib.bib50))提出了一种简洁的噪声标准差公式,使采样过程与视频生成的数据流形更好对齐。 #### LLM RL后训练中的训练-推理不匹配。 实际的LLM RL系统通常使用单独的推理引擎生成轨迹,并使用单独的框架进行训练,这可能引入不匹配。一条工作线处理数值不一致性(Qi等人,2025(https://arxiv.org/html/2608.05600#bib.bib30);Qiu等人,2026(https://arxiv.org/html/2608.05600#bib.bib31);Wasti等人,(https://arxiv.org/html/2608.05600#bib.bib41));例如,Qi等人(2025(https://arxiv.org/html/2608.05600#bib.bib30))在RL微调期间从BF16切换到FP16。另一条补充工作线采用算法方法,将采样器侧信息纳入训练更新(Yao等人,2025(https://arxiv.org/html/2608.05600#bib.bib47);Liu等人,2025(https://arxiv.org/html/2608.05600#bib.bib24);Liang等人,2026(https://arxiv.org/html/2608.05600#bib.bib22))。值得注意的是,Yao等人(2025(https://arxiv.org/html/2608.05600#bib.bib47))使用训练到采样器的概率比作为裁剪修正权重。 ## 3 预备知识 #### 流匹配。 设x0∼X0表示来自数据分布的样本,x1∼X1表示来自先验分布(如标准高斯分布)的噪声样本。修正流(Liu等人,2022(https://arxiv.org/html/2608.05600#bib.bib27);Lipman等人,2022(https://arxiv.org/html/2608.05600#bib.bib23))构造x0和x1之间的时间相关插值: xt=(1−t)x0+tx1,t∈[0,1]。 在此约定下,t=0对应数据,t=1对应噪声。因此,生成通过从先验分布求解反向时间ODE回到数据分布来执行: dxt=vtdt,(1) 其中x1∼X1且t:1→0。速度场vt将样本从先验分布输运到数据分布。在实践中,它由Transformer vθ(xt,t)近似,并通过流匹配回归目标训练: minθ Et,x0,x1[‖vθ(xt,t)−(x1−x0)‖2^2]。 然后使用学到的速度场求解反向时间ODE(式1(https://arxiv.org/html/2608.05600#S3.E1))进行生成。 #### 作为RL轨迹的SDE采样。 流匹配的推理过程可以形式化为马尔可夫决策过程(MDP)(Black等人,2024(https://arxiv.org/html/2608.05600#bib.bib2))。在去噪步骤t,状态定义为st:=(c,t,xt),动作是模型预测的下一个去噪样本at:=xt−1,策略为π(at∣st):=pθ(xt−1∣xt,c)。然而,基于ODE的采样是确定性的,不引入动作级随机性,这阻碍了强化学习所需的随机探索。为解决这一不匹配,Flow-GRPO(Liu等人,2026a(https://arxiv.org/html/2608.05600#bib.bib25))和DanceGRPO(Xue等人,2025(https://arxiv.org/html/2608.05600#bib.bib45))将反向时间ODE替换为等价的SDE: dxt=[vt(xt,t)+σt^2/(2t)(xt+(1−t)vt(xt,t))]dt+σt dwt,

相似文章

LithoGRPO:基于GRPO强化流匹配的快速逆光刻

arXiv cs.LG

LithoGRPO引入了一个新颖的框架,将流匹配与基于GRPO的强化学习相结合,用于快速且高质量的逆光刻掩模优化,在保持高效生成的同时实现了最先进的性能。

预测性GRPO:训练动力学的闭式模型

arXiv cs.LG

提出一个GRPO训练动力学的闭式降阶模型,将其简化为阻尼振荡器,并推导出关于稳定性、组大小不变性和损失曲率的预测。在多个模型和基准上进行了验证。

Flow-Map GRPO:基于锚定随机组合的少步流图生成器强化学习

arXiv cs.LG

提出了Flow-Map GRPO,一种用于确定性少步流图生成器的在线RL后训练框架,引入了锚定随机流图组合(ASFMC)以在不改变原始模型参数化的情况下实现随机优化。在基于FLUX的MeanFlow和sCM上的实验表明,在基于奖励的、感知的和任务级别的指标上均有改进。

多模块 GRPO:组合策略梯度与提示优化的语言模型程序方法

Papers with Code Trending

本文提出 mmGRPO,一种多模块扩展的群体相对策略优化(GRPO)方法,通过优化语言模型调用和提示来提升模块化 AI 系统的准确率。实验表明,该方法在各类任务上平均带来 11% 的准确率提升,并在 DSPy 中提供了开源实现。