Flow-Map GRPO:基于锚定随机组合的少步流图生成器强化学习

arXiv cs.LG 论文

摘要

提出了Flow-Map GRPO,一种用于确定性少步流图生成器的在线RL后训练框架,引入了锚定随机流图组合(ASFMC)以在不改变原始模型参数化的情况下实现随机优化。在基于FLUX的MeanFlow和sCM上的实验表明,在基于奖励的、感知的和任务级别的指标上均有改进。

arXiv:2607.00535v1 公告类型:新 摘要:少步流图生成器,如一致性模型(consistency models)和MeanFlow,通过直接学习噪声与数据之间的长程传输图来加速采样。然而,这些模型通常是确定性的,这使得它们难以通过需要随机轨迹和良好定义似然比的强化学习(RL)后训练方法进行优化。现有的基于SDE的随机化技术是为具有无穷小或精细离散化过渡的基于速度的采样器设计的,因此不直接适用于长程流图。在这项工作中,我们提出了Flow-Map GRPO,一种用于确定性少步流图生成器的在线RL后训练框架。关键组件是锚定随机流图组合(ASFMC),这是一种路径保持的随机化机制,通过基于锚点的条件重采样引入随机性,同时保留确定性流图的原始边缘概率路径。我们推导了单时间和双时间流图参数化的GRPO目标。在基于FLUX的少步文本到图像生成器(包括MeanFlow和sCM)上的实验表明,Flow-Map GRPO在基于奖励的、感知的和任务级别的评估指标上改善了预训练的确定性流图模型。我们的结果表明,确定性少步流图生成器可以有效地与RL后训练对齐,而无需修改其原始模型参数化或将其重新训练为原生随机模型。
查看原文
查看缓存全文

缓存时间: 2026/07/02 05:38

# Flow-Map GRPO: 基于锚定随机组合的少步流映射生成器强化学习
来源:https://arxiv.org/html/2607.00535

###### 摘要

少步流映射生成器(如一致性模型和 MeanFlow)通过直接学习噪声与数据之间的长程传输映射来加速采样。然而,这些模型通常是确定性的,这使得它们难以通过需要随机轨迹和定义良好的似然比的强化学习(RL)后训练方法进行优化。现有的基于随机微分方程(SDE)的随机化技术是为具有无穷小或精细离散化过渡的速度型采样器设计的,因此不直接适用于长程流映射。在这项工作中,我们提出了 **Flow-Map GRPO**,一个针对确定性少步流映射生成器的在线 RL 后训练框架。其关键组件是 **锚定随机流映射组合(ASFMC)**,这是一种路径保持的随机化机制,通过基于锚点的条件重采样引入随机性,同时保留确定性流映射的原始边际概率路径。我们为单时间和双时间流映射参数化推导了 GRPO 目标。在基于 FLUX 的少步文本到图像生成器(包括 MeanFlow 和 sCM)上的实验表明,Flow-Map GRPO 在基于奖励的、感知的和任务级的评估指标上改善了预训练确定性流映射模型。我们的结果证明,确定性少步流映射生成器可以有效地与 RL 后训练对齐,而无需修改其原始模型参数化或将其重新训练为原生随机模型。  
11footnotetext: 乔治亚理工学院,美国乔治亚州亚特兰大。通讯作者:李志奇。

## 1 引言

扩散模型和连续时间流式生成模型已成为高质量图像和视频生成的主导范式(Rombach 等,2022 (https://arxiv.org/html/2607.00535#bib.bib45);Ho 等,2022 (https://arxiv.org/html/2607.00535#bib.bib32);Dao 等,2023 (https://arxiv.org/html/2607.00535#bib.bib81))。这些方法在简单先验分布与数据分布之间构建概率路径,并学习定义连续时间生成过程的得分场或速度场。特别是,诸如流匹配和整流流之类的流式方法通过概率流 ODE 表示生成过程,从而可以通过数值积分学习到的速度场实现原则性采样。然而,尽管理论基础扎实,基于 ODE 的采样通常需要许多离散化步骤,导致推理时计算成本高。这激发了最近在少步流映射生成模型方面的进展,例如一致性模型(Song 等,2023 (https://arxiv.org/html/2607.00535#bib.bib102);Geng 等,2024 (https://arxiv.org/html/2607.00535#bib.bib86))和 MeanFlow(Geng 等,2025a (https://arxiv.org/html/2607.00535#bib.bib76);b (https://arxiv.org/html/2607.00535#bib.bib77);Li 等,2026 (https://arxiv.org/html/2607.00535#bib.bib74))。这些方法不是仅学习瞬时动态,而是直接学习在两个时间点之间映射样本的长程映射 ψt→r。通过将数值积分摊销到学习到的长程映射中,基于流映射的模型可以用一步或少步生成替代迭代 ODE 求解器。

然而,确定性少步流映射给 RL 后训练带来了困难,RL 后训练旨在使预训练生成器与任务级奖励对齐,同时保留其原始流映射参数化和学习到的边际概率路径。最近用于生成模型的强化学习(RL)后训练方法,例如 DDPO(Black 等,2024 (https://arxiv.org/html/2607.00535#bib.bib152))和 Flow-GRPO(Liu 等,2026 (https://arxiv.org/html/2607.00535#bib.bib150)),将采样公式化为马尔可夫决策过程,并使用任务级奖励优化生成策略。这些方法的一个关键要求是明确定义的随机转移核,这对于轨迹级探索以及在策略梯度优化中计算似然比都是必需的。扩散模型通过其去噪过程自然地提供此类随机转移,而基于速度的流模型可以通过路径保持的 SDE 重构(Lipman 等,2024 (https://arxiv.org/html/2607.00535#bib.bib134))配备随机转移。相比之下,基于流映射的模型直接参数化确定性长程传输 ψt→r,这没有定义随机轨迹或转移似然。这造成了确定性少步流映射生成器与基于似然比的 RL 后训练方法之间的结构性不匹配(Boffi 等,2025 (https://arxiv.org/html/2607.00535#bib.bib100))。

参见图注  
图 1:基础生成与 FlowMap-GRPO 后训练生成的比较。

一个自然的尝试是通过使用底层 ODE 动态的路径保持 SDE 重构来引入随机性。虽然这对具有无穷小或精细离散化过渡的速度型采样器有效,但它并不直接扩展到长程流映射。长程 SDE 转移取决于源时间和目标时间之间的整个随机路径,并且通常不能简化为以确定性流映射输出为中心的高斯转移(见 3.1 (https://arxiv.org/html/2607.00535#S3.Thmtheorem1))。因此,基于精确 SDE 的随机化将需要随机积分,从而削弱少步流映射的计算优势。这激发了一种直接在流映射层面操作、同时保留其概率路径的随机化机制。

为了解决这一限制,我们提出了 **Flow-Map GRPO**,一个针对确定性少步流映射生成器的在线 RL 后训练框架。其关键组件是 **锚定随机流映射组合(ASFMC)**,这是一种在长程流映射层面引入随机性的路径保持随机化机制。ASFMC 不是扰动无穷小动态,而是使用一个辅助的锚点变量:给定从 t 到 r 的确定性转移,它首先将样本映射到目标时间,将此确定性端点传输到锚点时间 τ,然后通过概率路径的条件转移重采样回到时间 r。通过这种方式,锚点将确定性流映射组合与随机条件重采样连接起来,产生随机转移,同时保留原始模型学习的边际分布。借助 ASFMC,每个流映射步骤都变成了随机策略转移,使得少步流映射采样可以公式化为 MDP,并使用 GRPO 风格的似然比进行优化。该构造是事后性的,不会修改预训练的流映射参数化。我们为两种主要流映射形式实例化了它:单时间端点映射(例如 sCM)和双时间映射(例如 MeanFlow),其中 ASFMC 可以使用局部或端点锚点。

我们的贡献如下:
- • 我们识别了确定性流映射的基于 SDE 的随机化的一个基本限制,表明它不直接适用于长程流映射转移。
- • 我们提出了锚定随机流映射组合(ASFMC),一种原则性的随机流映射构造,在保留边际概率路径的同时实现轨迹级探索。
- • 我们引入了 Flow-Map GRPO,一个针对确定性少步流映射生成器的统一 RL 后训练框架,并为单时间和双时间流映射参数化推导了一致的公式。
- • 我们在基于 FLUX 的少步文本到图像生成器上实证验证了 Flow-Map GRPO,展示了在基于奖励的、感知的和任务级的评估指标上对预训练 MeanFlow 和 sCM 检查点的改进。

## 2 背景

### 2.1 多步流模型与少步流映射

令 D = {x⁽ⁱ⁾ ∈ X}ⁿᵢ₌₁ 表示来自 X ⊂ Rᵈ 上未知数据分布 p₁ = p_data 的样本。连续时间生成模型构建一个随机过程 {Xₜ}ₜ∈[0,1],其边际分布 pₜ 从简单的基分布 p₀(通常是标准高斯分布)演化到数据分布 p₁,形成概率路径 {pₜ}₁ₜ₌₀。该概率路径可以由确定性概率流 ODE 描述。给定初始样本 x₀ ∼ p₀,其轨迹 {xₜ}ₜ∈[0,1] 根据以下公式演化:
dxₜ/dt = uₜ(xₜ), x₀ ∼ p₀,       (1)
其中 uₜ: X → Rᵈ 是时间相关的速度场。方程 1 (https://arxiv.org/html/2607.00535#S2.E1) 的解定义了一个时间相关流 ψₜ: X → X,满足 ψ₀(x)=x,使得 xₜ = ψₜ(x₀)。{Xₜ}ₜ∈[0,1] 被称为流模型(Lipman 等,2024 (https://arxiv.org/html/2607.00535#bib.bib134)),如果它由方程 1 (https://arxiv.org/html/2607.00535#S2.E1) 生成,即 Xₜ = ψₜ(X₀),X₀ ∼ p₀,并且相应的边际分布可以由前推 pₜ = [ψₜ]♯p₀ 诱导,满足连续性方程:
∂ₜpₜ(x) = -∇·(pₜ(x)uₜ(x)).       (2)
流模型涵盖了主要的连续时间生成模型,包括流匹配(Lipman 等,2022 (https://arxiv.org/html/2607.00535#bib.bib78))、整流流(Liu 等,2023 (https://arxiv.org/html/2607.00535#bib.bib98))以及扩散模型(如 DDIM(Song 等,2020a (https://arxiv.org/html/2607.00535#bib.bib79)))。流模型从 D 学习 uₜᶿ(x)(或等价参数化,如 epsilon 预测),并通过数值求解方程 1 (https://arxiv.org/html/2607.00535#S2.E1) 来生成样本。为了训练 uₜᶿ(x),流模型构建条件路径 Xₜ = aₜX₁ + bₜX₀,其中 aₜ 和 bₜ 是调度函数,满足 a₁=b₀=1 且 a₀=b₁=0。相应的条件速度目标是 uₜ(Xₜ|X₁,X₀) = ȧₜX₁ + ḃₜX₀。在边缘化 X₀ 后,条件路径和速度变为 pₜ(·|X₁) 和 uₜ(·|X₁),其边缘化再次恢复所需的概率路径和方程 1 (https://arxiv.org/html/2607.00535#S2.E1) 中的边际速度:
pₜ(x) = ∫ pₜ(x|x₁)p₁(x₁)dx₁ 且 uₜ(x) = E[uₜ(x|X₁) | Xₜ=x]。
对于上述仿射条件路径,条件速度可以写为:
uₜ(x|x₁) = (ḃₜ/bₜ)x + (ȧₜ - (aₜḃₜ)/bₜ)x₁,       (3)
然后使用代理目标训练模型:
L_c(θ) = E_{t, x₁∼p₁, x∼pₜ(·|x₁)} [ ‖uₜᶿ(x) - uₜ(x|x₁)‖² ]       (4)
流匹配和 DDIM 路径可以通过分别选择 (aₜ, bₜ) = (t, 1−t) 和 (aₜ, bₜ) = (√(1−(1−t)²), 1−t) 恢复。对于条件生成,概率路径和速度场可以直接以 c 为条件,使用 pₜ(x|x₁,c) 和 uₜ(x|x₁,c)。

速度场 uₜᶿ 仅描述生成过程的瞬时演化。离散化后,它给出从 t 到 t+Δt 的短程转移,因此生成样本需要多次求解方程 1 (https://arxiv.org/html/2607.00535#S2.E1)。为了实现一步或少步生成,基于流映射的方法,包括一致性模型(Geng 等,2024 (https://arxiv.org/html/2607.00535#bib.bib86))和 MeanFlow(Geng 等,2025a (https://arxiv.org/html/2607.00535#bib.bib76)),直接学习流映射 ψₜ→ᵣᶿ,定义为 ψₜ→ᵣ = ψₜ ∘ ψᵗ⁻¹,使一步生成为 x₁ = ψ₀→₁ᶿ(x₀),少步生成(例如两步)为 x₀.₅ = ψ₀→₀.₅ᶿ(x₀) 和 x₁ = ψ₀.₅→₁ᶿ(x₀.₅)。尽管基于流映射的方法在生成速度上具有明显优势,但它们面临一个关键训练挑战:从数据集获得 ψₜ→ᵣ 的直接监督是困难的(Li 等,2026 (https://arxiv.org/html/2607.00535#bib.bib74))。在附录 A (https://arxiv.org/html/2607.00535#A1) 中,我们总结了学习流映射的常见策略,并讨论了代表性的基于流映射的方法,包括一致性模型和 MeanFlow。

### 2.2 流模型的强化学习

最近的工作(Liu 等,2026 (https://arxiv.org/html/2607.00535#bib.bib150);Li 等,2025 (https://arxiv.org/html/2607.00535#bib.bib151);Xue 等,2025 (https://arxiv.org/html/2607.00535#bib.bib153);Black 等,2024 (https://arxiv.org/html/2607.00535#bib.bib152))旨在使用任务特定奖励(如人类偏好、美学质量或下游评估指标)改进流模型和扩散模型。这些奖励通常不可微分;因此,这些方法通过将采样轨迹视为多步 MDP,将生成公式化为强化学习问题。对于带有条件 c 的条件生成模型,状态为 sₜ = (c, t, xₜ),动作为沿轨迹的下一个样本 aₜ = x_{t+Δt},策略为模型转移 π_θ(aₜ|sₜ) = p_θ(x_{t+Δt}|xₜ|c),下一状态转移为 P(s_{t+Δt}|sₜ, aₜ) = δ_{(c, t+Δt, aₜ)}(s_{t+Δt})。初始状态从 ρ₀(s₀) = p(c)p₀(x₀) 中抽取,奖励分配给最终生成的样本:R(sₜ, aₜ) = r(x₁|c) 当 t=1 时。然后,可以使用基于转移似然 p_θ(x_{t+Δt}|xₜ|c) 的策略梯度目标来优化模型。

上述公式要求策略 π_θ(aₜ|sₜ) = p_θ(x_{t+Δt}|xₜ|c) 是随机的,以便 RL 过程可以探索不同的轨迹,并且策略似然比 π_θ(aₜ|sₜ) / π_θ_ref(aₜ|sₜ)

相似文章

通过非梯度向量流的流图学习

arXiv cs.LG

本文介绍了SGFlow,一种为扩散模型学习流图的方法,该方法避免了可逆性约束和通过模型迭代的反向传播,在CIFAR上取得了有竞争力的FID分数,并具有经过证明的稳定点保证。

面向组合奖励的流模型冲突感知加性引导

arXiv cs.AI

本文识别了组合奖励下引导流模型中的流形外漂移,并提出冲突感知加性引导(CAR),这是一种轻量级方法,可动态解决梯度冲突,从而无需重新训练即可提升生成保真度。