NormGuard:流匹配强化学习中保持奖励的范数约束

arXiv cs.LG 论文

摘要

本文提出了NormGuard,一种范数预算正则化器,用于在流匹配生成模型的强化学习后训练过程中抑制与奖励无关的速度范数膨胀,从而在不牺牲奖励的情况下改善感知图像质量。

arXiv:2606.27771v1 公告类型: 新 \n摘要:强化学习(RL)后训练改善了基于流的生成器的奖励对齐,但通常会降低感知质量,而这种降低并不被奖励代理所捕捉。我们发现了这种漂移的一个简单结构特征:在三种后训练方法(NFT、AWM、DPO)中,RL微调使每步速度范数$\|v_\theta\|$相对于参考值膨胀了$5\%$到$15\%$。在无分类器引导(CFG)中已经研究了一种范数膨胀形式,其中在推理时将速度重新缩放到参考范数可以减轻由此产生的伪影。然而,这种推理时的修正并不能干净地转移到RL中:在推理时将$v_\theta$重新缩放到与$\|v_{\text{ref}}\|$匹配既不能改善奖励,也不能修复质量下降,因为膨胀已共同适应到模型权重中。此外,伴随灵敏度分析表明,在批次级别,速度大小重新缩放不携带一致的一阶奖励信号,表明抑制范数膨胀不太可能移除一个持续携带奖励的分量。由于推理时重归一化失败,而范数抑制不带来奖励成本,训练时干预是合适的策略。综合这些发现,我们提出了\methodname,一种仅在$\|v_\theta\|$超过$\|v_{\text{ref}}\|$时激活的铰链惩罚,并且与任何速度局部的基损失加法组合。在两个基础模型、三种后训练方法和两个奖励代理上,\methodname一致改善了MLLM评判的图像质量和法医真实性,同时保持奖励,并且在少量步推理下增益放大,且不能通过早停来解释。
查看原文
查看缓存全文

缓存时间: 2026/06/29 05:26

# NormGuard: 流匹配强化学习中保持奖励的范数约束
来源: https://arxiv.org/html/2606.27771
1\]香港科技大学 2\]快手科技 3\]中国科学院大学

Lianyu Pang\* Cheng Da Huan Yang Changqian Yu Kun Gai Wenhan Luo†\\[\\[

###### 摘要

强化学习(RL)后训练改进了基于流的生成器在奖励对齐上的表现,但往往以奖励代理未捕捉的方式降低感知质量。我们识别出这种漂移的一个简单结构性特征:在三种后训练方法(NFT、AWM、DPO)中,RL微调使每步速度范数‖vθ‖\\\|v\_\{\\theta\}\\\|相对于参考模型膨胀了5%5\\%到15%15\\%。这种范数膨胀形式已在无分类器引导(CFG)中得到研究,其中在推理时将速度重新缩回到参考范数可以缓解由此产生的伪影。然而,这种推理时修正无法直接迁移到RL:在推理时将vθv\_\{\\theta\}重新缩放到匹配‖vref‖\\\|v\_\{\\text\{ref\}\}\\\|既不能提高奖励,也不能修复质量下降,因为膨胀已经与模型权重共同适应。此外,伴随灵敏度分析表明,速度大小重缩放无法在批次层面携带一致的一阶奖励信号,这表明抑制范数膨胀不太可能移除一个持续携带奖励的分量。由于推理时重归一化失败,而范数抑制又不带来奖励损失,训练时干预成为合适的策略。这些发现共同催生了NormGuard,一个仅在‖vθ‖\\\|v\_\{\\theta\}\\\|超过‖vref‖\\\|v\_\{\\text\{ref\}\}\\\|时激活的铰接惩罚,并与任何速度局部基础损失可加性组合。在两种基础模型、三种后训练方法和两种奖励代理上,NormGuard在保持奖励的同时持续改善了MLLM评判的图像质量和真实性,且增益在少步推理下更为显著,且无法通过早停来解释。

11脚注:同等贡献。†通讯作者。参见图注:图1:我们提出NormGuard,一个简单的范数预算正则化器,在流匹配模型的RL训练中抑制与奖励无关的范数膨胀。NormGuard减少了基线中出现的过度锐化、颜色过饱和和不自然光照,产生更逼真的结果。提示词见附录[10.1 (https://arxiv.org/html/2606.27771#S10.SS1)。

## 1 引言

强化学习(RL)后训练已成为将基于流的生成模型[ddpm,ddim,ldm,flow-matching]与人类偏好[PickScore,HPSv2]对齐的标准工具。然而,奖励增益总是伴随着*奖励过度优化*[ScalingRewardOveroptimization,realgen,GARDO]:感知质量以奖励代理未捕捉的方式下降,包括过度锐化、色彩偏移、不自然光照和精细纹理丢失。标准的缓解措施,如早停和KL正则化,将后训练漂移视为单一的聚合量。设vθv\_\{\\theta\}为微调后的速度,vrefv\_\{\\text\{ref\}\}为预训练的参考。KL正则化通常采用MSE惩罚‖vθ−vref‖2\\\|v\_\{\\theta\}\-v\_\{\\text\{ref\}\}\\\|^\{2\}的形式。这些方法约束了速度偏离的总量,但未区分偏离的哪个分量与伪影相关,因此缺乏针对性修复的基础。

参见图注:图2:动机:RL后训练使每步速度范数膨胀并产生视觉伪影(左)。与CFG不同,推理时重归一化对RL无效,因为膨胀已与模型权重共同适应(中)。伴随灵敏度分析证实,抑制范数膨胀不携带一致的一阶奖励信号,这促使我们在训练时对过高的速度范数施加铰接惩罚(右)。图2 (https://arxiv.org/html/2606.27771#S1.F2) 概述了完整的动机。在不施加任何漂移结构性假设的情况下,一个简单的起点是检查每步速度范数‖vθ\(xt,t\)‖\\\|v\_\{\\theta\}\(x\_\{t\},t\)\\\|及其与参考范数‖vref\(xt,t\)‖\\\|v\_\{\\text\{ref\}\}\(x\_\{t\},t\)\\\|的比值。以使用PickScore的SD3.5-Medium为例:在NFT、AWM和DPO中,RL后训练一致地使该范数相对于参考膨胀了5%5\\%到15%15\\%,且沿去噪轨迹均匀分布(图3 (https://arxiv.org/html/2606.27771#S3.F3))。

类似的范数膨胀形式已在推理时无分类器引导(CFG)[cfg]中得到充分记录。对于引导尺度ω\>1\\omega\>1,CFG修改后的速度其幅度远大于条件速度(‖vCFG‖\>‖vcond‖\\\|v\_\{\\text\{CFG\}\}\\\|\>\\\|v\_\{\\text\{cond\}\}\\\|),并且这种范数增长已被证明会使采样轨迹超出学习到的数据分布[cfg-renorm]。由此产生的伪影,如过度锐化和不自然的白平衡,也在RL微调模型中观察到。如图2 (https://arxiv.org/html/2606.27771#S1.F2)(中)所示,[cfg-renorm]通过在推理时将部署的速度重新缩回到参考范数同时保持其方向,成功解决了CFG伪影问题。

然而,这种CFG重归一化技术并不适用于RL后训练引起的范数膨胀。我们将RL微调后的速度重新缩放到在每一步匹配‖vref‖\\\|v\_\{\\text\{ref\}\}\\\|。重归一化后奖励得以保持,但生成的图像仍表现出过度锐化和不自然光照(表1 (https://arxiv.org/html/2606.27771#S3.T1)和图5 (https://arxiv.org/html/2606.27771#S3.F5))。与CFG的对比具有诊断意义:CFG膨胀是推理时两个速度头的显式组合,因此重缩放可以干净地移除它;而RL膨胀已训练进模型权重中,在推理时将其重新缩回会扭曲共同适应的动态。

接着,我们询问在训练时抑制膨胀是否会干扰奖励增益。在乘法速度缩放vθ↦\(1\+ε\)vθv\_\{\\theta\}\\mapsto\(1\+\\varepsilon\)v\_\{\\theta\}下的一阶奖励变化由每时间步的范数缩放灵敏度S\(t\)=vθ\(xt,t\)⊤a\(t\)S\(t\)=v\_\{\\theta\}\(x\_\{t\},t\)^\{\\top\}a\(t\)控制,其中a\(t\)a\(t\)是奖励的伴随状态。在6,4006\{,\}400个样本上,S\(t\)S\(t\)在不同提示词之间表现出显著的每样本幅度和符号异质性,而其批次均值接近于零;噪声信号比σ/\|μ\|\\sigma/\|\\mu\|范围从3×3\\times到100×100\\times。因此,在一阶和批次层面,速度大小重缩放并未揭示一致的奖励信号,表明在训练时抑制范数膨胀不太可能移除奖励增益。

这两个发现指向同一方向。1)推理时重归一化失败,因此干预必须发生在训练时。2)速度大小重缩放并未在批次层面揭示一致的一阶奖励信号,表明训练时范数抑制不太可能系统性地降低奖励增益。基于这些观察,我们提出NormGuard,一个训练时对速度范数的惩罚,仅在‖vθ‖\\\|v\_\{\\theta\}\\\|超过‖vref‖\\\|v\_\{\\text\{ref\}\}\\\|时激活,如图2 (https://arxiv.org/html/2606.27771#S1.F2)(右)所示。该目标与现有的速度局部后训练损失并存,仅添加一个标量超参数。

我们在两种基础流模型、三种后训练方法(NFT、AWM、DPO)和两种奖励模型上验证了该正则化器。使用基于MLLM的图像质量评估和真实性检测,我们发现该正则化器持续提升视觉质量,并且在大多数设置下提高真实感的同时保留了大部分奖励增益。值得注意的是,增益在少步推理下尤为显著,且改进无法通过早停解释,并与KL正则化互补。这些结果表明,KL惩罚的聚合漂移可以被有益地分解:范数膨胀驱动感知伪影而几乎不携带奖励信号,方向重对齐则贡献了大部分奖励增益。区分这两个分量为奖励过度优化提供了更精细的诊断。

我们的贡献有三点。1)我们识别出基于流的生成模型中RL后训练存在一致的速度范数膨胀效应,这可能导致视觉伪影。2)我们展示了CFG风格的推理时重归一化无法干净地迁移到RL训练的模型,而批次层面的一阶灵敏度并未揭示与均匀范数缩放对齐的稳定奖励效应。3)我们引入了NormGuard,一个简单的训练时正则化器,抑制过高的速度范数增长,并在多种模型、后训练方法和奖励函数上改善了感知质量。

## 2 相关工作

### 2.1 生成模型的RL后训练

文本到图像生成近年来取得了显著进步[ddpm,ldm,SD3,flux-2]。受RLHF在语言模型[ppo,dpo,grpo]中成功的启发,越来越多的研究工作将这些技术适配到基于流的生成模型,包括Diffusion-DPO[DiffusionDPO]、DDPO[DDPO]、Flow-GRPO[Flow-grpo]、Dance-GRPO[DanceGRPO]、Diffusion-NFT[NFT]和AWM[AWM]。所有这些方法都依赖奖励模型(如PickScore[PickScore]、GenEval[GenEval]或HPS[HPSv2,HPSv3])来提供训练信号。

### 2.2 奖励过度优化

RL微调的一个公认病理是奖励过度优化[ScalingRewardOveroptimization,ConfrontingRewardOveroptimization,DefiningRewardGaming],其中模型利用奖励代理的不完善性而牺牲真实质量。在文本到图像生成中,优化PickScore或HPS等奖励可能产生伪影,包括过度锐化、色彩偏差和不自然光照[realdpo,realgen],因此代理奖励可能提升,即使感知质量下降。

近期有几项工作从不同角度解决了这个问题。GRPO-Guard[GRPO-Guard]通过比率归一化和梯度重加权来稳定优化。RSA-FT[rsa-ft]将奖励攻击归因于陡峭的奖励景观,并通过在图像和参数空间展平景观来缓解。RealGen[realgen]用与逼真度更好对齐的检测器基础奖励替代人类偏好奖励。RewardDance[RewardDance]通过扩大奖励模型来减少奖励攻击,Pref-GRPO[Pref-GRPO]用成对偏好拟合替代逐点得分最大化以避免虚幻优势,而GARDO[GARDO]引入门控自适应正则化和多样性感知优化以平衡反攻击与探索。

## 3 范数膨胀:现象与诊断

本节强化我们方法的实证动机。我们首先记录RL后训练引起的范数膨胀,并将其与无分类器引导中的类似现象联系起来(第3.1节)。然后,我们检查相应的推理时重归一化是否能迁移到RL训练的模型,以及抑制膨胀范数是否在批次层面表现出稳定的一阶奖励效应(第3.2节)。

### 3.1 现象:范数膨胀及其视觉特征

参见图注
图3:RL引起的范数膨胀。SD3.5-Medium上AWM、DPO和NFT的去噪时间步平均速度范数。RL后训练(橙色)一致地将范数提升至预训练参考(蓝色虚线)之上。NormGuard正则化器(洋红色)在不牺牲奖励的情况下抑制了多余范数。
参见图注
图4:去噪步上的范数缩放灵敏度S\(t\)S\(t\)(SD3.5-M + 6.4K样本)。噪声信号比σ/\|μ\|\\sigma/\|\\mu|范围从3×3\\times到100×100\\times,表明沿范数膨胀方向的信号存在噪声。

##### 实证观察。

我们测量了SD3.5-Medium + PickScore在RL后训练前后的每步速度范数‖vθ\(xt,t\)‖\\\|v\_\{\\theta\}\(x\_\{t\},t\)\\\|,覆盖三种RL方法(NFT[NFT]、AWM[AWM]和DPO[DiffusionDPO])。RL微调一致地将速度范数分布向上移动了5%5\\%到15%15\\%,且沿去噪轨迹均匀分布,在所有配置中一致(图3 (https://arxiv.org/html/2606.27771#S3.F3))。

##### 与已知失败模式的联系:CFG引起的速度膨胀。

类似形式的范数膨胀已在推理时无分类器引导(CFG)[cfg]中得到充分记录。在CFG中,修改后的速度为

v^CFG\(xt,t\)=vuncond\(xt,t\)\+ω\(vcond\(xt,t\)−vuncond\(xt,t\)\),ω\>1,\\hat\{v\}\_\{\\text\{CFG\}\}\(x\_\{t\},t\)=v\_\{\\text\{uncond\}\}\(x\_\{t\},t\)\+\\omega\\big\(v\_\{\\text\{cond\}\}\(x\_\{t\},t\)\-v\_\{\\text\{uncond\}\}\(x\_\{t\},t\)\\big\),\\quad\\omega\>1, (1) 其中ω\\omega是引导尺度。STIV[cfg-renorm]报告称,对于ω\>1\\omega\>1,v^CFG\\hat\{v\}\_\{\\text\{CFG\}\}的幅度远大于条件速度,‖v^CFG‖\>‖vcond‖\\\|\\hat\{v\}\_\{\\text\{CFG\}\}\\\|\>\\\|v\_\{\\text\{cond\}\}\\\|,尤其在早期积分阶段。这种范数增长使采样轨迹超出学习到的数据分布,导致伪影。他们的修复方案*CFG重归一化*在推理时将v^CFG\\hat\{v\}\_\{\\text\{CFG\}\}重新缩放到‖vcond‖\\\|v\_\{\\text\{cond\}\}\\\|,同时保持其方向:

v^CFG′\(xt,t\):=‖vcond\(xt,t\)‖‖v^CFG\(xt,t\)‖⋅v^CFG\(xt,t\)。\\hat\{v\}\_\{\\text\{CFG\}\}^\{\\prime\}\(x\_\{t\},t\):=\\frac\{\\\|v\_\{\\text\{cond\}\}\(x\_\{t\},t\)\\\|\}\{\\\|\\hat\{v\}\_\{\\text\{CFG\}\}\(x\_\{t\},t\)\\\|\}\\cdot\\hat\{v\}\_\{\\text\{CFG\}\}\(x\_\{t\},t\)。 (2)
结果,这种推理时修正有效缓解了CFG设置中的伪影。下一小节将探讨相同的干预是否能迁移到RL训练模型的推理时。

### 3.2 推理时重归一化能迁移到RL吗?

表1:推理时重归一化并未改善奖励。ΔR\\DeltaR表示有无速度重归一化下奖励的变化。
| 指标 | 配置 | 基础 | RL | +重归一化 | ΔR\\DeltaR |
|------|------|------|----|-----------|----------|
| Pick-Score | SD3.5 (NFT) | 0.768 | 0.869 | 0.869 | \cellcolortablegray +0.000 |
| Pick-Score | SD3.5 (AWM) | 0.768 | 0.869 | 0.865 | \cellcolortablegray −0.004 |
| Pick-Score | SD3.5 (DPO) | 0.768 | 0.849 | 0.850 | \cellcolortablegray +0.001 |
| Pick-Score | FLUX (NFT) | 0.802 | 0.905 | 0.904 | \cellcolortablegray −0.001 |
| HPSv2 | SD3.5 (NFT) | 0.289 | 0.308 | 0.300 | \cellcolortablegray −0.008 |
| HPSv2 | FLUX (NFT) | 0.271 | 0.315 | 0.313 | \cellcolortablegray −0.002 |

参见图注
图5:推理时重归一化引入了额外伪影。
我们给出两个测量。观察1表明,CFG中使用的推理时修正无法干净地迁移到RL设置。观察2检验了抑制速度幅度是否在批次层面表现出稳定的一阶奖励效应。

##### 观察1:推理时重归一化无法干净地迁移到RL训练的模型。

我们测试了CFG重归一化风格的推理修正是否可以迁移。给定一个奖励微调后的...

相似文章

基于价值梯度流的强化学习

Hugging Face Daily Papers

价值梯度流(VGF)提出了一种可扩展的行为正则化强化学习方法,将其构建为通过离散梯度流求解的最优传输问题,在离线强化学习和大型语言模型强化学习基准测试中取得了最先进的成果。该方法消除了显式的策略参数化,同时通过控制传输预算实现了自适应的测试时缩放。

强化学习中流策略的测试时梯度引导

Hugging Face Daily Papers

QGF 是一种强化学习算法,通过使用价值梯度来指导预训练的流策略,在测试时改进策略,避免了训练时的不稳定性,同时保持了竞争力的性能。