ReNFT:通过内部概率质量重新校准修复奖励后训练中的模式崩溃
摘要
ReNFT 是一种方法,通过内部重新校准概率质量,修复扩散生成器奖励后训练中的模式崩溃,在保持高奖励分数的同时提高多样性。
arXiv:2609.00061v1 Announce Type: new
摘要:扩散生成器的奖励后训练不可避免地将概率质量集中在少数奖励偏好的模式上,这种模式崩溃会消除提示内多样性。现有的缓解崩溃的方法依赖于外部信号或接口,通过添加感知目标来增强奖励、调整参考正则化或修改文本编码器,但没有一种方法能在保持已获得奖励的同时修复已经崩溃的适配器。我们观察到,在线后训练主要是在预训练继承的能力上重新分配概率质量,而不是学习新的视觉内容。因此,崩溃是抑制而非删除,可以从生成器内部逆转。我们提出 ReNFT,它通过内部概率质量重新校准来修复高奖励、低多样性的适配器。无条件探测首先优先考虑“反枢纽”提示,其中提示无关的偏差最容易暴露。两个策略主导的混合路径然后从相同的提示和初始噪声生成匹配的反事实提议,一个探测冻结基础方向以寻找被抑制的替代方案,另一个暴露后训练的无条件倾向。带有自适应翻转保护的奖励排名分配拉和推角色,联合与配对的NFT更新实现了修复。在 PickScore 和 GenEval 上,ReNFT 保留了 NFT 奖励的 98.9% 和 99.0%,同时将 DreamSim-Div 分别提高了 58.8% 和 55.0%,提供了一种与外部干预互补的替代方案。
查看缓存全文
缓存时间: 2026/09/02 06:07
# ReNFT:通过内部概率质量再校准修复奖励后训练中的模式坍缩
来源:https://arxiv.org/html/2609.00061
陈超文 何伟 王若鑫 陈东浩 罗佳慧 詹文健 黄文健 陈申 王逸婷 姚太平 王成杰 丁守红 张建国††thanks:通讯作者\。
###### 摘要
扩散生成器的奖励后训练不可避免地会将概率质量集中于少数受奖励偏好的模式,这种模式坍缩会抹除提示内的多样性。现有缓解坍缩的方法依赖外部信号或接口,通过感知目标增强奖励、调整参考正则化或修改文本编码器,但无法修复已经坍缩的适配器并同时保留其获得的奖励。我们发现,在线后训练主要是对预训练继承的能力进行概率质量再分配,而非学习新的视觉内容。因此,坍缩是一种抑制而非删除,可以从生成器内部逆转。我们提出ReNFT,通过内部概率质量再校准修复高奖励、低多样性的适配器。无条件探测首先优先选择“反枢纽”提示,即提示无关偏差最易暴露的提示。随后,两个由策略主导的混合路由从相同的提示和初始噪声生成匹配的反事实提议:一个探测冻结的基础路由以寻找被抑制的替代方案,另一个暴露后训练的无条件倾向。奖励排序结合自适应翻转保护分配拉动和推动角色,联合配对NFT更新实现修复。在PickScore和GenEval上,ReNFT分别保留了NFT 98.9%和99.0%的奖励,同时将DreamSim-Div提升了58.8%和55.0%,为外部干预提供了互补的替代方案。
1南方科技大学
2腾讯优图实验室
## 1引言
基于奖励的后训练已成为对齐扩散和流式生成器超越预训练的一种实用方法。以DiffusionDPO和Flow-GRPO为代表的偏好优化和策略梯度方法,通过增加奖励偏好输出的概率来改善对齐(Wallace等人 2024 (https://arxiv.org/html/2609.00061#bib.bib32);Liu等人 2025 (https://arxiv.org/html/2609.00061#bib.bib20))。扩散NFT(负感知微调,NFT)(Zheng等人 2026a (https://arxiv.org/html/2609.00061#bib.bib40))使这种对齐效率显著提高:它用前向过程重建替代了似然比策略梯度,无需无分类器引导,且收敛更快。然而,相同的反馈循环不可避免地集中概率质量;优化越高效,集中越严重:每当一个狭窄的视觉模式重复获得高奖励时,同一提示下的不同初始噪声会被映射到相似的输出。这些语义等价样本之间的奖励差异编码了奖励模型的偏好而非真实质量,因此优化它们只会强化偏好。结果是一个高奖励的适配器,其提示内的结构和风格多样性已经坍缩,在最快优化器NFT下最为严重。
请参见插图图1:概率质量再校准概念图。预训练将概率分散在每个提示的模式上,而无条件行为跨越其边际范围。NFT将每个提示坍缩到奖励附近的模式,无条件行为坍缩到固定模式,抑制了替代方案。ReNFT恢复了无条件覆盖和奖励边界模式,同时将低质量模式排除在被抑制范围之外。灰色虚线比较了提示的最高奖励模式概率。
现有缓解坍缩的方法主要在三个位置进行干预。奖励塑造方法用外部感知信号增强奖励(Liu等人 2026a (https://arxiv.org/html/2609.00061#bib.bib18);Tan等人 2026 (https://arxiv.org/html/2609.00061#bib.bib29);Liu等人 2026b (https://arxiv.org/html/2609.00061#bib.bib19)),但只能在策略仍然生成的样本之间重新加权。基于正则化的方法将策略对齐到基础模型(Liu等人 2026a (https://arxiv.org/html/2609.00061#bib.bib18);He等人 2025 (https://arxiv.org/html/2609.00061#bib.bib10)),将可获得的奖励绑定到基础天花板。接口级方法修改文本表示(Hu等人 2026 (https://arxiv.org/html/2609.00061#bib.bib11);Chen等人 2026 (https://arxiv.org/html/2609.00061#bib.bib3)),但依赖于奖励模型的架构。因此我们提出疑问:*一个已经坍缩的适配器能否仅使用生成器内部已有的分布进行修复,而无需外部多样性目标或文本编码器修改,同时不牺牲其已获得的奖励?*
我们的回答始于一个区分:预训练从外部图像学习,而后训练使用生成器自身的带评分样本进行监督,因此它是在基础模型继承的能力上重新分配概率质量,放大奖励偏好的模式同时抑制替代方案。因此坍缩是抑制而非删除:被抑制的模式仍然可以通过生成器的内部路由达到,恢复其概率质量无需新的视觉知识。我们将这种操作性修复观点称为*概率质量再校准*。
再校准首先需要一个暴露质量去向的内部信号。后训练的无条件路由提供了这样的读数:它共享更新后的参数但舍弃了提示条件,暴露了适配器在被要求之外注入的内容。这个读数是诊断性的而非训练目标:修复必须作用于条件生成,而直接优化无条件方向无法提供对每提示结构的控制。因此我们通过两种间接方式使用它:定位远离暴露倾向的提示,以及在普通条件轨迹内构建反事实样本,在那里该倾向可以通过原始奖励模型进行测试。
这些观察启发了ReNFT(*修复NFT*),它通过内部概率质量再校准修复高奖励、低多样性的适配器。为了在最易区分的地方暴露偏差,无条件探测首先优先选择“反枢纽”提示,即远离无条件*枢纽*(奖励黑客下无条件分布集中的共享模式)的提示。为了在无任何外部信号的情况下获取候选,两个由策略主导的混合路由从相同的提示和初始噪声生成匹配的提议:一个探测冻结的基础路由以寻找被抑制的替代方案,而另一个暴露后训练的无条件倾向。原始奖励随后将每对排序为拉动和镜像推动目标,自适应翻转保护确保至少一半的拉动目标位于基础探测路由上。原生噪声联合更新随后将偏好锚定在共享轨迹原点,新噪声配对更新将其传播到中间噪声级别。冻结的图像-文本编码器仅用于优先选择提示;它从不进入奖励、优势或修复损失。
总而言之,我们的贡献如下:
- •我们将奖励诱导的模式坍缩表述为内部概率质量再分配问题,并研究修复一个严重奖励黑客、高奖励的适配器,而非从头开始多样性感知训练。
- •我们将后训练的无条件路由识别为奖励偏差的免费内部读数,并通过两种方式利用它:优先选择远离暴露倾向的“反枢纽”提示,以及将倾向注入条件轨迹以将隐藏偏差转化为显式、奖励可验证的候选。
- •我们通过同一生成器的两个内部路由实现概率质量再校准:从相同提示和初始噪声分叉,冻结的基础路由将概率质量扩展回被抑制的替代方案,而无条件路由在混合终点暴露学习到的偏差作为镜像推动候选;拉动和推动遵循每对的奖励差距而非路由身份。这种配对构建仅在训练时使用;修复后的适配器使用标准条件前向传递采样,在PickScore和GenEval上分别保留了NFT 98.9-99.0%的奖励,同时将DreamSim-Div(Fu等人 2023 (https://arxiv.org/html/2609.00061#bib.bib7))提升了58.8%和55.0%,这两项评估分别基于PickScore(Kirstain等人 2023 (https://arxiv.org/html/2609.00061#bib.bib13))和GenEval(Ghosh, Hajishirzi, 和 Schmidt 2023 (https://arxiv.org/html/2609.00061#bib.bib8))。
## 2相关工作
请参见插图图2:训练动态和消融实验。(a)(b):PickScore奖励和DreamSim-Div;(c)(d):GenEval奖励和DreamSim-Div。ReNFT从黑客检查点HH\(\star\)分支并修复50步;虚线标记基础生成器。(e)(f):从相同HH修复50步后的混合路由模式和反枢纽消融;虚线标记HH处的NFT。
DiffusionDPO(Wallace等人 2024 (https://arxiv.org/html/2609.00061#bib.bib32))将偏好优化应用于扩散和流式生成器的奖励后训练;Flow-GRPO(Liu等人 2025 (https://arxiv.org/html/2609.00061#bib.bib20))、DenseGRPO(Deng等人 2026 (https://arxiv.org/html/2609.00061#bib.bib4))和AWM(Xue等人 2026 (https://arxiv.org/html/2609.00061#bib.bib37))改进了组相对优化、奖励密度或稳定性;DiffusionNFT(Zheng等人 2026a (https://arxiv.org/html/2609.00061#bib.bib40))将监督转移到前向过程重建;Liu, He, 和 Li (2026) (https://arxiv.org/html/2609.00061#bib.bib21)调查了这一路线。后续变体改进了剪枝、信用分配、自校正和蒸馏(Ping等人 2026 (https://arxiv.org/html/2609.00061#bib.bib23);Tong等人 2026 (https://arxiv.org/html/2609.00061#bib.bib30);Qin等人 2026 (https://arxiv.org/html/2609.00061#bib.bib24);Li等人 2026b (https://arxiv.org/html/2609.00061#bib.bib15);Fang等人 2026 (https://arxiv.org/html/2609.00061#bib.bib6);Go等人 2026 (https://arxiv.org/html/2609.00061#bib.bib9);Li等人 2025 (https://arxiv.org/html/2609.00061#bib.bib17))。没有保留广泛支持的机制,重复强化自生成的高奖励样本会将概率质量集中在少数模式上,即模式坍缩,这在在策略、反散度目标中也有观察到(Zheng等人 2026b (https://arxiv.org/html/2609.00061#bib.bib41))。干预的主要区别在于注入多样性信号的位置。
奖励塑造方法。第一条路线用来自外部模型的感知多样性信号增强奖励或优势。DiverseGRPO(Liu等人 2026a (https://arxiv.org/html/2609.00061#bib.bib18))在CLIP空间中对同一样本进行聚类,并添加与集群大小成反比的探索奖励。PEC(Tan等人 2026 (https://arxiv.org/html/2609.00061#bib.bib29))用来自滚动状态的感知熵代理替代策略熵。DRIFT(Liu等人 2026b (https://arxiv.org/html/2609.00061#bib.bib19))结合奖励集中滚动选择、提示扰动和基于潜力的塑造。相关工作用成对胜率、门控或对抗优势或集合级统计替代奖励信号本身(Wang等人 2025 (https://arxiv.org/html/2609.00061#bib.bib33);Mao等人 2025 (https://arxiv.org/html/2609.00061#bib.bib22);Li等人 2026c (https://arxiv.org/html/2609.00061#bib.bib16))。
基于正则化的方法。第二条路线修改参考正则化。DiverseGRPO(Liu等人 2026a (https://arxiv.org/html/2609.00061#bib.bib18))在早期去噪步骤应用更强的KL正则化,后期放松。GARDO(He等人 2025 (https://arxiv.org/html/2609.00061#bib.bib10))对高不确定性样本进行门控惩罚,定期更新EMA参考,并放大高质量多样样本的奖励。
接口级方法。第三条路线修改提示或奖励进入优化的语义接口。D2-Align(Chen等人 2026 (https://arxiv.org/html/2609.00061#bib.bib3))在冻结奖励模型的文本嵌入空间中学习方向校正。E2PO(Hu等人 2026 (https://arxiv.org/html/2609.00061#bib.bib11))在生成器侧扰动内容标记嵌入,并在去噪过程中退火扰动。
ReNFT与所有三条路线互补:其修复信号来自后训练生成器内部已有的组件(冻结编码器仅用于优先选择提示)。一个自然的问题是这些方法是否也能*修复*已经坍缩的适配器:奖励塑造和接口级方法是为训练期间的预防设计的,而KL风格的锚定可以恢复被抑制的模式,但将可获得的奖励绑定到基础模型。ReNFT通过同一生成器的两个内部路由实现这一修复:冻结基础路由探测被抑制的替代方案,无条件路由暴露提示无关偏差。轨迹路由工作(Soboleva等人 2025 (https://arxiv.org/html/2609.00061#bib.bib28);Cao等人 2026 (https://arxiv.org/html/2609.00061#bib.bib2);Yin等人 2026 (https://arxiv.org/html/2609.00061#bib.bib38);Jin, Shi, 和 Gu 2026 (https://arxiv.org/html/2609.00061#bib.bib12))同样显示路由身份和时间步重要,但未构建奖励排序、共享噪声的反事实。
## 3预备知识
请参见插图图3:ReNFT流程。(a)无条件探测优先选择反枢纽提示;(b)两个由策略主导的混合路由从相同提示和初始噪声生成匹配提议;(c)奖励排序和自适应翻转保护为联合配对NFT修复分配拉动/推动目标。为清晰起见,VAE解码器省略。
我们介绍构成我们方法基础的流匹配表示法和NFT风格的前向过程后训练更新。
### 3.1流匹配生成
令\(y\)表示文本提示,\(x_{0}\)表示干净潜在变量,\(\varepsilon\sim\mathcal{N}(0,I)\)表示初始噪声。在校正流插值下,
\(x_{t}=(1-t)x_{0}+t\varepsilon,\quad t\in[0,1]\), (1)
目标传输速度为\(v=\varepsilon-x_{0}\),模型预测\(v_{\theta}(x_{t},t,y)\),使用标准流匹配回归目标训练。我们标记通过此采样器的三条路由:\(b\)(冻结基础),\(\theta\)(条件策略),以及\(u\)(当前策略的无条件路由);策略的EMA平滑副本提供稳定参考,其速度记为\(v_{\mathrm{old}}\)。
### 3.2NFT风格前向过程后训练
基于奖励的后训练使用奖励模型\(R(x_{0},y)\)重塑预训练生成器的分布。扩散NFT(Zheng等人 2026a (https://arxiv.org/html/2609.00061#bib.bib40))通过前向过程回归应用奖励监督,避免了似然比策略梯度。每个生成的终点\(x_{0}\)(来自\(N_{i}\)个ODE步骤的滚动)在\(N_{t}\)个训练时间步重新加噪为\(x_{t}=(1-\sigma_{t})x_{0}+\sigma_{t}\xi\),其中\(\xi\sim\mathcal{N}(0,I)\),噪声级别\(\sigma_{t}=t\),模型回归目标速度\(v=\xi-x_{0}\)。高奖励终点通过普通相似文章
Control-Diverse Reinforcement Fine-Tuning: Decoupling the Shared Control Bottleneck of RL Post-Training
The paper introduces CD-RFT, a method to decouple the shared control bottleneck in RL post-training by regularizing a novel control coefficient, improving multi-task capability on models like Qwen2.5-7B and Llama-3.2-3B.
超越Mode-Seeking RL:扩散语言模型的轨迹平衡后训练
本文识别了扩散语言模型奖励最大化后训练中的一种失败模式,称为“轨迹锁定”,并提出了TraFL,一种轨迹平衡目标,可提高数学和代码基准测试中的多样性和性能。
强化学习中的多模态奖励破解
本文系统地研究了多模态大语言模型在强化学习中的奖励破解问题,证明了仅基于结果的奖励即使在较大规模下也会导致严重的失败率,并引入了新奖励失败率(NRFR)指标来隔离强化学习导致的失败。
SafeDiffusion-R1: 在线奖励引导的安全扩散后训练
SafeDiffusion-R1 引入了一个基于 GRPO 和引导奖励机制的在线强化学习框架,用于提升扩散模型的安全性,无需监督数据或奖励调优,在多个有害类别上实现了最先进的性能。
面向开放世界测试时适应的可靠神经坍缩近似方法
本文提出了一种名为ReNC的开放世界测试时适应方法,该方法利用神经坍缩作为结构先验来过滤分布外样本并优化原型,以实现可靠的模型适应。