通过奖励倾斜分布匹配强化少步生成器
摘要
RTDMD是一个两阶段框架,结合分布匹配蒸馏与奖励引导的强化学习,以改进少步图像生成与人类偏好的一致性。它在仅需4步推理的情况下,在多个模型上取得了最先进的结果。
查看缓存全文
缓存时间: 2026/05/26 06:42
论文页面 — 通过奖励倾斜分布匹配增强少步生成器
来源:https://huggingface.co/papers/2605.26108
摘要
RTDMD 是一个两阶段框架,将分布匹配蒸馏与奖励引导的强化学习相结合,以改进少步图像生成与人类偏好的对齐。
近年来,少步扩散蒸馏(https://huggingface.co/papers?q=diffusion%20distillation)的进展实现了高效的图像生成,但将这些模型与人类偏好对齐仍然具有挑战性。我们提出奖励倾斜分布匹配蒸馏(Reward-Tilted Distribution Matching Distillation,RTDMD)(https://huggingface.co/papers?q=Distribution%20Matching%20Distillation),这是一个两阶段框架,将分布匹配蒸馏(https://huggingface.co/papers?q=distribution%20matching%20distillation)与奖励引导的强化学习(https://huggingface.co/papers?q=reward-guided%20reinforcement%20learning)统一起来,用于少步流生成器。我们证明了,最小化到奖励倾斜教师分布的 KL 散度(https://huggingface.co/papers?q=KL%20divergence)自然分解为一个分布匹配项和一个奖励最大化项。在第一阶段,我们引入了环境一致分布匹配蒸馏(Ambient-Consistent Distribution Matching Distillation,AC-DMD)(https://huggingface.co/papers?q=Distribution%20Matching%20Distillation),它在子区间上进行分布匹配,并通过一个一致性正则化项(https://huggingface.co/papers?q=consistency%20regularizer)增强假分数目标(https://huggingface.co/papers?q=fake%20score%20objective),帮助假分数模型在有限更新下跟踪变化的生成器分布。在第二阶段,我们联合优化两项:对于奖励最大化项,我们推导出一个混合策略梯度(https://huggingface.co/papers?q=policy%20gradient),它结合了一个 GRPO(https://huggingface.co/papers?q=GRPO)风格的随机中间转移估计器与通过确定性最后步骤的直接奖励反向传播,并进一步引入步骤子集 GRPO(SubGRPO)(https://huggingface.co/papers?q=SubGRPO)以降低方差。在 SD3、SD3.5 和 FLUX.2 上的实验表明,RTDMD 仅用 4 步推理就在偏好、美学和组合性指标上建立了新的最先进结果,超越了先前的少步文本到图像生成方法。代码和模型可在 https://github.com/Harahan/RTDMD 获取。
查看 arXiv 页面(https://arxiv.org/abs/2605.26108) 查看 PDF(https://arxiv.org/pdf/2605.26108) GitHub3(https://github.com/Harahan/RTDMD) 添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.26108)
在您的代理中获取此论文:
hf papers read 2605.26108
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型 2
Harahan/FLUX2-4B-RTDMD 文本到图像 • 更新于 39 分钟前(https://huggingface.co/Harahan/FLUX2-4B-RTDMD)
Harahan/SD35M-RTDMD 文本到图像 • 更新于 39 分钟前(https://huggingface.co/Harahan/SD35M-RTDMD)
引用此论文的数据集 0
没有数据集与此论文关联
在数据集的 README.md 中引用 arxiv.org/abs/2605.26108 以从该页面链接。
引用此论文的 Space 0
没有 Space 与此论文关联
在 Space 的 README.md 中引用 arxiv.org/abs/2605.26108 以从该页面链接。
包含此论文的收藏 1
相似文章
面向一步式视觉生成的表示分布匹配
本文介绍了表示分布匹配(RDM),一种通过匹配预训练编码器下的特征分布来实现一步式图像生成的方法,在ImageNet上取得了最先进的结果,并能够将FLUX.2后训练为性能提升的一步生成器。
通过分布级奖励优化视觉生成模型
本文提出一种用于视觉生成模型的强化学习框架,该框架使用分布级奖励,并采用子集替换策略以提高效率,在改善图像多样性和质量的同时,解决模式崩溃和奖励破解问题。
通过教师对齐的端到端蒸馏实现高保真两步图像生成
本文介绍了Z-Image Turbo++,这是一个两步图像生成模型,通过使用分布对齐的对抗学习、步骤解耦参数化以及带有迭代正则化的端到端训练,从八步教师模型中蒸馏而来,旨在缩小与多步生成之间的质量差距。
TILT:利用模型内在奖励提升扩散模型中的组合生成
TILT是一种无需训练的框架,通过使用模型内在奖励在测试时对齐采样轨迹,从而改善扩散模型中的组合生成,无需外部监督即可增强对复杂提示的忠实度。
RAD-2:在生成器-判别器框架中扩展强化学习
RAD-2 提出了一个用于自动驾驶的统一生成器-判别器框架,将基于扩散的轨迹生成与强化学习优化的重排序相结合,与基于扩散的规划器相比,碰撞率降低了56%。该方法引入了 Temporally Consistent Group Relative Policy Optimization 和 BEV-Warp 仿真环境等技术,以实现高效的大规模训练。