通过分布级奖励优化视觉生成模型

Hugging Face Daily Papers 论文

摘要

本文提出一种用于视觉生成模型的强化学习框架,该框架使用分布级奖励,并采用子集替换策略以提高效率,在改善图像多样性和质量的同时,解决模式崩溃和奖励破解问题。

传统的视觉生成强化学习策略通常采用样本级奖励函数,但这种做法经常导致奖励破解,从而降低图像多样性并引入视觉异常。为了解决这些局限性,我们提出了一种新颖的框架,通过分布级奖励对生成模型进行微调,确保与真实数据分布更优的对齐。与单独评估样本的奖励不同,分布级奖励考虑样本的数据分布,缓解了所有样本独立向同一方向优化时出现的模式崩溃问题。为了克服估计这些奖励的高昂计算成本,我们引入了子集替换策略,通过仅更新生成参考集中的一个小子集来高效提供奖励信号。此外,我们应用强化学习优化事后模型合并系数,从而可能缓解在常规RL实践中引入随机微分方程(SDE)导致的训练-推理不一致问题。大量实验表明,我们的方法显著改善了各种基础模型的FID-50K,SiT从8.30提升到5.77,EDM2从3.74提升到3.52。定性评估也证实了我们的方法在保持样本多样性的同时提升了感知质量。
查看原文
查看缓存全文

缓存时间: 2026/07/03 03:52

论文页面 - 通过分布级奖励优化视觉生成模型

来源: https://huggingface.co/papers/2607.02291

摘要

一种新颖的用于视觉生成的强化学习框架采用分布级奖励来提升图像多样性和质量,同时解决模式坍缩与计算效率问题。

视觉生成任务中传统的强化学习策略通常使用样本级奖励函数,但这种做法常常导致奖励欺骗,进而损害图像多样性并引入视觉异常。为克服这些局限,我们提出了一种新框架,该框架利用分布级奖励生成模型进行微调,从而更好地与真实世界数据分布对齐。与逐个评估样本的奖励不同,分布级奖励考虑了样本的数据分布,缓解了当所有样本独立地向同一方向优化时出现的模式坍缩问题。为克服估算这些奖励所带来的高昂计算成本,我们引入了子集替换策略,该策略仅更新生成参考集的一小部分,从而高效地提供奖励信号。此外,我们还应用强化学习以优化事后模型合并系数,这有助于缓解常规强化学习实践中因引入随机微分方程(SDE)而导致的训练-推理不一致问题。大量实验表明,我们的方法显著提升了多种基础模型的FID-50K指标:SiT从8.30降至5.77,EDM2从3.74降至3.52。定性评估也证实,该方法在保持样本多样性的同时提升了感知质量

查看 arXiv 页面 (https://arxiv.org/abs/2607.02291) · 查看 PDF (https://arxiv.org/pdf/2607.02291) · 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.02291)

在您的智能体中获取本论文:

hf papers read 2607.02291

没有最新CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本论文的模型0

暂无模型关联本论文

在模型的 README.md 中引用 arxiv.org/abs/2607.02291 即可从本页面链接。

引用本论文的数据集0

暂无数据集关联本论文

在数据集的 README.md 中引用 arxiv.org/abs/2607.02291 即可从本页面链接。

引用本论文的 Spaces0

暂无 Space 关联本论文

在 Space 的 README.md 中引用 arxiv.org/abs/2607.02291 即可从本页面链接。

包含本论文的收藏集0

暂无收藏集包含本论文

将本论文添加到一个收藏集中即可从本页面链接。

相似文章

通过奖励倾斜分布匹配强化少步生成器

Hugging Face Daily Papers

RTDMD是一个两阶段框架,结合分布匹配蒸馏与奖励引导的强化学习,以改进少步图像生成与人类偏好的一致性。它在仅需4步推理的情况下,在多个模型上取得了最先进的结果。

奖励作为具身世界模型的智能体

arXiv cs.AI

本文介绍了奖励作为智能体(Reward as an Agent)和DynDiff-GRPO,以解决具身世界模型中强化学习的奖励黑客攻击和有限探索问题,实现了显著的准确率提升。

面向奖励引导扩散的分层变分策略

arXiv cs.LG

提出了面向奖励引导扩散的分层变分策略框架,在降低推理成本的同时实现高质量采样。在超分辨率等任务上展现了优异的质量-速度权衡。