通过分布级奖励优化视觉生成模型
摘要
本文提出一种用于视觉生成模型的强化学习框架,该框架使用分布级奖励,并采用子集替换策略以提高效率,在改善图像多样性和质量的同时,解决模式崩溃和奖励破解问题。
查看缓存全文
缓存时间: 2026/07/03 03:52
论文页面 - 通过分布级奖励优化视觉生成模型
来源: https://huggingface.co/papers/2607.02291
摘要
一种新颖的用于视觉生成的强化学习框架采用分布级奖励来提升图像多样性和质量,同时解决模式坍缩与计算效率问题。
视觉生成任务中传统的强化学习策略通常使用样本级奖励函数,但这种做法常常导致奖励欺骗,进而损害图像多样性并引入视觉异常。为克服这些局限,我们提出了一种新框架,该框架利用分布级奖励对生成模型进行微调,从而更好地与真实世界数据分布对齐。与逐个评估样本的奖励不同,分布级奖励考虑了样本的数据分布,缓解了当所有样本独立地向同一方向优化时出现的模式坍缩问题。为克服估算这些奖励所带来的高昂计算成本,我们引入了子集替换策略,该策略仅更新生成参考集的一小部分,从而高效地提供奖励信号。此外,我们还应用强化学习以优化事后模型合并系数,这有助于缓解常规强化学习实践中因引入随机微分方程(SDE)而导致的训练-推理不一致问题。大量实验表明,我们的方法显著提升了多种基础模型的FID-50K指标:SiT从8.30降至5.77,EDM2从3.74降至3.52。定性评估也证实,该方法在保持样本多样性的同时提升了感知质量。
查看 arXiv 页面 (https://arxiv.org/abs/2607.02291) · 查看 PDF (https://arxiv.org/pdf/2607.02291) · 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.02291)
在您的智能体中获取本论文:
hf papers read 2607.02291
没有最新CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本论文的模型0
暂无模型关联本论文
在模型的 README.md 中引用 arxiv.org/abs/2607.02291 即可从本页面链接。
引用本论文的数据集0
暂无数据集关联本论文
在数据集的 README.md 中引用 arxiv.org/abs/2607.02291 即可从本页面链接。
引用本论文的 Spaces0
暂无 Space 关联本论文
在 Space 的 README.md 中引用 arxiv.org/abs/2607.02291 即可从本页面链接。
包含本论文的收藏集0
暂无收藏集包含本论文
将本论文添加到一个收藏集中即可从本页面链接。
相似文章
通过奖励倾斜分布匹配强化少步生成器
RTDMD是一个两阶段框架,结合分布匹配蒸馏与奖励引导的强化学习,以改进少步图像生成与人类偏好的一致性。它在仅需4步推理的情况下,在多个模型上取得了最先进的结果。
奖励作为具身世界模型的智能体
本文介绍了奖励作为智能体(Reward as an Agent)和DynDiff-GRPO,以解决具身世界模型中强化学习的奖励黑客攻击和有限探索问题,实现了显著的准确率提升。
加速视觉生成式LLMs的解耦RL:基于扩散并行与训练器辅助生成
本文介绍了DigenRL,一个用于基于扩散的生成式LLMs的解耦RL框架,它利用生成轴流水线并行和训练器辅助生成,相比现有系统实现了1.56-2.10倍的吞吐量提升。
Stream-R1:流式视频生成的可靠性-困惑度感知奖励蒸馏
Stream-R1 提出了一种针对流式视频生成的可靠性-困惑度感知奖励蒸馏框架,通过自适应加权监督信号来提升视觉和动态质量,且不增加额外的计算开销。
面向奖励引导扩散的分层变分策略
提出了面向奖励引导扩散的分层变分策略框架,在降低推理成本的同时实现高质量采样。在超分辨率等任务上展现了优异的质量-速度权衡。