UDM-GRPO:面向均匀离散扩散模型的稳定高效群体相对策略优化

Hugging Face Daily Papers 论文

摘要

UDM-GRPO 为均匀离散扩散模型提出了一种稳定的强化学习训练框架,将 GenEval 准确率从 69% 提升至 96%,OCR 基准准确率从 8% 提升至 57%。

均匀离散扩散模型(UDM)近期在离散生成建模领域展现出巨大潜力,但其与强化学习的结合仍鲜有研究。我们发现,直接将 GRPO 应用于 UDM 会导致训练不稳定且性能提升有限。为此,我们提出 \Ours,这是首个将 UDM 与强化学习融合的统一框架。我们的方法基于两大关键洞见:(i)将最终干净样本视为动作,可提供更准确、稳定的优化信号;(ii)通过扩散前向过程重建轨迹,使概率路径与预训练分布更好对齐。此外,我们引入 Reduced-Step 与 CFG-Free 两种策略,进一步提升训练效率。\Ours 在多项 T2I 任务上显著超越基座模型。其中,GenEval 准确率从 69% 提升至 96%,PickScore 从 20.46 提升至 23.81,在连续与离散设定下均达 SOTA。OCR 基准准确率亦从 8% 升至 57%,验证了我们方法的泛化能力。代码已开源:https://github.com/Yovecent/UDM-GRPO{https://github.com/Yovecent/UDM-GRPO}。
查看原文
查看缓存全文

缓存时间: 2026/04/22 10:35

论文页面 - UDM-GRPO:面向均匀离散扩散模型的稳定高效群组相对策略优化

来源:https://huggingface.co/papers/2604.18518

摘要

通过新颖的优化策略将均匀离散扩散模型与强化学习相结合,在文生图任务和 OCR 基准上达到 SOTA 性能。

均匀离散扩散模型(Uniform Discrete Diffusion Model,UDM)近来成为离散生成建模的新范式,但其与强化学习(reinforcement learning)的结合尚属空白。我们发现,直接将 GRPO 应用于 UDM 会导致训练不稳定且性能提升有限。为此,我们提出 UDM-GRPO,首个将 UDM 与 RL 整合的框架。方法基于两大关键洞察:(i) 将最终干净样本视为动作,可提供更精确稳定的优化信号;(ii) 通过扩散前向过程重构轨迹,使概率路径更贴合预训练分布。此外,我们引入 Reduced-StepCFG-Free 两种策略,进一步提升训练效率。UDM-GRPO 在多项 T2I 任务上显著超越基座模型:GenEval 准确率从 69% 提升至 96%,PickScore 从 20.46 提升至 23.81,在连续与离散设置均达 SOTA;OCR 基准准确率从 8% 跃升至 57%,验证方法的泛化能力。代码已开源:https://github.com/Yovecent/UDM-GRPO

查看 arXiv 页面(https://arxiv.org/abs/2604.18518)
查看 PDF(https://arxiv.org/pdf/2604.18518)
项目主页(https://yovecent.github.io/UDM-GRPO.github.io/)
GitHub(https://github.com/Yovecent/UDM-GRPO)
添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2604.18518)

在智能体中获取本文:

hf papers read 2604.18518

尚未安装最新 CLI?
curl -LsSf https://hf.co/cli/install.sh | bash

引用该论文的模型 2

Yovecents/URSA-1.7B-IBQ512-UDMGRPO-GenEval

文生图 • 1 天前更新 • 23 • 1(https://huggingface.co/Yovecents/URSA-1.7B-IBQ512-UDMGRPO-GenEval)

Yovecents/URSA-1.7B-IBQ512-UDMGRPO-PickScore

文生图 • 1 天前更新 • 54 • 1(https://huggingface.co/Yovecents/URSA-1.7B-IBQ512-UDMGRPO-PickScore)

引用该论文的数据集 0

暂无数据集关联该论文

在数据集 README.md 中引用 arxiv.org/abs/2604.18518 即可在此页面显示。

引用该论文的 Spaces 0

暂无 Spaces 关联该论文

在 Space README.md 中引用 arxiv.org/abs/2604.18518 即可在此页面显示。

包含该论文的收藏 2

相似文章

强化多模态掩码扩散模型的生成顺序

arXiv cs.LG

本文提出了一种可学习的控制模块,通过组相对策略优化(GRPO)进行训练,以优化多模态掩码扩散模型中的生成顺序,从而在文本到图像对齐和多模态理解方面取得了改进。

多模块 GRPO:组合策略梯度与提示优化的语言模型程序方法

Papers with Code Trending

本文提出 mmGRPO,一种多模块扩展的群体相对策略优化(GRPO)方法,通过优化语言模型调用和提示来提升模块化 AI 系统的准确率。实验表明,该方法在各类任务上平均带来 11% 的准确率提升,并在 DSPy 中提供了开源实现。