UDM-GRPO:面向均匀离散扩散模型的稳定高效群体相对策略优化
摘要
UDM-GRPO 为均匀离散扩散模型提出了一种稳定的强化学习训练框架,将 GenEval 准确率从 69% 提升至 96%,OCR 基准准确率从 8% 提升至 57%。
查看缓存全文
缓存时间: 2026/04/22 10:35
论文页面 - UDM-GRPO:面向均匀离散扩散模型的稳定高效群组相对策略优化
来源:https://huggingface.co/papers/2604.18518
摘要
通过新颖的优化策略将均匀离散扩散模型与强化学习相结合,在文生图任务和 OCR 基准上达到 SOTA 性能。
均匀离散扩散模型(Uniform Discrete Diffusion Model,UDM)近来成为离散生成建模的新范式,但其与强化学习(reinforcement learning)的结合尚属空白。我们发现,直接将 GRPO 应用于 UDM 会导致训练不稳定且性能提升有限。为此,我们提出 UDM-GRPO,首个将 UDM 与 RL 整合的框架。方法基于两大关键洞察:(i) 将最终干净样本视为动作,可提供更精确稳定的优化信号;(ii) 通过扩散前向过程重构轨迹,使概率路径更贴合预训练分布。此外,我们引入 Reduced-Step 与 CFG-Free 两种策略,进一步提升训练效率。UDM-GRPO 在多项 T2I 任务上显著超越基座模型:GenEval 准确率从 69% 提升至 96%,PickScore 从 20.46 提升至 23.81,在连续与离散设置均达 SOTA;OCR 基准准确率从 8% 跃升至 57%,验证方法的泛化能力。代码已开源:https://github.com/Yovecent/UDM-GRPO
查看 arXiv 页面(https://arxiv.org/abs/2604.18518)
查看 PDF(https://arxiv.org/pdf/2604.18518)
项目主页(https://yovecent.github.io/UDM-GRPO.github.io/)
GitHub(https://github.com/Yovecent/UDM-GRPO)
添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2604.18518)
在智能体中获取本文:
hf papers read 2604.18518
尚未安装最新 CLI?
curl -LsSf https://hf.co/cli/install.sh | bash
引用该论文的模型 2
Yovecents/URSA-1.7B-IBQ512-UDMGRPO-GenEval
文生图 • 1 天前更新 • 23 • 1(https://huggingface.co/Yovecents/URSA-1.7B-IBQ512-UDMGRPO-GenEval)
Yovecents/URSA-1.7B-IBQ512-UDMGRPO-PickScore
文生图 • 1 天前更新 • 54 • 1(https://huggingface.co/Yovecents/URSA-1.7B-IBQ512-UDMGRPO-PickScore)
引用该论文的数据集 0
暂无数据集关联该论文
在数据集 README.md 中引用 arxiv.org/abs/2604.18518 即可在此页面显示。
引用该论文的 Spaces 0
暂无 Spaces 关联该论文
在 Space README.md 中引用 arxiv.org/abs/2604.18518 即可在此页面显示。
包含该论文的收藏 2
相似文章
BiasGRPO:通过群体相对策略优化稳定高方差奖励环境中的偏见缓解
BiasGRPO 提出了一种利用群体相对策略优化(GRPO)的框架,通过对采样补全结果的奖励进行归一化,稳定 LLM 中社会偏见的缓解过程,在多个基准测试上优于 DPO 和 PPO。作者还发布了一个计算高效的偏见奖励模型,可无缝集成到多目标 RLHF 流水线中。
强化多模态掩码扩散模型的生成顺序
本文提出了一种可学习的控制模块,通过组相对策略优化(GRPO)进行训练,以优化多模态掩码扩散模型中的生成顺序,从而在文本到图像对齐和多模态理解方面取得了改进。
多模块 GRPO:组合策略梯度与提示优化的语言模型程序方法
本文提出 mmGRPO,一种多模块扩展的群体相对策略优化(GRPO)方法,通过优化语言模型调用和提示来提升模块化 AI 系统的准确率。实验表明,该方法在各类任务上平均带来 11% 的准确率提升,并在 DSPy 中提供了开源实现。
F-GRPO: 分解式组相对策略优化用于统一候选生成与排序
F-GRPO 提出了一种分解式组相对策略优化框架,将候选生成与排序统一在单个自回归LLM中,解决了信用分配问题,并在序列推荐和多跳问答基准上提升了顶级性能。
@probablynotaz9: ICML 单作者论文警报:是否曾想用经典策略梯度对扩散 LLM 进行后训练,而无需……
这篇 ICML 单作者论文介绍了摊销式组相对策略优化(AGRPO),旨在为扩散语言模型实现高效的强化学习后训练。