AlphaGRPO:通过分解可验证奖励释放统一多模态模型中的自反式生成能力
摘要
AlphaGRPO 是一个新框架,将组相对策略优化(Group Relative Policy Optimization)应用于统一多模态模型(UMMs),通过自反式精炼和分解可验证奖励来增强生成效果。
查看缓存全文
缓存时间: 2026/05/13 08:12
论文页面 - AlphaGRPO:通过分解式可验证奖励解锁统一多模态模型中的自反思多模态生成
来源:https://huggingface.co/papers/2605.12495
摘要
AlphaGRPO 通过自反思优化和分解式可验证奖励机制,将 Group Relative Policy Optimization 应用于 AR-Diffusion 统一多模态模型,从而提升多模态生成能力。
在本文中,我们提出了 AlphaGRPO,这是一种新颖的框架,将 Group Relative Policy Optimization (https://huggingface.co/papers?q=Group%20Relative%20Policy%20Optimization) (GRPO) 应用于 AR-Diffusion 统一多模态模型 (https://huggingface.co/papers?q=AR-Diffusion%20Unified%20Multimodal%20Models) (UMMs),以在没有额外冷启动阶段的情况下增强多模态生成能力。我们的方法释放了模型执行高级推理任务的内在潜力:推理文本到图像生成 (https://huggingface.co/papers?q=Reasoning%20Text-to-Image%20Generation),其中模型主动推断隐含的用户意图;以及自反思优化 (https://huggingface.co/papers?q=Self-Reflective%20Refinement),其中模型自主诊断并纠正生成输出中的不对齐问题。为了解决为现实世界多模态生成提供稳定监督的挑战,我们引入了分解式可验证奖励 (https://huggingface.co/papers?q=Decompositional%20Verifiable%20Reward) (DVReward)。与整体标量奖励不同,DVReward 利用 LLM (https://huggingface.co/papers?q=LLM) 将复杂的用户请求分解为原子的、可验证的语义和质量问题,然后通过通用 MLLM (https://huggingface.co/papers?q=MLLM) 进行评估,以提供可靠且可解释的反馈。大量实验表明,AlphaGRPO 在多模态生成基准(包括 GenEval (https://huggingface.co/papers?q=GenEval)、TIIF-Bench (https://huggingface.co/papers?q=TIIF-Bench)、DPG-Bench (https://huggingface.co/papers?q=DPG-Bench) 和 WISE (https://huggingface.co/papers?q=WISE))上取得了稳健的提升,同时在未针对编辑任务进行训练的情况下,在 GEdit (https://huggingface.co/papers?q=GEdit) 的编辑任务上也取得了显著增益。这些结果验证了我们的自反思强化方法有效地利用内在理解来指导高保真生成。项目页面:https://huangrh99.github.io/AlphaGRPO/
查看 arXiv 页面 (https://arxiv.org/abs/2605.12495) 查看 PDF (https://arxiv.org/pdf/2605.12495) 项目页面 (https://huangrh99.github.io/AlphaGRPO/) GitHub 5 (https://github.com/huangrh99/AlphaGRPO) 添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2605.12495)
在你的 Agent 中获取这篇论文:
hf papers read 2605\.12495
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
没有链接到此论文的模型
在模型的 README.md 中引用 arxiv.org/abs/2605.12495 以从此页面链接它。
引用此论文的数据集 0
没有链接到此论文的数据集
在数据集的 README.md 中引用 arxiv.org/abs/2605.12495 以从此页面链接它。
引用此论文的 Spaces 0
没有链接到此论文的 Space
在 Space 的 README.md 中引用 arxiv.org/abs/2605.12495 以从此页面链接它。
包含此论文的收藏集 0
没有包含此论文的收藏集
将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接它。
相似文章
多模块 GRPO:组合策略梯度与提示优化的语言模型程序方法
本文提出 mmGRPO,一种多模块扩展的群体相对策略优化(GRPO)方法,通过优化语言模型调用和提示来提升模块化 AI 系统的准确率。实验表明,该方法在各类任务上平均带来 11% 的准确率提升,并在 DSPy 中提供了开源实现。
UDM-GRPO:面向均匀离散扩散模型的稳定高效群体相对策略优化
UDM-GRPO 为均匀离散扩散模型提出了一种稳定的强化学习训练框架,将 GenEval 准确率从 69% 提升至 96%,OCR 基准准确率从 8% 提升至 57%。
F-GRPO: 分解式组相对策略优化用于统一候选生成与排序
F-GRPO 提出了一种分解式组相对策略优化框架,将候选生成与排序统一在单个自回归LLM中,解决了信用分配问题,并在序列推荐和多跳问答基准上提升了顶级性能。
BiasGRPO:通过群体相对策略优化稳定高方差奖励环境中的偏见缓解
BiasGRPO 提出了一种利用群体相对策略优化(GRPO)的框架,通过对采样补全结果的奖励进行归一化,稳定 LLM 中社会偏见的缓解过程,在多个基准测试上优于 DPO 和 PPO。作者还发布了一个计算高效的偏见奖励模型,可无缝集成到多目标 RLHF 流水线中。
强化多模态掩码扩散模型的生成顺序
本文提出了一种可学习的控制模块,通过组相对策略优化(GRPO)进行训练,以优化多模态掩码扩散模型中的生成顺序,从而在文本到图像对齐和多模态理解方面取得了改进。