AlphaGRPO:通过分解可验证奖励释放统一多模态模型中的自反式生成能力

Hugging Face Daily Papers 论文

摘要

AlphaGRPO 是一个新框架,将组相对策略优化(Group Relative Policy Optimization)应用于统一多模态模型(UMMs),通过自反式精炼和分解可验证奖励来增强生成效果。

在本文中,我们提出了 AlphaGRPO,这是一种新颖的框架,将组相对策略优化(GRPO)应用于自回归扩散统一多模态模型(UMMs),从而在不增加额外冷启动阶段的情况下增强多模态生成能力。我们的方法释放了模型执行高级推理任务的内在潜力:推理文本到图像生成(Reasoning Text-to-Image Generation),模型在此过程中主动推断隐含的用户意图;以及自反式精炼(Self-Reflective Refinement),模型在此过程中自主诊断并纠正生成输出中的不对齐问题。为解决为现实世界中的多模态生成提供稳定监督的挑战,我们引入了分解可验证奖励(DVReward)。与整体标量奖励不同,DVReward 利用大语言模型(LLM)将复杂的用户请求分解为原子的、可验证的语义和质量问题,然后由通用的多模态大语言模型(MLLM)进行评估,以提供可靠且可解释的反馈。广泛的实验表明,AlphaGRPO 在多模态生成基准测试中取得了稳健的提升,包括 GenEval、TIIF-Bench、DPG-Bench 和 WISE,同时在 GEdit 上的编辑任务中也取得了显著增益,尽管并未在编辑任务上进行训练。这些结果验证了我们的自反式强化方法有效利用了模型固有的理解能力来指导高保真生成。项目主页:https://huangrh99.github.io/AlphaGRPO/
查看原文
查看缓存全文

缓存时间: 2026/05/13 08:12

论文页面 - AlphaGRPO:通过分解式可验证奖励解锁统一多模态模型中的自反思多模态生成

来源:https://huggingface.co/papers/2605.12495

摘要

AlphaGRPO 通过自反思优化和分解式可验证奖励机制,将 Group Relative Policy Optimization 应用于 AR-Diffusion 统一多模态模型,从而提升多模态生成能力。

在本文中,我们提出了 AlphaGRPO,这是一种新颖的框架,将 Group Relative Policy Optimization (https://huggingface.co/papers?q=Group%20Relative%20Policy%20Optimization) (GRPO) 应用于 AR-Diffusion 统一多模态模型 (https://huggingface.co/papers?q=AR-Diffusion%20Unified%20Multimodal%20Models) (UMMs),以在没有额外冷启动阶段的情况下增强多模态生成能力。我们的方法释放了模型执行高级推理任务的内在潜力:推理文本到图像生成 (https://huggingface.co/papers?q=Reasoning%20Text-to-Image%20Generation),其中模型主动推断隐含的用户意图;以及自反思优化 (https://huggingface.co/papers?q=Self-Reflective%20Refinement),其中模型自主诊断并纠正生成输出中的不对齐问题。为了解决为现实世界多模态生成提供稳定监督的挑战,我们引入了分解式可验证奖励 (https://huggingface.co/papers?q=Decompositional%20Verifiable%20Reward) (DVReward)。与整体标量奖励不同,DVReward 利用 LLM (https://huggingface.co/papers?q=LLM) 将复杂的用户请求分解为原子的、可验证的语义和质量问题,然后通过通用 MLLM (https://huggingface.co/papers?q=MLLM) 进行评估,以提供可靠且可解释的反馈。大量实验表明,AlphaGRPO 在多模态生成基准(包括 GenEval (https://huggingface.co/papers?q=GenEval)、TIIF-Bench (https://huggingface.co/papers?q=TIIF-Bench)、DPG-Bench (https://huggingface.co/papers?q=DPG-Bench) 和 WISE (https://huggingface.co/papers?q=WISE))上取得了稳健的提升,同时在未针对编辑任务进行训练的情况下,在 GEdit (https://huggingface.co/papers?q=GEdit) 的编辑任务上也取得了显著增益。这些结果验证了我们的自反思强化方法有效地利用内在理解来指导高保真生成。项目页面:https://huangrh99.github.io/AlphaGRPO/

查看 arXiv 页面 (https://arxiv.org/abs/2605.12495) 查看 PDF (https://arxiv.org/pdf/2605.12495) 项目页面 (https://huangrh99.github.io/AlphaGRPO/) GitHub 5 (https://github.com/huangrh99/AlphaGRPO) 添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2605.12495)

在你的 Agent 中获取这篇论文:

hf papers read 2605\.12495

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

没有链接到此论文的模型

在模型的 README.md 中引用 arxiv.org/abs/2605.12495 以从此页面链接它。

引用此论文的数据集 0

没有链接到此论文的数据集

在数据集的 README.md 中引用 arxiv.org/abs/2605.12495 以从此页面链接它。

引用此论文的 Spaces 0

没有链接到此论文的 Space

在 Space 的 README.md 中引用 arxiv.org/abs/2605.12495 以从此页面链接它。

包含此论文的收藏集 0

没有包含此论文的收藏集

将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接它。

相似文章

多模块 GRPO:组合策略梯度与提示优化的语言模型程序方法

Papers with Code Trending

本文提出 mmGRPO,一种多模块扩展的群体相对策略优化(GRPO)方法,通过优化语言模型调用和提示来提升模块化 AI 系统的准确率。实验表明,该方法在各类任务上平均带来 11% 的准确率提升,并在 DSPy 中提供了开源实现。

强化多模态掩码扩散模型的生成顺序

arXiv cs.LG

本文提出了一种可学习的控制模块,通过组相对策略优化(GRPO)进行训练,以优化多模态掩码扩散模型中的生成顺序,从而在文本到图像对齐和多模态理解方面取得了改进。