基于交错强化学习的统一模型原生反思学习
摘要
本文介绍了UMM-Reflection,这是一种用于统一多模态模型的强化学习方法,能够实现生成图像的自我修复,无需外部验证器即可提升在GenEval、WISE和T2I-CompBench++等基准测试上的性能。
查看缓存全文
缓存时间: 2026/09/29 08:13
论文页面 - 在统一模型中通过交错强化学习实现原生反思能力
来源:https://huggingface.co/papers/2609.35767
摘要
统一多模态模型既能观察图像也能生成图像,因此理论上它们可以修复自身的生成结果:诊断图像存在的问题,进行修改,观察结果,并再次诊断。然而,修改是否有效只有在渲染后才能知晓,因此反思文本与图像生成必须在整个循环中联合学习。基于反思轨迹的监督微调(SFT)能提供冷启动效果,但无法找到高成功率的修复路径;而仅优化生成器或单一模块的朴素强化学习(RL)则无法充分利用潜在收益。我们提出UMM-Reflection方法,在单一统一模型内通过强化学习完成完整的反思轨迹:平行轨迹共享同一初始图像,通过组间相对优势比较反思策略,使用轨迹级优势同时更新反思词元与基于流匹配的修改过程,避免了逐轮信用分配的组合爆炸问题。与单轮编辑或依赖外部判别器的流程不同,其信用信号可跨轮次并在模型的双重角色间传递,且推理时无需验证器。在BAGEL模型上,UMM-Reflection相比SFT在GenEval指标上提升12.05点,且该增益可迁移至WISE(+10.97)、OneIG-Bench(+3.48)和T2I-CompBench++(+4.63)等训练中未使用的评估基准。
查看arXiv页面 (https://arxiv.org/abs/2609.35767)查看PDF (https://arxiv.org/pdf/2609.35767)项目主页 (https://waltstephen.github.io/UMM-Reflection/)GitHub4 (https://github.com/waltstephen/UMM-Reflection)添加至收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.35767)
在代理中获取本论文:
hf papers read 2609\.35767
尚未安装最新版CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本论文的模型0
无模型链接本论文
在模型README.md中引用arxiv.org/abs/2609.35767以在此页面创建链接。
引用本论文的数据集0
无数据集链接本论文
在数据集README.md中引用arxiv.org/abs/2609.35767以在此页面创建链接。
引用本论文的Space0
无Space链接本论文
在Space README.md中引用arxiv.org/abs/2609.35767以在此页面创建链接。
收录本论文的收藏夹0
无收藏夹收录本论文
将本论文添加至收藏夹 (https://huggingface.co/new-collection)以在此页面创建链接。
相似文章
MIRAGE: 基于强化学习引导的多角度创造性语言模型推理
论文介绍了 MIRAGE,这是一个推理时框架,通过使用强化学习引导动态切换视角来增强 LLM 推理,在各种基准测试中优于现有的提示方法。
ReflectMT:将反思内化为高效高质量机器翻译
ReflectMT提出两阶段强化学习方法,让大推理模型把反思能力内化,实现单次高质量翻译,比DeepSeek-R1等多步推理模型少用94%的token。
iVGR: 通过强化学习将视觉基础推理内化到多模态大语言模型
介绍 iVGR,一种强化学习框架,将视觉定位内化到多模态语言模型的文本推理中,在提升细粒度感知性能的同时,消除了推理过程中显式视觉基础的需求。
在原生统一多模态模型中揭示理解-生成协同:从表示、任务到系统
本文探讨了统一多模态模型中视觉理解与生成之间的协同效应,表明任务解耦架构和端到端优化可以通过将共存转化为协同来提升性能。
AlphaGRPO:通过分解可验证奖励释放统一多模态模型中的自反式生成能力
AlphaGRPO 是一个新框架,将组相对策略优化(Group Relative Policy Optimization)应用于统一多模态模型(UMMs),通过自反式精炼和分解可验证奖励来增强生成效果。