基于交错强化学习的统一模型原生反思学习

Hugging Face Daily Papers 论文

摘要

本文介绍了UMM-Reflection,这是一种用于统一多模态模型的强化学习方法,能够实现生成图像的自我修复,无需外部验证器即可提升在GenEval、WISE和T2I-CompBench++等基准测试上的性能。

统一多模态模型既能查看又能渲染图像,因此原则上它们可以修复自己的生成:诊断图像的错误,进行修正,观察结果,并再次诊断。只有在渲染后才知道修正是否有帮助,因此反思文本和图像生成必须在整个循环中联合学习。对反思轨迹进行监督微调(SFT)提供了冷启动,但未找到高成功率的修复路径,而仅优化渲染器或仅优化一个头的朴素强化学习则未能充分利用大部分收益。我们引入了UMM-Reflection,它应用强化学习(RL)在单一统一模型内完成反思轨迹:兄弟轨迹共享一个初始图像,因此组相对优势比较反思策略,而一个轨迹级优势同时更新反思令牌和基于流的修正,避免了每轮信用分配的组合爆炸。与单轮编辑或带有外部评论家的流程不同,信用流跨轮次流向同一模型的两个角色,且在推理时无需验证器。在BAGEL上,UMM-Reflection相比SFT将GenEval提升了12.05点,并且这些增益转移到了WISE(+10.97)、OneIG-Bench(+3.48)和T2I-CompBench++(+4.63),这些基准测试均未用于训练。
查看原文
查看缓存全文

缓存时间: 2026/09/29 08:13

论文页面 - 在统一模型中通过交错强化学习实现原生反思能力

来源:https://huggingface.co/papers/2609.35767

摘要

统一多模态模型既能观察图像也能生成图像,因此理论上它们可以修复自身的生成结果:诊断图像存在的问题,进行修改,观察结果,并再次诊断。然而,修改是否有效只有在渲染后才能知晓,因此反思文本与图像生成必须在整个循环中联合学习。基于反思轨迹的监督微调(SFT)能提供冷启动效果,但无法找到高成功率的修复路径;而仅优化生成器或单一模块的朴素强化学习(RL)则无法充分利用潜在收益。我们提出UMM-Reflection方法,在单一统一模型内通过强化学习完成完整的反思轨迹:平行轨迹共享同一初始图像,通过组间相对优势比较反思策略,使用轨迹级优势同时更新反思词元与基于流匹配的修改过程,避免了逐轮信用分配的组合爆炸问题。与单轮编辑或依赖外部判别器的流程不同,其信用信号可跨轮次并在模型的双重角色间传递,且推理时无需验证器。在BAGEL模型上,UMM-Reflection相比SFT在GenEval指标上提升12.05点,且该增益可迁移至WISE(+10.97)、OneIG-Bench(+3.48)和T2I-CompBench++(+4.63)等训练中未使用的评估基准。

查看arXiv页面 (https://arxiv.org/abs/2609.35767)查看PDF (https://arxiv.org/pdf/2609.35767)项目主页 (https://waltstephen.github.io/UMM-Reflection/)GitHub4 (https://github.com/waltstephen/UMM-Reflection)添加至收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.35767)

在代理中获取本论文:

hf papers read 2609\.35767

尚未安装最新版CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本论文的模型0

无模型链接本论文

在模型README.md中引用arxiv.org/abs/2609.35767以在此页面创建链接。

引用本论文的数据集0

无数据集链接本论文

在数据集README.md中引用arxiv.org/abs/2609.35767以在此页面创建链接。

引用本论文的Space0

无Space链接本论文

在Space README.md中引用arxiv.org/abs/2609.35767以在此页面创建链接。

收录本论文的收藏夹0

无收藏夹收录本论文

将本论文添加至收藏夹 (https://huggingface.co/new-collection)以在此页面创建链接。

相似文章