回读:预训练多模态大语言模型作为文本到图像生成的零样本奖励模型
摘要
本文介绍了SpectraReward,一种无需训练的奖励函数,利用预训练的多模态大语言模型(MLLM)作为文本到图像生成中强化学习的零样本奖励模型,在多项指标上持续优于先前方法。
查看缓存全文
缓存时间: 2026/07/15 04:21
论文页面 - Read It Back: Pretrained MLLMs Are Zero-Shot Reward Models for Text-to-Image Generation
来源:https://huggingface.co/papers/2607.11886
摘要
本文提出 SpectraReward,一种无需训练的奖励函数,将预训练的多模态大语言模型(MLLM)转化为用于图像生成强化学习的现成奖励模型。与要求 MLLM 判断生成图像或回答分解后的验证问题不同,SpectraReward 通过一次单次图像条件、教师强迫的前向传播,衡量从生成图像中恢复原始提示词的效果。我们使用平均图像条件提示词对数似然作为奖励,直接复用 MLLM 的预训练图像-文本对齐能力,无需偏好标签或奖励模型微调。我们进一步引入 Self-SpectraReward,这是统一多模态模型的一种特例,其中策略自身的理解分支作为其生成分支的奖励模型,形成一个无需外部奖励模型或外部知识的闭环自改进框架。大量实验通过一项广泛的图像生成强化学习研究验证了 SpectraReward,涵盖两种扩散模型、三种强化学习算法、来自四个 MLLM 家族(参数从 4B 到 235B)的九个奖励 MLLM 骨干网络,以及五个分布外文本到图像基准。结果表明,SpectraReward 和 Self-SpectraReward 均能显著且一致地提升生成性能,并优于先前基于 MLLM 的奖励训练方法。进一步分析显示,更大的奖励 MLLM 并不总是更好,而 Self-SpectraReward 可以匹配甚至超越大得多的外部奖励模型,这表明奖励-策略对齐是有效图像生成强化学习的关键因素。项目页面:https://huangrh99.github.io/SpectraReward/
查看 arXiv 页面 (https://arxiv.org/abs/2607.11886) 查看 PDF (https://arxiv.org/pdf/2607.11886) 项目页面 (https://huangrh99.github.io/SpectraReward/) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.11886)
在你的 agent 中获取此论文:
hf papers read 2607.11886
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本文的模型 0
没有模型链接本文
在模型的 README.md 中引用 arxiv.org/abs/2607.11886 以从本页链接到它。
引用本文的数据集 0
没有数据集链接本文
在数据集的 README.md 中引用 arxiv.org/abs/2607.11886 以从本页链接到它。
引用本文的 Space 0
没有 Space 链接本文
在 Space 的 README.md 中引用 arxiv.org/abs/2607.11886 以从本页链接到它。
包含本文的收藏集 0
没有收藏集包含本文
将本文添加到一个收藏集 (https://huggingface.co/new-collection) 以从本页链接到它。
相似文章
@xichen_pan: 现代文本到图像模型越来越多地依赖大型预训练LLM。但存在一个有趣的不匹配:LLM…
RepFusion提出了一种方法,在扩散Transformer中将预训练多模态LLM用作噪声表示编码器,用于文本到图像生成,在相似计算量下超越基线。
TRN-R1-Zero:仅通过强化学习实现富文本网络推理
TRN-R1-Zero 提出一种后训练框架,让大模型在无需监督微调或思维链数据的情况下,仅凭强化学习即可对富文本网络进行零样本推理。
STAR: 时空自适应奖励分配用于文本到图像强化学习后训练
本文介绍STAR,一种用于文本到图像扩散模型强化学习后训练中的时空自适应奖励分配方法,通过将策略更新聚焦于相关潜在区域,改善组合对齐和文本渲染。
从搜索到综合:训练大语言模型为零样本工作流生成器
介绍MetaFlow,一种通过结合监督微调和带执行反馈的强化学习来训练大语言模型为零样本任务生成工作流的方法,实现对未训练任务和算子集的强大泛化能力。
我从头开始预训练和后训练了一个500M参数的LLM和一个330M参数的图像生成器
作者详细介绍了从头开始预训练和后训练一个500M参数的语言模型和一个330M参数的图像生成器的过程。