回读:预训练多模态大语言模型作为文本到图像生成的零样本奖励模型

Hugging Face Daily Papers 论文

摘要

本文介绍了SpectraReward,一种无需训练的奖励函数,利用预训练的多模态大语言模型(MLLM)作为文本到图像生成中强化学习的零样本奖励模型,在多项指标上持续优于先前方法。

本文提出SpectraReward,一种无需训练的奖励函数,将预训练的多模态大语言模型(MLLM)直接转化为图像生成强化学习的现成奖励模型。与要求MLLM评判生成图像或回答分解后的验证问题不同,SpectraReward通过一次基于图像的、教师强制的前向传播,衡量原始提示能从生成图像中恢复的程度。我们以平均图像条件提示对数似然作为奖励,直接复用MLLM预训练的图像-文本对齐能力,无需偏好标签或奖励模型微调。进一步地,我们引入Self-SpectraReward——统一多模态模型的一种特例,其中策略自身的理解分支为其生成分支充当奖励模型,形成一个无需外部奖励模型或外部知识的闭环自改进框架。大量实验验证了SpectraReward在广泛的图像生成强化学习研究中的有效性,涵盖两种扩散模型、三种强化学习算法、来自四个MLLM家族(参数量从4B到235B)的九个奖励MLLM骨干网络,以及五个分布外文本到图像基准。结果表明,SpectraReward和Self-SpectraReward均能显著且一致地提升生成性能,并优于先前基于MLLM的奖励训练方法。进一步分析揭示,更大的奖励MLLM并不总是更好,而Self-SpectraReward能够匹配甚至超越更大的外部奖励模型,表明奖励-策略对齐是实现有效图像生成强化学习的关键因素。项目页面:https://huangrh99.github.io/SpectraReward/
查看原文
查看缓存全文

缓存时间: 2026/07/15 04:21

论文页面 - Read It Back: Pretrained MLLMs Are Zero-Shot Reward Models for Text-to-Image Generation

来源:https://huggingface.co/papers/2607.11886

摘要

本文提出 SpectraReward,一种无需训练的奖励函数,将预训练的多模态大语言模型(MLLM)转化为用于图像生成强化学习的现成奖励模型。与要求 MLLM 判断生成图像或回答分解后的验证问题不同,SpectraReward 通过一次单次图像条件、教师强迫的前向传播,衡量从生成图像中恢复原始提示词的效果。我们使用平均图像条件提示词对数似然作为奖励,直接复用 MLLM 的预训练图像-文本对齐能力,无需偏好标签或奖励模型微调。我们进一步引入 Self-SpectraReward,这是统一多模态模型的一种特例,其中策略自身的理解分支作为其生成分支的奖励模型,形成一个无需外部奖励模型或外部知识的闭环自改进框架。大量实验通过一项广泛的图像生成强化学习研究验证了 SpectraReward,涵盖两种扩散模型、三种强化学习算法、来自四个 MLLM 家族(参数从 4B 到 235B)的九个奖励 MLLM 骨干网络,以及五个分布外文本到图像基准。结果表明,SpectraReward 和 Self-SpectraReward 均能显著且一致地提升生成性能,并优于先前基于 MLLM 的奖励训练方法。进一步分析显示,更大的奖励 MLLM 并不总是更好,而 Self-SpectraReward 可以匹配甚至超越大得多的外部奖励模型,这表明奖励-策略对齐是有效图像生成强化学习的关键因素。项目页面:https://huangrh99.github.io/SpectraReward/

查看 arXiv 页面 (https://arxiv.org/abs/2607.11886) 查看 PDF (https://arxiv.org/pdf/2607.11886) 项目页面 (https://huangrh99.github.io/SpectraReward/) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.11886)

在你的 agent 中获取此论文:

hf papers read 2607.11886

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本文的模型 0

没有模型链接本文

在模型的 README.md 中引用 arxiv.org/abs/2607.11886 以从本页链接到它。

引用本文的数据集 0

没有数据集链接本文

在数据集的 README.md 中引用 arxiv.org/abs/2607.11886 以从本页链接到它。

引用本文的 Space 0

没有 Space 链接本文

在 Space 的 README.md 中引用 arxiv.org/abs/2607.11886 以从本页链接到它。

包含本文的收藏集 0

没有收藏集包含本文

将本文添加到一个收藏集 (https://huggingface.co/new-collection) 以从本页链接到它。

相似文章