AutoRubric-T2I: 基于规则的文本到图像对齐鲁棒奖励模型

Hugging Face Daily Papers 论文

摘要

AutoRubric-T2I 自动生成并选择显式评分标准,以指导视觉语言模型裁判对文本到图像生成进行评判,用极少的人工标注实现高质量奖励信号,并提升下游任务的生成质量。

对齐文本到图像(T2I)生成模型与人类偏好越来越依赖于图像奖励模型,这些模型根据提示对齐性和感知质量对生成的图像进行评分或排序。现有的奖励模型通常在大规模人类偏好语料库上训练为 Bradley-Terry (BT) 偏好模型,这使得它们训练成本高、难以适应,并且评估标准不透明。同时,视觉语言模型(VLM)裁判可以通过文本评分标准提供更细粒度的评估,但其手动设计或启发式生成的评分规则可能无法可靠地反映人类偏好。在本文中,我们提出 AutoRubric-T2I,这是 T2I 领域中第一个自动合成并选择显式评分标准以指导 VLM 裁判的评分学习框架。AutoRubric-T2I 首先将偏好对中的推理轨迹合成为候选评分标准,然后使用 VLM 裁判在每个评分标准下对成对图像进行评分,产生成对的评分标准-分数差异用于偏好学习。为了去除噪声和冗余规则,我们进一步采用 L1 正则化逻辑回归精炼器,选择最具判别力的 Top-N 评分标准。广泛评估表明,AutoRubric-T2I 使用不到 0.01% 的标注偏好数据产生高质量、可解释的奖励信号,大大减少了对大规模奖励模型训练的需求。在 MMRB2 等图像奖励基准上,AutoRubric-T2I 优于强奖励模型基线。我们进一步将 AutoRubric-T2I 作为下游 T2I 任务(包括 TIIF 和 UniGenBench++)的 RL 奖励进行验证,在使用 Flow-GRPO 流程的扩散模型上,它比标量奖励模型提高了生成质量。
查看原文
查看缓存全文

缓存时间: 2026/05/22 22:22

论文页面 - AutoRubric-T2I:面向文本到图像对齐的鲁棒基于规则奖励模型

来源:https://huggingface.co/papers/2605.17602

摘要

AutoRubric-T2I 自动生成并筛选显式评分准则,以指导视觉语言模型(VLM)裁判对文本到图像生成进行评判,从而在最小化人工标注的情况下获得高质量奖励信号,并在下游任务中提升生成质量。

将文本到图像生成模型与人类偏好对齐,日益依赖图像奖励模型(https://huggingface.co/papers?q=reward%20models)——这类模型根据提示对齐度和感知质量对生成图像进行评分或排序。现有奖励模型(https://huggingface.co/papers?q=reward%20models)通常作为 Bradley-Terry 偏好模型在大规模人类偏好语料上训练,导致训练成本高昂、难以迁移,且评估标准不可解释。与此同时,视觉语言模型(VLM)裁判能够通过文本准则提供更细粒度的评估,但其人工设计或启发式生成的评分规则可能无法可靠反映人类偏好。本文提出 AutoRubric-T2I,这是 T2I 领域中首个自动合成并筛选显式评分准则以指导 VLM 裁判的准则学习(https://huggingface.co/papers?q=rubric%20learning)框架。AutoRubric-T2I 首先从偏好对中合成推理轨迹形成候选准则,接着利用 VLM 裁判对每对图像在每个准则下进行评分,生成配对准则分数差用于偏好学习。为去除噪声和冗余规则,我们进一步采用 ℓ1 正则化逻辑回归精炼器,筛选出最具判别力的 Top-N 准则。大量评估表明,AutoRubric-T2I 仅需不到 0.01% 的标注偏好数据,即可生成高质量、可解释的奖励信号,大幅降低大规模奖励模型训练的需求。在 MMRB2 等图像奖励基准上,AutoRubric-T2I 超越了强奖励模型基线。我们进一步将 AutoRubric-T2I 作为强化学习奖励应用于下游 T2I 任务(包括 TIIF 和 UniGenBench++),通过 Flow-GRPO(https://huggingface.co/papers?q=Flow-GRPO)管道在扩散模型(https://huggingface.co/papers?q=diffusion%20models)上提升生成质量,效果优于标量奖励模型(https://huggingface.co/papers?q=reward%20models)。

查看 arXiv 页面(https://arxiv.org/abs/2605.17602)查看 PDF(https://arxiv.org/pdf/2605.17602)项目页面(https://johnsonkao0213.github.io/AutoRubric-T2I/)GitHub2(https://github.com/johnsonkao0213/AutoRubric-T2I)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.17602)

在您的智能体中获取此论文:

hf papers read 2605.17602

没有最新 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

尚无模型关联此论文

在模型 README.md 中引用 arxiv.org/abs/2605.17602 即可从此页面建立链接。

引用此论文的数据集0

尚无数据集关联此论文

在数据集 README.md 中引用 arxiv.org/abs/2605.17602 即可从此页面建立链接。

引用此论文的 Space0

尚无 Space 关联此论文

在 Space README.md 中引用 arxiv.org/abs/2605.17602 即可从此页面建立链接。

包含此论文的收藏集0

尚无收藏集包含此论文

将此论文添加到收藏集(https://huggingface.co/new-collection)即可从此页面建立链接。

相似文章

C2:基于二元偏好的可扩展评分增强奖励建模

Hugging Face Daily Papers

C2 提出了一种可扩展的评分增强奖励建模框架,该框架仅通过二元偏好训练一个协作的评分生成器和一个批判性验证器,无需昂贵的评分标注,同时在 RM-Bench 上实现了最高 6.5 分的提升。