AutoRubric-T2I: 基于规则的文本到图像对齐鲁棒奖励模型
摘要
AutoRubric-T2I 自动生成并选择显式评分标准,以指导视觉语言模型裁判对文本到图像生成进行评判,用极少的人工标注实现高质量奖励信号,并提升下游任务的生成质量。
查看缓存全文
缓存时间: 2026/05/22 22:22
论文页面 - AutoRubric-T2I:面向文本到图像对齐的鲁棒基于规则奖励模型
来源:https://huggingface.co/papers/2605.17602
摘要
AutoRubric-T2I 自动生成并筛选显式评分准则,以指导视觉语言模型(VLM)裁判对文本到图像生成进行评判,从而在最小化人工标注的情况下获得高质量奖励信号,并在下游任务中提升生成质量。
将文本到图像生成模型与人类偏好对齐,日益依赖图像奖励模型(https://huggingface.co/papers?q=reward%20models)——这类模型根据提示对齐度和感知质量对生成图像进行评分或排序。现有奖励模型(https://huggingface.co/papers?q=reward%20models)通常作为 Bradley-Terry 偏好模型在大规模人类偏好语料上训练,导致训练成本高昂、难以迁移,且评估标准不可解释。与此同时,视觉语言模型(VLM)裁判能够通过文本准则提供更细粒度的评估,但其人工设计或启发式生成的评分规则可能无法可靠反映人类偏好。本文提出 AutoRubric-T2I,这是 T2I 领域中首个自动合成并筛选显式评分准则以指导 VLM 裁判的准则学习(https://huggingface.co/papers?q=rubric%20learning)框架。AutoRubric-T2I 首先从偏好对中合成推理轨迹形成候选准则,接着利用 VLM 裁判对每对图像在每个准则下进行评分,生成配对准则分数差用于偏好学习。为去除噪声和冗余规则,我们进一步采用 ℓ1 正则化逻辑回归精炼器,筛选出最具判别力的 Top-N 准则。大量评估表明,AutoRubric-T2I 仅需不到 0.01% 的标注偏好数据,即可生成高质量、可解释的奖励信号,大幅降低大规模奖励模型训练的需求。在 MMRB2 等图像奖励基准上,AutoRubric-T2I 超越了强奖励模型基线。我们进一步将 AutoRubric-T2I 作为强化学习奖励应用于下游 T2I 任务(包括 TIIF 和 UniGenBench++),通过 Flow-GRPO(https://huggingface.co/papers?q=Flow-GRPO)管道在扩散模型(https://huggingface.co/papers?q=diffusion%20models)上提升生成质量,效果优于标量奖励模型(https://huggingface.co/papers?q=reward%20models)。
查看 arXiv 页面(https://arxiv.org/abs/2605.17602)查看 PDF(https://arxiv.org/pdf/2605.17602)项目页面(https://johnsonkao0213.github.io/AutoRubric-T2I/)GitHub2(https://github.com/johnsonkao0213/AutoRubric-T2I)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.17602)
在您的智能体中获取此论文:
hf papers read 2605.17602
没有最新 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
尚无模型关联此论文
在模型 README.md 中引用 arxiv.org/abs/2605.17602 即可从此页面建立链接。
引用此论文的数据集0
尚无数据集关联此论文
在数据集 README.md 中引用 arxiv.org/abs/2605.17602 即可从此页面建立链接。
引用此论文的 Space0
尚无 Space 关联此论文
在 Space README.md 中引用 arxiv.org/abs/2605.17602 即可从此页面建立链接。
包含此论文的收藏集0
尚无收藏集包含此论文
将此论文添加到收藏集(https://huggingface.co/new-collection)即可从此页面建立链接。
相似文章
自动评分标准作为奖励:从隐性偏好到显式多模态生成准则
本文介绍了自动评分标准作为奖励(ARR)框架,该框架将隐性偏好知识外显化为多模态对齐的显式评分标准。文章提出了评分标准策略优化(RPO)以稳定策略梯度,在文生图和图像编辑任务中取得了更佳的性能。
RULER:实例感知的评分标准奖励用于SVG生成
RULER为SVG生成引入了实例感知的评分标准奖励,利用视觉语言评判器优化强化学习,显著提升性能,优于之前的方法。
先思考,再评分:视觉生成的思考奖励模型
本文介绍了思考奖励模型(TRM),该模型显式地制定案例自适应标准来评估视觉生成,在开源奖励模型中实现了最先进的性能。
RewardVerse:评分标准指导的策略优化用于视频奖励建模
RewardVerse 提出了一种基于评分标准的视频奖励建模框架,以缓解标量漂移并提供稳定的评估标准,从而增强视频生成中的强化学习。
V-Rubrics:基于评估准则的强化学习实现视觉忠实性
提出一种基于评估准则的强化学习方法,通过将回答分解为原子命题,并从视觉忠实性、推理一致性和指令遵循度三个维度进行评分,从而提升视觉语言模型的视觉忠实性。