AutoRubric-T2I: 基于规则的文本到图像对齐鲁棒奖励模型
摘要
AutoRubric-T2I 自动生成并选择显式评分标准,以指导视觉语言模型裁判对文本到图像生成进行评判,用极少的人工标注实现高质量奖励信号,并提升下游任务的生成质量。
查看缓存全文
缓存时间: 2026/05/22 22:22
论文页面 - AutoRubric-T2I:面向文本到图像对齐的鲁棒基于规则奖励模型
来源:https://huggingface.co/papers/2605.17602
摘要
AutoRubric-T2I 自动生成并筛选显式评分准则,以指导视觉语言模型(VLM)裁判对文本到图像生成进行评判,从而在最小化人工标注的情况下获得高质量奖励信号,并在下游任务中提升生成质量。
将文本到图像生成模型与人类偏好对齐,日益依赖图像奖励模型(https://huggingface.co/papers?q=reward%20models)——这类模型根据提示对齐度和感知质量对生成图像进行评分或排序。现有奖励模型(https://huggingface.co/papers?q=reward%20models)通常作为 Bradley-Terry 偏好模型在大规模人类偏好语料上训练,导致训练成本高昂、难以迁移,且评估标准不可解释。与此同时,视觉语言模型(VLM)裁判能够通过文本准则提供更细粒度的评估,但其人工设计或启发式生成的评分规则可能无法可靠反映人类偏好。本文提出 AutoRubric-T2I,这是 T2I 领域中首个自动合成并筛选显式评分准则以指导 VLM 裁判的准则学习(https://huggingface.co/papers?q=rubric%20learning)框架。AutoRubric-T2I 首先从偏好对中合成推理轨迹形成候选准则,接着利用 VLM 裁判对每对图像在每个准则下进行评分,生成配对准则分数差用于偏好学习。为去除噪声和冗余规则,我们进一步采用 ℓ1 正则化逻辑回归精炼器,筛选出最具判别力的 Top-N 准则。大量评估表明,AutoRubric-T2I 仅需不到 0.01% 的标注偏好数据,即可生成高质量、可解释的奖励信号,大幅降低大规模奖励模型训练的需求。在 MMRB2 等图像奖励基准上,AutoRubric-T2I 超越了强奖励模型基线。我们进一步将 AutoRubric-T2I 作为强化学习奖励应用于下游 T2I 任务(包括 TIIF 和 UniGenBench++),通过 Flow-GRPO(https://huggingface.co/papers?q=Flow-GRPO)管道在扩散模型(https://huggingface.co/papers?q=diffusion%20models)上提升生成质量,效果优于标量奖励模型(https://huggingface.co/papers?q=reward%20models)。
查看 arXiv 页面(https://arxiv.org/abs/2605.17602)查看 PDF(https://arxiv.org/pdf/2605.17602)项目页面(https://johnsonkao0213.github.io/AutoRubric-T2I/)GitHub2(https://github.com/johnsonkao0213/AutoRubric-T2I)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.17602)
在您的智能体中获取此论文:
hf papers read 2605.17602
没有最新 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
尚无模型关联此论文
在模型 README.md 中引用 arxiv.org/abs/2605.17602 即可从此页面建立链接。
引用此论文的数据集0
尚无数据集关联此论文
在数据集 README.md 中引用 arxiv.org/abs/2605.17602 即可从此页面建立链接。
引用此论文的 Space0
尚无 Space 关联此论文
在 Space README.md 中引用 arxiv.org/abs/2605.17602 即可从此页面建立链接。
包含此论文的收藏集0
尚无收藏集包含此论文
将此论文添加到收藏集(https://huggingface.co/new-collection)即可从此页面建立链接。
相似文章
自动评分标准作为奖励:从隐性偏好到显式多模态生成准则
本文介绍了自动评分标准作为奖励(ARR)框架,该框架将隐性偏好知识外显化为多模态对齐的显式评分标准。文章提出了评分标准策略优化(RPO)以稳定策略梯度,在文生图和图像编辑任务中取得了更佳的性能。
V-Rubrics:基于评估准则的强化学习实现视觉忠实性
提出一种基于评估准则的强化学习方法,通过将回答分解为原子命题,并从视觉忠实性、推理一致性和指令遵循度三个维度进行评分,从而提升视觉语言模型的视觉忠实性。
FIRM-Video:评分前核查以实现可靠的文本到视频奖励建模
FIRM-Video 介绍了一种基于检查表驱动的验证框架,用于构建文本到视频任务中的可靠奖励模型,利用时间视觉证据来改进评估和对齐。
C2:基于二元偏好的可扩展评分增强奖励建模
C2 提出了一种可扩展的评分增强奖励建模框架,该框架仅通过二元偏好训练一个协作的评分生成器和一个批判性验证器,无需昂贵的评分标注,同时在 RM-Bench 上实现了最高 6.5 分的提升。
RUBRIC-ARROW:非可验证领域中LLM后训练的交替点状评分标准奖励建模
RUBRIC-ARROW 提出了一种交替式奖励建模框架,通过减少平局并利用成对偏好数据改进了基于评分标准的方法,在非可验证领域为LLM后训练实现了具有竞争力的准确率和收益。