先思考,再评分:视觉生成的思考奖励模型
摘要
本文介绍了思考奖励模型(TRM),该模型显式地制定案例自适应标准来评估视觉生成,在开源奖励模型中实现了最先进的性能。
查看缓存全文
缓存时间: 2026/09/30 04:22
论文页面 - 先思后评:用于视觉生成的思考奖励模型
来源:https://huggingface.co/papers/2609.37372 作者:
,
,
,
,
,
,
,
,
,
,
摘要
视觉奖励模型对于评估和改进视觉生成模型至关重要,但现有方法通常将任务条件与候选输出直接映射为标量奖励,隐式地决定了每个具体案例的评估内容。我们提出“先思后评”范式,在判断候选输出表现前明确每个案例的关键评估点。基于此原则,我们设计了思考奖励模型,它通过构建案例适配的评估准则,执行准则引导的评估,并输出细粒度的逐点奖励。我们进一步发现传统的成对偏好优化可能导致分数极化现象,因而提出成对双组相对策略优化方法,利用成对监督在保持细粒度逐点评分的同时提升奖励区分度。在图像生成和编辑奖励建模基准上的大量实验表明,该模型在开源奖励模型中达到了最优性能,同时与闭源替代方案相比保持高度竞争力。此外,将该模型作为奖励信号用于强化学习时,能持续提升各类视觉生成模型的效果,证明其细粒度、案例适配的奖励机制能为视觉生成提供有效的优化信号。
查看 arXiv 页面 (https://arxiv.org/abs/2609.37372)查看 PDF (https://arxiv.org/pdf/2609.37372)项目页面 (https://bxhsort.github.io/Thinking-Reward-Model/)GitHub16 (https://github.com/bxhsort/Thinking_Reward_Model)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.37372)
在您的智能体中获取此论文:
hf papers read 2609\.37372
没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型0
没有模型链接本文
在模型的 README.md 中引用 arxiv.org/abs/2609.37372 即可从本页链接。
引用本文的数据集0
没有数据集链接本文
在数据集的 README.md 中引用 arxiv.org/abs/2609.37372 即可从本页链接。
引用本文的空间0
没有空间链接本文
在空间的 README.md 中引用 arxiv.org/abs/2609.37372 即可从本页链接。
包含本文的收藏集0
没有收藏集包含本文
将本文添加到收藏集 (https://huggingface.co/new-collection)即可从本页链接。
相似文章
AutoRubric-T2I: 基于规则的文本到图像对齐鲁棒奖励模型
AutoRubric-T2I 自动生成并选择显式评分标准,以指导视觉语言模型裁判对文本到图像生成进行评判,用极少的人工标注实现高质量奖励信号,并提升下游任务的生成质量。
先思考,再打分:解耦推理与打分的视频奖励建模
本文介绍了 DeScore,这是一种通过解耦推理和打分过程来提高训练效率和泛化能力的视频奖励模型。它利用多模态大语言模型采用“先思考再打分”的范式,解决了现有判别式和生成式奖励模型的局限性。
自动评分标准作为奖励:从隐性偏好到显式多模态生成准则
本文介绍了自动评分标准作为奖励(ARR)框架,该框架将隐性偏好知识外显化为多模态对齐的显式评分标准。文章提出了评分标准策略优化(RPO)以稳定策略梯度,在文生图和图像编辑任务中取得了更佳的性能。
RewardVerse:评分标准指导的策略优化用于视频奖励建模
RewardVerse 提出了一种基于评分标准的视频奖励建模框架,以缓解标量漂移并提供稳定的评估标准,从而增强视频生成中的强化学习。
RULER:实例感知的评分标准奖励用于SVG生成
RULER为SVG生成引入了实例感知的评分标准奖励,利用视觉语言评判器优化强化学习,显著提升性能,优于之前的方法。