先思考,再评分:视觉生成的思考奖励模型

Hugging Face Daily Papers 论文

摘要

本文介绍了思考奖励模型(TRM),该模型显式地制定案例自适应标准来评估视觉生成,在开源奖励模型中实现了最先进的性能。

视觉奖励模型对于评估和改进视觉生成模型至关重要,然而现有的方法通常将任务条件和候选输出直接映射到标量奖励,使得每个个案应评估的内容变得隐含。我们引入“先思考,再评分”的范式,该范式在评判候选表现之前显式地确定每个案例的关键点。遵循这一原则,我们提出了思考奖励模型(TRM),该模型制定案例自适应标准,执行标准指导的评估,并生成细粒度的逐点奖励。我们进一步观察到,传统的成对偏好优化可能导致分数两极化,并引入成对双组相对策略优化(PD-GRPO),该方法利用成对监督来提高奖励区分度,同时保留细粒度的逐点评分。在图像生成和编辑奖励建模基准上的大量实验表明,TRM在开源奖励模型中实现了最先进的性能,同时与专有替代方案相比仍具有高度竞争力。此外,使用TRM作为强化学习的奖励一致地改进了各种视觉生成模型,证明其细粒度的、案例自适应的奖励转化为视觉生成的有效优化信号。
查看原文
查看缓存全文

缓存时间: 2026/09/30 04:22

论文页面 - 先思后评:用于视觉生成的思考奖励模型

来源:https://huggingface.co/papers/2609.37372 作者:

,

,

,

,

,

,

,

,

,

,

摘要

视觉奖励模型对于评估和改进视觉生成模型至关重要,但现有方法通常将任务条件与候选输出直接映射为标量奖励,隐式地决定了每个具体案例的评估内容。我们提出“先思后评”范式,在判断候选输出表现前明确每个案例的关键评估点。基于此原则,我们设计了思考奖励模型,它通过构建案例适配的评估准则,执行准则引导的评估,并输出细粒度的逐点奖励。我们进一步发现传统的成对偏好优化可能导致分数极化现象,因而提出成对双组相对策略优化方法,利用成对监督在保持细粒度逐点评分的同时提升奖励区分度。在图像生成和编辑奖励建模基准上的大量实验表明,该模型在开源奖励模型中达到了最优性能,同时与闭源替代方案相比保持高度竞争力。此外,将该模型作为奖励信号用于强化学习时,能持续提升各类视觉生成模型的效果,证明其细粒度、案例适配的奖励机制能为视觉生成提供有效的优化信号。

查看 arXiv 页面 (https://arxiv.org/abs/2609.37372)查看 PDF (https://arxiv.org/pdf/2609.37372)项目页面 (https://bxhsort.github.io/Thinking-Reward-Model/)GitHub16 (https://github.com/bxhsort/Thinking_Reward_Model)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.37372)

在您的智能体中获取此论文:

hf papers read 2609\.37372

没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型0

没有模型链接本文

在模型的 README.md 中引用 arxiv.org/abs/2609.37372 即可从本页链接。

引用本文的数据集0

没有数据集链接本文

在数据集的 README.md 中引用 arxiv.org/abs/2609.37372 即可从本页链接。

引用本文的空间0

没有空间链接本文

在空间的 README.md 中引用 arxiv.org/abs/2609.37372 即可从本页链接。

包含本文的收藏集0

没有收藏集包含本文

将本文添加到收藏集 (https://huggingface.co/new-collection)即可从本页链接。

相似文章

先思考,再打分:解耦推理与打分的视频奖励建模

Hugging Face Daily Papers

本文介绍了 DeScore,这是一种通过解耦推理和打分过程来提高训练效率和泛化能力的视频奖励模型。它利用多模态大语言模型采用“先思考再打分”的范式,解决了现有判别式和生成式奖励模型的局限性。