超越标量奖励:将推理内化到分数分布中

Hugging Face Daily Papers 论文

摘要

Z-Reward 是一个教师-学生框架,它将复杂推理与高效的奖励部署解耦,用于文本到图像的训练。该框架使用 27B 教师模型达到了 89.6% 的人类偏好准确率,使用 9B 学生模型达到了 88.6%,超过了先前的方法。

奖励模型在文本到图像的后训练中至关重要,但视觉偏好是主观的,更适合表示为评分标准上的分布而非确定性标量。现有的标量、评分标记和成对奖励模型过度压缩了不确定性和细粒度评分差异,而基于推理的生成式奖励提供了更强的判断力,但部署成本高且难以用作直接的优化信号。我们提出了 Z-Reward,一种教师-学生奖励建模框架,将高推理量的判断与高效的奖励部署解耦。教师是一个大型 VLM,使用推理来推断与评分标准对齐的分数分布,并通过组间直接分数优化(GDSO)进行训练,该优化结合了来自分布期望的策略梯度奖励以及对分数分布和分数差距的直接逐点和成对监督。学生通过推理内化分数蒸馏(RISD)进行训练,将教师基于推理的分数分布迁移到紧凑的 VLM 中,而在推理时无需显式的推理链。在我们内部标注的评估集上,27B 的 GDSO 教师达到了 89.6% 的人类偏好准确率,超过了 SFT、RewardDance 和 GRPO,而 9B 的 RISD 学生达到了 88.6%,超过了 OPD 基线,并接近更大的教师模型。我们进一步表明 Z-Reward 可以作为文本到图像优化的可微分奖励信号,比 SFT 基线带来了 41.3% 的净人类偏好提升。
查看原文
查看缓存全文

缓存时间: 2026/06/11 13:39

论文页面 - 超越标量奖励:将推理内化到分数分布中

来源:https://huggingface.co/papers/2606.09076

摘要

一种教师-学生框架将复杂推理与高效奖励部署解耦,用于文本到图像训练,实现了卓越的偏好准确性和优化性能。

奖励模型(https://huggingface.co/papers?q=Reward%20models)是文本到图像后训练的核心,但视觉偏好(https://huggingface.co/papers?q=visual%20preference)具有主观性,更适合表示为基于评分规则的分数分布,而非确定性标量。现有的标量、分数令牌和成对奖励模型(https://huggingface.co/papers?q=reward%20models)过度压缩了不确定性和细粒度分数差异,而基于推理的生成式奖励(https://huggingface.co/papers?q=reasoning-based%20generative%20rewards)虽然能提供更强的判断,但部署成本高且难以用作直接优化信号。我们提出 Z-Reward,一种教师-学生奖励建模框架,将推理密集型判断与高效奖励部署解耦。教师是一个大型 VLM(https://huggingface.co/papers?q=VLM),它利用推理来推断符合评分规则的分数分布(https://huggingface.co/papers?q=score%20distributions),并使用分组直接分数优化(https://huggingface.co/papers?q=Group-wise%20Direct%20Score%20Optimization)(GDSO)进行训练,该方法结合了来自分布期望的策略梯度奖励(https://huggingface.co/papers?q=policy-gradient%20rewards)以及对分数分布(https://huggingface.co/papers?q=score%20distributions)和分数差距的直接逐点和成对监督(https://huggingface.co/papers?q=pairwise%20supervision)。学生使用推理内化分数蒸馏(https://huggingface.co/papers?q=Reasoning-Internalized%20Score%20Distillation)(RISD)进行训练,将教师基于推理的分数分布转移到一个紧凑的 VLM(https://huggingface.co/papers?q=VLM)中,而无需在推理时使用显式推理链。在我们内部标注的评估集上,27B 的 GDSO 教师达到了 89.6% 的人类偏好准确率,优于 SFT、RewardDance 和 GRPO;而 9B 的 RISD 学生达到了 88.6%,优于 OPD 基线,并且与更大规模的教师相当。我们进一步展示了 Z-Reward 可以作为文本到图像优化(https://huggingface.co/papers?q=text-to-image%20optimization)的可微奖励信号,相比 SFT 基线实现了 41.3% 的净人类偏好提升。

查看 arXiv 页面(https://arxiv.org/abs/2606.09076)查看 PDF(https://arxiv.org/pdf/2606.09076)项目页面(https://github.com/Tongyi-MAI/Z-Image)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.09076)

在你的智能体中获取此论文:

hf papers read 2606\.09076

没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型关联此论文

在模型的 README.md 中引用 arxiv.org/abs/2606.09076 即可将其链接到此页面。

引用此论文的数据集0

没有数据集关联此论文

在数据集的 README.md 中引用 arxiv.org/abs/2606.09076 即可将其链接到此页面。

引用此论文的 Space0

没有 Space 关联此论文

在 Space 的 README.md 中引用 arxiv.org/abs/2606.09076 即可将其链接到此页面。

包含此论文的合集4

相似文章

先思考,再打分:解耦推理与打分的视频奖励建模

Hugging Face Daily Papers

本文介绍了 DeScore,这是一种通过解耦推理和打分过程来提高训练效率和泛化能力的视频奖励模型。它利用多模态大语言模型采用“先思考再打分”的范式,解决了现有判别式和生成式奖励模型的局限性。

端到端学习标量奖励模型的潜在推理轨迹

arXiv cs.CL

提出 LatentRM,一种奖励建模框架,将中间推理轨迹作为离散潜在变量学习,以显式最大化下游标量奖励似然,从而改进分布内和分布外任务上的偏好建模与策略对齐。

Self-Distillation Zero:自我修订将二元奖励转化为密集监督

Hugging Face Daily Papers

Self-Distillation Zero (SD-Zero) 是一种新颖的训练方法,通过双角色训练将稀疏的二元奖励转化为密集的token级监督,其中模型同时充当生成器和修订者,在数学和代码推理基准上实现了超过10%的性能提升,且样本效率高于强化学习方法。

Reasoning Arena: 当可验证奖励不足时的追踪锦标赛

Hugging Face Daily Papers

Reasoning Arena 通过使用追踪锦标赛和Bradley-Terry模型,从非多样化奖励组中生成有意义的梯度,从而改进了基于可验证奖励的强化学习,实现了更快的训练和更好的推理性能。