超越标量奖励:将推理内化到分数分布中
摘要
Z-Reward 是一个教师-学生框架,它将复杂推理与高效的奖励部署解耦,用于文本到图像的训练。该框架使用 27B 教师模型达到了 89.6% 的人类偏好准确率,使用 9B 学生模型达到了 88.6%,超过了先前的方法。
查看缓存全文
缓存时间: 2026/06/11 13:39
论文页面 - 超越标量奖励:将推理内化到分数分布中
来源:https://huggingface.co/papers/2606.09076
摘要
一种教师-学生框架将复杂推理与高效奖励部署解耦,用于文本到图像训练,实现了卓越的偏好准确性和优化性能。
奖励模型(https://huggingface.co/papers?q=Reward%20models)是文本到图像后训练的核心,但视觉偏好(https://huggingface.co/papers?q=visual%20preference)具有主观性,更适合表示为基于评分规则的分数分布,而非确定性标量。现有的标量、分数令牌和成对奖励模型(https://huggingface.co/papers?q=reward%20models)过度压缩了不确定性和细粒度分数差异,而基于推理的生成式奖励(https://huggingface.co/papers?q=reasoning-based%20generative%20rewards)虽然能提供更强的判断,但部署成本高且难以用作直接优化信号。我们提出 Z-Reward,一种教师-学生奖励建模框架,将推理密集型判断与高效奖励部署解耦。教师是一个大型 VLM(https://huggingface.co/papers?q=VLM),它利用推理来推断符合评分规则的分数分布(https://huggingface.co/papers?q=score%20distributions),并使用分组直接分数优化(https://huggingface.co/papers?q=Group-wise%20Direct%20Score%20Optimization)(GDSO)进行训练,该方法结合了来自分布期望的策略梯度奖励(https://huggingface.co/papers?q=policy-gradient%20rewards)以及对分数分布(https://huggingface.co/papers?q=score%20distributions)和分数差距的直接逐点和成对监督(https://huggingface.co/papers?q=pairwise%20supervision)。学生使用推理内化分数蒸馏(https://huggingface.co/papers?q=Reasoning-Internalized%20Score%20Distillation)(RISD)进行训练,将教师基于推理的分数分布转移到一个紧凑的 VLM(https://huggingface.co/papers?q=VLM)中,而无需在推理时使用显式推理链。在我们内部标注的评估集上,27B 的 GDSO 教师达到了 89.6% 的人类偏好准确率,优于 SFT、RewardDance 和 GRPO;而 9B 的 RISD 学生达到了 88.6%,优于 OPD 基线,并且与更大规模的教师相当。我们进一步展示了 Z-Reward 可以作为文本到图像优化(https://huggingface.co/papers?q=text-to-image%20optimization)的可微奖励信号,相比 SFT 基线实现了 41.3% 的净人类偏好提升。
查看 arXiv 页面(https://arxiv.org/abs/2606.09076)查看 PDF(https://arxiv.org/pdf/2606.09076)项目页面(https://github.com/Tongyi-MAI/Z-Image)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.09076)
在你的智能体中获取此论文:
hf papers read 2606\.09076
没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型关联此论文
在模型的 README.md 中引用 arxiv.org/abs/2606.09076 即可将其链接到此页面。
引用此论文的数据集0
没有数据集关联此论文
在数据集的 README.md 中引用 arxiv.org/abs/2606.09076 即可将其链接到此页面。
引用此论文的 Space0
没有 Space 关联此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2606.09076 即可将其链接到此页面。
包含此论文的合集4
相似文章
先思考,再打分:解耦推理与打分的视频奖励建模
本文介绍了 DeScore,这是一种通过解耦推理和打分过程来提高训练效率和泛化能力的视频奖励模型。它利用多模态大语言模型采用“先思考再打分”的范式,解决了现有判别式和生成式奖励模型的局限性。
优中选优:超越答案正确性奖励,激励可靠的多模态推理
研究者提出 Groupwise Ranking Reward,解决多模态强化学习中的“推理-答案不一致”问题,将可靠性条件下的准确率从 47.4% 提升至 54.7%,超越标准 RLVR。
端到端学习标量奖励模型的潜在推理轨迹
提出 LatentRM,一种奖励建模框架,将中间推理轨迹作为离散潜在变量学习,以显式最大化下游标量奖励似然,从而改进分布内和分布外任务上的偏好建模与策略对齐。
Self-Distillation Zero:自我修订将二元奖励转化为密集监督
Self-Distillation Zero (SD-Zero) 是一种新颖的训练方法,通过双角色训练将稀疏的二元奖励转化为密集的token级监督,其中模型同时充当生成器和修订者,在数学和代码推理基准上实现了超过10%的性能提升,且样本效率高于强化学习方法。
Reasoning Arena: 当可验证奖励不足时的追踪锦标赛
Reasoning Arena 通过使用追踪锦标赛和Bradley-Terry模型,从非多样化奖励组中生成有意义的梯度,从而改进了基于可验证奖励的强化学习,实现了更快的训练和更好的推理性能。