score-distributions

标签

Cards List
#score-distributions

超越标量奖励:将推理内化到分数分布中

Hugging Face Daily Papers ↗ · 2026-06-08 缓存

Z-Reward 是一个教师-学生框架,它将复杂推理与高效的奖励部署解耦,用于文本到图像的训练。该框架使用 27B 教师模型达到了 89.6% 的人类偏好准确率,使用 9B 学生模型达到了 88.6%,超过了先前的方法。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈