preference-data

#preference-data

RUBRIC-ARROW：非可验证领域中LLM后训练的交替点状评分标准奖励建模

Hugging Face Daily Papers ↗ · 2026-05-27 缓存

RUBRIC-ARROW 提出了一种交替式奖励建模框架，通过减少平局并利用成对偏好数据改进了基于评分标准的方法，在非可验证领域为LLM后训练实现了具有竞争力的准确率和收益。

0 人收藏 0 人点赞