preference-data

标签

Cards List
#preference-data

RUBRIC-ARROW:非可验证领域中LLM后训练的交替点状评分标准奖励建模

Hugging Face Daily Papers · 2026-05-27 缓存

RUBRIC-ARROW 提出了一种交替式奖励建模框架,通过减少平局并利用成对偏好数据改进了基于评分标准的方法,在非可验证领域为LLM后训练实现了具有竞争力的准确率和收益。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈