rubric-based

标签

Cards List
#rubric-based

RUBRIC-ARROW:非可验证领域中LLM后训练的交替点状评分标准奖励建模

Hugging Face Daily Papers · 2026-05-27 缓存

RUBRIC-ARROW 提出了一种交替式奖励建模框架,通过减少平局并利用成对偏好数据改进了基于评分标准的方法,在非可验证领域为LLM后训练实现了具有竞争力的准确率和收益。

0 人收藏 0 人点赞
#rubric-based

基于评分细则的在策略蒸馏

Hugging Face Daily Papers · 2026-05-08 缓存

本文提出了 ROPD,一种基于评分细则的在策略蒸馏框架,相比传统的基于 logits 的方法,该框架在样本效率上表现更优。它通过使用结构化的语义评分细则而非教师 logits,实现了黑盒场景下的模型对齐。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈