preference-averaging

标签

Cards List
#preference-averaging

偏好平均导致的RLHF程序公平性失败

arXiv cs.LG · 2026-08-12 缓存

本文指出,RLHF因平均化异质偏好而导致程序公平性失败:多数群体主导奖励学习,少数偏好代表性不足。文章提出了偏好感知RLHF(PA-RLHF),在受控实验中提升了对齐准确率并缩小了公平性差距。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈