preference-instability

标签

Cards List
#preference-instability

奖励模型中的偏好不稳定性:通过稀疏自编码器进行检测与缓解

arXiv cs.LG · 2026-05-19 缓存

本文研究了大型语言模型奖励模型中的偏好不稳定性,即微小的输入变化会导致矛盾的偏好分配。作者提出了两种基于SAE的缓解策略——SAE特征引导和SAE残差校正——在不重新训练的情况下减少错误的偏好分配。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈