preference-based-rl

标签

Cards List
#preference-based-rl

S2T-RLHF:面向稳定偏好型RLHF的分层信用分配

arXiv cs.AI · 2天前 缓存

S2T-RLHF提出了一种句子到令牌的奖励分解框架,通过在句子粒度上分配序列级奖励,提高了偏好型RLHF的训练稳定性和鲁棒性,避免了过度细粒度的令牌级精化带来的不稳定性。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈