entropy-masking

标签

Cards List
#entropy-masking

基于位置选择性自蒸馏,从语言反馈中训练 LLM 评判模型

arXiv cs.CL ↗ · 4天前 缓存

该论文提出了一种位置选择性自蒸馏方法,用于利用自然语言反馈训练 LLM 评判模型。该方法通过逐位置的熵变化来屏蔽容易记忆的词元,在主观任务上将分布外泛化能力提升了 2–9 个点,优于 GRPO 等结果监督强化学习方法。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈