标签
该论文提出了一种位置选择性自蒸馏方法,用于利用自然语言反馈训练 LLM 评判模型。该方法通过逐位置的熵变化来屏蔽容易记忆的词元,在主观任务上将分布外泛化能力提升了 2–9 个点,优于 GRPO 等结果监督强化学习方法。