Tag
The paper proposes position-selective self-distillation for training LLM judges from natural language feedback, using per-position entropy shifts to mask memorization-prone tokens and improve out-of-distribution generalization over outcome-supervised RL methods like GRPO by 2–9 points on subjective tasks.