entropy-masking

Tag

Cards List
#entropy-masking

Training LLM Judges from Language Feedback via Position-Selective Self-Distillation

arXiv cs.CL ↗ · 4d ago Cached

The paper proposes position-selective self-distillation for training LLM judges from natural language feedback, using per-position entropy shifts to mask memorization-prone tokens and improve out-of-distribution generalization over outcome-supervised RL methods like GRPO by 2–9 points on subjective tasks.

0 favorites 0 likes
← Back to home

Submit Feedback