variational-policy-distillation

Tag

Cards List
#variational-policy-distillation

Learning from Language Feedback via Variational Policy Distillation

Hugging Face Daily Papers · 2026-05-18 Cached

Variational Policy Distillation (VPD) formalizes learning from language feedback as a variational EM problem, co-training teacher and student networks to improve policy learning in reinforcement learning from verifiable rewards. It shows consistent improvements over baselines on code generation and scientific reasoning tasks.

0 favorites 0 likes
← Back to home

Submit Feedback