language-feedback

Tag

Cards List
#language-feedback

STRIDE: Learnable Stepwise Language Feedback for LLM Reasoning

arXiv cs.LG · 2026-05-20

STRIDE introduces a training framework that uses learnable stepwise language feedback instead of scalar rewards to improve LLM reasoning, achieving state-of-the-art results on diverse benchmarks.

0 favorites 0 likes
#language-feedback

Learning from Language Feedback via Variational Policy Distillation

Hugging Face Daily Papers · 2026-05-18 Cached

Variational Policy Distillation (VPD) formalizes learning from language feedback as a variational EM problem, co-training teacher and student networks to improve policy learning in reinforcement learning from verifiable rewards. It shows consistent improvements over baselines on code generation and scientific reasoning tasks.

0 favorites 0 likes
← Back to home

Submit Feedback