surrogate-policy

Tag

Cards List
#surrogate-policy

SLPO: Scaling Latent Reasoning via a Surrogate Policy

Hugging Face Daily Papers · 3d ago Cached

Introduces Surrogate Latent Policy Optimization (SLPO) to apply outcome-reward RL to autoregressive latent reasoners, enabling test-time scaling and variable-horizon policies that improve accuracy on harder instances.

0 favorites 0 likes
← Back to home

Submit Feedback