SLPO: Scaling Latent Reasoning via a Surrogate Policy
Summary
Introduces Surrogate Latent Policy Optimization (SLPO) to apply outcome-reward RL to autoregressive latent reasoners, enabling test-time scaling and variable-horizon policies that improve accuracy on harder instances.
View Cached Full Text
Cached at: 07/24/26, 05:09 AM
Paper page - SLPO: Scaling Latent Reasoning via a Surrogate Policy
Source: https://huggingface.co/papers/2607.19691
Abstract
Reinforcementlearningwithverifiablerewardshasbecomethepredominantrecipeforelicitingtest-timescalinginexplicitChain-of-Thoughtreasoners.Yetthisscalingpathremainscomputationallycostly,sinceeveryintermediatestepmustbedecodedasalanguagetoken.LatentreasoninginsteadcarriesintermediatecomputationascontinuousvectorsandalreadymatchesorsurpassesexplicitCoTatfarshorterhorizons.Despitethispromise,latentreasonersremainlargelyimitation-bound,whileexplicitCoThasalreadymovedpastimitationviaoutcome-rewardRL.Latenttrajectorieslackatractableper-steplikelihoodandanadaptivestoppinginterfaceunderfixedthinkingbudgets,sooutcomerewardscannotelicitlatenttest-timescaling.WeintroduceSurrogateLatentPolicyOptimization(SLPO)tobringoutcome-rewardRLtoautoregressivelatentreasoners:anempiricalsurrogatepolicydensityoverlatenttransitionsfortrajectory-levelcreditassignment,andacorrectness-supervisedstoppingheadthatoutcome-rewardoptimizationrefinesintoavariable-horizonpolicy.Acrosscontinuousandsoftthinkingsettings,SLPOimprovesPass@kunderparallelsamplingandallocateslongerlatentcomputationtoharderinstanceswithhigherdeterministicaccuracy.
View arXiv pageView PDFGitHub2Add to collection
Community
Upload images, audio, and videos by dragging in the text input, pasting, orclicking here.
Tap or paste here to upload images
Get this paper in your agent:
hf papers read 2607\.19691
Don’t have the latest CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
Models citing this paper2
#### ModalityDance/slpo-coconut-gpt2 Text Generation• 0.1B• Updatedabout 23 hours ago • 49
#### ModalityDance/slpo-codi-gpt2 Text Generation• 0.1B• Updatedabout 23 hours ago • 51
Datasets citing this paper0
No dataset linking this paper
Cite arxiv.org/abs/2607.19691 in a dataset README.md to link it from this page.
Spaces citing this paper0
No Space linking this paper
Cite arxiv.org/abs/2607.19691 in a Space README.md to link it from this page.
Collections including this paper2
Similar Articles
LambdaPO: A Lambda Style Policy Optimization for Reasoning Language Models
Introduces LambdaPO, a novel reinforcement learning framework that improves upon GRPO by decomposing advantage estimation into pairwise preference comparisons and adding a semantic density reward, achieving better performance on math reasoning tasks.
Beyond Trajectory Imitation: Strategy-Guided Policy Optimization for LLM Reasoning
Introduces Strategy-Guided Policy Optimization (SGPO) for LLM reasoning, which replaces trajectory imitation with strategy distillation, improving generalization on math benchmarks.
SocraticPO: Policy Optimization via Interactive Guidance
SocraticPO augments RL rollouts with Socratic-style natural language guidance and reward decay to improve scientific reasoning in LLMs, outperforming strong baselines on SciKnowEval benchmarks.
PPO-HSC: An Exploratory Reinforcement Learning Framework Based on Wide-Area Policy Coverage Optimization
PPO-HSC introduces a High-order Sampling Coverage reward to encourage exploration of diverse reasoning patterns in RL fine-tuning of LLMs, improving solution diversity and state-space coverage on math and code tasks.
Structured Role-Aware Policy Optimization for Multimodal Reasoning
This paper introduces Structured Role-Aware Policy Optimization (SRPO), a method that improves multimodal reasoning in Large Vision-Language Models by assigning token-level credit based on distinct perception and reasoning roles within reinforcement learning frameworks.