SLPO:通过代理策略扩展潜在推理
摘要
介绍了一种代理潜在策略优化(SLPO)方法,将结果奖励强化学习应用于自回归潜在推理器,实现测试时扩展和变长策略,从而在更难实例上提高准确率。
查看缓存全文
缓存时间: 2026/07/24 05:09
论文页面 - SLPO:通过替代策略扩展潜在推理
来源:https://huggingface.co/papers/2607.19691
摘要
基于可验证奖励的强化学习已成为激发显式思维链推理器测试时扩展的主要方法。然而,这种扩展路径计算成本高昂,因为每个中间步骤都需解码为语言token。潜在推理则将中间计算以连续向量形式进行,并在远更短的推理步长下已达到或超越显式CoT的表现。尽管潜力巨大,潜在推理器仍主要受限于模仿学习,而显式CoT已通过结果奖励RL超越了模仿阶段。由于潜在轨迹缺乏可逐步骤计算的似然度,且在固定思考预算下缺少自适应停止接口,因此结果奖励无法激发潜在的测试时扩展。我们提出代理潜在策略优化(SLPO),将结果奖励RL引入自回归潜在推理器:为潜在状态转移建立经验性代理策略密度以实现轨迹级信用分配,并引入一个由正确性监督的停止头,通过结果奖励优化将其转化为变时域策略。在连续和软思考两种设置下,SLPO提升了并行采样下的Pass@k指标,并将更长的潜在计算分配给更难的实例,同时保持更高的确定性准确率。
查看 arXiv 页面 (https://arxiv.org/abs/2607.19691)查看 PDF (https://arxiv.org/pdf/2607.19691)GitHub2 (https://github.com/ModalityDance/SLPO)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.19691)
社区
通过在文本输入框、粘贴或点击此处来上传图像、音频和视频。
点击或粘贴此处以上传图像
在你的 agent 中获取该论文:
hf papers read 2607.19691
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型2
ModalityDance/slpo-coconut-gpt2 文本生成• 0.1B• 约23小时前更新 • 49 (https://huggingface.co/ModalityDance/slpo-coconut-gpt2)
ModalityDance/slpo-codi-gpt2 文本生成• 0.1B• 约23小时前更新 • 51 (https://huggingface.co/ModalityDance/slpo-codi-gpt2)
引用此论文的数据集0
暂无数据集关联该论文
请在数据集 README.md 中引用 arxiv.org/abs/2607.19691,以便在此页面建立链接。
引用此论文的 Spaces0
暂无 Space 关联该论文
请在 Space README.md 中引用 arxiv.org/abs/2607.19691,以便在此页面建立链接。
包含此论文的收藏集2
相似文章
LambdaPO: 面向推理语言模型的Lambda风格策略优化
引入LambdaPO,一种新颖的强化学习框架,它通过将优势估计分解为成对偏好比较并添加语义密度奖励来改进GRPO,从而在数学推理任务上取得了更好的性能。
超越轨迹模仿:面向大模型推理的Strategy-Guided Policy Optimization
介绍了针对大模型推理的Strategy-Guided Policy Optimization(SGPO),该方法用策略蒸馏替代轨迹模仿,提升了数学基准测试上的泛化能力。
SocraticPO:通过交互式指导的策略优化
SocraticPO通过苏格拉底式自然语言指导和奖励衰减增强强化学习(RL)的展开过程,以提升大语言模型(LLM)的科学推理能力,在SciKnowEval基准测试中超越强基线。
PPO-HSC:一种基于广域策略覆盖优化的探索性强化学习框架
PPO-HSC引入了一种高阶采样覆盖奖励,以鼓励在LLM的强化学习微调中探索多样化的推理模式,从而在数学和代码任务上提升解决方案的多样性和状态空间覆盖。
面向多模态推理的结构化角色感知策略优化
本文介绍了结构化角色感知策略优化(SRPO),该方法通过在大视觉-语言模型的强化学习框架内,根据感知和推理的不同角色分配令牌级信用,从而提升多模态推理能力。