SLPO:通过代理策略扩展潜在推理

Hugging Face Daily Papers 论文

摘要

介绍了一种代理潜在策略优化(SLPO)方法,将结果奖励强化学习应用于自回归潜在推理器,实现测试时扩展和变长策略,从而在更难实例上提高准确率。

具有可验证奖励的强化学习已成为在显式思维链(CoT)推理器中引发测试时扩展的主要方法。然而,这种扩展路径在计算上仍然昂贵,因为每个中间步骤都必须解码为语言令牌。相反,潜在推理将中间计算作为连续向量进行,并以更短的步数匹配或超越显式CoT。尽管有这种潜力,潜在推理器仍然主要局限于模仿学习,而显式CoT已经通过结果奖励强化学习超越了模仿。潜在轨迹缺乏可处理的每步似然性以及在固定思考预算下的自适应停止接口,因此结果奖励无法引发潜在测试时扩展。我们引入了代理潜在策略优化(SLPO),将结果奖励强化学习应用于自回归潜在推理器:一个基于潜在转移的经验代理策略密度用于轨迹级信用分配,以及一个正确性监督的停止头,通过结果奖励优化将其精炼为变长策略。在连续和软思考设置中,SLPO提高了并行采样下的Pass@k,并将更长的潜在计算分配给更难实例,同时保持更高的确定性准确率。
查看原文
查看缓存全文

缓存时间: 2026/07/24 05:09

论文页面 - SLPO:通过替代策略扩展潜在推理

来源:https://huggingface.co/papers/2607.19691

摘要

基于可验证奖励的强化学习已成为激发显式思维链推理器测试时扩展的主要方法。然而,这种扩展路径计算成本高昂,因为每个中间步骤都需解码为语言token。潜在推理则将中间计算以连续向量形式进行,并在远更短的推理步长下已达到或超越显式CoT的表现。尽管潜力巨大,潜在推理器仍主要受限于模仿学习,而显式CoT已通过结果奖励RL超越了模仿阶段。由于潜在轨迹缺乏可逐步骤计算的似然度,且在固定思考预算下缺少自适应停止接口,因此结果奖励无法激发潜在的测试时扩展。我们提出代理潜在策略优化(SLPO),将结果奖励RL引入自回归潜在推理器:为潜在状态转移建立经验性代理策略密度以实现轨迹级信用分配,并引入一个由正确性监督的停止头,通过结果奖励优化将其转化为变时域策略。在连续和软思考两种设置下,SLPO提升了并行采样下的Pass@k指标,并将更长的潜在计算分配给更难的实例,同时保持更高的确定性准确率。

查看 arXiv 页面 (https://arxiv.org/abs/2607.19691)查看 PDF (https://arxiv.org/pdf/2607.19691)GitHub2 (https://github.com/ModalityDance/SLPO)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.19691)

社区

通过在文本输入框、粘贴或点击此处来上传图像、音频和视频。

点击或粘贴此处以上传图像

在你的 agent 中获取该论文:

hf papers read 2607.19691

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型2

ModalityDance/slpo-coconut-gpt2 文本生成• 0.1B• 约23小时前更新 • 49 (https://huggingface.co/ModalityDance/slpo-coconut-gpt2)

ModalityDance/slpo-codi-gpt2 文本生成• 0.1B• 约23小时前更新 • 51 (https://huggingface.co/ModalityDance/slpo-codi-gpt2)

引用此论文的数据集0

暂无数据集关联该论文

请在数据集 README.md 中引用 arxiv.org/abs/2607.19691,以便在此页面建立链接。

引用此论文的 Spaces0

暂无 Space 关联该论文

请在 Space README.md 中引用 arxiv.org/abs/2607.19691,以便在此页面建立链接。

包含此论文的收藏集2

相似文章

SocraticPO:通过交互式指导的策略优化

arXiv cs.LG

SocraticPO通过苏格拉底式自然语言指导和奖励衰减增强强化学习(RL)的展开过程,以提升大语言模型(LLM)的科学推理能力,在SciKnowEval基准测试中超越强基线。

面向多模态推理的结构化角色感知策略优化

arXiv cs.AI

本文介绍了结构化角色感知策略优化(SRPO),该方法通过在大视觉-语言模型的强化学习框架内,根据感知和推理的不同角色分配令牌级信用,从而提升多模态推理能力。