揭秘隐藏状态递归:基于在策略强化学习的可切换隐式推理
摘要
SWITCH 是一种可切换隐式推理框架,它使用显式边界标记,通过基于在策略的强化学习实现可训练且可解释的递归隐状态推理,优于先前的方法。
查看缓存全文
缓存时间: 2026/06/12 06:51
论文页面 - 揭秘隐状态循环:基于在线策略强化学习的可切换潜在推理
来源:https://huggingface.co/papers/2606.13106 发布于6月11日 · 由https://huggingface.co/EasonFan fan (https://huggingface.co/EasonFan)于6月12日提交
摘要
一个可切换的潜在推理框架使用显式边界令牌,通过循环隐状态实现可训练且可解释的潜在推理。潜在思维链(https://huggingface.co/papers?q=Latent%20chain-of-thought)通过用连续的隐状态循环(https://huggingface.co/papers?q=hidden-state%20recurrence)替代可见推理轨迹来压缩推理,但现有公式难以通过标准的在线策略强化学习(https://huggingface.co/papers?q=on-policy%20reinforcement%20learning)(RL)进行优化,并且难以进行因果解释。我们的关键洞察是,一对显式边界令牌可以同时解决这两个问题:离散的进入和退出锚点使得潜在块与标准的在线策略RL兼容,并且相同的锚点为机制分析(https://huggingface.co/papers?q=mechanistic%20analysis)提供了自然的立足点。受此启发,我们提出了SWITCH,一个可切换的潜在推理(https://huggingface.co/papers?q=switchable%20latent%20reasoning)框架。模型发出
查看arXiv页面(https://arxiv.org/abs/2606.13106) 查看PDF(https://arxiv.org/pdf/2606.13106) 添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.13106)
在你的agent中获取论文:hf papers read 2606.13106
没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用该论文的模型
0 篇没有引用该论文的模型 在模型README.md中引用arxiv.org/abs/2606.13106以链接到此页面。
引用该论文的数据集
0 篇没有引用该论文的数据集 在数据集README.md中引用arxiv.org/abs/2606.13106以链接到此页面。
引用该论文的Space
0 个没有引用该论文的Space 在Space README.md中引用arxiv.org/abs/2606.13106以链接到此页面。
包含该论文的收藏集
0 篇没有包含该论文的收藏集 添加该论文到收藏集(https://huggingface.co/new-collection)以链接到此页面。
相似文章
推理微调诱导持续潜在策略状态
本文将链式思维推理建模为切换动态系统,表明推理微调全局性地重新组织潜在策略状态,从而改善了多步推理。提出的框架结合了时间感知对比学习与离散状态发现,实验表明,微调后的模型展现出更丰富的潜在策略组织,并具有功能特化。
神经伴随状态策略:在循环强化学习中构建隐藏状态
本文提出了神经伴随状态策略,建立了循环强化学习隐藏状态与庞特里亚金极小值原理之间的正式联系,以增强可解释性和鲁棒性。
@machinestein: ICML 2026:TRMs中的潜在推理实际上是策略改进算子 为什么递归推理,尤其是…
论文揭示了基于transformer的推理模型(TRMs)中的潜在推理实际上充当了策略改进算子,并提出了一种算法,将学习和推理效率提升高达18倍。
学习细化隐藏状态以实现可靠的LLM推理
提出了ReLAR,一种强化引导的潜在细化框架,在解码前迭代更新LLM中的隐藏表示,与思维链方法相比,提高了推理可靠性和效率。
SLPO:通过代理策略扩展潜在推理
介绍了一种代理潜在策略优化(SLPO)方法,将结果奖励强化学习应用于自回归潜在推理器,实现测试时扩展和变长策略,从而在更难实例上提高准确率。