2026年潜在推理全景:映射BDH-CQ、HRM/TRM、Coconut [D]
摘要
本文探讨了潜在推理作为AI中思维链的替代方案,将方法分为五类,并讨论了对AGI和可解释性的影响。
在追踪了X/蓝标上关于潜在推理和持续学习的各种arXiv论文和研究者讨论后,一个强烈共鸣的观点是,通往AGI的道路可能不再依赖于生成越来越长的思维链,而是更多地寻找能够超越令牌流进行推理的架构。LLMs经常通过有缺陷或虚构的CoT步骤得出正确答案,并产生完全逻辑的步骤却导致错误答案(Kambhampati, 2025)。追踪并未反映计算过程,这表明言语化的CoT是推理的模仿,而非机制本身。最引人注目的替代机制是潜在推理:模型不是言语化每个中间结果,而是反复转换其连续隐状态,并仅解码答案。
我将潜在推理分解为至少五个不同的家族:
- 自回归LM中的连续思维:Coconut(Hao等,2024)将模型自身的最终隐状态反馈为下一个输入嵌入,而Soft Thinking(Zhang等,2025)在连续概念空间中推理。这里的理论认为,单个连续状态可以同时持有多个搜索前沿并并行扩展它们(Zhu等,2025)。
- 压缩的离散非语言令牌:Abstract-CoT(Ramji等,2026)用学到的词汇表中的短序列替换言语化理由。它是非语言的,但仍然是串行和外部解码的,属于离散端。
- 循环深度和循环模型:循环深度LM(Geiping等,2025)和循环Transformer(Saunshi等,2025;Zhu等,2026)将共享块重复应用于隐状态。主要被框定为参数效率和测试时计算缩放,而非新的推理接口。
- 任务训练的递归求解器:HRM(Wang等,2025)和TRM(Jolicoeur-Martineau, 2025)递归精化隐状态和候选答案状态。它们的ARC管道是归纳的:评估任务演示被增强为优化,使用学到的每个谜题身份,因此未见任务在回答前需要向后传播。
- 上下文内循环潜在求解器:这就是BDH-CQ(Engdahl等,2026)所在的地方,基于Dragon hatchling架构(Kosowski等,2025)。演示在推理时直接写入循环记忆,然后新测试输入通过单独的连续隐空间中的迭代计算解决。作者报告了超出先前发布的成本-精度帕累托前沿的点在公开ARC-AGI-1上,以及早期预训练实验显示类似Transformer的缩放定律高达600B参数,同时保留潜在推理行为。
两个区别似乎特别重要:系统如何获得新任务(通过上下文、记忆或基于梯度的优化或微调)以及其中间计算发生在哪里(通过语言令牌、抽象令牌或连续隐状态)。
如果我错过了任何家族或论文,请告知。更重要的是,如果潜在推理在效率上获胜,那么当前行业可解释性和评估工作所依赖的可读追踪会发生什么?CoT可读性是我们扩展LLMs的临时后果,还是值得为保留而支付效率代价的安全属性?
相似文章
思维链是一个扩展陷阱。下一波是潜在推理(Coconut / HRM / RecrusiveMAS)……但随后我们遇到了黑箱难题。BDH 适合哪里?[D]
本文认为,思维链推理是一种临时性技巧,未来在于像 Coconut、HRM 和 RecursiveMAS 这样的潜在推理方法。文章讨论了黑箱问题,并提出了基于 DAGs 和验证的外循环治理方案,同时将 BDH 定位为一种结合潜在计算与有状态记忆的模型。
BDH-CQ:结合循环潜在推理的上下文学习
本文介绍了BDH-CQ,一个150M参数规模的推理模型,它将上下文学习与循环潜在推理相结合,在ARC-AGI-1上以极低的推理成本实现了29.5%的pass@2,确立了新的成本-精度前沿。
将潜在思维链推理解释为动力系统
本文应用动力系统分析来解释CODI和COCONUT等模型中的潜在思维链推理,揭示了具有稳定和不稳定类别的结构化动态。
@burny_tech: 隐式推理综述 "大型语言模型(LLMs)展现了令人印象深刻的推理能力,尤其是……
本综述全面概述了LLM中的隐式推理,探讨了在连续隐藏状态中执行多步推理且无需显式token级监督的方法。
检索、整合与综合:空间-语义接地潜层视觉推理
本文介绍了 RIS,这是一个用于多模态大语言模型的空间-语义接地潜层视觉推理框架,旨在克服信息瓶颈。该框架提出将潜在令牌(tokens)锚定于空间和语义证据之上,在 V* 和 HRBench 等基准测试中展现出性能提升。