2026年潜在推理全景:映射BDH-CQ、HRM/TRM、Coconut [D]

Reddit r/MachineLearning 新闻

摘要

本文探讨了潜在推理作为AI中思维链的替代方案,将方法分为五类,并讨论了对AGI和可解释性的影响。

在追踪了X/蓝标上关于潜在推理和持续学习的各种arXiv论文和研究者讨论后,一个强烈共鸣的观点是,通往AGI的道路可能不再依赖于生成越来越长的思维链,而是更多地寻找能够超越令牌流进行推理的架构。LLMs经常通过有缺陷或虚构的CoT步骤得出正确答案,并产生完全逻辑的步骤却导致错误答案(Kambhampati, 2025)。追踪并未反映计算过程,这表明言语化的CoT是推理的模仿,而非机制本身。最引人注目的替代机制是潜在推理:模型不是言语化每个中间结果,而是反复转换其连续隐状态,并仅解码答案。 我将潜在推理分解为至少五个不同的家族: - 自回归LM中的连续思维:Coconut(Hao等,2024)将模型自身的最终隐状态反馈为下一个输入嵌入,而Soft Thinking(Zhang等,2025)在连续概念空间中推理。这里的理论认为,单个连续状态可以同时持有多个搜索前沿并并行扩展它们(Zhu等,2025)。 - 压缩的离散非语言令牌:Abstract-CoT(Ramji等,2026)用学到的词汇表中的短序列替换言语化理由。它是非语言的,但仍然是串行和外部解码的,属于离散端。 - 循环深度和循环模型:循环深度LM(Geiping等,2025)和循环Transformer(Saunshi等,2025;Zhu等,2026)将共享块重复应用于隐状态。主要被框定为参数效率和测试时计算缩放,而非新的推理接口。 - 任务训练的递归求解器:HRM(Wang等,2025)和TRM(Jolicoeur-Martineau, 2025)递归精化隐状态和候选答案状态。它们的ARC管道是归纳的:评估任务演示被增强为优化,使用学到的每个谜题身份,因此未见任务在回答前需要向后传播。 - 上下文内循环潜在求解器:这就是BDH-CQ(Engdahl等,2026)所在的地方,基于Dragon hatchling架构(Kosowski等,2025)。演示在推理时直接写入循环记忆,然后新测试输入通过单独的连续隐空间中的迭代计算解决。作者报告了超出先前发布的成本-精度帕累托前沿的点在公开ARC-AGI-1上,以及早期预训练实验显示类似Transformer的缩放定律高达600B参数,同时保留潜在推理行为。 两个区别似乎特别重要:系统如何获得新任务(通过上下文、记忆或基于梯度的优化或微调)以及其中间计算发生在哪里(通过语言令牌、抽象令牌或连续隐状态)。 如果我错过了任何家族或论文,请告知。更重要的是,如果潜在推理在效率上获胜,那么当前行业可解释性和评估工作所依赖的可读追踪会发生什么?CoT可读性是我们扩展LLMs的临时后果,还是值得为保留而支付效率代价的安全属性?
查看原文

相似文章

BDH-CQ:结合循环潜在推理的上下文学习

Hugging Face Daily Papers

本文介绍了BDH-CQ,一个150M参数规模的推理模型,它将上下文学习与循环潜在推理相结合,在ARC-AGI-1上以极低的推理成本实现了29.5%的pass@2,确立了新的成本-精度前沿。

检索、整合与综合:空间-语义接地潜层视觉推理

arXiv cs.CL

本文介绍了 RIS,这是一个用于多模态大语言模型的空间-语义接地潜层视觉推理框架,旨在克服信息瓶颈。该框架提出将潜在令牌(tokens)锚定于空间和语义证据之上,在 V* 和 HRBench 等基准测试中展现出性能提升。