@rao2z: \"当LLM输出逐步计划时,它会产生一种强烈的错觉,让你以为正在观看机器推理...

X AI KOLs Following 论文

摘要

亚利桑那州立大学的Subbarao Kambhampati教授及研究人员在一篇立场论文中提出,LLM中的思维链推理制造了一种推理假象,业界需要超越昂贵的token生成,转向替代推理机制。

\"当LLM输出逐步计划时,它会产生一种强烈的错觉,让你以为正在观看机器一步步推理得出结论。亚利桑那州立大学的Subbarao Kambhampati教授及研究人员在一篇立场论文中系统性地拆解了这一假设。\" (来自 @bendee983 via @bdtechtalks )\n\nhttps://bdtechtalks.substack.com/p/escaping-the-chain-of-thought-trap…
查看原文
查看缓存全文

缓存时间: 2026/06/22 03:30

“When an LLM outputs a step-by-step plan, it creates a powerful illusion that you are watching a machine reason its way to a conclusion. A position paper by professor Subbarao Kambhampati and researchers at Arizona State University systematically dismantles this assumption.” (来自 @bendee983 via @bdtechtalks )

https://bdtechtalks.substack.com/p/escaping-the-chain-of-thought-trap…


走出思维链陷阱:LLM 推理的下一个方向

来源:https://bdtechtalks.substack.com/p/escaping-the-chain-of-thought-trap 近期行业事件表明,随着 AI token 支出失控,企业正面临巨大的投资回报困境。据报道,Uber 在数月内就耗尽了全年的 AI 预算(https://fortune.com/2026/05/26/uber-coo-ai-spending-tokens-claude-code/),被迫对其代理工作流程进行彻底重新评估。Meta 已对内部 AI 计算支出设置硬性上限(https://www.theinformation.com/articles/tokenminimizing-meta-moves-curb-employee-ai-usage-ai-costs-reach-billions),而 Amazon 则关闭了其鼓励工程师在 LLM token 上烧钱的内部 AI 排行榜(https://www.ft.com/content/b1a62a7f-6df5-4c90-94ce-64ce9c9961b6?syn-25a6b1a6=1)。即便是资本近乎无限的科技巨头都在为计算账单发愁并踩下刹车,更广泛的技术生态系统面临的挑战则更为严峻。

这些计算预算中有很大一部分被消耗在思维链(CoT)提示和训练上。CoT 是一种方法,它指导或微调大型语言模型(LLM)在给出最终答案之前进行“逐步思考”。总体而言,当 LLM 被迫生成一串冗长的中间“思考” token 时,它们在推理任务上的表现会更好。

CoT 最初成为无可争议的行业标准,是因为它是一个巧妙、实用的权宜之计。它利用了自回归 Transformer 现有的文本生成接口,无需对底层架构进行结构性更改。它随推理时计算的增加而可预测地扩展,并为人类操作者提供了一个易读的、基于文本的模型行为痕迹。

然而,AI 社区陷入了一种货物崇拜心态。我们将生成昂贵的中间文本 token 等同于实际的认知处理过程。生成文本并不等同于思考。文本瓶颈正在耗尽企业的 AI 预算,拖慢推理速度,并掩盖了机器计算的真实本质。为了可持续地扩展 AI,行业需要超越 CoT token,转向替代性推理机制。

要理解为何行业需要新的方向,我们必须审视模型生成这些推理步骤的机制。

当 LLM 输出一个逐步计划时,它会产生一种强烈的错觉,让你以为正在观看一台机器推理出结论。亚利桑那州立大学的 Subbarao Kambhampati 教授和研究人员的一篇立场论文(https://arxiv.org/abs/2504.09762)系统地拆解了这一假设。

研究人员发现,中间 token 常常充当一种结构性约束,是对人类输出格式的强制模仿,而非真正的算法泛化。从经验上看,模型经常使用完全错误、不连贯或捏造的 CoT 步骤得出正确答案。反之,它们也能生成完美、合乎逻辑的步骤,却输出完全错误的最终答案。这种脱钩证明模型的内部计算过程与其生成的文本并不一致。CoT 是对推理的模仿,而非其实际机制。

其他研究进一步证实了这种结构上的脆弱性。关于复杂规划任务(如 Blocksworld 环境)的详细研究(https://bdtechtalks.com/2024/05/13/chain-of-thought-planning/)表明,在狭窄分布之外,CoT 带来的提升只是一种脆弱的幻象。CoT 无法教会模型通用、可重复的程序。相反,它创建了高度依赖于提示的特定行为,随着推理链的增长,会导致严重的误差累积。由于每个生成的 token 都依赖于前一个 token 的正确性,文本链早期的单个逻辑偏差就会使整个执行路径崩溃。在某些分布外任务中,强制模型生成 CoT 反而会比直接回答降低其准确性。

除了推理的错觉,CoT 还造成了巨大的技术和财务瓶颈。由于 LLM 是自回归的,它们必须一次生成一个 token,为每个输出的单词在其整个词汇表上计算新的概率分布。

冗长的推理链会提高计算和内存成本,用大多是没用的 CoT 废话填满模型有限的上下文窗口,并降低生成后续 token 的速度。强制模型“出声思考”会限制推理速度并引入巨大的延迟。

此外,训练模型执行 CoT 会迫使它们在训练后期记忆冗长、人类可读的推理链,而不是提取逻辑的纯数学本质。这会使上下文窗口膨胀,需要大量的参数,并直接导致了企业目前面临的基建预算危机。

更广泛的 AI 研究社区已经在寻找替代方案,以摆脱 token 成本陷阱。新出现的共识指向允许模型完全在“潜在空间”内进行推理。

要理解潜在空间,想象一下 LLM 如何处理数据。单词并非神经网络的原生语言。在推理时,它们被转换成复杂的数值向量。在标准 Transformer 中,这些向量经过隐藏层,再被转换回特定的文本 token,然后重复这个过程。

相比之下,潜在推理器将整个计算过程保留在这些隐藏向量状态内。模型并非在每个中间步骤将向量翻译回人类语言,而是在内部循环处理问题,直接操作连续的向量表征。

Meta 对“连续思维链(https://arxiv.org/abs/2412.06769)”(Coconut 范式)的探索是这一大趋势的早期标志,证明了模型可以在隐藏层内完全执行广度优先搜索,之后再输出文本。

AI 初创公司 Sapient Intelligence 将其层次推理模型(https://bdtechtalks.com/2025/08/04/hierarchical-reasoning-model/)(HRM)及其后续版本 HRM-Text 投入生产。HRM 通过一种完全在潜在空间中运行的双时间尺度循环,将策略与执行解耦,从而摒弃了逐 token 推理。

该架构将处理过程一分为二:一个缓慢的抽象规划层设定问题参数,而一个快速的详细计算层则在连续表征空间内执行递归循环。由于在“思考”阶段完全避免了自回归文本解码瓶颈,它能够以标准 LLM 无法企及的速度处理复杂逻辑。

最初的 HRM 模型是为非语言推理任务和谜题设计的。HRM-Text(https://venturebeat.com/technology/researchers-say-they-trained-a-foundation-model-from-scratch-for-about-1-500)则将这一范式引入需要文本推理的更实用应用。它仅使用 10 亿参数的模型,就在 MATH 和 GSM8K 等艰难基准测试中取得了具有竞争力的推理得分。关键在于,由于过滤掉了冗长的 CoT 数据,该基础模型从零开始训练仅消耗约 40B 的 token,成本约为 1500 美元,而相比之下通常需要数百万美元和数万亿 token。

完全相同的概念在多智能体 AI 中显示出巨大的效率提升。UIUC 和 Stanford 的研究人员近期联合发表了一篇论文,介绍了 RecursiveMAS(https://venturebeat.com/orchestration/how-recursivemas-speeds-up-multi-agent-inference-by-2-4x-and-reduces-token-usage-by-75),这是一个旨在解决多智能体 token 爆炸问题的框架。传统上,多智能体系统由多个 LLM 相互传递文本提示以协作完成任务,这一过程累积了巨大的 token 成本和高延迟。

RecursiveMAS 通过引入一个名为“RecursiveLink”的专用模块改变了架构。智能体之间不再将内部状态翻译成文本字符串来进行通信,而是直接相互传递连续的潜在嵌入。这相当于算法层面的心灵感应。

RecursiveLink 也用于每个智能体的内部推理。智能体不再生成中间文本 token 来处理子任务,而是递归地循环自己的隐藏状态来推理问题,从而进一步降低 token 成本。智能体基于这些内部循环和从同伴那里接收到的潜在向量,递归地更新自己的内部状态。

RecursiveMAS 实验的结果展示了超越 token 接口的纯粹效率:该系统在复杂编排任务上准确率提升了 8.3%,推理速度提升了 2.4 倍,总 token 使用量减少了 75.6%。

然而,现实地看待这些潜在和递归方法,必须承认它们仍处于早期阶段。它们主要擅长高度结构化、确定性的推理任务,例如编程和数学。对于开放式自然语言生成、细微的创意写作或广泛的情境知识检索,纯潜在模型并非完整的解决方案。它们几乎肯定需要作为专门的执行引擎,与更广泛的语言系统混合运作。

尽管潜在推理优雅地解决了“token 最大化”带来的性能和成本危机,但对于生产级应用而言,它引入了一个致命缺陷:零可见性。

相似文章

大语言模型何时进行推理?基于熵相变的动力系统视角

arXiv cs.LG

本文探讨了思维链推理在何时对大语言模型有益,表明早期熵动力学能够可靠地指示推理效用,并介绍了EDRM,这是一个轻量级、无需训练的框架,可自适应选择推理策略,在保持或提升准确率的同时显著节省token。

并非所有LLM推理都可见于思维链

arXiv cs.CL

本文证明,前沿语言模型能够利用语义无关的填充令牌进行“不可见推理”,在合成推理任务上准确率提升高达13个百分点,这动摇了思维链监控能捕获所有推理的假设。

学习如何让大语言模型进行推理

OpenAI Blog

OpenAI 发布了一篇文章,通过密码破译示例探索大语言模型的推理技术,展示了语言模型的逐步问题求解和模式识别能力。