AI推理是否因错误的原因而正确?

Hacker News Top 新闻

摘要

《Quanta Magazine》的一篇文章探讨了AI推理研究的混乱现状,权衡了关于大型推理模型能力的相互矛盾的证据,以及它们的行为对真正推理意味着什么。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/07/31 17:00

# AI 推理是否只是“歪打正着”? | Quanta Magazine 来源:https://www.quantamagazine.org/is-ai-reasoning-right-for-the-wrong-reasons-20260731/ Qualia:好奇心所至的随笔 我直说了吧:AI 的“推理”到底是怎么回事? 抱歉用了引号。这种标点符号式的侧目在 2024 年还比较常见,当时那些经过特殊训练的大型语言模型(LLM)的表亲——如今被称为“大型推理模型”(LRM)——才刚刚问世。不过,如今再这么做似乎有点无礼了,因为 OpenAI 的一个“通用推理模型”在 2026 年 5 月一次性解决了一个著名的开放数学研究问题。尽管如此,我仍不确定该如何用其他方式来表达我在科学解读这些 AI 系统实际在做什么时的认知眩晕。 推理有许多技术上的定义形式(https://www.comm.pitt.edu/reasoning),但基本过程很容易辨认:通过将逻辑上相互衔接的中间步骤串联起来,得出一个可靠的结论。我们用思想来完成这一过程;LRM 则使用所谓的“思维链”(chain of thought),这是一个专业术语,指模型在回答复杂查询之前生成的一连串合成文本。前一分钟,关于 AI 能通过这些链条进行推理的想法还遭到了一群来自苹果公司的研究人员的著名且可信的批评,称之为“思维的幻象(https://machinelearning.apple.com/research/illusion-of-thinking)”,并声称在出奇简单的条件下会“完全崩溃”。下一分钟,LRM 就在国际数学奥林匹克竞赛中摘得金牌,这一壮举极具挑战性,以至于“即使是非常成功的数学家和科学家,也可能一辈子都将其(https://garymarcus.substack.com/p/deepmind-and-openai-achieve-imo-gold)写在简历上”,科学家兼 AI 批评者 Gary Marcus 和 Ernest Davis 在 2025 年这样写道。如果这都不算“真正的”推理,那什么才算? 但等等——不久之后,圣塔菲研究所的更多研究表明,LRM 甚至可以用仅仅是“表面层面的‘捷径’(https://arxiv.org/abs/2510.02125)”来碾压那些精心设计的推理基准测试(比如一个(https://arcprize.org/arc-agi/1)由类比式视觉谜题组成的集合)。它们的行为看起来更像是投机取巧,而不是可泛化的推理。然后,仿佛如期而至,又来了一个“看我的”时刻:Google DeepMind 和数学家陶哲轩(数学界的史上最佳!(https://www.quantamagazine.org/how-terry-tao-became-an-evangelist-for-ai-in-math-20260608/))使用 AI 重新发现或改进了 67 个问题的解法(https://arxiv.org/abs/2511.02864),这些解法“横跨数学分析、组合学、几何和数论”。你们这些黑子,接受现实吧! 那还有什么额外的证据表明 LRM 无法可靠地推理(https://arxiv.org/abs/2506.05205v2#S3),即使它们拥有必要的算法和计算预算,并且有着一长串已经有科学文献记载的故障状态,长到足够当一条水滑梯玩了?随便吧——我想这就是所谓的“锯齿形智能”吧(AI 行话,意思是“能用的时候就是能用”)。 于是,从 2025 年末到 2026 年,局面就这样反复拉锯。我做科学记者已有 20 年,其中一半时间在报道 AI,所以我知道不应该指望快速发展的研究会保持整洁的一致性。但即使对我来说,这种翻来覆去也有点过头了。借用阿尔·帕西诺在《惊爆内幕》中的台词:“我现在有两种感觉:愤怒,和好奇。”我不认为这里有欺诈行为。我只是想知道到底哪边才是对的。AI 的推理能否在某种意义上是扯淡,同时又并非扯淡?如果是这样,那这到底是怎么*运作*的? 我立刻知道该给谁打电话。 Melanie Mitchell 的 AI 职业生涯(https://www.quantamagazine.org/melanie-mitchell-trains-ai-to-think-with-analogies-20210714/)可以追溯到 1980 年代,但近来她以一位*时尚*的 AI 实话实说者而闻名,她为《科学》杂志(https://www.science.org/action/doSearch?AllField=melanie+mitchell)撰写清晰的解释性文章,运营着广受欢迎的通讯(https://aiguide.substack.com/),并在圣塔菲研究所开展研究。(那篇关于“表面层面‘捷径’”的研究就是她的。)当我问她,关于 AI 推理我们究竟知道些什么时,她的回答简短到足以写在一张索引卡上。 “第一:它有效。它改善了结果,”她说,指的是 LRM 在推理任务上的准确率优于 LLM。“第二:实际生成的文本”——也就是每个 LRM 都被训练用来生成以提高自身性能的思维链——“不一定忠实于(模型内部)正在发生的事情。第三:这些文本中有很多甚至没有用处。你实际上可以把它们去掉。” 让我们来展开第二点和第三点,因为“扯淡又并非扯淡”的叠加态正是在这里。思维链在 2022 年(https://arxiv.org/abs/2201.11903)是半发现、半发明的,作为 LLM 的一种提示技巧:给它们提供写出来的推理示例(或者,著名的做法是,只需让它们“一步步思考(https://arxiv.org/abs/2205.11916)”),它们就会突然对简单的逻辑和数学问题给出不那么愚笨的答案。从 2024 年 OpenAI 的 o1 模型开始,LRM 被训练来自动化这一技巧,方法是生成这样的提示——也被称为推理痕迹或思考令牌——然后将其反馈给自身。因为 LRM 本质上只是语言模型,这些额外的文本片段就创造出了看起来很像模型“思维过程”的文字记录。 但事情并没有那么简单。越来越多的学术界和工业界研究对这些“中间令牌”是否忠实反映了 LRM 的内部运作提出了质疑。它们并非可审计的收据或准确的报告,而更像是亚利桑那州立大学研究员 Subbarao Kambhampati(https://rakaposhi.eas.asu.edu/)所说的“喃喃自语”——确实是语言片段,但其含义可能与实际发生的任何推理完全无关。Kambhampati 的实验室在 2025 年(https://neurips.cc/virtual/2025/loc/san-diego/137141)表明,在正式推理任务中,将一个模型正确的“痕迹”完全替换为错误或不相关的痕迹,并不会降低其性能。与此同时,*只*用正确的痕迹数据训练模型,仍会导致它偶尔生成无效的推理记录——即使它给出了原问题的正确答案。纽约大学研究人员 2024 年的一篇论文表明,“无意义的填充令牌(https://arxiv.org/abs/2404.15758)”——说白了就是一连串的点——可以有效替代人类可读的“思维链”。 William Merrill(https://lambdaviking.com/),该论文的作者之一,目前在芝加哥丰田技术研究院任教授,直截了当地说:“没有任何保证说思维链必须在任何意义上是有意义的。” Pavel Izmailov(https://izmailovpavel.github.io/),纽约大学研究员,也在 Anthropic 工作(并且是其原始推理模型团队的成员),他表示怀疑强化学习——LRM 的一种典型训练方法——是否从一开始就激励模型生成忠实的思维链。“我的意思是,也许它会,”他告诉我,“但我认为几率不是很高。” 好吧,推理痕迹的语言内容可能可疑。但那些令牌本身肯定在产生模型输出方面发挥了某种作用吧?(想想弹球机:它靠硬币运行,而不是靠“我们信上帝”这几个字。) 别急。东北大学和加州大学伯克利分校在 2025 年发表的一篇论文(https://arxiv.org/abs/2510.24941)研究了前沿开源 LRM,结果显示,它们 30% 到 60% 的“思考步骤”对模型在基准数学问题上产生的答案“几乎没有因果影响”。砍掉其中一半,模型的性能几乎没有受损。“我们在审查这些思维链提示时需要小心,因为它们可能 与最终输出没有关联,”该研究的作者之一 Weiyan Shi(https://wyshi.github.io/)说。 所以,推理痕迹——那些据称将 LRM 与仅仅是预测下一个词的 LLM 区分开来的东西——不一定是有意义的,也不一定对模型的……推理有因果作用?我不是哲学家,但这似乎把“推理”的含义拉伸到了超过其抗拉强度的程度。Kambhampati 的研究小组在他们关于这一主题的立场论文(https://arxiv.org/abs/2504.09762)的标题中坦率地表达了厌倦(该论文在 2026 年国际机器学习大会——该领域最负盛名的学术会议之一——上展示):“别再拟人化地把中间令牌当作推理/思考痕迹了!” 需要说明的是,Kambhampati 是人工智能促进协会前主席,有 AI 规划算法的背景,他并不否认 LRM 可以工作(在它们能工作的时候)。“我们正处在奇妙的时代,”当我问他如何看待 OpenAI 在 2026 年解决数学中著名单位距离问题(https://openai.com/index/model-disproves-discrete-geometry-conjecture/)的胜利时,他这样告诉我。如果说他有什么不满,那就是他看到的学术界和工业界都急于拥抱过于方便的解释。 “很多关于(这些模型)力量来源的提议都被误解或曲解了,”他说。“有一种普遍的思维方式是:‘让我们先宣称某些能力,因为最终这些能力无论如何都可能成真。’而我的感觉是:那不是科学。那是投资。” 而在 AI 推理栅栏的另一边,不屑似乎是相互的。“去年夏天那些‘科学’论文——我要给‘科学’加上大大大的引号,”OpenAI 技术团队成员 Sébastien Bubeck(http://sbubeck.com/)说(他也是该公司推理模型在科学家和数学家中的著名布道者)。他称早前苹果公司批评 AI 推理的结果(https://arxiv.org/abs/2410.05229)是“错误的”,声称那是现已过时模型中的训练怪癖所致。“从 GPT-5.5 开始的现代模型不存在这个问题,”他说,“重新审视那些结果会很有趣。”(苹果公司没有让其研究人员接受采访。) 事情是这样的:没有人否认 AI 推理模型确实能产生重大而准确的结果。此外,我采访的每一位研究人员都承认,关于这些模型在某些推理任务上(尤其是较小的开源 LRM)的负面发现,可能并不总能推广到最新最先进的 AI 产品。它们的内部运作仍是商业机密。但如果我们不愿意(像我一样)简单地将那些关于 AI 推理机制相互矛盾的证据一笔勾销,那么问题仍然是:我们如何解释它? 事实证明,Kambhampati 正是有兴趣这样做的人。“我并不消极。我只是听起来消极,因为其他人都太积极了,”他说,“在科学中,你必须真正理解当前事物能做什么、不能做什么。” 他告诉我,最先进的 LRM 之所以有效的一个直接原因(Mitchell 也认同这一点)是,它们通常被“普通”软件包围,这些软件引导并验证它们的输出。自 2025 年秋季以来彻底改变了软件工程的智能体 AI 系统就是如此运作的。Google DeepMind 的 AlphaProof Nexus(https://arxiv.org/abs/2605.22763v1)也是如此,它依赖于自动化定理证明工具 Lean。但 Kambhampati 更感兴趣的是理解那些完全依赖自身生成的推理痕迹的独立推理模型——“即‘思考’部分,”他说。 “思考”部分正是 OpenAI 等公司正在加倍投入的。当我问 Bubeck,那个引起轰动的单位距离证明是否是用 LRM 自身思维链之外的方法产生的——也许是用 Lean 验证了其结果——他似乎觉得这个问题几乎毫无意义。 “我们不是在故弄玄虚,”他说,“我们已经发布了思维链。你可以直接去看。重点在于,模型就像人类一样在推理。而人类推理时,我们不用 Lean。”严格来说,OpenAI 发布的是由两位人类专家使用另一个 OpenAI 模型 Codex 生成的模型思维链的“改写摘要(https://cdn.openai.com/pdf/1625eff6-5ac1-40d8-b1db-5d5cf925de8b/unit-distance-cot.pdf)”。自 2024 年以来,该公司一直没有公开其推理模型的“原始”思维链,Google DeepMind 和 Anthropic 也采取了同样的政策。 Kambhampati 的分析起点出人意料地相似:认为 LRM 只是经过了更专门训练的 LLM。“没有额外的魔法,”他说。但他随后就分道扬镳了。“在我看来,LLM 在给出答案之前,先逐步描述它(推理)的内容是没有意义的——因为按照 LLM 的训练方式,这比直接猜测答案要难得多。” 他的工作假说是,LRM 与其 LLM 前辈一样,在其庞大的训练语料库中执行他所谓的“近似检索”:介于模式匹配和推理之间的“中间地带”,但他表示,更接近前者。那么,“思考令牌”的作用就不是叙述真实的思维链(因为根本没有思维链)。相反,它是以一种使模型更有可能预测或“近似检索”出具有推理形态的文本字符串的方式来加载模型的上下文窗口。 Kambhampati 将这一过程比作对自己喃喃自语以唤起记忆:说什么并不重要(虽然相关的话可能有帮助),只要它能撞出有用的东西。LRM 庞大的“记忆”包括它训练时见过的所有类似呼唤-应答的书面推理示例,这些示例被粉碎成数值“嵌入”(https://www.quantamagazine.org/how-embeddings-encode-what-words-mean-sort-of-20240918/),将它们的相似性和差异(以及其他难以理解的关联)编码为高维空间中的几何关系。在那个空间中概率性地得出答案,可能涉及一些中间令牌,其嵌入映射到用普通英文表达出来的、看上去连贯的“思想”——但也不一定。它们可能是其他语言的片段。它们可能是“啊哈”之类的假感叹(https://arxiv.org/abs/2510.24941v2)。在适当条件下,它们甚至可能只是一串点。 “(嵌入)是否真的对应一个单词”——更不用说忠实的推理过程了——“并不是重点,”Kambhampati说。 这个框架可能有助于解释某些思维链奇怪的“扯淡”性质,以及它们仍然能引出准确输出的事实。它也能很好地解释 LRM 在编程和数学方面的稳步提升——AI 研究人员称之为“可验证领域”。代码要么能跑,要么不能;证明要么正确,要么错误。这些二元条件以及与之相关的书面步骤,可以为 LRM 创造便捷的训练信号。Kambhampati 说,模型不需要学习或可靠地应用一般的推理过程;它只需吸收足够多的步骤*看起来是什么样*的例子,以便在“拼凑”出一个看似合理的结果(随后可被验证)的过程中预测性地模仿它们。 Kambhampati 还补充说,推理模型训练和步骤遵循能力的极限,即所谓的“推理视野”,正是苹果研究人员在 2025 年的“思维的幻象”论文中所揭示的。较新的模型已经

相似文章

我是不是完全疯了,觉得AI很平庸?

Reddit r/ArtificialInteligence

作者对AI进展表示失望,认为尽管经过多年发展和巨额投入,大型语言模型在基本推理上仍然力不从心,并引用了一篇揭示其根本缺陷的Apple论文。他们质疑围绕超级智能的炒作是否被误导了。