AI并未超越数学家的思维,而是超越了他们的记忆
摘要
文章认为,AI在数学领域的成功可能源于其庞大的工作记忆(上下文窗口),而非更优越的推理能力,并将此与人类认知局限性进行了对比。
暂无内容
查看缓存全文
缓存时间: 2026/08/15 18:36
# AI 并非在思考能力上超越数学家,而是在记忆能力上胜过他们
来源:https://davidepiffer.com/p/ai-isnt-outthinking-mathematicians
**约翰·冯·诺依曼**:《我的小百科全书》词条定义 (https://substackcdn.com/image/fetch/$s_!DIxw!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F2e2e14e7-c536-49c0-9f27-79b1073dd527_1279x759.jpeg)1952年高等研究院计算机落成典礼上的约翰·冯·诺依曼。人工智能与其说像电子爱因斯坦,不如说是机器增强版的冯·诺依曼:具备极高的速度、广度和符号记忆能力。
当人工智能系统解决一个困难的数学问题时,通常的解释是它变得更聪明了。
或许它吸收了数百万个数学范例;或许强化学习教会了它更好的推理策略;或许它开始发展出类似真正的数学直觉的东西。
这些解释可能都有一定道理,但它们忽略了一个更简单的可能性:
**人工智能拥有远超人脑的工作记忆容量。**
或者更准确地说,它拥有一个庞大的外部符号工作空间,可以执行人类工作记忆的许多功能。
这种差异在数学领域可能尤为重要。
人类数学家一次只能将少数几个陌生的元素保持在头脑中。而一个人工智能模型可以将整个问题陈述、数百个中间方程、数个被放弃的方法、定义、约束条件和早期的结论全部保留在其上下文窗口内。
我们通常将这种由此产生的表现解释为推理能力更优越的证据。但其中的一部分可能只是反映了消除了人类推理中最重要的生物学限制之一:我们极其有限的工作记忆容量。
工作记忆是允许我们在短时间内保持和操作信息的心理系统。
解方程时,你必须记住每个变量的含义、已进行的操作以及当前目标。在证明过程中,你可能需要追踪假设、中间引理、例外情况和多种可能的情形。
人类的工作记忆极其有限。
其确切容量取决于任务以及信息的组织方式,但其总体限制从日常经验中显而易见。试着心算两个三位数的乘法。底层运算很简单。困难主要来自于在执行额外计算时必须保留中间结果。
将数字写下来就改变了这个问题。
纸张不会让你更聪明,它扩展了你的有效工作记忆。
同样的原理适用于更高层次的数学。数学家使用符号、草稿纸、图表和先前写好的引理,不仅仅是为了交流解决方案,更是为了让推理在认知上成为可能。
专家通过“组块”来补偿。新手看到一长串符号。专家则能识别出熟悉的结构,并将其视为一个单一的概念对象。这使得在相同的工作记忆生物限制下可以容纳更多的信息。
但组块并没有消除限制,它只是压缩了信息。
人工智能模型面临的是一个非常不同的约束。
工作记忆对于数学的重要性不仅仅是理论上的,它体现在人类个体之间的差异上。
工作记忆与一般智力密切相关,这引出一个显而易见的问题:它是否独立预测数学表现,还是仅仅是智商的另一种不完美衡量指标?
多项研究表明,它贡献了超出传统智力测量范畴的东西。例如,Alloway 和 Passolunghi(2011)研究了儿童的工作记忆、语言能力和数学技能。他们发现,工作记忆测量对数学表现有独特贡献,而不仅仅是复现了数学能力与一般语言能力之间的关联。
在一项为期六年的独立纵向研究中,Alloway 和 Alloway(2010)在儿童五岁时测量了他们,并在六年后考察了他们的学业成就。即使在分析中纳入了智商,早期的工作记忆表现也能预测后期的读写和计算能力。事实上,工作记忆比研究中使用的智商指标更能预测后期的学业成果。
Blankenship 及其同事(2015)同样报告称,在统计控制了智商和年龄因素后,工作记忆解释了数学流畅性和计算能力的独特变异。Friso-van den Bos 及其同事(2013)进行的一项大型元分析也发现,在小学研究中,工作记忆与数学能力之间存在一致的关系,尽管这种关系的强度因所测量的工作记忆类型和数学任务类型而异。
这些发现不应被夸大。工作记忆与智力有相当大的重叠,而统计控制无法完美地将它们作为独立的心理机制分离开来。这些证据也并不意味着商业性的工作记忆训练必然带来智力或数学能力的巨大提升。
然而,一个更窄的结论仍然重要:**在测量智力相似的儿童中,保持、更新和操作信息的能力差异仍然可以预测数学表现的差异。**
这为理解人工智能提供了一个关键线索。如果人类的数学表现部分受限于工作记忆瓶颈,那么给一台机器提供一个巨大的符号工作空间就改变了竞争的本质。这台机器显得数学智能更高,部分原因可能是它受到那种抑制人类表现的认知限制的束缚要小得多。
现代语言模型可以一次处理巨大的标记序列。这个序列可能包括原始问题、定义、示例、中间计算以及模型自身的早期推理。
上下文窗口与人类工作记忆并不相同。它最好被理解为一个巨大的外部笔记本,加上一个用于搜索和使用其中内容的不完善系统。
这个区别很重要。
人类拥有一种主动的内部记忆形式。我们可以在不发声或不书写的情况下,默选一个数字,在心中保持它、转换它并用一个新值替换它。
标准语言模型在维持这种私密的、持续更新的心智状态方面要弱得多。它们最稳定的记忆形式通常是已经生成的标记序列。
如果模型写下:
x=6
稍后又写下:
x+3=9,
这些陈述就保留在上下文中。模型在生成下一步时可以再次注意到它们。
因此,它的推理往往是外化的。文本不仅仅是一个完成的思考过程的报告,文本本身就是推理发生的机制的一部分。
人类在使用草稿纸时也会做类似的事情。主要的区别在于规模。
一个没有辅助的人可能难以同时保持五个陌生条件的活跃状态。而一个人工智能可以将数十个甚至数百个条件以明确的形式保存下来。
这并不意味着长上下文中的每一项信息都能被完美检索。模型可能会忽略相关信息、分心或丢失细节。宣传的上下文长度并不等同于完美可用的记忆。
然而,潜在容量上的差异是巨大的。
上下文窗口的优势并非在每种推理中都同样有用。
它在数学领域尤其重要,因为数学推理可以异常良好地转化为明确的符号。
数学问题的几乎所有相关元素都可以写下来:
- 假设;
- 定义;
- 已知方程;
- 当前目标;
- 已证明的结果;
- 已排除的情形;
- 每一步保持有效的条件。
一旦写下来,这些信息就保持稳定。
如果 \(x\) 在证明开头被定义为整数,那么除非证明明确更改了定义,否则它就保持为整数。一个严格不等式不会因为情绪、语境或解释的变化而逐渐变成非严格不等式。
数学符号的设计旨在减少歧义。
这使得数学几乎完美地适合于通过大型文本工作空间运作的智能。
考虑一个需要求解者记住以下内容的问题:
- \(n\) 是奇数;
- \(p\) 是素数;
- \(x \neq 0\)
并且论证的一个分支已经得出了矛盾。
人类可能理解基本策略,但在确定 \(x \neq 0\) 之前就除以了 \(x\)。这个错误不一定是由缺乏智力造成的,它可能是簿记的失败。
人工智能可以在每个阶段重述活跃的约束条件:
> 我们在假设 \(n\) 是奇数、\(p\) 是素数且 \(x \neq 0\) 的条件下工作。
上下文就变成了推理状态的账本。
许多困难的数学问题在开头附近包含深刻的洞见,但它们也包含大量随后不太引人注目的工作:展开表达式、检查各种情形、在变换中传递条件以及确保最终结论与每个早期假设兼容。
机器在这里获得优势,并不需要比人类拥有更深刻的洞见,它可能只是更善于在完成一长串操作的同时保留问题的完整状态。
数学具有高度的组合性。
一个证明通常可以表示为:
A → B → C → D
如果每一步都有效,并且链条被准确地保持,结论就能成立。
更大的工作空间允许模型在迷失主线之前构建更长的链条。
这很重要,因为问题的难度不仅取决于每个单独步骤的难度,还取决于必须协调多少步骤。
一个人可能完全能够理解一个100步论证中的每一个局部推断,却仍然无法独立生成整个论证。这个问题超出了这个人维持全局结构的能力。
人工智能可以通过写下几乎所有东西来潜在地进行补偿。
这也许可以解释为什么额外的“思考时间”通常能提高模型性能。更多的计算允许系统产生更多的中间状态、检查替代分支并保留部分结论。
看起来像是更深层思考的东西,有时可能只是在更大的笔记本中进行的更广泛的搜索。
现在,将一个数学问题与一个社会问题进行比较:
> 为什么玛丽亚突然停止回复我的消息?
更大的上下文窗口可能允许人工智能检查多年的通信。它可以识别语气、时间和词汇的变化。
但决定性的信息可能仍然缺失。
也许玛丽亚生气了。也许她很忙。也许她病了。也许她丢了手机。也许她在回避一个无关的问题。
再多的记忆也无法检索从未被观察到的事实。
挑战不仅仅是保留一组已知的前提并推导其结果,而是在关于隐藏原因的不确定性下进行推理。
非正式推理也严重依赖于含义不稳定的含义。
诸如“公平”、“成功”、“负责”、“有害”或“聪明”之类的词不具备数学变量的精确性。它们的含义取决于文化、目标和背景。
模型可以记住讨论中的每一句话,同时仍然误解参与者的意图。
同样的情况也适用于政治分析、历史解释、商业策略和心理判断。在这些领域,核心问题通常不是工作记忆容量,而是在证据不完整和模糊时识别正确的因果模型。
一个更大的笔记本有帮助,但它无法解决根本问题。
数学是不同的,因为推理环境是人工构建的,以使假设明确化、变换可验证。
数学答案通常可以被检验。
一个方程的解可以被代回原始表达式。一个提出的恒等式可以进行数值计算。计算机程序可以测试数百种情况。形式化证明助手可以验证每个推断是否遵循公认的规则。
这为人工智能创造了一个理想的环境。
模型不仅可以利用其上下文生成解决方案,还可以记录替代方法、识别矛盾并纠正先前的错误。
在不太正式的领域,反馈要弱得多。
一个有说服力的历史解释可能无法最终被证实。一个商业策略可能在多年后才能揭示其是否正确。一个心理解释可能永远无法确定。
在这样的领域,一个长而连贯的论证仍然可能完全错误。
数学奖励那些能够生成、存储和验证明确中间状态的系统。这正是上下文窗口、草稿本、代码执行和形式化验证所放大的能力。
一些研究人员会反对将上下文窗口描述为工作记忆。
他们有道理。
人类工作记忆不仅仅是一个存储缓冲区。它涉及注意力、抑制、持续更新和对内部表征的主动操作。
语言模型的上下文更被动。之前的标记保持不变。模型不能真正返回早期的某一行并替换它。它根据现有记录生成新的标记。
因此,最准确的描述可能是**增强的符号工作记忆**。
模型在某些方面的内部私人记忆比人类弱,但在其他方面的外部显式记忆却远超人类。
人类更擅长默默地维持一个小的内部状态。人工智能更擅长在巨大的书写记录上操作。
对于数学来说,第二种能力往往可能更有价值。
形式推理并不要求每个相关状态都保持私密。相反,当假设和中间步骤被明确化时,数学能力会提高。
人工智能表面的弱点——它“大声思考”的倾向——当领域本身由书写符号构成时,就变成了优势。
这引出了一个更广泛的问题:说人工智能在数学上“优于人类”意味着什么?
想象给两个人相同的数学问题。
一个人必须完全在头脑中解决它。另一个人获得无限的纸张、完美的笔记、即时访问每一次先前计算的能力、同时尝试多种方法的能力以及一台检查每个结果的机器。
如果第二个人获胜,我们不一定会得出结论说第二个人拥有更强大的原始数学智能。我们可能反而会得出结论,认为第二个人在完成这项任务上拥有更好的认知架构。
同样的谨慎也应适用于比较人类和人工智能。
人工智能系统在海量的数学材料上训练。它们可以生成许多可能的解决方案,使用代码,查阅工具,并保留长的推理痕迹。
因此,它们的表现是多个因素的产物:数学知识、推理能力、记忆容量、搜索和验证。
我们往往关注推理,因为这是哲学上最令人兴奋的组成部分。但记忆可能在做比我们……
相似文章
AI超越数学家
AI已经进步到能够为原创数学研究做出贡献的程度,超越了人类数学家,并可能减少对该职业的需求,尽管人类与AI的团队合作可能最终表现出色。
AI更擅长寻找答案而非质疑假设
探讨了AI如何在既定范围内擅长寻找答案,但可能缺乏质疑基本假设的能力,暗示了与人类智能的关键差异。
人工智能与数学的未来(2分钟阅读)
Grant Sanderson 与 Dwarkesh Patel 探讨了人工智能在数学领域的快速进展、概念突破的本质,以及随着AI的进步这对其他领域意味着什么。
AI 模型在这些智力测试中频频失手,你能做得更好吗?
本文探讨了AI模型在空间推理和记忆谜题等智力测试中的表现不佳,突出了与人类认知的差距,并邀请读者测试自己的能力。
如果AI+人类能够覆盖弱点来解决复杂数学问题,那么我们就能解决AI问题
本文探讨了在假设驱动研究中,人机协作如何推动数学问题解决和人工智能发展,并以黎曼猜想的进展以及用于架构搜索的AIRA-Compose系统为例。