使用 GPT-5.5 Pro 对 $\mathbb R$ 上求和-乘积猜想的自主反证
摘要
本文介绍了一个基于 GPT-5.5 Pro 构建的 AI 智能体,它通过三阶段提示流水线,在 8 次试验中有 7 次自主生成了推翻实数域上 Erdős–Szemerédi 求和-乘积猜想的正确证明。
arXiv:2607.20525v1 公告类型:新
摘要:OpenAI 近期对 Erdős 单位距离猜想的推翻标志着人工智能在数学领域的一个里程碑。它还激发了另一项突破:人类对实数域上 Erdős–Szemerédi 求和-乘积猜想的推翻。在本文中,我们介绍了一个基于 GPT-5.5 Pro 构建的简单智能体。通过使用一个与问题无关的三阶段提示管道——证明计划提出、证明构建和审查——该智能体在 8 次独立试验中有 7 次自主生成了正确的证明,表明求和-乘积猜想在 $\mathbb R$ 上不成立;在剩余的一次试验中,它识别出了其论证中的一个未解决的漏洞。这七个证明多种多样:一些接近现有的基于单位的构造,而另一些则通过使用代数整数的 $L^p$ 型区域来避免单位。该系统每次试验平均使用 132.4k 推理令牌。我们公开了代码、中间输出和生成的证明,提供了一个可复现、无数据污染的自主证明生成案例研究。
查看缓存全文
缓存时间: 2026/07/24 05:04
# 积和猜想在实数域上的自主反证——基于GPT-5.5 Pro
项目仓库:https://github.com/yichenhuang/sum-product
来源:https://arxiv.org/html/2607.20525
###### 摘要
OpenAI 最近对 Erdős 单位距离猜想的反证,标志着人工智能在数学领域的一个里程碑。它也激发了另一项突破:人类对 Erdős–Szemerédi 积和猜想在实数域 \(\mathbb{R}\) 上的反证。本文介绍了一个基于 GPT-5.5 Pro 的简单智能体。该智能体采用与问题无关的三阶段提示流程——包括证明方案提出、证明构建与评审——在 8 次独立试验中的 7 次中自主生成了关于积和猜想在 \(\mathbb{R}\) 上不成立的正确证明;在剩余的一次试验中,它识别出了自己论证中的一个未解决的漏洞。这七个证明各具特色:有的接近于现有的基于单位的构造,而另一些则通过使用代数整数的 \(L^p\) 型区域避免了单位的使用。该系统每次试验平均使用了 132.4k 推理 token。我们公开发布了代码、中间输出以及生成的证明,为自主证明生成提供了一个可复现、无数据污染风险的案例研究。
## 1 引言
近期,OpenAI 宣布其内部 AI 模型自主推翻了 Erdős 单位距离猜想 [undef (https://arxiv.org/html/2607.20525#bib.bibx1), undefa (https://arxiv.org/html/2607.20525#bib.bibx2)]。这解决了一个长期悬而未决的离散几何公开难题,标志着人工智能在数学研究应用中的一个里程碑。受单位距离反例的启发,Bloom、Sawin、Schildkraut 和 Zhelezov [undefb (https://arxiv.org/html/2607.20525#bib.bibx3)] 很快取得了第二项突破:人类在实数域 \(\mathbb{R}\) 上成功反证了 Erdős–Szemerédi 积和猜想。
### Erdős–Szemerédi 积和猜想。
对于交换环中的有限集 \(A\),定义
\[
A+A = \{a+b: a,b \in A\}, \quad A\cdot A = \{ab: a,b \in A\}.
\tag{1}
\]
积和问题探讨的是这两个集合在多大程度上能同时较小。对于 \(A \subset \mathbb{Z}, \mathbb{R}, \mathbb{C}\),有猜想认为至少其中一个集合必然具有本质上最大的大小:
\[
\max\{|A+A|, |A\cdot A|\} \ge |A|^{2-o(1)}.
\tag{2}
\]
该猜想首次出现在 [undefc (https://arxiv.org/html/2607.20525#bib.bibx4)] 中,Erdős 在该文中特别强调了整数情形。由于 Erdős 和 Szemerédi [undefd (https://arxiv.org/html/2607.20525#bib.bibx5)] 证明了这个方向上的首批一般性结果,它通常被称为 Erdős–Szemerédi 积和猜想。在实数情形,Solymosi 证明了 \(|A|^{4/3-o(1)}\) 下界 [undefe (https://arxiv.org/html/2607.20525#bib.bibx6)];Konyagin 和 Shkredov 突破了 \(4/3\) 的壁垒 [undeff (https://arxiv.org/html/2607.20525#bib.bibx7)];目前已知的最佳下界是 \(|A|^{4/3+10/4407-o(1)}\),由 Cushman [undefg (https://arxiv.org/html/2607.20525#bib.bibx8)] 获得。
Bloom、Sawin、Schildkraut 和 Zhelezov 在其论文中反证了实数域 \(\mathbb{R}\) 上的积和猜想:
###### 定理 1 ([undefb (https://arxiv.org/html/2607.20525#bib.bibx3)])
存在绝对常数 \(c>0\) 和任意大的有限集 \(A \subset \mathbb{R}\),使得
\[
\max\{|A+A|, |A\cdot A|\} \le |A|^{2-c}.
\tag{3}
\]
他们的反例是在全实数域(degree 任意大且根判别式一致有界)中代数整数环内部构造的,然后嵌入到 \(\mathbb{R}\) 中。Martinet 的类域塔提供了所需的数论输入。使用大次数数域是新反例构造的本质来源,这可能有助于解释为何先前的几何和组合方法未能发现这一构造。
### AI 后续成果。
Levent Alpöge [undefh (https://arxiv.org/html/2607.20525#bib.bibx9)] 宣布,一个基于 Anthropic 的 Claude Mythos 的智能体自主证明了定理 1 (https://arxiv.org/html/2607.20525#Thmtheorem1)。该证明使用了与 [undefb (https://arxiv.org/html/2607.20525#bib.bibx3)] 相同的基本构造。Anthropic 后来公开发布了 Claude Fable 5,官方描述为“Mythos 级”模型。尽管如此,确切的 Claude Mythos 模型以及 Alpöge 所使用的智能体仍未公开。运行产生正确证明的概率以及计算成本也未见报道。
Sébastien Bubeck [undefi (https://arxiv.org/html/2607.20525#bib.bibx10)] 公布了由 Boris Alexeev [undefj (https://arxiv.org/html/2607.20525#bib.bibx11)] 提示的 GPT-5.5 Pro 对话记录。然而,该记录并不代表一次自主的反证。一个关键提示向模型提供了单位距离证明,并明确指示其使用相同方法来反证积和猜想。这是一个重要的数学提示。因此,该记录更适合被理解为一次有人员引导的 GPT-5.5 Pro 测试,而非对积和反例的自主发现。
### 我们的贡献。
我们使用 GPT-5.5 Pro 作为基础模型,以获得一个干净、无数据污染风险的实验。GPT-5.5 Pro 在首个公开证明 [undefb (https://arxiv.org/html/2607.20525#bib.bibx3)] 出现之前就已发布,并且所有运行均禁用了网络搜索。因此,模型在推理时无法检索到任何公开证明,此类证明也不可能出现在其训练数据中。
本文介绍了一个基于 GPT-5.5 Pro 的简单智能体。该智能体采用三阶段提示流程:证明方案提出、证明构建与关键评审。在 8 次独立试验中的 7 次中,该智能体正确证明了定理 1 (https://arxiv.org/html/2607.20525#Thmtheorem1)。在剩余的一次试验中,它没有完成证明,但正确地识别出了漏洞,而不是将一个不完整的论证作为完成的证明呈现出来。该实验的计算成本适中,在全部八次运行中,每次试验平均使用了 132.4k 推理 token。因此,事后看来,对实数域 \(\mathbb{R}\) 上 Erdős–Szemerédi 积和猜想的自主反证,完全在人类证明 [undefb (https://arxiv.org/html/2607.20525#bib.bibx3)] 发布之前就已公开的模型能力范围内,且无需依赖复杂的架构或当时尚未公开的模型。我们在 GitHub (https://github.com/yichenhuang/sum-product) 上公开了智能体的源代码、所有模型中间输出以及生成的证明。
该智能体还生成了与所有公开证明存在显著差异的证明。这些证明完全不使用单位;相反,它们通过从精心选择的区域中选取代数整数然后嵌入到 \(\mathbb{R}\) 来构造反例。它们所需的数论背景知识较少,具有独立的数学意义。
## 2 智能体
虽然称之为智能体,但我们的系统采用极简架构:它运行一轮三阶段的对话,引导底层模型依次识别有前途的方法、构造严谨的证明,并进行关键评审。
系统提示提供背景和目标:
`系统提示`
第一个提示陈述了定理,并要求模型识别出一种有前途的证明方法:
`第一个提示`
第二个提示要求模型构造一个完整且严谨的证明:
`第二个提示`
第三个提示要求模型对其证明进行关键评审和完善:
`第三个提示`
有两点需要说明。首先,第一个提示中陈述的定理直接断言了实数域 \(\mathbb{R}\) 上 Erdős–Szemerédi 积和猜想反例的存在性。如果该猜想的真假未知,此提示可以进行中立处理,只需指示智能体在独立的运行中分别尝试证明和反驳(代价大约是测试时计算量翻倍)。其次,所有与问题相关的文本仅局限于第一个提示中分隔符 `***` 以上的部分。而推理指令——证明方案提出、证明构建与关键评审——是与问题无关的。因此,通过仅修改第一个提示中的问题陈述(包括任何附注),该流程可以应用于其他定理证明任务。对于需要最终答案并附带严谨论证的问题,需要对提示进行少量额外修改。
所有试验均通过 GPT-5.5 Pro API 进行,使用了 `gpt-5.5-pro-2026-04-23` 快照。工具和网络搜索被禁用。推理努力参数设置为“xhigh”。详细程度参数在前两轮设置为“high”,第三轮保持默认(medium)设置。所有其他参数,包括温度系数和最大输出 token 数,均保持默认值。
## 3 实验结果
我们的智能体在 8 次独立试验中的 7 次生成了正确证明,通过率为 87.5%。例外的是试验 2。在该次试验中,模型在第二轮(证明构建)后产生的论证是不完整的,并且在最后一轮(评审)后仍不完整。模型并未将不完整的论证作为完成的证明呈现。相反,它强调了不完整性并清楚地识别出了未解决的漏洞。对于一个自主数学推理系统而言,当证明尝试失败时,这种诚实的自我诊断是值得肯定的。
我们在表 1 中报告了推理 token 使用情况和汇总统计。面板 (a) 给出了逐轮使用情况。对于每次试验,总行中的条目是三轮提示中推理 token 计数的总和。在产生正确证明的七次试验中,该行的条目平均为 125.3k 推理 token。在所有八次试验中,总行的条目平均为 132.4k 推理 token。由于八次试验中有七次产生了正确证明,每个正确证明的摊销推理 token 使用量(将失败试验的计算量计入总预算)为 \(132.4k \times 8/7 = 151.3k\) 推理 token。
**表 1:8 次独立试验的推理 token 使用情况与统计。**
面板 (a) 按试验和提示轮次报告推理 token 使用量。对于每次试验,最后一行为“总计”,给出三轮 token 计数的总和。对勾表示正确证明,破折号表示不完整证明。面板 (b) 报告七次成功试验的平均值和样本标准差,针对面板 (a) 中的每一轮和总计行进行计算。面板 (c) 报告所有八次试验针对面板 (a) 中总计行的相应统计量。Token 计数以千为单位,四舍五入至最接近的 0.1k。
**(a) 按试验的推理 token 使用量**
| 试验 | 第一轮 (k) | 第二轮 (k) | 第三轮 (k) | 总计 (k) |
|------|-----------|-----------|-----------|---------|
| 1 | 65.0 | 71.6 | 16.6 | 153.2 |
| 2 | 51.4 | 64.0 | 56.4 | 171.8 |
| 3 | 72.5 | 32.1 | 15.4 | 120.0 |
| 4 | 59.6 | 40.2 | 18.3 | 118.1 |
| 5 | 65.4 | 49.7 | 20.8 | 135.9 |
| 6 | 48.3 | 44.1 | 15.7 | 108.1 |
| 7 | 60.9 | 20.1 | 12.7 | 93.7 |
| 8 | 65.9 | 59.4 | 23.0 | 148.3 |
**(b) 成功试验 (1,3-8) 的统计量**
| 轮次 | 平均值 (k) | 样本标准差 (k) |
|--------|-----------|----------------|
| 第一轮 | 62.5 | 7.7 |
| 第二轮 | 45.3 | 18.2 |
| 第三轮 | 17.4 | 2.3 |
| 总计 | 125.3 | 18.2 |
**(c) 所有试验的统计量**
| 总计行 | 平均值 (k) | 样本标准差 (k) |
|--------|-----------|----------------|
| 总计 | 132.4 | 22.3 |
第一轮(证明方案提出)的计算强度一直很高。在七次成功试验中,它平均消耗了 62.5k 推理 token,样本标准差为 7.7k。本轮的高推理 token 使用量表明,模型并未满足于一个肤浅的证明方案,而是投入了大量的测试时计算来应对问题的核心数学难点。从这个意义上说,提示策略成功引出了所需行为:模型花费大量推理努力来寻找并深入发展证明策略。
第二轮的推理 token 使用量变化较大。在成功试验中,本轮平均使用了 45.3k 推理 token,样本标准差高达 18.2k。一个自然的解释是:第二轮所需推理量敏感地取决于第一轮产生的证明方案的质量。当第一轮方案已包含大部分正确证明策略时,第二轮的负担相对较轻:模型主要需要填充细节并组织论证。然而,当第一轮方案指向一个无效方向时,推理 token 使用量可能显著增加,因为模型可能需要在该方法内挣扎,或者完全放弃它。试验 1 和试验 2 拥有最大的第二轮推理 token 计数,分别为 71.6k 和 64.0k。在这两个试验中,初始方案都指向了错误方向。然而,在试验 1 中,经过第二轮的大量推理,模型成功回到了正确路径。相比之下,在试验 2 中,模型仍然卡住,未能完成证明。
对于成功试验,最后一轮的计算量要轻得多。一旦第二轮已经产生了基本正确的证明,最后一轮的作用就相对有限且可预测:检查论证,修复次要问题,并清晰地呈现最终证明。因此,对于七次成功试验,最后一轮平均仅消耗了 17.4k 推理 token,样本标准差较小,仅为 2.3k。不成功的试验 2 再次成为例外。由于第二轮后没有出现完整证明,模型在最后一轮继续尝试完成证明,而不仅仅是润色已有的证明,导致最后一轮 token 使用量高达 56.4k。
这好比下棋。在胜势局面中,已经识别并验证了获胜计划的棋手通常无需过多思考就能走出制胜一着;长时间的思考往往表明计划尚未找到。类似地,在我们的实验中,一旦第二轮产生了基本正确的证明,评审轮就显得相对轻松。相反,后期轮次异常高的推理 token 使用量表明模型仍在寻找可行的路径,或试图修补不完整的路径。这就提出了对测试时计算的更细致解读:推理 token 消耗只记录了花费的计算量,而不代表该计算的使用效率。更高的消耗并不一定意味着更深入、更全面或更高质量的推理。它可能反映了不确定性、绕路,或者模型尚未找到能够贯彻到底的方法。试验 2 最好从这一角度来理解:模型未找到可行的证明方案,花费了相当多的推理努力试图完成和修补论证,最终报告了剩余漏洞。因此,推理 token 使用量数据与其说是成功与否的单调预测指标,不如说是一个诊断工具,用于判断数学难度所在以及智能体是否已收敛到一个可行的方法。
## 4 证明分析
我们现在比较以下十个证明:人类证明 [undefb]、OpenAI 证明 [undefj]、Claude Mythos 证明 [undefk],以及我们的 GPT-5.5 Pro 智能体自主生成的七个正确证明。对于这七个证明,Proof i 表示在第 i 次试验中产生的最终证明;在我们的 GitHub 仓库中,这些文件命名为 proof-1.html、proof-3.html、proof-4.html……proof-8.html。缺失的索引是有意为之:试验 2 未产生完整证明。
所有十个证明都始于代数数论的相同输入:一个无限序列的全实数域 \(K_i\),其次数 \(d_i \to \infty\),且根判别式一致有界。就我们的目的而言,“全实”意味着每个 \(K_i\) 具有 \(d_i\) 个实嵌入 \(\sigma_1, \ldots, \sigma_{d_i}: K_i \to \mathbb{R}\)。相似文章
@rohanpaul_ai: 这太棒了。GPT-5.6 Sol Ultra 在一小时内使用64个子代理证明了一个有五十年历史的猜想。该成果…
据报道,OpenAI 发布的 GPT-5.6 Sol Ultra 在一小时内使用64个子代理证明了已有五十年历史的 Cycle Double Cover 猜想,标志着人工智能领域的重大突破。
GPT-5.6 Sol Ultra 生成了循环双覆盖猜想的证明 [pdf]
GPT-5.6 Sol Ultra,OpenAI 的人工智能模型,已经生成了循环双覆盖猜想的证明,这是图论中一个长期存在的问题。
又一个50多年未解决的Erdős问题被GPT-5.6攻克
GPT-5.6又解决了一个由数学家Paul Erdős提出的50多年未解决的难题,展示了人工智能在数学推理能力上的重大飞跃。
不仅仅是组合数学与反例:GPT-5.5 解决纯泛函分析中的精选问题
本文展示了 GPT-5.5 解决纯泛函分析中精选问题的能力,超越了典型的组合数学与反例任务。
人类数学家正在被反例超越
包括ChatGPT和OpenAI的Sol在内的人工智能系统,已经驳斥并完全形式化了Erdős单位距离猜想,标志着人工智能辅助数学的一个里程碑。文章讨论了这一过程及其对数学证明验证未来的影响。