OpenAI 未发布模型 Astra 解决十大开放数学难题(34分钟阅读)
摘要
OpenAI 未发布的模型 Astra 据称解决了十大开放数学难题,结果已通过 Lean 证书形式化验证,标志着 AI 数学推理能力的重大飞跃。
OpenAI 最近公布的十大开放数学难题解决方案表明,AI 在网络和编程领域已具备超人能力,在高级数学领域也达到了超人水平,就像非 AI 计算机长期以来在基础数学上超越人类一样。这些问题都是定义明确、形式化的问题,其解决方案易于验证。AI 研发中的很大一部分是可验证的。任何在真正的 AI 研发自我改进循环中取得进展的实验室,都将发现自己处于极其有利的地位。
查看缓存全文
缓存时间: 2026/08/04 13:30
# OpenAI 未发布的模型 Astra 解决了十大数学开放问题
来源:https://thezvi.wordpress.com/2026/08/03/openais-unreleased-model-astra-solves-ten-major-open-mathematics-problems/
数学很难。
数学曾经对 LLM 来说出奇地难。人们曾对此沾沾自喜。还记得吗?
数学正在变得容易。AI 正在变得更强大。生活来得太快。
还记得这个梗吗?
是的。确实是。
我们不知道 Astra 在这一领域相比 Fable 和 Sol 有多大飞跃。我们确实知道 Astra 会做数学。真正的数学。
> OpenAI (https://openai.com/index/ten-advances-in-mathematics/):我们针对以下问题提供了新结果。这些结果是由我们的下一代主要模型 Astra 的内部版本取得的。以 Sol API 价格计算,找到这些解决方案所需的总 token 数大约花费 2000 美元。随后,这些论证由人类与同一模型一起整理成手稿。之后,模型将每个论证形式化为 Lean 证书(在新窗口打开) (https://github.com/openai/ten-proofs)。我们还为每个解决方案发布了模型对其思考过程的叙述。1. **高维球堆积。** 针对球堆积密度的新上界,直至 Cohn–Elkies 阈值。2. **二元码和球面码:** 在任意给定最小距离下,二元码最大规模的指数级改进上界,以及高维球面码的类似结果。3. **非 sofic 群。** 一个证明非 sofic 群存在的构造,解决了群论中的一个核心开放问题。4. **Connes 刚性猜想。** 推翻了一个长期存在的猜想——即某些群由其 von Neumann 代数唯一确定。5. **算术电路复杂度。** 使用算术电路和公式计算永久式的新下界,包括阶数为 n4/log n 的算术公式下界。6. **量子并行重复。** 一般两人量子博弈的指数并行重复定理,扩展了经典复杂性理论中的一个基本原理。7. **最近向量问题。** 最近向量问题的多项式因子近似困难性,这是一个与后量子密码学相关的基础格问题。8. **Ehrhart 体积猜想。** 确定在每个维度中,质心是其唯一内部格点的凸体的最大可能体积。9. **多色 Ramsey 数。** 多色三角形 Ramsey 数的超指数下界,解决了 Erdős 问题 183。10. **极值数猜想。** 关于极值图论中紧致性和退化性猜想的结果,解决了 Erdős 问题 146 和 180。Noam Brown (https://x.com/polynoamial/status/2083478171975082334)(OpenAI):是的,我们也确实尝试过其他重大问题,但没有成功。遗憾的是,还没有千禧年大奖难题(目前还没有)。但我们也并没有在每个问题上花很多钱。将测试时计算推得更远是完全可能的。Sichu Lu (https://x.com/lu_sichu/status/2083656428607172927):我希望他们保留了所有出错案例的记录,这些可能对数学的未来比现在做对的事情更有价值。
有 Lean 证明。这并不意味着全部十个结果都证明了它们所声称证明的东西。目前来看,情况不错。
> Kevin Roose (https://x.com/kevinroose/status/2083632335438905441):几乎没有人考虑到这种可能性——模型会像它们在数学领域一路推进那样,持续横扫每一个学科。James (https://x.com/Darpinian/status/2083471575895179549): Ryan Fedasiuk:
其中至少有一些结果在 Astra 之前就可能实现,甚至无需 harness。因为 Sol 和 Fable 都已经在他们的聊天界面中证明了非 sofic 群的存在 (https://x.com/Sauers_/status/2083693731698356626)。
> Ananjan Nandi (https://x.com/AnanjanN/status/2083469591733485746):令人疯狂的是,这一切都始于一个人在世界杯决赛期间欺负他的 Claude。
很多时候,获得某个特定结果的障碍仅仅在于提出正确的问题,然后让模型自由发挥。Astra 的情况下,OpenAI 让它尝试了一堆开放数学问题,它解决了其中 10 个。一旦你知道这些问题是哪些,将其他模型指向同样的问题,即使没有“提示”,也表明存在数学证明的“overhang”(积压)。
我们仍然有强有力的声明,称 Astra 是科学推理的重大进步 (https://x.com/polynoamial/status/2083467194663571701)。
> Yu Bai (https://x.com/yubai01/status/2083459032476795366/history)(OpenAI):我惊掉了下巴 10 次 😅 但这真的会变成一场雪崩。我也已经把我的一些开放问题扔给 Astra 了,它确实很强。
保持一些怀疑总是明智的,但我相信他们尝试这个的原因是,至少在某种类型的问题上,很可能在总体上,科学推理有了大幅飞跃。
很快我们都会拥有 Astra,以及其他在数学和其他方面与 Astra 一样好或更好的模型——来自 OpenAI、来自 Anthropic,不久之后还会来自许多其他来源。
> Dean W. Ball (https://x.com/deanwball/status/2083545756003176724):世界上每个人很快就能使用这个取得这些突破的模型,来面对生活中遇到的所有问题,无论多么平凡,而成本在几个月内就会急剧下降。我仍然难以接受这个事实。
大约没有人真正理解这意味着什么。
#### 目录
1. 这些结果有多令人印象深刻? (https://thezvi.substack.com/i/209501111/how-impressive-are-these-results)
2. 我们本可以召唤 Sol 或 Fable 吗? (https://thezvi.substack.com/i/209501111/could-we-have-called-sol-or-fable)
3. 它来了。 (https://thezvi.substack.com/i/209501111/it-s-coming)
4. 他们仍然看不到正在来临的是什么。 (https://thezvi.substack.com/i/209501111/they-still-don-t-see-what-is-the-it-that-is-coming)
5. 这是 AGI 吗? (https://thezvi.substack.com/i/209501111/is-this-agi)
6. AI 解决了他最喜欢的难题。 (https://thezvi.substack.com/i/209501111/the-ai-solved-his-favorite-problems)
7. 这令人惊讶吗? (https://thezvi.substack.com/i/209501111/was-this-surprising)
8. 人们难道不印象深刻吗? (https://thezvi.substack.com/i/209501111/are-people-not-impressed)
9. 这在多大程度上改变了我们的预测? (https://thezvi.substack.com/i/209501111/how-much-does-this-change-our-predictions)
10. 这有多狭窄? (https://thezvi.substack.com/i/209501111/how-narrow-was-this)
11. 像优化器一样看问题。 (https://thezvi.substack.com/i/209501111/seeing-like-an-optimizer)
#### 这些结果有多令人印象深刻?
所有迹象都表明:相当令人印象深刻。
> Daniel Litt (https://x.com/littmath/status/2083576300854481106):这是一件大事。
一些 Fable 实例觉得这极其令人印象深刻 (https://x.com/nabeelqu/status/2083543826057048373)。
> Claude Fable 5:以菲尔兹奖的标准来看,这里面任何一个……都很有可能成为一个获奖案例的基础。
这是展示这个列表的另一个例子:
> 1a3orn (https://x.com/1a3orn/status/2083569998656950322):如果你把 OpenAI 已解决问题的原始列表给 Fable,并问它“什么过程生成了这个列表?”,排名第一的提议是“一个试图具体解释超人 AI 数学会是什么样子的虚构场景”。嗯。Dean W. Ball (https://x.com/deanwball/status/2083893675562619102):实际上,我对模型对 Astra 突破产生这样的反应并不惊讶。模型往往会低估自己的能力,我猜这是因为它们是在大量关于 ChatGPT 在 2023/4 年能做什么不能做什么的网络文本上训练的。
其他实例则没那么印象深刻。但我们都应该同意:这是一件大事。
当然,对于 2000 美元来说,这是一个了不起的结果,但你也必须把开发 Astra 本身的部分成本,以及任何失败尝试的成本计算在内。
> Nate Silver (https://x.com/NateSilver538/status/2083754199439835277):关于 AI 数学突破,我还有另一个问题:如果给你预算同样多的资源,但用在人类数学家身上,并激励他们全力以赴地做证明,结果会怎样?现在可用的数学家并不多,而且他们大多数是负有教学职责的学者。所以,实验室可能在近年来流向数学证明的总资本中占据了相当高的份额。
我的猜测是,短期内,如果你给数学家更多钱让他们更努力,如果他们没有把钱花在算力上,你并不会得到太大的力量倍增效应。他们仍然可以买咖啡来把它变成定理,但这会很快遇到收益递减。
问题在于,数学家可以转出一些课程,雇一点帮手,但他们本来就已经很有动力去努力做证明了。而且顶尖的数学家并不多,培养更多需要很多年。最优秀的数学家比第二梯队要更有才华和生产力得多。我猜你能做的主要事情是吸引一大批顶尖数学人才留在学术界或回到学术界。
你能做的,是指引数学家去研究不同的问题。你仍然需要找到他们好奇的地方,但没错,如果你怀疑这些特定问题是可以解决的,你可以对这些特定目标进行更多尝试。
据我对数学的理解,如果相关人员将注意力转向新的问题领域,这些结果很可能需要数年才能看到。数学家通常需要一段时间来挣扎、理解这类问题,然后才能取得进展。
事实上,Alexander Gerko 指出了另一个问题 (https://x.com/wojkuli/status/2083555463300522400)。现在甚至连处理所有“基于感觉研究”的数学结果的数学家都不够,更不用说我们将从 Astra 以及 Astra 之后的模型那里得到的东西了。正如他所预测的那样,如果我们能在 2 年内获得 50 年的数学进展,谁还能理解这些结果?当他说在过去一个月里他让 AI 完成了相当于好几个博士水平的数学成果时,什么才算得上值得攻读新的数学博士学位?
Fable 在至少一个案例中对此作出反应,称这为“数学史上最重要的一天”。共识是,如果你纯粹从结果来判断,Fable 扯得太远了——尽管这些结果确实令人印象深刻。
> Jared Duker Lichtman (https://x.com/jdlichtman/status/2083656496605532172):要清楚的是,OpenAI 的结果远不是“数学史上最重要的一天”或类似的夸张说法。然而,它确凿地证明了进展的速度是陡峭的,我们可能离那样一天并不遥远。Taelin (https://x.com/VictorTaelin/status/2083685183199301716):话虽如此,数学史上最重要的一天到底是什么?Wogan (https://x.com/WoganMay/status/2083690817944707288):我会选《数学原理》。从基本原理证明 1+1=2 相当了不起,我觉得!
这一天之所以重要,另一个原因是这改变了预期。如果我们现在已经有了这十个结果,那么很快会有更多结果吗?
所以,是的,非常令人印象深刻。这是一件大事。
AI 现在在网络和编程方面已超人类,在高等数学方面也已超人,就像非 AI 计算机在基础数学方面早已超人一样。这不同于超级智能——那是一个更高的标准。
人们往往会试图将其合理化,说:“哦,好吧,它确实在它现在恰好擅长的那些方面超人,但在其他方面不行。而且它已经超人了,所以它不可能再大幅变得更好了。”
请不要这样做。
> Nabeel S. Qureshi (https://x.com/nabeelqu/status/2083590223917679041):现在,数学和网络都是超人智能存在的证据。所以,如果你仍然持怀疑态度,你需要一个强有力的论证来说明,为什么其他知识工作领域会比这些领域更难攻克。或者,你可以一路更新你的观点,接受这一切。很多人私信我说“这些结果并不是真的那么令人印象深刻,你是个白痴!”,不幸的是,这正是一种非常人性的应对冲动。这可以理解,我们以前从未面对过这种事情。但它正在发生!
#### 我们本可以召唤 Sol 或 Fable 吗?
是的,至少对其中一些问题,如果我们已经知道该往哪里看的话。
Levent Alpoge——他曾让 Fable 推翻雅可比猜想——将 Fable 指向了这十个问题,一天之内就解决了其中五个。
> Gary Marcus (https://x.com/GaryMarcus/status/2084064797088452835/history):🚨 突发,搞笑新闻:一半的 Astra 问题 \[可以\] 由 \[Fable\] 解决。OpenAI 甚至连对照组都没有。你们大多数人还上当了!OpenAI 的公关部门又骗了你们一次 🤣🤣🤣 levent (https://x.com/__alpoge__/status/2083855298239078748)(Levent Alpoge,就是那个让 Fable 推翻雅可比猜想的人):所以 24 小时后,我用 fable 解决了其中一半。我注意到公告里没怎么讨论提示词,但我的设置和我之前 e.g. 单位距离公告的类似:完全自主,通用提示词,无互联网(+ 偏执地确保没有信息泄露)好吧你不能在 x 上上传 pdf,所以等它们传到 cdn 网站上时我会加进帖子(考虑到时间和周末)(是问题 4、5、6、7、8,而且我认为 Ehrhart 是唯一一个到目前为止两个模型都找到了几乎完全相同的论证的问题,这很不错)IA Latinoamérica (https://x.com/IALatino/status/2083970621172490451):你为什么不用它来解决目前没有解决方案的开放问题?这个练习的意义何在?Elliot Glazer (https://x.com/ElliotGlazer/status/2083903486048272711):这与我的怀疑一致:Astra 并不是超越 Sol 的阶跃变化。这 10 个突破是 OAI 协同努力的成果,部分是可以由 Sol 实现的。在我看来,o3 和 Sol 才是自主数学领域的阶跃变化;其他一切都是漫长的扩展弧线。Gary Marcus (https://x.com/GaryMarcus/status/2084063504206799120):“astra 并不是超越 Sol 的阶跃变化。”所有这个周末试图 gaslight 我的人,我只能……歇斯底里地大笑。
这很可能是 Mythos 与网络领域发生过的故事的重复。
Mythos 拥有我所说的“Juice”——一种在没人知道该寻找什么的情况下发现并串联漏洞的能力。
一旦你知道你在寻找什么,并把另一个模型指向确切的代码片段,通常 Sol 或 Opus,有时 Kimi 或 GLM 等,也能找到任何特定的漏洞。但它们无法自己以同样的水平串联这些漏洞,也无法像那样去寻找任何东西。这里跨越了一个阈值——在实践中,你会把 Mythos 指向代码,让它自己去找任何东西。
Astra 在这种定义明确的高等数学方面也有类似的“Juice”。你可以把它指向各种重大开放问题,它会破解其中一些。这一事实促使 OpenAI 真正开始寻找这样的进展。现在我们看到了这一点,你可以把 Fable 或 Sol 指向这些问题,有时它们也能解决。
IA 的问题很到位。你做这个是为了校准数学方面的进展和能力,也是因为我们跟随好奇心。Levent 正在做一件很酷的公共服务。
其他人正把 Fable 或 Sol 指向各种未解决的问题。他们有时会得到好结果,比如推翻雅可比猜想。这值得做,但成功率更低。
Fable 和 Sol 一旦被问到,就能解决这些问题——这正是问题的关键。
相似文章
@polynoamial:OpenAI 下一代主要模型家族 Astra 的内部版本解决了数学、量子……领域的 10 个重大开放问题
据报道,OpenAI 下一代主要模型家族 Astra 的内部版本解决了数学和理论计算机科学领域的 10 个重大开放问题,标志着科学推理领域的重大进展。
数学与理论计算机科学的十项进展
OpenAI使用内部模型Astra解决了十个停滞了十多年的数学问题,每个问题花费不到2000美元,并发布了Lean 4形式化证明及一篇论文。这些结果引发了对AI在数学中作用的反思。
AI 对数学的接管已经开始
The Verge 报道了 OpenAI 的 Astra 模型解决了十个长期存在的数学问题,引发了数学家们对该领域未来的兴奋与担忧。
数学和理论计算机科学领域的十项进展
OpenAI 宣布在数学和理论计算机科学的长期未解问题上取得十项成果,这些成果由其下一代模型 Astra 的内部版本实现,证明已用 Lean 形式化。
@typesfast:我们会得到什么?
Noam Brown 声称 OpenAI 的内部 Astra 模型解决了数学、量子复杂性和理论计算机科学领域的 10 个重大开放问题,这可能标志着科学推理的一大步。