@MaxForAI: 一个残酷的事实,AI的数学能力已经超过这个世界上99%的人类了。 @MenloVentures 合伙人,曾投资了Anthropic、OpenRouter的Deedy @deedydas 进行了一次测试。 他用刚结束的2026 年国际数学奥…
摘要
AI模型Fable、Sol、K3和Axiom在2026年国际数学奥林匹克竞赛中全部取得满分42/42的成绩,首次完全解决了该竞赛,且成本低廉。其中Claude Fable 5速度最快,GPT 5.6 Sol成本最低。
查看缓存全文
缓存时间: 2026/07/21 16:46
一个残酷的事实,AI的数学能力已经超过这个世界上99%的人类了。
@MenloVentures 合伙人,曾投资了Anthropic、OpenRouter的Deedy @deedydas 进行了一次测试。
他用刚结束的2026 年国际数学奥林匹克竞赛(IMO)的原题让AI来测试。
这是世界范围内面向高中生最难的数学竞赛,之前还作为最常用的测试之一来评测AI模型的数学能力。
他让 Fable(高配置)、Sol(超高配置)、K3(最大配置)和 Axiom 参与了此次竞赛,它们均取得了 42/42 的满分成绩。
作为参考,在过去7年的比赛中,共有4347位人类选手参加,仅有30人获得满分42分,比例是0.69%。
— Claude Fable 5 仅用一次尝试便解出所有题目,且速度最快。 — GPT 5.6 Sol 多花了一次尝试,但成本最低。 — Kimi K3 做到了,但多花了 4 次尝试,并且消耗了大量 token。
根据尝试次数和 token 数量判断,第3题和 第6题最难,其次是第2题。
人类学生们有 9 小时来解决这 6 道题,而 Fable 和 Sol 均在 4 小时内完成。
这是国际数学奥林匹克(IMO)首次被彻底解决。
去年,表现最佳的模型是尚未发布的 Gemini Deep Think 和一个实验性的 OpenAI 模型,两者均取得了 35/42 的成绩。
今年,包括一个即将开源权重的模型(K3)在内的三个面向公众开放的模型,仅以 10 至 50 美元的成本就做到了这一点!
人工智能的能力已正式远远超越了国际数学奥林匹克竞赛的水平。
Deedy (@deedydas): The International Math Olympiad (IMO) 2026, the hardest math contest for high schoolers, just ended.
I ran Fable (high), Sol (xhigh), K3 (max) and Axiom against it and all got a perfect score of 42/42 (repo below if you want to check their solutions): — Claude Fable 5 was the
相似文章
@paperpaper886: 上周有和数学系的朋友讨论过AI4Math的现状和未来,他说现在的AI作为辅助工具已经足够强大,但如果AI要做独立自主的discovery还有一段路要走
讨论了AI在数学领域的现状与未来,引用事例称ChatGPT 5.5 Pro自主解决了高维计算几何中死卡多年的最远点对问题,显示AI在数学发现上的潜力。
@VraserX: 你实在无法过度吹嘘这个。GPT-5.6 Sol Ultra,这是一个公开可用的AI,刚刚破解了一个50年未解的数学猜想……
GPT-5.6 Sol Ultra,一个公开可用的AI模型,在一小时内破解了一个50年未解的数学猜想,这表明AI可能在未来十年内解决数学问题。
@MaxForAI: 田渊栋 @tydsh 的创业团队Recursive @Recursive_SI 发布了一个阶段性的成果:自动化AI研究系统 这个系统里AI能自己完成「提出想法→实现→跑实验→验证→根据结果选下一个实验」这一整套研究循环。 结果表明在目标清…
Recursive团队发布自动化AI研究系统,能自主完成研究循环,在多个基准上超越人类社区已有方案,如在NanoGPT Speedrun中将训练时间从79.7秒压缩至77.5秒,在SOL-ExecBench上将得分提升至0.754。
@FinanceYF5: 1/ AI 竞争的新护城河:速度 截至 2026/5/30,OpenAI 重大模型平均 51.8 天一更,Anthropic 59.8 天,Google 75.8 天。 差距不只在 benchmark,也在迭代节奏。
截至2026年5月30日,OpenAI重大模型平均51.8天更新一次,Anthropic 59.8天,Google 75.8天,指出AI竞争不仅在于benchmark,还在于迭代速度。
@FinanceYF5: OpenAI 的模型刚刚干了一件大事:独立攻克了 Erdős 1946 年提出的“平面单位距离问题”。 80 年来大家以为最优解像网格,结果 AI 找到了更优的新构造。 AI 首次自主解决数学核心开放问题,历史性突破。
OpenAI的模型独立解决了Erdős在1946年提出的平面单位距离问题,这是AI首次自主解决数学核心开放问题,具有历史性意义。