@MaxForAI: 一个残酷的事实,AI的数学能力已经超过这个世界上99%的人类了。 @MenloVentures 合伙人,曾投资了Anthropic、OpenRouter的Deedy @deedydas 进行了一次测试。 他用刚结束的2026 年国际数学奥…
摘要
AI模型Fable、Sol、K3和Axiom在2026年国际数学奥林匹克竞赛中全部取得满分42/42的成绩,首次完全解决了该竞赛,且成本低廉。其中Claude Fable 5速度最快,GPT 5.6 Sol成本最低。
查看缓存全文
缓存时间: 2026/07/21 16:46
一个残酷的事实,AI的数学能力已经超过这个世界上99%的人类了。
@MenloVentures 合伙人,曾投资了Anthropic、OpenRouter的Deedy @deedydas 进行了一次测试。
他用刚结束的2026 年国际数学奥林匹克竞赛(IMO)的原题让AI来测试。
这是世界范围内面向高中生最难的数学竞赛,之前还作为最常用的测试之一来评测AI模型的数学能力。
他让 Fable(高配置)、Sol(超高配置)、K3(最大配置)和 Axiom 参与了此次竞赛,它们均取得了 42/42 的满分成绩。
作为参考,在过去7年的比赛中,共有4347位人类选手参加,仅有30人获得满分42分,比例是0.69%。
— Claude Fable 5 仅用一次尝试便解出所有题目,且速度最快。 — GPT 5.6 Sol 多花了一次尝试,但成本最低。 — Kimi K3 做到了,但多花了 4 次尝试,并且消耗了大量 token。
根据尝试次数和 token 数量判断,第3题和 第6题最难,其次是第2题。
人类学生们有 9 小时来解决这 6 道题,而 Fable 和 Sol 均在 4 小时内完成。
这是国际数学奥林匹克(IMO)首次被彻底解决。
去年,表现最佳的模型是尚未发布的 Gemini Deep Think 和一个实验性的 OpenAI 模型,两者均取得了 35/42 的成绩。
今年,包括一个即将开源权重的模型(K3)在内的三个面向公众开放的模型,仅以 10 至 50 美元的成本就做到了这一点!
人工智能的能力已正式远远超越了国际数学奥林匹克竞赛的水平。
Deedy (@deedydas): The International Math Olympiad (IMO) 2026, the hardest math contest for high schoolers, just ended.
I ran Fable (high), Sol (xhigh), K3 (max) and Axiom against it and all got a perfect score of 42/42 (repo below if you want to check their solutions): — Claude Fable 5 was the
相似文章
@paperpaper886: 上周有和数学系的朋友讨论过AI4Math的现状和未来,他说现在的AI作为辅助工具已经足够强大,但如果AI要做独立自主的discovery还有一段路要走
讨论了AI在数学领域的现状与未来,引用事例称ChatGPT 5.5 Pro自主解决了高维计算几何中死卡多年的最远点对问题,显示AI在数学发现上的潜力。
@VraserX: 你实在无法过度吹嘘这个。GPT-5.6 Sol Ultra,这是一个公开可用的AI,刚刚破解了一个50年未解的数学猜想……
GPT-5.6 Sol Ultra,一个公开可用的AI模型,在一小时内破解了一个50年未解的数学猜想,这表明AI可能在未来十年内解决数学问题。
@MaxForAI: 田渊栋 @tydsh 的创业团队Recursive @Recursive_SI 发布了一个阶段性的成果:自动化AI研究系统 这个系统里AI能自己完成「提出想法→实现→跑实验→验证→根据结果选下一个实验」这一整套研究循环。 结果表明在目标清…
Recursive团队发布自动化AI研究系统,能自主完成研究循环,在多个基准上超越人类社区已有方案,如在NanoGPT Speedrun中将训练时间从79.7秒压缩至77.5秒,在SOL-ExecBench上将得分提升至0.754。
@FinanceYF5: 这个结论可能会让市场感到意外:实际上,OpenAI 的增长速度已经超过 Anthropic。 Ramp 数据显示,Q3 至今两者环比增长分别为【82% 和 76%】。 为什么? GPT-5.6 Sol 正在成为更多开发者的选择;Fable…
OpenAI 的增长速度超过 Anthropic,Q3 环比增长分别为 82% 和 76%,主要由于 GPT-5.6 Sol 更受开发者欢迎,而 Fable 5 因成本和数据问题采用不及预期。
@FinanceYF5: 1/ AI 竞争的新护城河:速度 截至 2026/5/30,OpenAI 重大模型平均 51.8 天一更,Anthropic 59.8 天,Google 75.8 天。 差距不只在 benchmark,也在迭代节奏。
截至2026年5月30日,OpenAI重大模型平均51.8天更新一次,Anthropic 59.8天,Google 75.8天,指出AI竞争不仅在于benchmark,还在于迭代速度。