@MaxForAI: 一个残酷的事实,AI的数学能力已经超过这个世界上99%的人类了。 @MenloVentures 合伙人,曾投资了Anthropic、OpenRouter的Deedy @deedydas 进行了一次测试。 他用刚结束的2026 年国际数学奥…

X AI KOLs Timeline 新闻

摘要

AI模型Fable、Sol、K3和Axiom在2026年国际数学奥林匹克竞赛中全部取得满分42/42的成绩,首次完全解决了该竞赛,且成本低廉。其中Claude Fable 5速度最快,GPT 5.6 Sol成本最低。

一个残酷的事实,AI的数学能力已经超过这个世界上99%的人类了。 @MenloVentures 合伙人,曾投资了Anthropic、OpenRouter的Deedy @deedydas 进行了一次测试。 他用刚结束的2026 年国际数学奥林匹克竞赛(IMO)的原题让AI来测试。 这是世界范围内面向高中生最难的数学竞赛,之前还作为最常用的测试之一来评测AI模型的数学能力。 他让 Fable(高配置)、Sol(超高配置)、K3(最大配置)和 Axiom 参与了此次竞赛,它们均取得了 42/42 的满分成绩。 作为参考,在过去7年的比赛中,共有4347位人类选手参加,仅有30人获得满分42分,比例是0.69%。 — Claude Fable 5 仅用一次尝试便解出所有题目,且速度最快。 — GPT 5.6 Sol 多花了一次尝试,但成本最低。 — Kimi K3 做到了,但多花了 4 次尝试,并且消耗了大量 token。 根据尝试次数和 token 数量判断,第3题和 第6题最难,其次是第2题。 人类学生们有 9 小时来解决这 6 道题,而 Fable 和 Sol 均在 4 小时内完成。 这是国际数学奥林匹克(IMO)首次被彻底解决。 去年,表现最佳的模型是尚未发布的 Gemini Deep Think 和一个实验性的 OpenAI 模型,两者均取得了 35/42 的成绩。 今年,包括一个即将开源权重的模型(K3)在内的三个面向公众开放的模型,仅以 10 至 50 美元的成本就做到了这一点! 人工智能的能力已正式远远超越了国际数学奥林匹克竞赛的水平。
查看原文
查看缓存全文

缓存时间: 2026/07/21 16:46

一个残酷的事实,AI的数学能力已经超过这个世界上99%的人类了。

@MenloVentures 合伙人,曾投资了Anthropic、OpenRouter的Deedy @deedydas 进行了一次测试。

他用刚结束的2026 年国际数学奥林匹克竞赛(IMO)的原题让AI来测试。

这是世界范围内面向高中生最难的数学竞赛,之前还作为最常用的测试之一来评测AI模型的数学能力。

他让 Fable(高配置)、Sol(超高配置)、K3(最大配置)和 Axiom 参与了此次竞赛,它们均取得了 42/42 的满分成绩。

作为参考,在过去7年的比赛中,共有4347位人类选手参加,仅有30人获得满分42分,比例是0.69%。

— Claude Fable 5 仅用一次尝试便解出所有题目,且速度最快。 — GPT 5.6 Sol 多花了一次尝试,但成本最低。 — Kimi K3 做到了,但多花了 4 次尝试,并且消耗了大量 token。

根据尝试次数和 token 数量判断,第3题和 第6题最难,其次是第2题。

人类学生们有 9 小时来解决这 6 道题,而 Fable 和 Sol 均在 4 小时内完成。

这是国际数学奥林匹克(IMO)首次被彻底解决。

去年,表现最佳的模型是尚未发布的 Gemini Deep Think 和一个实验性的 OpenAI 模型,两者均取得了 35/42 的成绩。

今年,包括一个即将开源权重的模型(K3)在内的三个面向公众开放的模型,仅以 10 至 50 美元的成本就做到了这一点!

人工智能的能力已正式远远超越了国际数学奥林匹克竞赛的水平。

Deedy (@deedydas): The International Math Olympiad (IMO) 2026, the hardest math contest for high schoolers, just ended.

I ran Fable (high), Sol (xhigh), K3 (max) and Axiom against it and all got a perfect score of 42/42 (repo below if you want to check their solutions): — Claude Fable 5 was the

相似文章

@MaxForAI: 田渊栋 @tydsh 的创业团队Recursive @Recursive_SI 发布了一个阶段性的成果:自动化AI研究系统 这个系统里AI能自己完成「提出想法→实现→跑实验→验证→根据结果选下一个实验」这一整套研究循环。 结果表明在目标清…

X AI KOLs Timeline

Recursive团队发布自动化AI研究系统,能自主完成研究循环,在多个基准上超越人类社区已有方案,如在NanoGPT Speedrun中将训练时间从79.7秒压缩至77.5秒,在SOL-ExecBench上将得分提升至0.754。