imo

标签

Cards List
#imo

我们比较了不同LLM在IMO 2026上的表现 [R]

Reddit r/MachineLearning · 5天前

本研究评估了前沿和开放权重LLM在IMO 2026题目上的表现,证明像AutoFyn这样的专用工具链能显著提升次前沿模型的性能,不过在最难的题目上仍然存在幻觉问题。

0 人收藏 0 人点赞
#imo

@enginenerdx: 同一模型,三块奖牌:Sonnet 5 在网页界面上的IMO得分为14/42,在Claude Code中为21,在结构化多智能体框架中为35…

X AI KOLs Timeline · 6天前 缓存

一项比较显示,LLM在2026年IMO上的表现因评估框架的不同而有巨大差异,结构化多智能体设置比简单网页界面获得的分数高得多,表明当前收益在前沿被更好的编排所吸收。

0 人收藏 0 人点赞
#imo

@MaxForAI: 一个残酷的事实,AI的数学能力已经超过这个世界上99%的人类了。 @MenloVentures 合伙人,曾投资了Anthropic、OpenRouter的Deedy @deedydas 进行了一次测试。 他用刚结束的2026 年国际数学奥…

X AI KOLs Timeline · 2026-07-21 缓存

AI模型Fable、Sol、K3和Axiom在2026年国际数学奥林匹克竞赛中全部取得满分42/42的成绩,首次完全解决了该竞赛,且成本低廉。其中Claude Fable 5速度最快,GPT 5.6 Sol成本最低。

0 人收藏 0 人点赞
#imo

@ChrisHayduk: https://x.com/ChrisHayduk/status/2076196217109746095

X AI KOLs Timeline · 2026-07-12 缓存

本文比较了两种用于数学问题求解的AI方法:DeepMind的AlphaProof,它在Lean证明语言中使用强化学习;以及OpenAI的原始大型语言模型,该模型在没有正式方法的情况下在2025年国际数学奥林匹克竞赛中获得金牌。

0 人收藏 0 人点赞
#imo

@vista8: https://x.com/vista8/status/2072191315916538039

X AI KOLs Timeline · 2026-07-01 缓存

文章从伽罗瓦的群论故事切入,深入探讨了AI在数学领域的能力边界,区分了“连接闪电”(跨领域连接)和“建造山峰”(创造新框架)两种进展类型,分析了RLVR训练方法的局限性,并提出了“可磨性”概念来解释AI在数学和代码上的快速进步。

0 人收藏 0 人点赞
#imo

Maxproof

Hacker News Top · 2026-06-12 缓存

MaxProof 引入了一种测试时缩放框架,该框架结合了证明生成、验证和修复,使用生成-验证器强化学习,使 M3 模型在 IMO 2025 和 USAMO 2026 上超过了人类金牌阈值。

0 人收藏 0 人点赞
#imo

Gemini 3.2 Flash 能够解答 IMO 2025 第6题。目前只有 GPT-5.5-Pro 可以在没有任何脚手架或工程框架的情况下解答此题。

Reddit r/singularity · 2026-05-18

Gemini 3.2 Flash 可以解答 IMO 2025 第6题,但只有 GPT-5.5-Pro 能够在没有脚手架或工程框架的情况下完成。

0 人收藏 0 人点赞
#imo

MIT 与 IMO 发布 MathNet:全球最大国际数学奥林匹克题库与解答数据集,规模达以往 5 倍,覆盖 40 余国、40 年历程

Reddit r/LocalLLaMA · 2026-04-22

MIT 与 IMO 联合推出 MathNet,汇集 40 多国、40 年国际数学奥林匹克赛题与详解,数据量较现有数据集扩大 5 倍。

0 人收藏 0 人点赞
#imo

Gemini 高级版本配合 Deep Think 在国际数学奥林匹克竞赛中正式达到金牌标准

Google DeepMind Blog · 2025-10-24 缓存

Google DeepMind 的高级 Gemini 配合 Deep Think 在 2025 年国际数学奥林匹克竞赛中达到金牌标准,在竞赛时间限制内以自然语言端到端操作,解答了 6 道题目中的 5 道,获得 35 分——相比去年的银牌成绩取得了重大进步。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈