我们比较了不同LLM在IMO 2026上的表现 [R]
摘要
本研究评估了前沿和开放权重LLM在IMO 2026题目上的表现,证明像AutoFyn这样的专用工具链能显著提升次前沿模型的性能,不过在最难的题目上仍然存在幻觉问题。
国际数学奥林匹克竞赛(IMO)的题目之所以是LLM的良好基准,有几个原因:
- 题目都是全新的,不在任何模型的训练数据中
- 高难度数学题是通用智能能力的一个很好代理指标
- 这些是多步复杂任务,可以从编排/工具链工程中受益
结果:无论使用何种工具链,前沿模型(sol 和 fable)都能获得满分或接近满分。对于 sonnet 和 opus 而言,网页应用的性能相当差,供应商工具链(claude code)有所改善,而我们开发的可定制多智能体工具链 AutoFyn 进一步提升了性能。即使使用了工具链,我们也无法达到前沿模型的性能水平。开放权重模型 GLM 在没有工具链的情况下与 sonnet 大致相当,并且使用 AutoFyn 后同样得到改善。具体分数见下文所附论文。 https://preview.redd.it/fy4ayale5nfh1.png?width=2155&format=png&auto=webp&s=040e466171a2f9480d4d6578b34f4d930b41e292 评分由另一个前沿模型以及人工验证完成(我们是前IMO奖牌得主,能够进行合理性验证)。存在模型声称虚假解答的情况(例如,sonnet 在 P3 上),因此幻觉问题在数学这样的可验证领域仍然存在。在最难的问题上:每个次前沿模型在所有工具链中都漏掉了 P3 的关键约化,包括一次20小时的运行—该运行证明了其他所有内容,但在完全相同的步骤上卡住了。工具链提供了检索和验证,但没有提供解题所需的关键思路。
论文: https://github.com/SignalPilot-Labs/AutoFyn/blob/main/results/imo-2026/autofyn-beyond-model-imo26-report.pdf
审计追踪: https://github.com/SignalPilot-Labs/AutoFyn/tree/main/results/imo-2026
相似文章
@enginenerdx: 同一模型,三块奖牌:Sonnet 5 在网页界面上的IMO得分为14/42,在Claude Code中为21,在结构化多智能体框架中为35…
一项比较显示,LLM在2026年IMO上的表现因评估框架的不同而有巨大差异,结构化多智能体设置比简单网页界面获得的分数高得多,表明当前收益在前沿被更好的编排所吸收。
估计开放权重大型语言模型的最坏情况前沿风险
OpenAI 研究人员通过在生物学和网络安全领域进行恶意微调(MFT)来研究发布开放权重大型语言模型的最坏情况前沿风险,发现开放权重模型的表现不如前沿闭源模型,且不会显著提升有害能力。
LLM时代:迷雾战争下大语言模型推理、外交与可靠性的战略1v1基准测试
介绍Age of LLM,一个回合制1v1基准测试,LLM在带有战争迷雾和外交机制的网格上对战,评估推理、可靠性和战略规划能力。结果显示核速攻战术占主导,且可靠性与获胜之间存在弱关联。
基准是否低估了 LLM 的性能?采用以大语言模型为先、人工仲裁的评估方法评估幻觉检测
本文通过采用以大语言模型为先、人工仲裁的评估方法重新评估幻觉检测数据集,研究了标准基准是否低估了大语言模型(LLM)的性能。研究发现,在仲裁过程中融入大语言模型的推理能力可以提高评估的一致性,并表明针对容易产生歧义的任务,采用模型辅助的重新评估能产生更可靠的基准。
行动之前:面向前瞻性假设发现的LLM基准测试
本文介绍了HypoArena,这是一个用于评估LLMs从非完整证据中主动构建假设空间能力的基准,在15个前沿LLM上的实验揭示了能力分层。