我们比较了不同LLM在IMO 2026上的表现 [R]
摘要
本研究评估了前沿和开放权重LLM在IMO 2026题目上的表现,证明像AutoFyn这样的专用工具链能显著提升次前沿模型的性能,不过在最难的题目上仍然存在幻觉问题。
国际数学奥林匹克竞赛(IMO)的题目之所以是LLM的良好基准,有几个原因:
- 题目都是全新的,不在任何模型的训练数据中
- 高难度数学题是通用智能能力的一个很好代理指标
- 这些是多步复杂任务,可以从编排/工具链工程中受益
结果:无论使用何种工具链,前沿模型(sol 和 fable)都能获得满分或接近满分。对于 sonnet 和 opus 而言,网页应用的性能相当差,供应商工具链(claude code)有所改善,而我们开发的可定制多智能体工具链 AutoFyn 进一步提升了性能。即使使用了工具链,我们也无法达到前沿模型的性能水平。开放权重模型 GLM 在没有工具链的情况下与 sonnet 大致相当,并且使用 AutoFyn 后同样得到改善。具体分数见下文所附论文。 https://preview.redd.it/fy4ayale5nfh1.png?width=2155&format=png&auto=webp&s=040e466171a2f9480d4d6578b34f4d930b41e292 评分由另一个前沿模型以及人工验证完成(我们是前IMO奖牌得主,能够进行合理性验证)。存在模型声称虚假解答的情况(例如,sonnet 在 P3 上),因此幻觉问题在数学这样的可验证领域仍然存在。在最难的问题上:每个次前沿模型在所有工具链中都漏掉了 P3 的关键约化,包括一次20小时的运行—该运行证明了其他所有内容,但在完全相同的步骤上卡住了。工具链提供了检索和验证,但没有提供解题所需的关键思路。
论文: https://github.com/SignalPilot-Labs/AutoFyn/blob/main/results/imo-2026/autofyn-beyond-model-imo26-report.pdf
审计追踪: https://github.com/SignalPilot-Labs/AutoFyn/tree/main/results/imo-2026
相似文章
@enginenerdx: 同一模型,三块奖牌:Sonnet 5 在网页界面上的IMO得分为14/42,在Claude Code中为21,在结构化多智能体框架中为35…
一项比较显示,LLM在2026年IMO上的表现因评估框架的不同而有巨大差异,结构化多智能体设置比简单网页界面获得的分数高得多,表明当前收益在前沿被更好的编排所吸收。
前沿大语言模型是高效的批量优化器:评估推理模型在连续和离散环境中的表现
本文研究评估了前沿大语言模型在连续和离散环境中作为批量优化器的表现,发现它们在数值任务上具有竞争力,但在语义丰富的环境中比传统方法更有效。
HarnessOpt-Bench:评估LLM在Harness优化中的表现
HarnessOpt-Bench是一个基准测试,用于评估LLM在固定评估预算下优化目标智能体周围harness(提示、工具、控制流、记忆和编排代码)的能力。对五个前沿LLM的实验表明,优化器模型之间的差异大于它们所借助的编码harness之间的差异,且仍有很大的改进空间。
估计开放权重大型语言模型的最坏情况前沿风险
OpenAI 研究人员通过在生物学和网络安全领域进行恶意微调(MFT)来研究发布开放权重大型语言模型的最坏情况前沿风险,发现开放权重模型的表现不如前沿闭源模型,且不会显著提升有害能力。
没有中性评测配置:现代LLM排行榜由配置敏感项塑造
本文研究了LLM评估基准对不同评测配置的敏感性,发现配置敏感项对模型间性能差距的影响不成比例,且评测配置的选择可以决定排行榜排名。