我们比较了不同LLM在IMO 2026上的表现 [R]

Reddit r/MachineLearning 论文

摘要

本研究评估了前沿和开放权重LLM在IMO 2026题目上的表现,证明像AutoFyn这样的专用工具链能显著提升次前沿模型的性能,不过在最难的题目上仍然存在幻觉问题。

国际数学奥林匹克竞赛(IMO)的题目之所以是LLM的良好基准,有几个原因: - 题目都是全新的,不在任何模型的训练数据中 - 高难度数学题是通用智能能力的一个很好代理指标 - 这些是多步复杂任务,可以从编排/工具链工程中受益 结果:无论使用何种工具链,前沿模型(sol 和 fable)都能获得满分或接近满分。对于 sonnet 和 opus 而言,网页应用的性能相当差,供应商工具链(claude code)有所改善,而我们开发的可定制多智能体工具链 AutoFyn 进一步提升了性能。即使使用了工具链,我们也无法达到前沿模型的性能水平。开放权重模型 GLM 在没有工具链的情况下与 sonnet 大致相当,并且使用 AutoFyn 后同样得到改善。具体分数见下文所附论文。 https://preview.redd.it/fy4ayale5nfh1.png?width=2155&format=png&auto=webp&s=040e466171a2f9480d4d6578b34f4d930b41e292 评分由另一个前沿模型以及人工验证完成(我们是前IMO奖牌得主,能够进行合理性验证)。存在模型声称虚假解答的情况(例如,sonnet 在 P3 上),因此幻觉问题在数学这样的可验证领域仍然存在。在最难的问题上:每个次前沿模型在所有工具链中都漏掉了 P3 的关键约化,包括一次20小时的运行—该运行证明了其他所有内容,但在完全相同的步骤上卡住了。工具链提供了检索和验证,但没有提供解题所需的关键思路。 论文: https://github.com/SignalPilot-Labs/AutoFyn/blob/main/results/imo-2026/autofyn-beyond-model-imo26-report.pdf 审计追踪: https://github.com/SignalPilot-Labs/AutoFyn/tree/main/results/imo-2026
查看原文

相似文章

估计开放权重大型语言模型的最坏情况前沿风险

OpenAI Blog

OpenAI 研究人员通过在生物学和网络安全领域进行恶意微调(MFT)来研究发布开放权重大型语言模型的最坏情况前沿风险,发现开放权重模型的表现不如前沿闭源模型,且不会显著提升有害能力。

基准是否低估了 LLM 的性能?采用以大语言模型为先、人工仲裁的评估方法评估幻觉检测

arXiv cs.CL

本文通过采用以大语言模型为先、人工仲裁的评估方法重新评估幻觉检测数据集,研究了标准基准是否低估了大语言模型(LLM)的性能。研究发现,在仲裁过程中融入大语言模型的推理能力可以提高评估的一致性,并表明针对容易产生歧义的任务,采用模型辅助的重新评估能产生更可靠的基准。