@enginenerdx: 同一模型,三块奖牌:Sonnet 5 在网页界面上的IMO得分为14/42,在Claude Code中为21,在结构化多智能体框架中为35…
摘要
一项比较显示,LLM在2026年IMO上的表现因评估框架的不同而有巨大差异,结构化多智能体设置比简单网页界面获得的分数高得多,表明当前收益在前沿被更好的编排所吸收。
查看缓存全文
缓存时间: 2026/07/25 14:06
同一模型,三种奖牌:Sonnet 5 在网页界面下IMO得分14/42,在Claude Code中得21分,在结构化多智能体测试框架下得35分。增益在前沿被吸收——对于真正新颖的题目,测试框架依然决定奖牌归属。https://t.co/VgJZzrkUaC
Tarik Moon 🏔 (@TarikMoon): 过去几天我让五个大语言模型在三种测试框架下参加了2026年IMO。结果改变了我对AI进步究竟源自何处的看法。
首先,每个人都在期待的头条新闻:GPT-5.6 Sol 和 Claude Fable 5 都获得了完美的42/42满分。在前沿,
相似文章
我们比较了不同LLM在IMO 2026上的表现 [R]
本研究评估了前沿和开放权重LLM在IMO 2026题目上的表现,证明像AutoFyn这样的专用工具链能显著提升次前沿模型的性能,不过在最难的题目上仍然存在幻觉问题。
@kapicode: 我一直在使用 Claude 作为“人类”来提示 @opencode 以重建参考项目,在同一测试平台上评估了四款 LLM…
一项针对四款大语言模型(Qwen、MiniMax、GLM)的评估显示,当使用 Claude 作为 Opencode 智能体工具的提示器时,一个较小的本地模型(运行在 3090 显卡上的 Qwen 27B)在代码质量与可靠性方面表现优于更大的剪枝模型。
新LLM协调基准 - 在语言智能体中评估开放式多智能体协调 [R]
介绍了一个用于评估LLMs中多智能体协调的新基准,发现大多数模型在处理长期开放式任务时表现不佳,但Gemini 3.1 Pro在最具挑战性的设置下表现与经过训练的MARL智能体相当。
我让55个LLM互相盲评(22k条评价,全部公开)。每个有足够数据的模型家族都偏向自家兄弟。Qwen的评委给Qwen加分约0.9分。Mistral给自己的扣分约1.0分。
一个包含55个LLM互相盲评的公开评估设置揭示了8个模型家族中统计显著的同类家族评分偏差,其中Mistral对自己模型的扣分最为严重。该研究指出了聚合排行榜的问题,并提出了改进方法,如使用响应内混合效应模型。
@polynoamial: https://x.com/polynoamial/status/2064210146558136827
本文认为,LLM基准测试性能越来越依赖于测试时的计算量,而当前的评估方法在控制推理预算时无法捕捉到能力的提升。它主张绘制性能与token数、成本或时间的关系图,并讨论了对安全评估的影响。