@enginenerdx: 同一模型,三块奖牌:Sonnet 5 在网页界面上的IMO得分为14/42,在Claude Code中为21,在结构化多智能体框架中为35…

X AI KOLs Timeline 新闻

摘要

一项比较显示,LLM在2026年IMO上的表现因评估框架的不同而有巨大差异,结构化多智能体设置比简单网页界面获得的分数高得多,表明当前收益在前沿被更好的编排所吸收。

同一模型,三块奖牌:Sonnet 5 在网页界面上IMO得分为14/42,在Claude Code中为21,在结构化多智能体框架中为35。收益在前沿被吸收——对于真正新颖的问题,仍然是框架决定奖牌。https://t.co/VgJZzrkUaC
查看原文
查看缓存全文

缓存时间: 2026/07/25 14:06

同一模型,三种奖牌:Sonnet 5 在网页界面下IMO得分14/42,在Claude Code中得21分,在结构化多智能体测试框架下得35分。增益在前沿被吸收——对于真正新颖的题目,测试框架依然决定奖牌归属。https://t.co/VgJZzrkUaC

Tarik Moon 🏔 (@TarikMoon): 过去几天我让五个大语言模型在三种测试框架下参加了2026年IMO。结果改变了我对AI进步究竟源自何处的看法。

首先,每个人都在期待的头条新闻:GPT-5.6 Sol 和 Claude Fable 5 都获得了完美的42/42满分。在前沿,

相似文章

我们比较了不同LLM在IMO 2026上的表现 [R]

Reddit r/MachineLearning

本研究评估了前沿和开放权重LLM在IMO 2026题目上的表现,证明像AutoFyn这样的专用工具链能显著提升次前沿模型的性能,不过在最难的题目上仍然存在幻觉问题。

我让55个LLM互相盲评(22k条评价,全部公开)。每个有足够数据的模型家族都偏向自家兄弟。Qwen的评委给Qwen加分约0.9分。Mistral给自己的扣分约1.0分。

Reddit r/LocalLLaMA

一个包含55个LLM互相盲评的公开评估设置揭示了8个模型家族中统计显著的同类家族评分偏差,其中Mistral对自己模型的扣分最为严重。该研究指出了聚合排行榜的问题,并提出了改进方法,如使用响应内混合效应模型。

@polynoamial: https://x.com/polynoamial/status/2064210146558136827

X AI KOLs Following

本文认为,LLM基准测试性能越来越依赖于测试时的计算量,而当前的评估方法在控制推理预算时无法捕捉到能力的提升。它主张绘制性能与token数、成本或时间的关系图,并讨论了对安全评估的影响。