我们一直在基准测试中挑选前沿模型,但这些测试条件与我们的实际部署环境并不相符。
摘要
本文突出了 Claude Opus 和 Gemini Pro 在预测基准测试中的性能排名反转,具体取决于模型是自行进行网络搜索还是使用固定的证据。这表明,在研究阶段 Opus 表现出色,而 Gemini 在基于固定证据的判断方面更胜一筹,揭示了标准基准测试与实际部署条件之间的不匹配。
结果表明,Opus 更擅长研究,而 Gemini 更擅长判断!在包含 1,417 道题的预测基准测试中,当每个模型在做出预测前自行进行网络研究时,Opus 的表现更优(Brier 分数 0.131,低于 Gemini 的 0.143)。但当两个模型在每道题上都获得相同的起始研究资料(通过预先收集的文件包)时,Gemini 以相同的幅度胜出(0.141 vs Opus 的 0.153)。这表明 Opus 的优势在于研究阶段:确定搜索什么、阅读哪些页面、关注哪些细节。如果去掉这一环节,Gemini 在固定证据基础上的判断更为敏锐。校准分数也印证了这一点。当 Opus 不再负责自行开展研究时,其校准效果明显下降。而 Gemini 在获得标准化文件包后表现实际上有所提升,暗示其自主代理的研究过程可能遗漏了部分有价值的信息。这种不对称性表明,Opus 可能将其搜索轨迹作为概率分配的基础架构(即,执行搜索循环这一行为本身就在进行一定的认知工作,独立于其获取的信息之外)。
为了厘清这一点,我们在 1,417 道二进制预测问题基准上运行了四种模型:Claude Opus 4.6、GPT-5.4、Gemini 3.1 Pro 和 Grok 4.20。这些问题将在 2025 年 10 月至 12 月间揭晓结果,测试分为两种评估条件:自主代理模式(每个模型使用工具自行进行网络研究)和固定证据模式(每个模型接收相同的约 12,000 字符研究文件包)。需要注意的是,一个局限性在于固定证据文件包本身是由大语言模型(LM)生成的,因此我们测量的可能是各模型对特定标准化证据版本的解读能力,而非抽象意义上的判断力。但这意味着所有四个模型都应朝同一方向偏移。事实并非如此。GPT-5.4 和 Grok 4.20 在不同条件下的表现几乎没有变化,而 Opus 和 Gemini 的排名顺序发生了互换(这与评估系统故障或偏见所产生的结果截然相反)。
我们一直在使用与部署条件不匹配的基准测试来选择前沿模型。据我所知,这是首次直接评估前沿模型,并将其性能分解为研究和判断两个阶段。排名顺序的反转只是这种不匹配的一个具体实例,是我们所测量的部分;很可能还存在其他类似情况。如果你在自部署中发现了类似的分裂现象(检索与综合、摘要与推理,或任何需要模型按顺序执行两项不同任务的场景),我很想听听你的观察和应对措施。
相似文章
开源模型正以约1.5倍于前沿模型的速度缩小与GPT/Claude/Gemini的编码差距,且在去污染基准测试中,一个27B模型已经击败了Claude Opus 4.8 [实时仪表盘 + 分析]
一个实时仪表盘和统计分析显示,开源编码模型正以1.5倍的速度缩小与闭源模型的差距,一个27B模型已经在去污染基准测试中超越了Claude Opus。工具调用可靠性仍然是主要瓶颈。
Artificial Analysis | Google 进行基准测试的首选网站 | Gemini 3.1 Pro 在实际使用中远不及 Opus 4.7
一项比较表明,Google 的 Gemini 3.1 Pro 在实际使用中的表现远不如 Opus 4.7,文章强调 Artificial Analysis 是进行基准测试的首选资源。
@narens:基准测试巅峰
在Artificial Analysis的分析师代理基准测试中,Gemini 3.7 flash超越了Fable 5、Opus 5和GPT-5.6。
是我的错觉,还是当前的LLM基准测试未能捕捉到实际可用性?(Gemma 4 对比 Gemini/Claude Opus)
作者分享了实际对比体验,显示 Gemma 4 在实用的指令遵循方面优于 Gemini 3.5 Flash 和 Claude Opus 5 等更大的模型,认为当前的 LLM 基准测试未能反映真实世界的可用性。
'一刀切'式AI时代已终结。我实测了GPT-5.5、Claude 4.7、Gemini 3.1 Pro和DeepSeek V4 Pro——以下是最新前沿格局。
对GPT-5.5、Claude Opus 4.7、Gemini 3.1 Pro和DeepSeek V4 Pro的基准测试分析表明,没有单一模型在所有任务上占据优势;要实现最佳性能,需要采用多模型路由器,根据各模型的优势与弱点进行专门化使用。