我们一直在基准测试中挑选前沿模型,但这些测试条件与我们的实际部署环境并不相符。

Reddit r/AI_Agents 新闻

摘要

本文突出了 Claude Opus 和 Gemini Pro 在预测基准测试中的性能排名反转,具体取决于模型是自行进行网络搜索还是使用固定的证据。这表明,在研究阶段 Opus 表现出色,而 Gemini 在基于固定证据的判断方面更胜一筹,揭示了标准基准测试与实际部署条件之间的不匹配。

结果表明,Opus 更擅长研究,而 Gemini 更擅长判断!在包含 1,417 道题的预测基准测试中,当每个模型在做出预测前自行进行网络研究时,Opus 的表现更优(Brier 分数 0.131,低于 Gemini 的 0.143)。但当两个模型在每道题上都获得相同的起始研究资料(通过预先收集的文件包)时,Gemini 以相同的幅度胜出(0.141 vs Opus 的 0.153)。这表明 Opus 的优势在于研究阶段:确定搜索什么、阅读哪些页面、关注哪些细节。如果去掉这一环节,Gemini 在固定证据基础上的判断更为敏锐。校准分数也印证了这一点。当 Opus 不再负责自行开展研究时,其校准效果明显下降。而 Gemini 在获得标准化文件包后表现实际上有所提升,暗示其自主代理的研究过程可能遗漏了部分有价值的信息。这种不对称性表明,Opus 可能将其搜索轨迹作为概率分配的基础架构(即,执行搜索循环这一行为本身就在进行一定的认知工作,独立于其获取的信息之外)。 为了厘清这一点,我们在 1,417 道二进制预测问题基准上运行了四种模型:Claude Opus 4.6、GPT-5.4、Gemini 3.1 Pro 和 Grok 4.20。这些问题将在 2025 年 10 月至 12 月间揭晓结果,测试分为两种评估条件:自主代理模式(每个模型使用工具自行进行网络研究)和固定证据模式(每个模型接收相同的约 12,000 字符研究文件包)。需要注意的是,一个局限性在于固定证据文件包本身是由大语言模型(LM)生成的,因此我们测量的可能是各模型对特定标准化证据版本的解读能力,而非抽象意义上的判断力。但这意味着所有四个模型都应朝同一方向偏移。事实并非如此。GPT-5.4 和 Grok 4.20 在不同条件下的表现几乎没有变化,而 Opus 和 Gemini 的排名顺序发生了互换(这与评估系统故障或偏见所产生的结果截然相反)。 我们一直在使用与部署条件不匹配的基准测试来选择前沿模型。据我所知,这是首次直接评估前沿模型,并将其性能分解为研究和判断两个阶段。排名顺序的反转只是这种不匹配的一个具体实例,是我们所测量的部分;很可能还存在其他类似情况。如果你在自部署中发现了类似的分裂现象(检索与综合、摘要与推理,或任何需要模型按顺序执行两项不同任务的场景),我很想听听你的观察和应对措施。
查看原文

相似文章

@narens:基准测试巅峰

X AI KOLs Following

在Artificial Analysis的分析师代理基准测试中,Gemini 3.7 flash超越了Fable 5、Opus 5和GPT-5.6。