当AI基准陷入平台期:基准饱和的系统性研究
摘要
一项系统性研究,定义并分析了60个语言模型基准中的基准饱和现象,发现近一半的基准已出现饱和,且专家精选的基准更具韧性,为构建持久评估提供了设计选择。
暂无内容
查看缓存全文
缓存时间: 2026/08/04 16:46
# 当 AI 基准测试趋于饱和:一项关于基准测试饱和的系统性研究
来源:https://arxiv.org/html/2602.16763
Anka Reuel,Prajna Soni,Sanchit Ahuja,Pawan Sasanka Ammanamanchi,Ruchit Rawal,Vilém Zouhar,Srishti Yadav,Chenxi Whitehouse,Dayeon Ki,Jennifer Mickel,Leshem Choshen,Marek Šuppa,Jan Batzner,Jenny Chim,Jeba Sania,Yanan Long,Hossein A. Rahmani,Christina Knight,Yiyang Nan,Jyoutir Raj,Yu Fan,Shubham Singh,Subramanyam Sahoo,Eliya Habba,Usman Gohar,Siddhesh Pawar,Robert Scholz,Arjun Subramonian,Jingwei Ni,Mykel J. Kochenderfer,Sanmi Koyejo,Mrinmaya Sachan,Stella Biderman,Zeerak Talat,Avijit Ghosh,Irene Solaiman
##### 摘要
人工智能基准测试是衡量模型进展和指导部署决策的重要机制。然而,基准测试往往会迅速“饱和”,这使得区分不同模型变得困难,并削弱了其长期价值。在本研究中,我们定义了**基准测试饱和**,并使用与饱和相关的 14 个属性对 60 个语言模型基准测试进行了分析。我们发现,我们研究中的近一半基准测试表现出饱和,且饱和率随基准年龄增长而上升。此外,我们发现,对饱和的抵抗能力受专家策划的影响,而非公开测试数据。我们的结果表明,设计选择可以延长基准测试的寿命,并为更持久的评估方法提供参考。¹¹¹数据和代码可在 Github 仓库中获取 (https://github.com/evaleval/benchmark-saturation)。机器学习,ICML * 主要作者 ⋄ 主要贡献者 † 顾问 本项目是 Evaluating Evaluations (EvalEval) 联盟的一部分:![[未标注图像]](https://arxiv.org/html/2602.16763v3/images/logo-square.png)https://evalevalai.com/
## 1 引言
人工智能(AI)基准测试在衡量模型进展、指导部署决策以及为政策和监管提供信息方面发挥着核心作用(Hardy 等,2025 (https://arxiv.org/html/2602.16763#bib.bib30),2024 (https://arxiv.org/html/2602.16763#bib.bib16);Alzahrani 等,2024 (https://arxiv.org/html/2602.16763#bib.bib14);Union,2024 (https://arxiv.org/html/2602.16763#bib.bib56))。其价值取决于其区分不同模型的能力。然而,许多广泛使用的基准测试(例如,HumanEval(Chen,2021 (https://arxiv.org/html/2602.16763#bib.bib59)))已经迅速“饱和”(Maslej 等,2024 (https://arxiv.org/html/2602.16763#bib.bib57)),顶级系统的得分几乎相同。当性能在狭窄范围内趋同时,基准测试会失去区分力,并为模型比较或选择提供的指导有限(Ott 等,2022 (https://arxiv.org/html/2602.16763#bib.bib32);Chen 等,2025 (https://arxiv.org/html/2602.16763#bib.bib58))。其他领域也观察到类似的动态变化——例如,ImageNet(Deng 等,2009 (https://arxiv.org/html/2602.16763#bib.bib9))对大多数新模型表现出接近上限的性能。²²²我们想强调,基准测试饱和并不总是负面的——如果基准测试是有效的(Salaudeen 等,2025 (https://arxiv.org/html/2602.16763#bib.bib136)),饱和意味着任务可以被视为“已解决”。
尽管其重要性,*基准测试饱和*尚未得到系统的研究。先前的工作常常注意到性能平台期、鲁棒性提升(Ashury-Tahan 等,2026a (https://arxiv.org/html/2602.16763#bib.bib3))或引入新的基准测试以应对(Wang 等,2024b (https://arxiv.org/html/2602.16763#bib.bib45);Jimenez 等,2024 (https://arxiv.org/html/2602.16763#bib.bib75)),但很少分析驱动饱和的机制。目前仍不清楚为什么有些基准测试迅速饱和,而另一些则保持区分力,并且没有公认的操作性定义——饱和是否反映接近人类的表现、固定上限,或最先进模型之间统计可分离性的丧失。我们通过将饱和定义为顶级模型之间可靠区分力的丧失,并通过一种基于排行榜数据、对不确定性敏感的饱和指数来操作化这一概念,从而解决这些空白。利用这一框架,我们分析了跨领域和评估设置、广泛使用的 60 个基于文本的 LLM 基准测试,并沿任务设计、语言范围、数据构建和可访问性等维度进行标注,以研究与饱和相关的因素。
本文做出以下贡献:
- • 我们将基准测试饱和定义为最先进模型之间可靠区分力的丧失,并引入一个可复现、对不确定性敏感的、来源于排行榜数据的饱和指数。
- • 我们基于对 60 个基准测试的分析,识别出哪些基准测试属性与饱和系统性相关。我们发现,通常认为的保障措施,如私有测试集或封闭式格式,对饱和的影响有限,而基准测试年龄和规模则强烈预测饱和。
- • 我们为基准测试设计和生命周期管理提供实用建议,包括监测实践、不确定性报告以及基准测试退役或修订的标准。
论文其余部分组织如下:第 2 节 (https://arxiv.org/html/2602.16763#S2) 形式化基准测试饱和并介绍我们的饱和指数;第 3 节 (https://arxiv.org/html/2602.16763#S3) 概述基准测试的收集和标注;第 4 节 (https://arxiv.org/html/2602.16763#S4) 呈现实证分析;第 5 节 (https://arxiv.org/html/2602.16763#S5) 讨论影响和可操作的建议;第 6 节 (https://arxiv.org/html/2602.16763#S6) 以局限性和未来方向作结。
#### 利益冲突披露
这项工作是作为一个研究联盟的一部分进行的,其中一些成员(包括共同作者)为本研究中分析或报告的模型或评估做出了贡献。所有工件都经过相同的纳入和标注程序,无论作者是否参与。
## 2 概念化基准测试饱和
在本节中,我们正式定义基准测试饱和、介绍我们对不确定性敏感的饱和指数,并分析其对关键参数选择的稳健性。
### 2.1 定义与范围
我们将**基准测试饱和**定义为在比较的顶级模型中可靠区分力的丧失。当顶级模型无法在统计上被区分,且性能接近基准测试的经验观察上限时,该基准测试即为饱和。这一概念与先前工作非正式描述的*性能饱和*相对应——即模型间差异变得可忽略的平台期(Justen,2025 (https://arxiv.org/html/2602.16763#bib.bib23);Wang 等,2024b (https://arxiv.org/html/2602.16763#bib.bib45);Ott 等,2022 (https://arxiv.org/html/2602.16763#bib.bib32))。
#### 人类性能上限。
与基于达到人类水平的表现的定义(Gupta 等,2025 (https://arxiv.org/html/2602.16763#bib.bib19))不同,我们的定义不依赖于人类基线,因为人类基线通常无法全面获取、不可用或测量不一致(Wei 等,2025 (https://arxiv.org/html/2602.16763#bib.bib33))。此外,人类水平的表现并不意味饱和,因为即使在达到人类水平得分后,模型仍可能在统计上可区分,从而让基准测试保持区分力。先前的分析描述性地描述饱和模式(Ott 等,2022 (https://arxiv.org/html/2602.16763#bib.bib32))或强调生命周期管理(Hardy 等,2024 (https://arxiv.org/html/2602.16763#bib.bib16)),但并未提供确定饱和的定量标准。
#### 饱和 vs. 停滞。
因此,我们将饱和形式化为一种源自排行榜不确定性的可测量属性。我们进一步将*停滞*与饱和区分开来:停滞指顶级模型之间在统计上无法区分,而饱和还要求性能接近经验上限。在实践中,有限的噪声估计模糊了两者之间的区别。
定义:基准测试饱和
如果评估的模型无法通过其性能得分被可靠地区分,并且在该评估协议下任何进一步的改进在统计上不可区分,则基准测试是*饱和的*。形式上,饱和的特征是:(1)不同顶级模型之间的性能在统计上相似;(2)顶级模型正在接近基准测试的经验推断上限。如果仅条件(1)成立,我们将该基准测试称为*停滞*而非饱和。在这种情况下,观察到的不可区分性可能源于模型层面的限制、评估噪声、基准测试敏感性不足,或基准测试本身的伪影(例如,虚假相关或重复模式),并且可能通过未来的架构、训练或评估进展来克服。
通常很难清楚地区分停滞和饱和,因为评估噪声和基准测试上限的可靠估计很少可用。我们的操作化应满足四个期望:
1. 1\.模型相对性:相对于给定时间的顶级模型定义。
2. 2\.度量无关性:适用于常见度量(准确率、F1、BLEU)。
3. 3\.数据驱动:避免依赖外部策划的性能上限。
4. 4\.可复现性:给定相同的排行榜快照,产生相同的决策。
为了形式化这一概念,我们考虑一组顶级模型在每个基准测试上的性能。对于给定的基准测试,设 \(s_1 \geq \dots \geq s_k\) 表示前 \(k\) 个模型的得分(默认 \(k=5\))。我们引入 \(k\) 作为通用参数,以避免固定所考虑的模型数量,并灵活定义用于评估饱和的顶级模型集合。在我们的分析中,我们固定 \(k=5\) 以确保各基准测试之间的可比性。这一选择反映了实际的权衡:较小的 \(k\) 值可能导致不稳定的估计,而较大的值可能将前沿模型与较旧的或不太相关的模型混合在一起,尤其是在排行榜覆盖不全的情况下。根据经验,我们数据集中的大多数基准测试报告了约 5–7 个最近的、高能力的模型,因此 \(k=5\) 是一个合理且一致的选择。
### 2.2 对不确定性敏感的饱和测量
#### 基于性能的评估。
对于类似准确率的度量,即对大小为 \(n\) 的固定测试集的平均值,我们将模型得分 \(s\) 的标准误差近似为:
\(\mathrm{SE}(s) \approx \sqrt{\frac{s(1-s)}{n_{\mathrm{eff}}}}.\) (1)
其中
\(n_{\mathrm{eff}} = n^\alpha,\qquad \alpha \in [0,1],\ \text{default } \alpha=0.5,\)
注意,类似准确率的度量——即对固定测试样本集合计算平均且每个样本贡献有界的度量(如准确率、F1、BLEU)——被广泛使用。在这类度量中,不确定性可以从有限样本的变异性中近似。对于其他度量类型(例如,Pass@k),相同的框架适用,但需要特定于基准测试的不确定性估计,如自助法(bootstrap)区间或重复评估方差。
有效测试集大小 \(n_{\mathrm{eff}} = n^\alpha\) 对名义测试集大小 \(n\) 进行降权,以避免饱和计算对测试集大小产生过强的依赖。在我们的数据集中,基准测试大小差异很大,从几十到几十万个测试样本不等,且由于少数非常大的基准测试,分布高度偏斜。因此,使用原始测试集大小 \(n\) 会导致不确定性项被这些离群值主导,使得大基准测试的标准误差不成比例地变小,并人为地降低其饱和估计。
因此,顶级模型与第 \(k\) 个模型之间差异的标准误差近似为:
\(\mathrm{SE}_{\Delta} \approx \sqrt{\frac{s_1(1-s_1)}{n_{\mathrm{eff}}} + \frac{s_k(1-s_k)}{n_{\mathrm{eff}}}}.\) (2)
设 \(\Delta = s_1 - s_k\)。如果 \(\Delta \leq z \cdot \mathrm{SE}_{\Delta}\),我们认为顶级模型的性能在统计上相似,其中 \(z\) 是标准正态分位数(例如,对于 95% 置信水平,\(z=1.96\))。该标准同时考虑数据集大小和评估噪声。评估不确定性指的是有限测试集大小和度量估计噪声引入的排行榜得分的预期变异性。我们通过模型得分及其差异的标准误差来定义这种不确定性,并将该范围内的性能差异视为统计上不可区分。
#### 得分压缩。
为了量化排行榜顶部性能得分在多大程度上趋于坍缩,我们计算归一化得分范围:
\(R_{\mathrm{norm}} = \frac{s_1 - s_k}{\mathrm{SE}_{\Delta}}.\) (3)
\(R_{\mathrm{norm}}\) 可以解释为信噪比,将观察到的顶级模型得分分布与预期评估不确定性进行比较。较低的 \(R_{\mathrm{norm}}\) 表示更大的饱和,即顶级模型之间的差异落在预期评估不确定性之内,区分力有限。³³³在极少数不确定性接近零的情况下(例如,确定性且接近完美的得分),我们在分母中添加一个小的 \(\varepsilon\) 稳定性项,以避免数值不稳定。
#### 噪声上限的经验近似。
我们不假设固定的或外部定义的噪声上限,而是将观察到的最高模型性能(\(s_1\))视为经验代理上限。因此,饱和是相对于观察到的模型得分分布来评估的,而不是相对于绝对性能目标(如完美准确性,即 100% 准确率)。顶级模型在低性能水平上的强聚类不应被解释为任务已解决。相反,这种聚类表明**模型层面饱和**:基准测试可能不再有效地区分当代最先进模型。然而,正如先前基准测试中所观察到的,这种形式的饱和反映了停滞,并不排除基准测试在范式转变(例如,引入以推理为中心或工具增强的模型)后重新获得区分力(Cobbe 等,2021 (https://arxiv.org/html/2602.16763#bib.bib29);Lewkowycz 等,2022 (https://arxiv.org/html/2602.16763#bib.bib28))。
#### 饱和指数。
为了将饱和作为一个分级现象来捕获,我们将上述信号组合成一个连续的饱和指数 \(S_{\text{index}} \in [0,1]\),该指数随着顶级模型在统计上变得不可区分而增加。基准测试的 \(S_{\text{index}}\) 值越高,饱和证据越强。我们将饱和指数定义为:
\(S_{\text{index}} = \exp(-R_{\mathrm{norm}}^2),\) (4)
当性能差异相对于评估不确定性较小时,该指数赋予高值。高 \(S_{\text{index}}\) 值表示顶级模型紧密聚集在评估噪声范围内,反映了区分力的减弱。为了便于解释,我们将基准测试分为五个区间:*极低*(\(<0.01\))、*低*(\([0.01,0.3)\))、*中等*(\([0.3,0.7)\))、*高*(\([0.7,0.9)\))和*极高*饱和(\(\geq 0.9\))。值得注意的是,高饱和也可能发生在较低的绝对性能水平上,反映了模型层面的饱和,而相似文章
基准饱和之后:CORE-Bench 案例研究
本文反对在基准准确率饱和时直接“废止并替换”的做法,以 CORE-Bench 为例,证明在准确率持平后,从构建效度、效率、可靠性以及人机协作等维度衡量智能体性能,仍能获得有意义的洞见。
AI模型构建者的不稳定指标与基准测试文化
本文介绍了Benchmarking-Cultures-25数据集,该数据集分析了AI模型构建者如何在新闻稿中选择性突出基准测试。研究发现评估格局碎片化,跨模型可比性有限,并指出基准测试更多被用作市场定位的叙事工具,而非标准化的科学测量手段。
现在的基准测试要么已经饱和,要么残酷无比,而这两类数字都无法告诉你真正导致部署失败的原因
作者反思了AI基准测试目前要么在顶尖水平上饱和,要么难度极高,并认为这两者都无法捕捉到真实的生产失败模式——模型缺乏对任务是否值得做的判断力。他们询问是否有人找到了在发布前评估判断力的方法。
@Lyubh22:编程基准测试正在趋于饱和。AI4Research 是下一个前沿领域。很高兴看到我们的 MLS-Bench(https://mls-bench.co…)
正式发布 MLS-Bench,这是首个获得社区广泛采用的 AI4Research 基准测试,它在 12 个领域的 140 个可执行任务上测试 AI 智能体,以提出模块化的机器学习改进方案。该帖子还包含 Claude Opus 4.6 和 GPT-5.4 等模型的排行榜分数。
好的基准
这篇2026年7月的论文基于Terminal Bench项目的经验,定义了为AI智能体设计有效基准任务的原则。好的任务应当正确、可解、可验证、明确规范,并且因有趣的原因而具有难度,强调现实世界相关性和基于结果的验证。