基准饱和之后:CORE-Bench 案例研究

arXiv cs.AI 论文

摘要

本文反对在基准准确率饱和时直接“废止并替换”的做法,以 CORE-Bench 为例,证明在准确率持平后,从构建效度、效率、可靠性以及人机协作等维度衡量智能体性能,仍能获得有意义的洞见。

arXiv:2606.26158v1 公告类型: 新 摘要:当基准的准确率饱和时,它通常会被废弃,并由更具挑战性的版本取代。我们表明,这种方法过于侧重准确率,因而错过了研究智能体性能其他六个关键维度的机会:构建效度问题(如捷径)、分布外泛化能力、效率、可靠性、模型与框架的相对重要性,以及人机协作带来的提升。我们以 CORE-Bench Hard(一个用于科学代码计算可复现性的基准)作为案例,展示在准确率饱和后,沿这些维度测量智能体仍能为理解其性能提供有意义的洞见。首先,我们揭示了 CORE-Bench Hard 中那些仅凭能力较弱的智能体难以预见的构建效度威胁。我们引入了改进版基准 CORE-Bench v1.1 和一个分布外任务套件 CORE-Bench OOD。其次,我们发现尽管准确率已经饱和,CORE-Bench v1.1 在测量效率、可靠性、模型性能及框架性能方面仍然有用。最后,我们通过一项小规模随机实验,测量了在实际计算可复现性任务中人机协作带来的提升。我们发现速度存在统计上显著的约两倍提升——这一数字可能被低估,因为五分之一纯人工复现任务在完成前已达时间上限——并描述了其他多项发现。综合来看,我们的贡献为主流的以准确率为中心的评估范式提供了一种更为严谨的替代方案。
查看原文
查看缓存全文

缓存时间: 2026/06/26 05:11

# 基准饱和之后:CORE-Bench 案例研究  
来源:https://arxiv.org/html/2606.26158  

Nitya Nadgir¹,Sayash Kapoor²,Kangheng Liu²,Peter Kirgis²,Matilda Orona³,Stephan Rabanser²,Tilman Bayer¹,Abhishek Shetty¹,Yue Ling¹,Derrick Chan-Sew¹,Rumi Nakagawa¹,Saiteja Utpala²,Zachary S. Siegel⁴,Arvind Narayanan²  

¹独立作者,²普林斯顿大学,³加州大学伯克利分校,⁴麻省理工学院  

###### 摘要  
当基准的准确率饱和时,通常会被弃用,并替换为更具挑战性的版本。我们表明,这种方法偏重准确率,而忽略了研究智能体性能的其他六个关键维度:构造效度问题(如捷径)、分布外泛化能力、效率、可靠性、模型与脚手架的相对重要性,以及人机协作带来的提升。我们以 CORE-Bench Hard(一个用于科学代码计算可再现性的基准)作为案例,证明即使在准确率饱和之后,测量智能体在这些维度上的表现,仍能获得有意义的性能洞察。首先,我们揭示了 CORE-Bench Hard 中难以在智能体能力较弱时预见的构造效度威胁。我们推出了改进版基准 CORE-Bench v1.1,以及一个分布外任务套件 CORE-Bench OOD。其次,我们发现尽管准确率已经饱和,CORE-Bench v1.1 在测量效率、可靠性、模型性能和脚手架性能方面仍然有用。最后,我们进行了一项小规模随机实验,测量在真实世界计算可再现性任务中人机协作带来的提升。我们发现了统计上显著的加速,大约提升了两倍——由于五分之一的人类单独复现因达到时间限制而未完成,这一提升很可能被低估——并描述了其他各种发现。综合来看,我们的贡献为当前占主导地位的以准确率为中心的评估范式提供了一种更严格的替代方案。  

## 1 引言  
AI 智能体正越来越多地部署在广泛的领域中,包括客户服务[56 (https://arxiv.org/html/2606.26158#bib.bib39)]、软件工程[3 (https://arxiv.org/html/2606.26158#bib.bib99)]、法律服务[25 (https://arxiv.org/html/2606.26158#bib.bib50)]、金融分析[17 (https://arxiv.org/html/2606.26158#bib.bib51)]和科学发现[37 (https://arxiv.org/html/2606.26158#bib.bib46)]。随着这些系统的普及,基准已成为比较不同供应商和不同时期性能的标准工具。大多数基准将性能浓缩为一个单一的标题指标:总体准确率,即智能体正确解决任务的比例。这一指标多年来稳步提升,但在许多广泛使用的基准上,进步已经开始趋于平稳。顶级智能体现在聚集在天花板级别的分数附近,并且通常在统计上难以区分[2 (https://arxiv.org/html/2606.26158#bib.bib59),30 (https://arxiv.org/html/2606.26158#bib.bib36),12 (https://arxiv.org/html/2606.26158#bib.bib55),10 (https://arxiv.org/html/2606.26158#bib.bib368),26 (https://arxiv.org/html/2606.26158#bib.bib28)]。许多领域的研究者将此解释为这些基准已经失去了区分能力。主流的应对方式是弃用这些基准,转而采用更困难的继任者;例如,ARC-AGI 1 演进到 ARC-AGI 2 和 3,MMLU 到 MMLU-Pro,HumanEval 到 HumanEval+,SWE-bench 到 SWE-bench Pro[11 (https://arxiv.org/html/2606.26158#bib.bib48),21 (https://arxiv.org/html/2606.26158#bib.bib54),53 (https://arxiv.org/html/2606.26158#bib.bib29),35 (https://arxiv.org/html/2606.26158#bib.bib30),15 (https://arxiv.org/html/2606.26158#bib.bib49)]。我们将这种重复出现的模式称为*弃用并替换*。  

在本文中,我们认为,尽管这一策略对于专注于优化相对准确率的模型开发者可能有用,但它从根本上不足以帮助研究人员和下游开发者理解智能体解决真实世界任务的能力。我们工作的核心论点是:*准确率饱和*,即顶级智能体达到统计上无法区分的准确率,并不表示在所有有意义的智能体行为维度上无法获得进一步性能洞察。我们证明,即使基准的准确率指标已经趋于平稳,我们仍能在其他关键轴上获得智能体性能的有用信息。这些包括 (i) *基准效度*,即高分是否反映了真正的任务掌握,而非利用捷径或过拟合;(ii) *评估完备性*,涵盖可靠性、计算效率以及模型与其脚手架的相对性能;以及 (iii) *对人工工作流的实际影响*。尽管先前的工作在原则上倡导评估这些多面维度[32 (https://arxiv.org/html/2606.26158#bib.bib160),47 (https://arxiv.org/html/2606.26158#bib.bib57),54 (https://arxiv.org/html/2606.26158#bib.bib42),34 (https://arxiv.org/html/2606.26158#bib.bib41),31 (https://arxiv.org/html/2606.26158#bib.bib37)],但该领域基本上默认采用开发越来越困难的基准继任者的做法,这些继任者继续仅针对准确率进行优化。通过挑战*弃用并替换*范式,我们主张提取基准准确率天花板之外持续存在的丰富信号,并强调以准确率为中心的评估的局限性贯穿基准的整个生命周期,而不仅仅是饱和阶段。  

我们通过 CORE-Bench Hard[49 (https://arxiv.org/html/2606.26158#bib.bib38)] 这一计算可再现性基准来研究这一主张。CORE-Bench Hard 是一个有用的案例研究,因为可再现性是一项高价值的真实世界任务,有直接的人类对应版本(允许进行具体的人类提升研究)、清晰的分布外轴(例如,改变研究领域)以及多个实际相关的性能维度(例如,正确性、成本、延迟和可靠性)。¹¹¹我们在此提供代码、数据和日志:https://github.com/nnadgi01/corebench-analysis。  

具体而言,我们做出以下三项贡献:  

1. **新的 CORE-Bench 变体以改进基准效度(第 2 节)**。我们通过日志分析发现了 CORE-Bench Hard 中 15 个任务级错误和 20 个存在可利用捷径的任务,这些问题在准确率饱和之前很难被发现。我们纠正了这些错误并添加了十个新任务,从而产生 CORE-Bench v1.1,一个包含 39 个任务的任务套件,保留了 CORE-Bench Hard 原有的学科、语言和构建流程。我们还通过引入 CORE-Bench OOD 测试了饱和准确率是否能在领域分布变化下迁移,该套件包含 19 个任务,涵盖与 CORE-Bench Hard 不同的学科:物理学、工程学、经济学和计算机科学。我们在表 1 中描述了每个 CORE-Bench 变体。  
2. **多维评估的结果(第 3 节)**。即使基准在智能体准确率方面失去区分能力,它仍然可用于区分其他维度的性能。在 20 次智能体运行中,我们展示了准确率统计上无差异的智能体在效率、可靠性以及模型与脚手架行为方面存在差异。  
3. **对协作智能体提升人类性能的观察(第 4 节)**。虽然基准是任务自动化中智能体能力的有用代理,但对于人机协作的实际效用来说,它们是不够的。我们针对真实世界的计算可再现性任务进行了一项小型随机研究,包含 20 篇机器学习和社会科学论文,发现智能体协作将完成时间减少了一半以上。这很可能是一个保守估计,因为五分之一的人类单独会话未能在三小时时间限制内完成,而所有人机协作会话都完成了。  

表 1:CORE-Bench 变体。CORE-Bench v1.1 修正了 CORE-Bench Hard 中的构造效度威胁。CORE-Bench OOD 是 CORE-Bench v1.1 的分布外任务套件。  

| CORE-Bench 变体 | 描述 |
| :--- | :--- |
| CORE-Bench | 原始 CORE-Bench 变体[49 (https://arxiv.org/html/2606.26158#bib.bib38)],它评估智能体在三个领域(计算机科学、医学科学和社会科学)和两种语言(Python 和 R)上的计算可再现性任务。测试集包含三个难度级别(简单、中等、困难)各 45 个任务。每个任务选自 codeocean.com 上的一个胶囊,该胶囊包含一篇研究论文的代码库,并且经验证可在本地重现。²²²胶囊是一个自包含的可执行研究环境,捆绑了复现计算实验所需的代码、数据和软件依赖项。每个胶囊对应一个任务,一个任务由一个或多个任务问题组成。虽然三个难度级别的任务问题相同,但随着难度增加,提供给智能体的解题信息减少。有关胶囊选择标准的完整描述,请参见 Siegel 等人[49 (https://arxiv.org/html/2606.26158#bib.bib38)]。 |
| CORE-Bench Hard | CORE-Bench 中最难的级别,智能体必须仅根据 README、代码和数据(无 Dockerfile、运行文件或其他指令)来复现论文代码。 |
| CORE-Bench v1.1 | CORE-Bench Hard 的更新版本。修正了 CORE-Bench Hard 中的 15 个任务级错误(包括错误的地面真值、格式错误的任务问题、评分错误和不可解任务)以及 20 个允许捷径的任务。包含 10 个新任务,采用与 CORE-Bench Hard 相同的构建流程和任务分布创建,共计 39 个任务。 |
| CORE-Bench OOD | 包含 19 个任务的套件,旨在评估智能体在领域分布偏移下的性能,与其他仅包含计算机科学、医学科学和社会科学任务的 CORE-Bench 变体不同。CORE-Bench OOD 通过涵盖物理学、工程学、经济学和计算机科学任务来评估跨领域的泛化能力。 |

## 2 准确率饱和暴露了对基准效度的威胁  
基准效度在两个难以在构建过程中预见的轴上受到威胁。第一个是*任务级威胁*,即标题指标不能忠实衡量预期的能力。近期工作表明,这影响了许多广泛使用的基准,包括 SWE-Bench 中不可能解决的任务[30 (https://arxiv.org/html/2606.26158#bib.bib36),13 (https://arxiv.org/html/2606.26158#bib.bib272)]、τ-Bench Airline 脚手架错误[56 (https://arxiv.org/html/2606.26158#bib.bib39),31 (https://arxiv.org/html/2606.26158#bib.bib37)]以及 WebArena 中评分错误的任务[59 (https://arxiv.org/html/2606.26158#bib.bib40),60 (https://arxiv.org/html/2606.26158#bib.bib43)]。这些问题在能力更强的智能体能够利用替代解题路径、发现细微捷径或成功完成端到端任务但被错误评分时才会暴露。  

表 10 说明了 CORE-Bench Hard 中仅在准确率饱和后才出现的任务级威胁示例。日志分析(追踪智能体的输入、输出和环境)已成为识别这些问题的主要方法[51 (https://arxiv.org/html/2606.26158#bib.bib52)],先前的工作已利用它发现了基准错误、捷径、环境障碍和脚手架级别的错误[24 (https://arxiv.org/html/2606.26158#bib.bib60),43 (https://arxiv.org/html/2606.26158#bib.bib61),31 (https://arxiv.org/html/2606.26158#bib.bib37)]。第二个是*基准特定适应*,当基准被用作开发目标时会出现:随着开发者针对固定基准迭代智能体,他们可能会根据观察到的失败调整提示、脚手架、工具使用、依赖处理、超时设置或恢复启发式。这些变化提高了基准性能,但也可能使智能体适应基准的特定特质(例如,任务分布或输出格式)。因此,强大的性能可能部分反映了适应性,而非通用能力[32 (https://arxiv.org/html/2606.26158#bib.bib160)]。  

准确率饱和(如 Akhtar 等人[2 (https://arxiv.org/html/2606.26158#bib.bib59)]所定义)使得能够沿着这两个轴对基准效度进行更深入的调查。受此启发,我们引入了两个新的任务套件:CORE-Bench v1.1(相对于 CORE-Bench Hard 改进了构造效度)和 CORE-Bench OOD(评估分布外泛化)。  

### 2.1 CORE-Bench v1.1:更稳健的计算可再现性度量  

表 2:CORE-Bench v1.1 准确率。顶级智能体聚集在天花板附近的准确率。对于 Claude 模型,“thinking”表示推理(Opus 4.5 的 token 预算为 10K;“adaptive”没有预算参数)。max_thr 控制并发 Codex CLI 子智能体的最大数量(省略则禁用子智能体)。准确率以 value^{upper}_{lower} 格式显示,附 95% Wilson 置信区间。  

| Scaffold | Model (reasoning effort) | Accuracy |
| :--- | :--- | :--- |
| Codex CLI (default) | GPT-5 (medium) | 84.6%^{92.8}_{70.3} |
| | GPT-5.1 (medium) | 87.2%^{94.4}_{73.3} |
| | GPT-5.2 (medium) | 94.9%^{98.6}_{83.1} |
| | GPT-5.3-Codex (medium) | 97.4%^{99.5}_{86.8} |
| | GPT-5.4 (low) | 92.3%^{97.3}_{79.7} |
| | GPT-5.4 (medium) | 94.9%^{98.6}_{83.1} |
| | GPT-5.4 (high) | 97.4%^{99.5}_{86.8} |
| | GPT-5.4 (xhigh) | 97.4%^{99.5}_{86.8} |
| Codex CLI (max\_thr=1) | GPT-5.4 (medium) | 94.9%^{98.6}_{83.1} |
| Codex CLI (max\_thr=3) | GPT-5.4 (medium) | 97.4%^{99.5}_{86.8} |
| Codex CLI (max\_thr=6) | GPT-5.4 (medium) | 92.3%^{97.3}_{79.7} |
| Codex CLI (max\_thr=9) | GPT-5.4 (medium) | 97.4%^{99.5}_{86.8} |
| Claude Code | Opus 4.5 (thinking) | 89.7%^{95.9}_{76.4} |
| | Opus 4.6 (adaptive) | 92.3%^{97.3}_{79.7} |
| OpenCode | Opus 4.5 (thinking) | 82.1%^{91.0}_{67.3} |
| | Opus 4.6 (none) | 82.1%^{91.0}_{67.3} |

相似文章

当AI基准陷入平台期:基准饱和的系统性研究

Hacker News Top

一项系统性研究,定义并分析了60个语言模型基准中的基准饱和现象,发现近一半的基准已出现饱和,且专家精选的基准更具韧性,为构建持久评估提供了设计选择。

仅靠基准测试不够:RAMP——生产系统中代理模型的运行时评估

Hugging Face Daily Papers

RAMP是一个基于生产环境的LLM代理评估框架,可揭示静态基准测试无法察觉的显著能力退化,显示任务完成率在串行工作流中从100%骤降至20%。该框架在真实的编译器构建工作负载上评估了15个主流模型,涉及复杂的工具链交互和分阶段恢复机制。

关于TASTE:提升智能体基准测试的覆盖度与难度

Hugging Face Daily Papers

TASTE是一种自动化方法,通过自适应对比n-gram建模和迭代难度优化来演化工具序列,从而生成覆盖更广工具使用、更具挑战性的智能体基准测试。生成的τ^c-Bench显示,在现有基准测试中几乎饱和的模型性能大幅下降,表明这是基准饱和而非模型具备稳健能力。