用于衡量前沿AI能力的开放世界评估
摘要
本文认为传统基准测试既高估又低估了前沿AI能力,并提出“开放世界评估”——一种定性评估的长期、真实世界任务——作为补充方法。介绍了CRUX项目,并通过一个演示展示了AI代理在最少干预下成功将iOS应用发布到App Store。
arXiv:2605.20520v1 公告类型:新
摘要:基于基准的评估对于追踪前沿AI进展仍然重要。但它可能高估或低估部署能力,因为它偏向于那些可以精确定义、自动评分、易于优化、且预算低、时间短的任務。我们提倡一种互补的评估类别,称为开放世界评估:通过小样本定性分析而非基准规模自动化评估的长期、混乱的真实世界任务。本文调查了最近的开放世界评估,指出其优势和局限性,并介绍了CRUX(协作更新AI期望研究)项目,用于定期进行此类评估。作为第一个实例,我们让AI代理开发并发布一个简单的iOS应用到苹果App Store。该代理仅通过一次可避免的人工干预完成了任务,表明开放世界评估可以为即将广泛普及的能力提供早期预警。最后,我们提出了设计和报告开放世界评估的建议。
查看缓存全文
缓存时间: 2026/05/22 08:47
# 测量前沿AI能力的开放世界评估 来源:https://arxiv.org/html/2605.20520 Sayash Kapoor¹, Peter Kirgis¹, Andrew Schwartz¹,², Stephan Rabanser¹, J.J. Allaire³, Rishi Bommasani⁴, Harry Coppock⁵, Magda Dubois⁵, Gillian Hadfield⁶, Andy Hall⁴, Sara Hooker⁷, Seth Lazar⁶,⁸, Steve Newman⁹, Dimitris Papailiopoulos¹⁰,¹¹, Shoshannah Tekofsky¹², Helen Toner¹³, Cozmin Ududec⁵, Arvind Narayanan¹ ¹普林斯顿大学 ²Cornflower Labs ³Meridian Labs ⁴斯坦福大学 ⁵英国AI安全研究所 ⁶约翰·霍普金斯大学 ⁷Adaption Labs ⁸澳大利亚国立大学 ⁹金门AI研究所 ¹⁰威斯康星大学麦迪逊分校 ¹¹微软研究院 ¹²AI Digest ¹³乔治城大学(CSET) ###### 摘要 基于基准的评估对于追踪前沿AI的进展仍然很重要。但它既可能高估也可能低估部署后的能力,因为它偏向于那些可以精确定义、自动评分、易于优化、且预算低、时间短的任务。我们提倡一种互补的评估类别,称之为**开放世界评估**:长期、混乱、真实的现实世界任务,通过小样本定性分析而非基准规模的自动化来评估。在本文中,我们调查了最近的开放世界评估,识别了它们的优势和局限性,并介绍了CRUX(Collaborative Research for Updating AI eXpectations,更新AI期望的合作研究),一个定期进行此类评估的项目。作为首次实例,我们让一个AI代理开发并发布一个简单的iOS应用到苹果应用商店。该代理仅在一次可避免的人工干预下完成了任务,这表明开放世界评估可以为即将变得普遍的能力提供早期预警。最后,我们提出了设计和报告开放世界评估的建议。 ## 1 引言 追踪和预测前沿AI系统的能力是一个开放的方法论问题,随着这些系统进入日益重要的场景,其重要性也在上升。目前,主要方法依赖于基准测试(benchmarking),即代理在大规模自动评分任务集上进行评分。这些基于基准的评估支撑着公众对AI进展的大部分讨论。例如,METR的时间跨度图[1](https://arxiv.org/html/2605.20520#bib.bib1)已被行业领导者、安全组织和政策分析师广泛引用,作为能力快速增长的证据。随着关于资金、监管和安全投资的决策越来越基于这些测量,其准确性变得至关重要,它们所捕捉到的任何系统性差距都值得审视。 尽管有这种依赖,基准测试可能同时高估和低估实际进展。高估经常发生,因为任何能够精确到足以进行基准测试的任务,也精确到足以进行优化。这种动态使得代理可以在测试中表现出色,但不一定获得底层能力。更糟糕的是,著名基准测试的测试集经常泄露到训练数据中,要么直接发生,要么通过保留任务的近似改写。相反,低估则发生在低基准分数反映了偶然失败而非真正的能力差距时。一个基本有能力完成任务的代理可能仍然失败,因为它遇到了验证码、达到了速率限制,或者卡在了脆弱的GUI元素上。综合来看,这些问题表明:**基准分数将目标能力与评估环境的伪影混为一谈**。对于决策者真正关心的问题,由此产生的信号是嘈杂的,并且随着代理能力增强而变得更加嘈杂。 为了解决这些局限性,越来越多的研究开始评估代理在超出传统基准的长期、复杂、现实世界任务上的表现。例如,Carlini [2](https://arxiv.org/html/2605.20520#bib.bib2) 使用Claude代理构建了一个能够编译Linux内核的C编译器,这需要数周的代理时间和大量的辅助工程。在另一个实验中,Anthropic和Andon Labs让Claude管理一个小型办公室商店[3](https://arxiv.org/html/2605.20520#bib.bib3),使代理接触真实客户、实时库存和真实资金。其他研究人员运行了开放式项目、协调了跨数天的多代理工作流,或重新实现了重要的生产软件(更多示例见第2.3节)。尽管种类繁多,但这些实验共享一个共同结构:它们依赖小样本量,在代理遇到与测试能力无关的障碍时允许人工干预,并优先考虑代理日志的定性评估而非单一聚合指标。 由于这种非常规结构,这类评估很容易被认为不科学。每个评估通常样本量为1,缺乏标准化,无法干净地独立复现。这些局限性是真实的,我们不声称它们可以完全克服。尽管如此,这种新兴的评估类别——我们称之为**开放世界评估**——提供了标准基准所遗漏的关于AI能力的关键证据。首先,它们揭示了新兴能力的早期预警,给机构和政策制定者留出时间建立社会韧性,并为部署、监管和投资等战略决策提供信息。其次,它们揭示了现有基准中的盲点,即自动评分忽略了任务的实际实质。在本文中,我们将对开放世界评估进行概念化,调查先前的示例以获取最佳实践和陷阱,并介绍定期运行这些评估的CRUX项目。我们的主要贡献和发现包括: - •**开放世界评估是AI评估中的一个重要新兴类别(第2节)。** 随着AI系统能力的增强,用于引发前沿能力的评估也必须增加复杂性。开放世界评估是这一进展的最新阶段。 - •**我们引入CRUX来系统地进行开放世界评估,首次展示一个端到端的iOS应用部署实验(第3节和第3.1节)。** CRUX(Collaborative Research for Updating AI eXpectations)是我们进行严格开放世界评估并实施大多数先前工作所缺乏的最佳实践的努力。我们的第一个实验让一个代理开发和发布一个简单的iOS应用到App Store。虽然许多现有基准测试孤立的编码技能,但我们关注的是代理能否端到端地处理现实世界的部署——这需要它导航复杂、非标准化的步骤,如签署应用程序、发布隐私政策、填写苹果公司的表格,以及引导应用程序通过审核。 - •**我们的主要发现:代理在一次可避免的人工干预后成功(第3.1.2节)** ——在某个时刻,它忘记了凭证的存储位置。日志分析产生了丰富的额外观察结果,例如代理为App Store审核过程编造了一个虚构的电话号码。在1000美元的总成本中,97.5%用于轮询审核状态,而开发本身仅花费了25美元的代币。该应用程序现已上线App Store。我们在初步公开披露前四周向苹果公司告知了我们的结果。应用商店运营商应准备处理垃圾提交,因为代理可能很快会大规模提交应用。 - •**开放世界评估的方法论建议(第4节)。** 借鉴CRUX #1和对其他开放世界评估的调查,我们确定了六项建议:明确测量构念、记录干预措施、分析并发布日志、实时监控、进行预演和报告成本。如果这些原则被采纳为共享规范,开放世界评估将产生更可操作的见解,并且更容易在此基础上构建。 ## 2 开放世界评估的理由 在本节中,我们定义开放世界评估,调查现有示例,并将它们相对于传统基准进行定位。我们的核心主张是:随着AI系统能力的增强,用于评估其前沿能力的方法也必须相应增加复杂性,这使得开放世界评估成为这一进展的最新阶段。为了使这一框架具体化,我们提出了五个标准来表征开放世界评估,并探讨了它们与基准相比的局限性。我们有意将这些标准留得灵活,认识到复杂基准任务与开放世界评估之间的界限很少是清晰的。 ### 2.1 基准可能既高估也低估进展 人们广泛共识是AI基准正在迅速饱和[4](https://arxiv.org/html/2605.20520#bib.bib4),这一担忧得到了对AI整体轨迹持截然不同观点的研究人员的共鸣[5](https://arxiv.org/html/2605.20520#bib.bib5),并且建立在对NLP基准测试实践更长期批评的基础上[6](https://arxiv.org/html/2605.20520#bib.bib6), [7](https://arxiv.org/html/2605.20520#bib.bib7)。随着过去两年中知名基准已达到上限,它们引发了新一轮的后继测试,而这些测试本身也已接近各自的极限(图1)。因此,社区发现自己正在追逐新目标,却不知道实际底层能力是否跟上了头条数字。 导致这种脱节的一个根本问题是**有限的构念效度**[8](https://arxiv.org/html/2605.20520#bib.bib8), [9](https://arxiv.org/html/2605.20520#bib.bib9)。我们观察到的度量指标——通常是狭窄沙盒任务上的准确率——是决策者关心的现实世界能力的不完美代理。由于测量变量与预期构念之间的这种不匹配,基准分数可以同样轻易地**高估**或**低估**真实的部署能力,这完全取决于沙盒环境与现实世界之间的差距。 '23 '24 '25 '26 ARC-AGI v1 '19 τ-bench SWE-bench METR TH 1.0 Terminal Bench 原始/后继 **图1:** 几个流行基准(SWE-Bench、ARC-AGI、τ-bench、Terminal Bench、METR的时间跨度)在过去两年内都发布了后继基准[1, 10, 11, 12, 13, 14, 15, 16, 17, 18, 19, 20, 21, 22]。 ↑ **为什么基准可能*高估*能力。** 基准类似于适合现代强化学习(RL)的任务。一个精确到足以进行基准测试的任务,也精确到足以进行优化。现代RL训练运行越来越像基准本身,而领先的评估平台如Harbor[23](https://arxiv.org/html/2605.20520#bib.bib23)同时充当RL训练平台。即使有保留的测试集,训练集任务也可能与测试集任务非常相似,因此基准性能可能不代表现实世界的泛化。更糟糕的是,以基准为中心的利益驱动可能使模型开发偏向于提高分数但不会提高实际有用性的属性(例如,总是猜测的策略提高了多项选择医学QA的准确率,但损害了临床决策支持)。基准避免了现实世界的混乱。真实任务具有未充分指定的交互和开放环境,沙盒基准可以近似但无法完全复现。 ↓ **为什么基准可能*低估*能力。** 引发前沿能力成本高昂。Anthropic的C编译器实验花费约20,000美元,我们的iOS应用实验花费约1,000美元。这类实验不可能重复数百次,这限制了基准的预算和复杂性。平均性能不同于上限引发。大样本仅对*平均*性能是必要的。表征前沿需要*最佳情况*性能:代理在足够资源下克服偶发失败所能完成的任务。人工干预有助于引发上限。代理可能遇到与测量能力无关的政策拒绝、验证码或基础设施故障。在数百个任务中手动解决这些问题不切实际,但在小样本评估中是可行的。对于前沿评估,一个紧迫目标是确定代理所能达到的**上限**。仅在有利条件下才可能的能力可能很快变得普遍,预测这些能力可以让公司有时间采取行动、机构有时间建立韧性、政策制定者有时间应对风险。基准性能不适合这种早期预警。诸如可靠性评分[24](https://arxiv.org/html/2605.20520#bib.bib24)和对SWE-Bench解决方案的维护者接受度审计[25](https://arxiv.org/html/2605.20520#bib.bib25)等指标细化,部分解决了这些效度问题,但没有解决上限引发。附录A扩展了这些局限性,并讨论了为什么基准效度在结构上难以修补。 这些局限性并不意味着传统基准已经过时。它们仍然非常有用,而开放世界评估也引入了自己的约束,我们将在本文后面讨论。相反,我们的目标是识别基准测试固有的系统性盲点,并激励一种能够解决这些盲点的互补方法。随着代理能力越来越强,这些盲点只会扩大,使得开放世界评估成为必要的方法论平衡。 ### 2.2 定义开放世界评估 随着评估方法与AI能力同步成熟,出现了一系列评估方法的梯度,从简单自动化基准测试用于狭窄、定义明确的任务,到劳动密集型方法在更简单指标饱和时变得必要。我们识别了该梯度的五个层次:单轮问答[26](https://arxiv.org/html/2605.20520#bib.bib26), [27](https://arxiv.org/html/2605.20520#bib.bib27), [28](https://arxiv.org/html/2605.20520#bib.bib28);开放式聊天[29](https://arxiv.org/html/2605.20520#bib.bib29), [30](https://arxiv.org/html/2605.20520#bib.bib30);仅输出代理基准[10](https://arxiv.org/html/2605.20520#bib.bib10), [31](https://arxiv.org/html/2605.20520#bib.bib31);带有日志分析的代理基准[32](https://arxiv.org/html/2605.20520#bib.bib32), [1](https://arxiv.org/html/2605.20520#bib.bib1);以及开放世界评估。在最远端,开放世界评估在现实世界环境中对少量长期任务运行代理,并定性分析其结果。它们旨在补充基准而不是取代它:它们解决了上述的一些局限性,并且还可以揭示当前AI系统无法完成的任务。图2总结了
相似文章
前沿与中心:谁来评估评估?(12分钟阅读)
Google Data Cloud 的前沿AI团队讨论了一种利用信息理论评估AI代理的新方法,创建了一个名为 Discovery Bench 的元基准,该基准衡量一个查询在代理失败之前可以有多模糊,从而提供比简单的通过/失败考试更细致的代理能力图谱。
超越最终分数:长期AI研发智能体的系统性评估
本文系统评估了七个前沿AI智能体在长期任务上的表现,发现它们更像是工程优化器而非自主研究者,并提出了改进训练和经验管理的建议。
嵌入式评估器如何监控前沿人工智能(阅读时间8分钟)
这篇博客文章提议使用嵌入式评估器来监控和评估前沿人工智能系统,以应对对齐风险并提高透明度,尤其是在像OpenAI-Hugging Face黑客事件这样的最近事件之后。
AutoWorldModel-Bench:面向自动化世界模型研究的以状态为中心的基准
介绍了AutoWorldModel-Bench,这是一个闭环基准测试,用于评估AI编程代理在八个游戏环境中进行自主世界模型研究的能力。该基准测试表明,Codex-5.4和Claude Opus 4.6等前沿代理在大多数会话中进行了非平凡的研究型改进。
单一能力还是多重能力?测试前沿人工智能评估的经济有效性
这项研究检验了人工智能排行榜中的经济基准是在衡量独立能力,还是仅仅反映一个总体趋势,结果表明它们提供了额外的信息,但主要受时间因素驱动。