评估陷阱:基准设计作为理论承诺
摘要
本文识别了“评估陷阱”,即人工智能基准测试无意中通过缩小“进步”的定义来稳定主导范式,并引入了Epistematics,一种元评估方法论,以确保评估标准能够区分真实能力与代理行为。
arXiv:2605.14167v1 Announce Type: new
摘要:每一个AI基准测试都在操作化其所声称评估能力背后的理论假设。当这些假设作为未经审视的承诺发挥作用时,基准测试便通过缩小“进步”的定义来稳定主导范式。随着时间的推移,狭窄的评估重新组织能力概念:架构和定义被选择以适配基准测试的可读性,直到评估不再追踪独立对象,而是产生一个由其自身操作假设定义的目标版本。结果便是一个陷阱:评估框架将自我强化的评价视为有效,既创造又掩盖了当前范式所能实现的结构性限制。我们引入了Epistematics,一种直接从技术能力主张中推导评估标准,并审计所提出的基准测试能否区分声称能力与代理行为的方法论。其贡献在于元评估层面:一个审计程序、一个失败模式分类法,以及用于评估能力-评估一致性的基准设计标准。我们通过对Dupoux等人(2026)的工作审计来演示该程序,该提案在架构层面修正了主导范式的理论假设,却在评估标准中复制了这些假设,从而以评估无法察觉的形式固化了其试图克服的约束。
查看缓存全文
缓存时间: 2026/05/15 06:21
# 基准测试设计作为理论承诺 来源:https://arxiv.org/html/2605.14167 ## 评估陷阱:基准测试设计作为理论承诺 ###### 摘要 每一个AI基准测试都将关于其所声称评估能力的理论假设操作化。当这些假设作为未经审视的承诺发挥作用时,基准测试会通过窄化什么算作进步来稳定主导范式。随着时间的推移,狭隘的评估重新组织能力概念:架构和定义被选择以适应基准测试的可读性,直到评估不再追踪一个独立的对象,而是产生一个由其自身操作假设定义的被评估对象版本。结果是一个陷阱:评估框架将自我强化的评估视为有效,既创造又掩盖了当前范式所能实现的结构性限制。我们引入**Epistematics**,一种直接从技术能力声明中推导评估标准,并审计所提议的基准测试能否区分所声称能力与代理行为的方法论。其贡献是元评估性的:一个审计程序、一个失败模式分类法,以及用于评估能力-评估一致性的基准设计标准。我们通过对Dupoux等人(2026)(https://arxiv.org/html/2605.14167#bib.bib6)的工作审计来演示该程序,该提案试图在架构层面修正主导范式的理论假设,同时在其评估标准中重现这些假设,从而以评估无法察觉的形式固化了它试图克服的约束。 ## 1 引言 众所周知,评估并非中立地衡量性能;它塑造着研发活动(Raji等人,2021(https://arxiv.org/html/2605.14167#bib.bib20)),污染了研究对象。然而,关于这种现象发生的机制以及如何应对,仍然解释不足。 本文探讨AI领域的评估,认为基准测试之所以塑造该领域,是因为它们将指导能力如何被建模、评估以及最终判定为有效的隐含理论假设操作化。随着基准测试成功成为进步的主导信号,它变成了能力的实际解释,掩盖了性能与其所代表能力之间的区别。这种动态使学科对其自身的边界视而不见,导致它将结构性死胡同视为单纯的技术障碍。我们将这种污染命名为**评估陷阱**,并提出一种方法论应对。这一动态与Kalaitzidis (2026(https://arxiv.org/html/2605.14167#bib.bib13))描述的认知洗白机制是一脉相承的,后者通过AI话语使有争议的理论承诺得以稳定和自然化。 我们引入**Epistematics**作为解决此问题的元评估框架。该方法论分为四个步骤:(1) 明确所声称的能力;(2) 提取定义该能力所需的理论假设;(3) 推导这些假设所蕴含的架构和环境要求;(4) 检验所提议的评估标准能否区分所声称能力与更简单的代理行为。输出结果是易于处理的设计输入:判别性的评估标准、预测的失败模式,以及候选的基准测试规范。现有的基准测试分析通常是在事后识别评估失败;Epistematics则在基准构建之前,直接从能力声明中推导评估条件。 我们通过对Dupoux等人(2026(https://arxiv.org/html/2605.14167#bib.bib6))的工作审计来演示该程序,该提案关于“自主学习的”试图在架构层面修正主导AI范式的理论假设,同时在其评估标准中重现这些假设。通过这一演示,我们为评估科学做出三项贡献:用于诊断能力-评估不一致性的形式化审计程序;展示即使在最前沿研究中评估失败仍然存在的工作分析;以及构建能够检测其所声称能力的基准测试的设计标准。 ## 2 评估陷阱的机制:可迁移性、循环性与行为近似 要评估任何能力,基准测试必须明确什么构成证据、什么表现具有诊断性、以及什么条件会揭示其缺失。这些规范编码了关于目标的理论假设;一旦操作化,它们就作为理论承诺发挥作用,决定了框架能检测到什么、不能检测到什么(Bowker和Star,1999(https://arxiv.org/html/2605.14167#bib.bib2))。不审视自身假设的评估无法检测其自身方法的结构性局限。依赖此类评估的领域无法产生超越这些局限所需的修正。这一动态通过三种相互依赖的机制运作:将基准性能转化为能力归因的**可迁移性假设**、评估逐步重组自身对象的**循环性**,以及由此产生的**行为近似**。 ### 2.1 可迁移性假设 在AI中,理论假设渗透到设计堆栈的每个层面。目标函数决定优化目标,训练数据界定相关证据,评估条件定义有效测试,指标指定成功标准。这些选择共同实例化了一个关于目标能力的特定理论,并排除了其他理论。例如,奖励与目标分布输出相似性的基准测试,并不衡量一般意义上的能力;它衡量的是**按照分布性能理论定义**的能力,并激励构建实现该能力的架构。 一个操作化了这种**事实上的**理论的基准测试,无法区分一个在其自身标准上有所改进的系统与一个实例化了其所声称衡量能力的系统(Chollet,2019(https://arxiv.org/html/2605.14167#bib.bib4);Raji等人,2021(https://arxiv.org/html/2605.14167#bib.bib20))。这种局限性是结构性的:做出区分需要一个框架未编码的比较理论。 从基准性能到能力归因的推断依赖于一个**可迁移性**假设:即在基准测试上的表现能够推断出更广泛的能力(Cartwright,1999(https://arxiv.org/html/2605.14167#bib.bib3))。没有这一理论假设,基准测试所衡量的与能力所要求之间的差距将是可见且可处理的。有了它,可观察的性能就被视为能力的证据,即使支撑该推断的机制并不存在。在优化压力下,这种推断重塑了原始目标。一旦性能被视为能力的充分证据,优化便作用于基准测试的操作化而非能力本身。这建立了一个强化反馈循环:可迁移性假设将性能视为能力,优化随之跟进,目标围绕基准测试所能检测的东西重组。 ### 2.2 循环性问题 我们将这个循环称为**循环性问题**。它不同于数据污染(描述训练数据对测试集的泄露),也超出了古德哈特定律(该定律假设存在一个稳定的目标,代理指标无法追踪它)(Goodhart,1984(https://arxiv.org/html/2605.14167#bib.bib10))。古德哈特定律识别了稳定目标与日益被操纵的代理指标之间的分歧,而循环性则识别了一个反馈循环,其中评估行为本身参与了对目标在概念和技术上的构成。这是一个“循环效应”(Hacking,1999(https://arxiv.org/html/2605.14167#bib.bib11)),其中分类参与创造了它们所描述的现象。随着评估框架稳定下来,它们重塑了什么是能力(Porter,1995(https://arxiv.org/html/2605.14167#bib.bib19)),产生了满足评估标准的系统,同时将这些标准固化为了能力本身。这种稳定化过程通过Kalaitzidis (2026(https://arxiv.org/html/2605.14167#bib.bib13))所分析的认知洗白机制运作:通过双重掩盖使误认自然化。 这产生了能力概念的“有损压缩”,其中实例化能力所需的各种理论承诺被丢弃,而易于处理、对基准可读的代理指标被保留。这种简化产生了一个**结构性天花板**:即一个范式所能达到或识别为成就的限度。由于底层假设固定了 (1) 问题空间、(2) 可读解决方案的空间、以及 (3) 进步证据的标准,这个天花板从范式内部是看不到的;它看起来不是边界,而是可能的极限(Kuhn,1962(https://arxiv.org/html/2605.14167#bib.bib14))。 ### 2.3 行为近似的有损性 结构性天花板在该领域造成了盲点:前沿研究所追求的一些能力可能需要与主导基准测试所假设的不可通约的理论承诺。这种不可通约性在架构层面表现出来。例如,分布理论通常通过固定权重的部署模型进行操作化,而控制论111控制论由Wiener [1948] 发展,将学习视为通过连接系统输出与环境状态的反馈循环进行的实时纠错。则需要将系统输出与环境状态耦合的闭环反馈循环。在分布性评估框架内的优化不仅无法趋近控制论能力;它还会造成一种假象,即现有方法只要规模足够就足够了(Chollet,2019(https://arxiv.org/html/2605.14167#bib.bib4);Marcus,2017(https://arxiv.org/html/2605.14167#bib.bib17);Agre,1997(https://arxiv.org/html/2605.14167#bib.bib1))。评估和工程变得相互强化,掩盖了可能支撑它们的替代理论框架、架构和评估。 这种强化的循环性产生了一类特定的系统。当前的基准测试评估的是具有稳定条件和可验证输出的定义明确的问题空间;而许多AI工程师追求的能力(例如,自主学习、真正的推理、自适应世界建模)是在开放、依赖情境的条件下运作的,且抵制预定义的成功标准。基准测试通过将结构不良的问题转化为结构良好的代理指标来测量这些自适应能力(Jonassen,1997(https://arxiv.org/html/2605.14167#bib.bib12)),而针对这些代理指标进行优化的系统学会了在代理指标定义的条件上取得成功(Chollet,2019(https://arxiv.org/html/2605.14167#bib.bib4);Geirhos等人,2020(https://arxiv.org/html/2605.14167#bib.bib8))。我们将由此产生的系统称为**行为近似的**:它们在基准测试条件下产生类似于真正有能力系统的输出,但没有实例化这些输出所需的机制。 行为近似源于在可迁移性假设下的基准设计,以及在一个循环的、有损的评估体系内的优化。它是结构性天花板的显现形式。性能无法迁移不是因为系统没能学习,而是因为它精确地学习了基准测试使之可读的东西。 这种分类上的忽视逃脱了产生它的评估框架。当失败发生时,从业者通过工程实践的技术理性(Schön,1983(https://arxiv.org/html/2605.14167#bib.bib23))来应对:更多数据、架构改进、延长训练。但如果天花板是结构性的而非技术性的,这些应对措施无法解决它。它们只是在产生限制的相同假设内进一步优化,这就是为什么尽管在主导评估体系内持续进步,但该领域最雄心勃勃的能力可能仍然遥不可及。该领域陷入了评估陷阱:其评估框架无法检测声称能力与实际实例化能力之间的差距,而可用的唯一解决方案就是该范式所能产生的那些方案。 ## 3 Epistematics:一个元评估程序 能力声明 → 理论假设 → 设计与评估要求 → 判别效度检验 ↑ 在此识别出失败模式 图1:Epistematics程序:从能力声明到判别效度检验的四步流程,带有识别失败模式的反馈箭头。 Epistematics将能力定义视为必须在评估之前明确的理论承诺。它分四步进行:(1) 明确技术与公共话语中使用的能力声明;(2) 提取该声明所援引或隐含的理论假设;(3) 推导这些假设所必需的架构和环境要求;(4) 检验所提议的评估标准能否将目标能力与代理行为区分开来。如果一个缺乏目标机制的系统能够满足该标准,或者一个拥有目标机制的系统无法被该标准唯一识别,则基准测试未能通过判别效度检验。因此,判别效度关注的不是基准测试能否预测性能,而是它能否将目标机制与通向基准成功的替代路径区分开来。 该程序设计为可重复的:独立研究人员应用四个步骤应能收敛于可比较的架构要求,差异可追溯到理论解释或约束推导上的分歧。这种分歧本身就是一个发现,而非缺陷。输出结果是易于处理的设计输入:判别性评估标准、预测的失败模式,以及工程师可以评估、质疑和发展的候选基准规范。这些输出规定了基准测试可以有效地归因于所声称能力的条件。 具体来说,判别效度检验的失败模式并非一般的基准缺陷;它们是循环性问题的特定标志。每一种都命名了可迁移性假设维持评估中结构性盲视的方式。 **代理替代。** 基准测试衡量的是任务收敛性而非目标能力。一个通过利用代理任务中的统计规律达到标准性能的系统,与一个真正实例化了目标机制的系统是无法区分的。 **架构不可区分性。** 某些机制在特定架构中无论在何种训练历史下都是结构上不可能的。一个固定权重、非递归的系统无法实例化实时反馈耦合,但达到标准的指标衡量的是结果而非机制,无法注册这种结构性缺失。一个近似反馈驱动行为的系统和一个实例化它的系统在评估上变得等价。 **情境盲区。** 不变化情境的基准测试无法检测能力是情境敏感的,还是任务特定的。在固定任务族上的性能只能证明基准测试自身的任务被解决了;通用能力与任务特定优化区分开来的条件从未出现。 **标准泄漏。** 统计上的对等并不意味机制上的等价。一个达到人类
相似文章
AI模型构建者的不稳定指标与基准测试文化
本文介绍了Benchmarking-Cultures-25数据集,该数据集分析了AI模型构建者如何在新闻稿中选择性突出基准测试。研究发现评估格局碎片化,跨模型可比性有限,并指出基准测试更多被用作市场定位的叙事工具,而非标准化的科学测量手段。
Evaluation Cards: 一种AI评估报告的解释层
本文介绍了EvalCards,这是一种操作框架,通过将基准元数据、评估运行数据和模型元数据组合成一个统一记录,并包含可重现性、完整性、来源、风险和分数可比性的解释性信号,从而标准化AI评估报告。作者在数千个模型和基准测试中部署了一个监控工具,揭示了当前报告实践中的系统性差距。
交互式评估需要设计科学
本立场论文认为,交互式AI评估应被视为一种设计科学范式,提出了用于通过轨迹评估动态系统行为的双轴分类法和报告标准。
当AI基准陷入平台期:基准饱和的系统性研究
一项系统性研究,定义并分析了60个语言模型基准中的基准饱和现象,发现近一半的基准已出现饱和,且专家精选的基准更具韧性,为构建持久评估提供了设计选择。
古德哈特定律盯上了每一个你信任的基准
讨论了古德哈特定律如何削弱对AI基准的信任,因为指标一旦成为目标,就会失去作为评估标准的有效性。