当基准测试推理无法组合时:AI评估中的可投射性

arXiv cs.AI 论文

摘要

本文识别了AI基准评估中的一个非组合原则:对相邻投射的支持并不自动保证它们组合的合理性。文章提出了一种可投射性审计,用于诊断从基准到应用论证中缺乏支持的连接,并辅以一个法律研究案例和模拟实验。

arXiv:2607.26159v1 公告类型:新 摘要:一个AI基准结果很少一步就能得出重要的结论。评估者会将其推广到更多案例,将其解释为能力的证据,将其外推到新任务,将其迁移到另一个系统或场所,并将其与关于人工审查和下游后果的假设结合起来。以效度为中心的方法要求每一项主张都有证据。本文指出了一个更深层次的认识论问题:受支持的联系并不能自动构成一条受支持的链条。一项研究的目标可能不是下一项研究的来源;系统、总体、结果或条件可能在接口处发生变化;共享的数据或模型血缘可能使表面上独立的支持变得相互依赖。可投射性关注的是从观察到未观察案例的有界外推是否受支持。古德曼提出了竞争性外推问题;基于论证的效度提供了检验这些外推的架构。本文的独特主张是一个非组合原则:只有当端点与假设对齐,并且依赖性和不确定性被贯穿传递时,对相邻投射的支持才能保证其组合。一个法律研究案例表明,基准证据和一项部署研究可以各自有效,却仍然互不相干。一项再分析和模拟表明,总体稳定性为何会抹去后续投射所需的区分。由此产生的可投射性审计能够诊断基准到应用论证中缺乏支持的连接。
查看原文
查看缓存全文

缓存时间: 2026/07/31 04:00

# 当基准测试推断无法组合:AI评估中的可投影性

来源:https://arxiv.org/html/2607.26159

###### 摘要

一个AI基准测试结果很少能一步达到一个具有实际意义的结论。评估者会将其推广到更多案例,解读为能力的证据,外推到新任务,迁移到另一个系统或场景,并与关于人工审查和下游后果的假设相结合。以效度为中心的方法要求为每个论断提供证据。本文识别了一个更深层的认识论问题:有保证的链接并不自动构成有保证的链条。一项研究的目标可能不是下一项研究的来源;系统、总体、结果或条件可能在接口处发生变化;共享的数据或模型谱系可能使看似独立的支持变得相互依赖。可投影性关注的是从已观察到未观察案例的有界扩展是否得到保证。古德曼提供了竞争性扩展的问题;基于论证的效度提供了检验这些问题的架构。本文的独特主张是一个非组合原则:只有当端点和假设对齐、依赖性和不确定性被传递时,对相邻投影的支持才能保证其组合。一个法律研究案例表明,基准证据和部署研究各自成立却仍保持平行。一项重新分析和模拟表明,为什么总体稳定性会抹去后续投影所需的区分。由此产生的可投影性核查能够诊断基准到使用论证中不成立的联系。

关键词:AI评估;基准效度;可投影性;构念效度;泛化;AGI即AI应用。

在本文准备过程中,大型语言模型 ChatGPT 5;Claude Sonnet 4.5 和 Opus 4.8;Gemini 3.1 Pro 全程作为起草和编辑辅助工具。所有理论主张、论证、错误和解释选择均由我本人负责。

## 1 缺失的问题:组合

一个基准测试结果很少能单独支持一个具有实际意义的论断。考虑一个常见的推理链条。一个基础模型在多功能域测试组上得分很高。该得分被解释为通用推理能力的证据。基于该模型构建的产品被期望执行一项专业任务。人工审查被期望改善最终工作。这种期望、预计节省的成本以及容错率支持了授权。该链条跨越四个经验对象:基准测试响应、使用工具的应用程序的输出、人工审查后的工作,以及政策下的后果。能力归因涉及基础模型,通常允许从基准测试表现到应用表现的迁移。得分只记录基准测试响应,而非其他三个对象。

心理和教育测量为这个问题提供了严格的应对方式。在基于论证的观点中,效度属于分数的一种拟议解释和使用,而非独立于任何论断的测试本身[undefaaq (https://arxiv.org/html/2607.26159#biba.bibx31),undefaai (https://arxiv.org/html/2607.26159#biba.bibx23)]。近期工作将该观点引入AI评估。以论断为中心的框架区分测量、评估,以及从中得出的断言或决策;构念效度研究追问基准测试的内容、结构和关系是否支持所命名的能力;基准认识论说明识别了从学习问题上的表现移动到科学结论所需的假设[undefaav (https://arxiv.org/html/2607.26159#biba.bibx36),undefap (https://arxiv.org/html/2607.26159#biba.bibx4),undefaab (https://arxiv.org/html/2607.26159#biba.bibx16)]。这些方法相比将基准测试视为有效或无效而不说明其应当保证什么,有了显著改进。它们也揭示了一个进一步的问题。评估论证通常是链条,但对各个链接的支持并不会自动组合。一个基准测试可能支持一个关于在其规则下生成的新项目的论断。一个公司可能单独证明某个特定的人机协同流程在其自身案例样本上有效。这两个结果都可以各自成立,而不需要第一个结果为第二个提供前提。局部研究可能绕过基准测试而非扩展它。相反,两项研究可能在一个共享名词如“法律推理”、“草稿质量”或“人工监督”上看似汇合,却操作化了不同的对象、总体和结果。在任一情况下,简单地将研究加在一起并不会产生宽泛的论断。

这些不仅仅是可能性。法律研究供应商曾宣传基于检索的工具“无幻觉”,依据是这些工具的构建方式,而一项预注册评估后来在超过17%的查询上测量到幻觉[undefaan (https://arxiv.org/html/2607.26159#biba.bibx28)]。问题不在于机器输出会出错而人类判断不会。人类判断和制度同样会失败。AI使接口问题尤为紧迫,因为一个被评估的组件可以大量复制、修改成许多应用程序,并插入到相关证据分布于不同行动者之间的工作流程中。一个不成立的桥梁可能成为反复出现、相互关联的失败,而没有一项研究观察到完整的链条。LLM也可以使补救措施更易实施,它们能帮助评估者准备类型化的来源和目标描述、追踪假设和证据,并标记可能的不匹配以供检查。这些输出并不证明其所描述的保证;它们仍然是对一个过程的可错贡献,而该过程需要对独立证据和可问责判断负责。

本文的中心主张是一个非组合原则:

\[
\operatorname{Warr}(C_{1}) \land \operatorname{Warr}(C_{2}) \not\Rightarrow \operatorname{Warr}(C_{2}\!\circ C_{1}). \tag{1}
\]

这里 \(C_{1}\) 和 \(C_{2}\) 是呈现为相邻的链接。如果 \(C_{1}\) 的目标不是 \(C_{2}\) 的来源,那么组合在没有桥梁的情况下是未定义的;公式1 (https://arxiv.org/html/2607.26159#S1.E1) 涵盖其保证无法传递的已定义组合。公式1 (https://arxiv.org/html/2607.26159#S1.E1) 陈述了一个非组合原则,而非一种保证理论。将 \(\operatorname{Warr}\) 写成一个谓词是符号上的便利:\(\operatorname{Warr}(C)\) 表示足以满足所声明用途的保证。这个阈值记号并不意味着对固定论断的支持是二分的或可还原为一个尺度;对组件链接的保证不会扩展到它们的组合。有保证的组合需要对象、总体、条件、结果和时期上的对齐,或一个单独得到保证的桥梁;需要兼容的假设和效应修饰因子;需要依赖性和不确定性的传播。

可投影性关注的是从已观察到未观察案例的一个有界扩展是否得到保证。该术语来自古德曼对归纳的处理,但这里发展出的说明并不提供归纳的一般解决方案,也不使“固着”成为充分条件。它在效度论证中为一个更窄的问题提供了位置:究竟投射的是什么,跨越哪条边界,在哪些假设下,以及有哪些证据来对抗可能击败该扩展的差异?一个“可投影性核查”逐链接记录答案,并诊断不成立的联系,而不是将各自有保证的链接视为自动可组合的。

这一焦点将本文与相邻提议区分开来,但并不取代它们。一个“律则网络”(即一个构念被预测与其他构念和可观察量具有的关系集合)可以使能力主张更加实质[undefax (https://arxiv.org/html/2607.26159#biba.bibx12),undefaaa (https://arxiv.org/html/2607.26159#biba.bibx15)]。一个估计量可以精确说明一项研究针对的数量[undefaq (https://arxiv.org/html/2607.26159#biba.bibx5)]。一个选择图可以识别将因果效应迁移的条件[undefaar (https://arxiv.org/html/2607.26159#biba.bibx32)]。每一项都可能为某个投影提供证据或结构。但它们中没有一项本身能保证一个分析的目标是下一个分析的来源。可投影性关注每个特定边界的扩展是否得到保证;核查还考察各分析之间的接口。

第2节 (https://arxiv.org/html/2607.26159#S2) 将可投影性定位于效度理论内部,并将其与构念意义、预测和决策区分开来。第3节 (https://arxiv.org/html/2607.26159#S3) 陈述接口要求,并将组合与收敛和替代区分开来。第4节 (https://arxiv.org/html/2607.26159#S4) 详述一个法律研究案例,其假设结果支持一个投影、击败另一个投影,并使第三个投影悬而未决。第5节 (https://arxiv.org/html/2607.26159#S5) 展示上游平均值如何抹去下游投影所需的项目级差异。第6节 (https://arxiv.org/html/2607.26159#S6) 和第7节 (https://arxiv.org/html/2607.26159#S7) 将结果应用于通用能力主张,并在开发者与部署者之间分配证据工作。

## 2 效度论证中的可投影性

### 2.1 来自相同观察的竞争性扩展

古德曼的归纳新谜题始于对同样符合互不相容扩展的观察。在时间 \(t\) 之前检查的每颗祖母绿都是绿色的。这些观察符合熟悉的假说:祖母绿是绿色的。它们也符合竞争性假说:祖母绿是“绿蓝的”。在该假说下,已观察的祖母绿符合条件是因为它们是绿色的,但在 \(t\) 之后首次检查的祖母绿只有在它是蓝色时才符合条件。两个假说在每一颗已观察的祖母绿上都一致,而在下一个未检查的祖母绿上分歧。对来源观察的拟合并不决定哪个谓词适合投影[undefaae (https://arxiv.org/html/2607.26159#biba.bibx19), 74–80]。

基准测试的类比并非评估者真的发明了时间索引谓词。许多对未观察案例的分类在已评分项目上是一致的。成功可以被归入“通用法律推理”、“回答给定文本的法律问题”、“识别来自熟悉来源问题的模式”,或更窄的描述。这些谓词在测试集上可以是外延等价的,而在一个需要当前权威、实时检索、来源比较和引用备忘录的研究请求上则可能分歧。更多在相同窄项目生成规则下采样的观察可能无法区分其中任何一个。

古德曼诉诸固着,即一个谓词在过去投影中成功使用的历史[undefaae (https://arxiv.org/html/2607.26159#biba.bibx19), 84–98]。其他说明更重视可修订的背景理论和因果结构[undefat (https://arxiv.org/html/2607.26159#biba.bibx8),undefaak (https://arxiv.org/html/2607.26159#biba.bibx25)]。本说明不需要任何单一充分标准。它更谦虚的教训是,扩展规则必须被暴露出来。目标声明识别竞争谓词在其中分歧的案例。背景知识识别可能重要的差异。直接样本、受控变化和后续观察检验这些差异。这并不消除归纳;它使特定的归纳可检查且可修订。

### 2.2 定义与范围

一个“投影”将解释、预测或说明从指定来源观察扩展到未观察案例。可投影性关注的是相对于一个已声明目标和用途,该有界扩展是否得到保证。随之有三个限制。

首先,可投影性属于一个有界的投影主张,而非孤立地属于一个分数、基准或系统。同一个基准结果可能为在注册模板下生成的进一步项目上的表现提供实质保证,而为开放式专业工作上的表现提供很少保证。不指明目标而称基准“可投影”,掩盖了争议所在。

其次,可投影性不是一个标量属性。对固定投影的支持可能更强或更弱,但支持、范围以及与该论断相关的证据种类不应被压缩到一个尺度上。报告应保留异质结果:一个预测估计和区间、一个被击败的不变性假设、一个未解决的总体差距,以及一个得到支持的窄用途。将这些压缩成可投影性分数会重新制造聚合问题。状态应保持针对具体论断:在所述证据标准下得到支持,被特定证据击败,或因相关证据缺失或不精确而未解决。每种状态都应指明其限度,例如对一种请求类型的支持,或对只有另一方才能提供的证据的依赖。

第三,来源拟合只是证据的一部分。对投影的保证通常来自四个地方。直接目标抽样展示目标规则所允许案例中发生的情况。刻意变化检验那些被怀疑会改变结果的特性,同时保持主张所视为不变的部分。背景知识解释为什么某些差异是合理的击败者而其他不是。在真正新的层面上的复制(另一个模板族、系统谱系、站点或时期)检验早期规律是否在被投影的维度上存续。没有任何一个可以被关于来源与目标相似的裸断言所取代。

本说明属于基于论证的效度方法内部。Kane 将拟议的解释和使用表示为一系列推断和假设,每个都需要与其论断的雄心相称的支持[undefaai (https://arxiv.org/html/2607.26159#biba.bibx23), 1–3, 22–25]。Messick 的统一说明同样将效度视为关于分数意义和使用的证据判断,利用内容、反应过程、内部结构、与外部变量的关系以及后果[undefaaq (https://arxiv.org/html/2607.26159#biba.bibx31), 741–749]。可投影性关注的是论证中那些扩展到来源设计下观察到的案例之外的部分是否得到保证。它并不包含每一个效度问题。一个量规是否错误评分了观察到的反应,首先是一个评分问题,然后才是投影问题;一个拟议能力是否具有连贯意义,是一个解释性问题,它可能制约投影但不还原为投影。

### 2.3 可投影性为相邻框架增加了什么

相邻工作可以按推理延伸的距离来分类。一些框架止步于基准测试收集的内容;另一些则跟随单个论断从证据到解释和使用。本文追问是什么保证了两个此类论断之间的连接。

[undefaat (https://arxiv.org/html/2607.26159#biba.bibx34)] 认为,宽泛的基准主张通常超出用于构建它们的上下文任务,而 [undefas (https://arxiv.org/html/2607.26159#biba.bibx7)] 阐述了构念效度在语言模型评估中如何失败。[undefaam (https://arxiv.org/html/2607.26159#biba.bibx27)] 将教育评估中的循证中心设计(evidence-centered design)加以改编,将基准构建形式化为需要设计者——

相似文章

评估陷阱:基准设计作为理论承诺

arXiv cs.AI

本文识别了“评估陷阱”,即人工智能基准测试无意中通过缩小“进步”的定义来稳定主导范式,并引入了Epistematics,一种元评估方法论,以确保评估标准能够区分真实能力与代理行为。

AI模型构建者的不稳定指标与基准测试文化

arXiv cs.AI

本文介绍了Benchmarking-Cultures-25数据集,该数据集分析了AI模型构建者如何在新闻稿中选择性突出基准测试。研究发现评估格局碎片化,跨模型可比性有限,并指出基准测试更多被用作市场定位的叙事工具,而非标准化的科学测量手段。

BEAMS: AI在建模与仿真中的基准测试与评估

arXiv cs.AI

BEAMS倡议提出了一套基准测试集,用于评估建模与仿真中的AI工具,重点关注以人为本和负责任的AI实践。测试显示,基于LLM的引擎存在差异,在定性任务上的表现优于因果推理。

好的基准

arXiv cs.AI

这篇2026年7月的论文基于Terminal Bench项目的经验,定义了为AI智能体设计有效基准任务的原则。好的任务应当正确、可解、可验证、明确规范,并且因有趣的原因而具有难度,强调现实世界相关性和基于结果的验证。