基准测试的基准测试:检验常识基准的预测效度

arXiv cs.CL 论文

摘要

本文通过评估23个大语言模型在四个基准测试及其改进版本上的表现,检验常识基准分数是否能预测现实世界下游任务的表现,发现改进版本保持了排名,但仅提供依赖于任务的预测效度。

arXiv:2608.03340v1 公告类型:新 摘要:预测LLM在现实世界任务上的能力至关重要,但常识基准上的性能在多大程度上能预测下游性能仍未得到充分说明。为了确定广泛采用的常识基准的实用可用性,我们在四个成熟的常识基准、四个改进版本、三个非常识对照组以及八个需要隐含社会、语用、时间或物理推理的下游任务上评估了来自六个模型家族的23个模型。我们比较模型排名,计算受控相关性,并使用留一模型家族交叉验证来评估常识基准的效标效度。我们的结果表明,改进后的基准在很大程度上保留了原始模型排名,并未提高下游预测能力。常识基准仅对一小部分下游任务表现出一致的跨家族预测效度,在其他方面仅有较小或特定于指标的提升。总体而言,标准化常识基准提供的是依赖任务的证据,而非广泛的下游常识能力证据。
查看原文
查看缓存全文

缓存时间: 2026/08/05 07:45

# 基准测试的基准测试:检验常识基准的预测效度
来源:https://arxiv.org/html/2608.03340
###### 摘要

预测大语言模型(LLM)在真实世界任务上的能力至关重要,但常识基准上的表现能在多大程度上预测下游表现,仍未得到充分说明。为了确立广泛采用的常识基准的实际可用性,我们评估了来自六个模型家族的 23 个模型,涉及四个成熟的常识基准、四个重制变体、三个非常识对照组,以及八个需要隐式社会、语用、时间或物理推理的下游任务。我们比较模型排名,计算受控相关性,并使用留一家族交叉验证来评估常识基准的效标效度。结果表明,修订后的基准基本保留了原始模型的排名,且并未提升下游预测能力。常识基准仅对一小部分下游任务表现出跨家族的一致预测效度,在其他任务上则只有较小或特定于指标的增益。总体而言,标准化常识基准提供的更多是依赖于任务的证据,而非广泛的下游常识能力的证据。

## 1 引言

标准化评估设置允许频繁且相对廉价的模型评估,此类基准分数通常被解释为模型已获得某种技能或知识的证据。然而,此类主张的有效性受到质疑(例如,参见 Sajadieh 等人 (2026);Gevers 等人 (2025b);Sheikhi 等人 (2026);Mitchell (2026))。许多广泛使用的(常识)基准是静态的多项选择数据集,研究反复表明,此类基准分数容易受到伪影、污染、不稳定的评分选择或不可靠标注的影响。核心问题已不再是否常识基准存在缺陷,而是其分数是否仍能作为下游模型行为的有用指标。我们将这一问题置于当前基准危机引发的两种常见应对方式之间。一种应对方式是修复并标准化现有评估结构;另一种则是用交互式、基于任务或开放式评估范式取代静态基准(Truong 等人,2026;Kapoor 等人,2026;Ying 等人,2026;Momentè 等人,2025)。重制的基准可能改善内部数据集质量,但这些修复是否产生了更有用的模型能力指标仍不清楚。因此,我们既检验修订是否保留了其原始版本所引发的测量结果,也检验它们是否提升了效标效度:在常识基准上表现良好的模型,是否也在需要相同底层技能的下游任务上表现良好?为回答这一问题,我们评估了来自六个模型家族的 23 个大语言模型,涵盖四个广泛使用的常识基准:WinoGrande、HellaSwag、Social IQA 和 Physical IQA,及其用于解决已知局限性的重制变体:WinoWhat、GoldenSwag、过滤版 Social IQA 变体,以及 Physical IQA-RUP。同一批模型还在八个覆盖三个概念轴(社会与情绪推理、语用推理、事件/物理合理性)的下游任务上进行了评估:CEI、SARC7、False Beliefs、Implicature、Presupposition、Indirect Requests、TimeDial 和 TRIP。由于相关性可能反映的是整体模型质量而非特定于常识的能力,我们纳入了 BLiMP、GPQA-Diamond 和 MMLU-Redux 作为对照,并测试常识分数是否能在模型大小和对照表现之外,改善对来自未见模型家族模型的预测。下游任务为常识基准提供了一次效标效度压力测试。完成这些任务需要的不仅仅是明确陈述的信息:模型必须利用广泛共享且通常未说明的(背景)知识,来推断代理的信念、合理情绪、说话者意图,以及事件的时间或物理后果。我们并不期望每个基准都能预测每个下游任务。然而,如果一个基准捕捉到的是其所要测量的、可复用的常识推理形式,而非主要依赖数据集特有的线索,那么在基准上表现良好的模型,也应在需要相关推理的情境化任务上表现良好。换言之,针对特定常识子技能(例如社会或物理推理)的常识基准,按理应更好地迁移到同一概念领域内的下游任务。据此,我们提出三个研究问题:(1)常识基准的修订是否会改变模型排名,或相对于其原始版本提升效标效度?(2)常识基准分数能否在通用模型能力之外预测下游表现?(3)这种效度是否具有领域特异性,即社会、语用或事件/物理基准是否对来自同一概念轴的下游任务尤其具有预测力?所有任务均采用基于对数似然的多项选择设置进行评估。随后我们计算成对 Spearman 相关性、控制模型大小、模型家族和非常识基准表现的偏 Spearman 相关性,并拟合留一家族交叉验证预测模型。我们的结果表明:首先,重制基准在很大程度上保留了其原始版本的模型排名,且并未实质性地提升下游预测效度。其次,False Beliefs 和 TRIP 表现出最强、最一致的关联和跨家族预测增益。Presupposition 在各指标上也表现出正向预测,而 Implicature、Indirect Requests 和 TimeDial 的增益则因指标而异;CEI 和 Sarcasm 的预测效果仍然较差。第三,我们几乎没有发现证据表明常识基准捕捉了独特的领域特定能力:迁移很少遵循基准元数据所暗示的细粒度构念。综合来看,这些发现表明常识基准表现是对下游语用任务表现的不均衡预测指标。它们对 False Beliefs 和 TRIP 最具信息量,在其他任务上则具有选择性信息量,但并未提供语用常识能力的广泛证据,也无法可靠地支持关于不同常识子技能的细粒度主张。¹¹¹所有代码和数据集可在 https://github.com/clips/predictive_validity_benchmarks 获取。

## 2 相关工作

基准分数只有在评估操作化了预期构念的情况下,才能支持能力主张。近期研究记录了判别力与排名一致性较弱、对提示和评分的敏感性、污染,以及指标套利的机会(Qian 等人,2026;Molfese 等人,2025;Balepur 等人,2026;Chung 和 Kim,2026;Wang 等人,2026)。依赖基准分数来指导模型选择(例如,行业教程和博客文章中教授的:IBM (n.d.);Arize AI (2023))可能误导科学研究的开展(Bean 等人,2026;Mitchell,2026)。这些威胁在测试常识知识时尤其相关,常识本身就是一个极其广泛的任务,缺乏清晰定义,导致基准多样化且宽泛。观察到常识基准存在缺陷并非新事(例如,参见 Sajadieh 等人 (2026);Gevers 等人 (2025b);Sheikhi 等人 (2026))。其通常受约束的多项选择问答形式可能无法反映模型的实际行为(Balepur 等人,2025;Wang 等人,2024);答案标签可能与人类偏好冲突或在不同人群中存在差异(Palta 等人,2024;Nguyen 等人,2026);而固有主观的任务可能导致标注不稳定(Kejriwal 等人,2024)。数据集清洗能够解决一些内部弱点,但改进标注质量本身并不能确立效标效度。内部效度与效标效度之间的区别对于修订版基准尤其相关。修订通常通过证明示例歧义更少、更少受伪影驱动,或对特定捷径更稳健来获得合理性。这些都是重要改进,但这并不意味着它们自动成为更好的下游表现指标。一个重制基准可能与其原始版本保持高度相关,因为过滤保留了模型之间的相对优势;另一种情况是,大规模改写可能改变排名,但同时测量的却是不同能力的混合体。将原始和修订基准与外部标准进行比较,可以在经验上区分这些可能性,而本研究正是填补了这一研究空白。我们的研究旨在经验性地确立标准化常识基准的预测效度:我们不是聚焦于应对当前基准缺陷的理想方案,而是探索学术基准分数与下游实用性之间的实际关系,这一关系仍相对未被绘制(Sheikhi 等人,2026)。这将评估从内部数据集质量转向效标效度:基准引发的模型间差异是否与相关外部结果有关;以及增量效度:它们是否在通用能力指标之外提供了额外信息。

常识推理通常不被理解为一个单一的、形式上界定清晰的技能,而是关于物理对象、事件、社会关系、信念、目标、情绪、规范以及可能后果的广泛日常背景知识(McCarthy,1959;Davis 和 Marcus,2015;Levesque 等人,2012)。语用解释依赖于大量相同的隐式信息:含义(implicature)、预设(presupposition)、间接言语、讽刺以及社会情境化解释,都需要对说话者目标、共同基础、语境和合理事件进行推理(Grice,1975;Stalnaker,2002;Geurts,2024;Sravanthi 等人,2024;Ma 等人,2025)。

尽管如此,先前研究表明,即使在旨在测量相关能力的基准之间,表现也未必会迁移(Shen 和 Kejriwal,2023)。因此,近期研究通过跨模型相关性和预测比较来考察能力关系(Fan 等人,2026;Tsvilodub 等人,2026)。然而,标准化常识基准能在多大程度上预测在更具情境化的语用和常识依赖任务上的表现,仍研究不足。我们通过测试常用常识基准所引发的模型排名是否迁移到需要相关形式隐式推理的下游任务上,来填补这一空白。

## 3 方法

### 3.1 常识基准

我们选择了四个广泛使用的常识基准及其四个修订版本,修订版本旨在过滤有问题的条目或改写原始数据(见表 1)。所有基准均在公开验证集上使用长度归一化的答案选项对数似然进行评估。

所选基准操作化了广泛常识构念的互补方面。WinoGrande 要求通过关于事件、目标和因果关系的知识来解析歧义指代;HellaSwag 要求模型区分日常情境的合理与不合理延续。Social IQA 关注意图、动机、反应和可能的社会后果,而 Physical IQA 则针对物体使用、可供性(affordances)和直觉物理约束。尽管侧重点不同,所有这些基准都假设成功作答需要恢复提示中未明确陈述的信息。

表 1:常识基准对(Sakaguchi 等人,2021;Zellers 等人,2019;Sap 等人,2019;Bisk 等人,2020;Gevers 等人,2025a;Chizhov 等人,2025;Mousavi 等人,2026;Wang 和 Zhao,2024)。原始基准和修订基准均可获得,这使我们能够衡量基准修订(1)是否影响模型排名,以及(2)相对于其原始版本,是否更能指示下游表现。

### 3.2 下游任务

我们构建了一个下游评估套件,涵盖社会推理、语用解释、话语理解和事件级推理。选择这些任务是因为它们在更丰富的语言和话语语境中实例化了常识基准所针对的隐式推理。我们按照三个概念轴组织任务(见表 2)。**社会与情绪推理轴**包括 CEI(Chun 等人,2026)、SARC7(Xiong 等人,2025)和 False Beliefs(Jones 等人,2024)。这些任务涉及对代理内部状态的推理:他们的情绪、态度、意图和对世界的表征。**语用推理轴**则关注通过语言传达但并非完全由其字面内容决定的意义。它包括 Implicature 和 Presupposition(Jeretic 等人,2020),以及 Indirect Requests(Jones 等人,2024),这些任务要求模型对交际意图、会话替代项和共同基础进行推理。**事件与物理合理性轴**包括 TimeDial(Qin 等人,2021)和 TRIP(Storks 等人,2021),它们要求进行时间事件推理、物理状态跟踪,以及关于行动前提和后果的推断。这些轴是分析性分组,而非常识的确定性分类法。它们捕捉了广泛的对

相似文章

对概率算子进行逻辑推理的LLM能力基准测试

arXiv cs.CL

本文介绍了一个包含14,320个程序化生成提示词的基准测试,用于评估LLM在涉及“probably”“might”“must”等概率算子的逻辑推理上的表现。作者对29个模型进行了测试,发现了系统性的答案偏差,并表明只有9个模型的表现超过了随机水平。

基准是否低估了 LLM 的性能?采用以大语言模型为先、人工仲裁的评估方法评估幻觉检测

arXiv cs.CL

本文通过采用以大语言模型为先、人工仲裁的评估方法重新评估幻觉检测数据集,研究了标准基准是否低估了大语言模型(LLM)的性能。研究发现,在仲裁过程中融入大语言模型的推理能力可以提高评估的一致性,并表明针对容易产生歧义的任务,采用模型辅助的重新评估能产生更可靠的基准。

当无基准存在时:验证无真实标签的LLM安全评分比较

Hugging Face Daily Papers

本文介绍了一个框架,用于在没有真实标签的情况下验证LLM安全评分比较,通过使用'工具有效性链'来建立部署证据。该方法通过一个名为SimpleAudit的本地优先工具在挪威安全包上进行了演示,并比较了Borealis和Gemma 3等模型。