CogArena:大语言模型中认知能力结构的多元方法评估

arXiv cs.CL 论文

摘要

CogArena 引入了一个程序化生成的 13 范式基准,用于评估大语言模型是否展现出可分离的认知能力还是单一的通用能力,结果仅发现对 55 个模型稳定五维特征的支持较弱。

arXiv:2607.24999v1 公告类型:新 摘要:LLM 的认知得分越来越多地按能力维度进行总结,这些维度应在任务间收敛,对匹配的干预做出选择性响应,并能够推广到定义它们的模型之外。我们提出了 CogArena,这是一个程序化生成的 13 范式基准,基于多元方法框架构建,用于确定认知任务得分何时足以支持五个理论驱动的分组中的维度标签。在 55 个开源权重模型中,几乎所有范式的相关性均为正,一个公共轴解释了约一半的方差。分组内优势较小,对评分敏感,且在不同模型家族间具有不确定性。在一项独立冻结、完全交叉的研究中(涉及 6 个家族的 12 个模型),针对性的支架显示出较小的匹配分组优势,但没有一个支架特定的对比能够通过多重性校正,且选择性并未改善对保留家族的预测。冻结的确认标准未通过。事后进行的措辞替代复制产生了更小的正向估计,且再次失败。综合来看,这些结果支持一个边界结论。与理论一致的提示在电池内部产生了一个小的对角线趋势,但现有证据并未建立稳定的五维特征。CogArena 提供了一套工作流程,在将认知标签附加到模型得分之前,结合了行为特征、协方差、匹配干预和家族外预测。
查看原文
查看缓存全文

缓存时间: 2026/07/29 09:54

# CogArena:大语言模型认知能力结构的多元方法评估

来源:https://arxiv.org/html/2607.24999

###### 摘要

大语言模型(LLM)的认知分数越来越多地被总结为按能力划分的轮廓图,这些轮廓的维度应在任务间收敛,对匹配的干预措施做出选择性响应,并能推广到用于定义它们的模型之外。我们提出了CogArena,这是一个程序化生成的13范式基准测试,围绕一个多元方法框架构建,用于确定认知任务分数何时值得在五种理论动机分组中赋予维度标签。在55个开放权重模型中,几乎所有范式之间的相关性都是正的,一个共同轴解释了大约一半的方差。组内优势很小,对评分方式敏感,且在不同模型家族间存在不确定性。在一项独立冻结的、跨六个家族的12个模型的完全交叉研究中,针对性支架显示出微小的匹配组优势,但没有任何支架特定的对比在多重校正后幸存,并且选择性并不能改善对留出家族的预测。冻结确认标准失败。一项事后替代措辞复现产生了更小的正向估计,并且再次失败。综合来看,这些结果支持一个边界结论。与理论对齐的提示在测试矩阵内产生了微小的对角线倾向,但目前的证据并未建立稳定的五维轮廓。CogArena提供了一个工作流程,在将认知标签附加到模型分数之前,结合了行为特征、协方差、匹配干预和族外预测。

## 1 引言

大型语言模型(LLM)越来越多地采用心理学评估人类的方式进行评估。除了诸如MMLU (Hendrycks et al. 2021) (https://arxiv.org/html/2607.24999#bib.bib15) 这样的聚合基准测试,一项快速增长的工作对LLM进行认知测试,探究心理理论、工作记忆、元认知及相关构念。认知科学已经开发出针对这些构念的标准化范式。Stroop冲突衡量抑制控制 (Stroop 1935) (https://arxiv.org/html/2607.24999#bib.bib35),错误信念预测探究心理理论 (Baron-Cohen, Leslie, and Frith 1985) (https://arxiv.org/html/2607.24999#bib.bib1),DRM列表引发出对未呈现单词的错误识别 (Roediger and McDermott 1995) (https://arxiv.org/html/2607.24999#bib.bib32)。此类测试的结果越来越多地以认知轮廓形式报告,每个能力一个分数 (Zhou et al. 2026) (https://arxiv.org/html/2607.24999#bib.bib42); (Haznitrama, Ardi, and Oh 2026) (https://arxiv.org/html/2607.24999#bib.bib13)。这样的轮廓预设了底层构念在LLM中是经验上可分的,而这很少在每个分组使用多个范式的情况下进行过测试。

LLM在认知任务上的行为是否可以分解为独立的认知能力,或者它们主要反映一种单一的广泛能力?先前的工作从两个方面处理这个问题。行为测试组合将心理学实验改编为LLM,但主要描述个体行为,或将认知测试与游戏和基准测试联系起来 (Coda-Forno et al. 2024) (https://arxiv.org/html/2607.24999#bib.bib7); (Binz and Schulz 2023) (https://arxiv.org/html/2607.24999#bib.bib4); (Momentè et al. 2025) (https://arxiv.org/html/2607.24999#bib.bib28)。心理测量学分析发现了一个正流形和一个主导的一般因子,通常是在成就基准测试上,而不是在理论定义的认知构念的重复测量上 (Burnell et al. 2023) (https://arxiv.org/html/2607.24999#bib.bib6); (Ilić and Gignac 2024) (https://arxiv.org/html/2607.24999#bib.bib17)。尚未解决的问题不是提示是否能改进任务,而是提议的分类法是否能通过收敛、干预和预测测试。

我们提出CogArena¹¹代码和程序化生成的测试组合:https://github.com/dengzhe-hou/CogArena。技术附录在参考文献之后。 (图1 (https://arxiv.org/html/2607.24999#S1.F1)),这是一个基准测试,将13个既定范式改编为5个分组,涵盖工作记忆、认知控制、情景记忆、心理理论和元认知。全文文本测试组合在20个开放权重LLM上运行,维度分析扩展到55个模型。一项独立的干预研究将五种无答案、理论针对性的支架与每个分组在留出项目上进行交叉,与基线和一个长度匹配的中性安慰剂对照,涉及来自六个家族的12个模型。CogArena的核心方法论贡献是一个多元方法框架,用于决定基准分数何时能够赋予维度认知标签。它通过三个相互关联的贡献实例化。

(1) **一个经过构念效度审计的认知基准测试。** 其程序化生成的项目经过行为特征检查和适应性效度的明确分析。
(2) **一个多元方法验证协议。** 它通过范式内特征、模型间协方差、带有中性安慰剂的完全交叉匹配干预,以及对留出模型家族的预测来测试同一分类法。
(3) **LLM认知轮廓的边界结果。** 广泛能力占主导地位,而分组结构和匹配支架增益很小,冻结标准失败。因此,五个分组仍然是组织标签,而非经过验证的、可迁移的维度。

见图注

图1:CogArena 概述。13个范式中的两个说明了既定的认知程序如何成为程序化生成的、确定性评分的LLM评估。完整的测试组合涵盖五个理论动机分组。右侧面板报告了来自不同模型家族的三个代表性检查点(Qwen2.5-7B-Instruct, Mistral-7B-Instruct-v0.3, 和 Llama-3.1-8B-Instruct)在所有13个范式上的校正准确率(%)。已发表的人类锚点是异质的,并没有定义人类和LLM表现的共同尺度。CogArena通过行为特征、模型间协方差、带有中性安慰剂的完全交叉匹配支架干预,以及留出模型家族预测来评估分类法。这三个轮廓是描述性的;推断性分析使用为每个分析指定的模型集。

## 2 相关工作

#### 认知理论与模型。
Cattell-Horn-Carroll分类法 (McGrew 2009) (https://arxiv.org/html/2607.24999#bib.bib25) 和执行功能的统一-多样性模型 (Miyake et al. 2000) (https://arxiv.org/html/2607.24999#bib.bib27) 激发了我们的工作记忆、认知控制和情景记忆分组。心理理论和元认知则借鉴了错误信念和元认知监测的传统 (Wellman, Cross, and Watson 2001) (https://arxiv.org/html/2607.24999#bib.bib40); (Lichtenstein and Fischhoff 1977) (https://arxiv.org/html/2607.24999#bib.bib23); (Persaud, McLeod, and Cowey 2007) (https://arxiv.org/html/2607.24999#bib.bib30))。WMF-AM (Hou et al. 2026) (https://arxiv.org/html/2607.24999#bib.bib16) 提供了一个深度参数化的累积状态追踪探针,与下游智能体表现相关。一个轴是否足够,或者按能力划分的轮廓是否增加信号,正是CogArena测试的可分离性问题。

#### LLM的认知评估。
CogBench (Coda-Forno et al. 2024) (https://arxiv.org/html/2607.24999#bib.bib7) 从七个认知实验中推导出十个行为指标,拟合多层模型,并研究提示效应。它表征了任务特定的行为;而CogArena则询问来自多个范式的分数是否支持一个家族通用的分组结构。特定能力的研究研究执行功能 (de Langis et al. 2026) (https://arxiv.org/html/2607.24999#bib.bib9),但不涉及多构念分类法。回顾445个LLM基准测试,Bean et al. (2025) (https://arxiv.org/html/2607.24999#bib.bib2) 发现构念效度基本缺失;Jung et al. (2026) (https://arxiv.org/html/2607.24999#bib.bib21) 同样表明心理测量学可靠性不一定意味着生态效度。

#### 干预与支架效度。
理论引导的提示可以引出潜在的任务表现。NeuReasoner 映射了模块化认知激发程序在何处有助于 CogBench 和传统推理基准测试 (Javadov et al. 2026) (https://arxiv.org/html/2607.24999#bib.bib18))。然而,直接的提示增益混淆了有用的语义内容与支架格式和辅助上下文。He et al. (2026) (https://arxiv.org/html/2607.24999#bib.bib14) 通过使用仅格式、误导性和错误事实的对照来解决数学概念支架的这一问题。CogArena 提出了一个不同的、判别性问题。每个目标支架都与每个理论分组进行交叉,并与一个长度匹配的中性安慰剂进行比较,因此通用改进不能满足对角线估计量。这是对指令和分数进行的干预,而不是对内部认知机制的干预。

#### LLM能力的结构。
正流形和主导的一般因子在 CHC 分类的基准分数 (Ilić and Gignac 2024) (https://arxiv.org/html/2607.24999#bib.bib17)、基准测试组合 (Kipnis et al. 2025) (https://arxiv.org/html/2607.24999#bib.bib22) 以及每个维度一个任务的神经心理学测试组合 (Haznitrama, Ardi, and Oh 2026 (https://arxiv.org/html/2607.24999#bib.bib13)) 中均有充分记录。Burnell et al. (2023) (https://arxiv.org/html/2607.24999#bib.bib6) 恢复了相关因子,但成就因子不一定验证理论定义的认知构念。能力量表工具 (Zhou et al. 2026) (https://arxiv.org/html/2607.24999#bib.bib42) 通常假设其维度。在我们的比较中,只有 CogArena 将范式内构念检查、收敛和判别分析、完全交叉的支架特异性测试以及同一分类法的留出模型家族预测结合起来(附录表 S12)。

## 3 CogArena 基准测试

图1 (https://arxiv.org/html/2607.24999#S1.F1) 总结了13个范式、它们的5个理论动机分组以及验证工作流程。每个范式改编自一个经过验证的、具有已发表参考数据的人类实验,尽管原始终点通常是反应时间、广度或校准度,而非准确率。这里,“范式”是一个标准化的实验任务,具有固定的程序和预期的行为效应,而不是一种建模方法。分组遵循既定的认知科学分类法,但第5.2节 (https://arxiv.org/html/2607.24999#S5.SS2) 测试而非假设它们形成稳定的维度。准确率是共同的轮廓终点,而构念相关的对比则在第5.1节 (https://arxiv.org/html/2607.24999#S5.SS1) 中单独评估。确定性的项目或回合级评分产生每个范式的一个模型级准确率,由此产生的13个分数构成了第5.2节 (https://arxiv.org/html/2607.24999#S5.SS2) 中分析的模型×范式矩阵。附录表 S13 提供了完整的范式定义、源锚点、人类样本量、适应性评分和评估模式;附录表 S11 报告了预期信号和观察到的特征证据。

### 3.1 构建与构念检查

#### 程序化生成。
所有任务项目都是程序化生成的。每个生成器随机化表面内容(名称、对象、单词列表),并通过设计设定每个项目的条件和难度。这减轻了来自训练语料库的数据污染(在第5节中直接探究)。已知静态基准项目相对于同一问题的新生成变体会夸大测量能力 (Mirzadeh et al. 2025) (https://arxiv.org/html/2607.24999#bib.bib26))。主要测试组合排除了经典刺激,如 Sally-Anne 场景;经典项目仅用于单独的污染探针。附录 S1.1 给出了每个范式的一个生成示例。

#### 适应性距离。
我们评估每个范式与原始人类实验的适应性距离(低/中/高)。语言介导的任务(错误信念、DRM、元认知)很好地保留了核心构念(低)。依赖于感知运动处理的任务(Stroop 颜色命名、Go/No-Go 抑制)需要更多适应(中)。原始形式根本是非语言性的范式(高距离,例如心理旋转)无法忠实地进行文本改编,因此被排除。CogArena 仅保留低距离和中距离范式。这些评级是作者判断,而非计算指标。下面的行为特征检查提供了每个改编范式是否仍能再现预期人类方向效应的经验测试。

#### 两级验证框架。
我们在范式层面和轮廓层面评估效度。在范式层面,三个互补的诊断方法审计了设计允许的情况下的文本改编。

1. **行为特征。** 预期的方向效应是否成立?(例如,Stroop 的一致 > 不一致)
2. **难度梯度。** 随着构念相关需求增加,准确率是否下降?(例如,更多来源 → 更低准确率;在源监控和 n-back 负荷上最清晰)
3. **跨模态检查。** 文本和图像版本是否产生不同的模式?(对于具有视觉形式的三个范式)

行为特征分析是主要的适应性检查,第5.1节 (https://arxiv.org/html/2607.24999#S5.SS1) 报告了每个范式的结果。在轮廓层面,我们测试提议的分组是否显示出收敛和判别分离,是否对匹配的支架做出选择性响应,以及是否改善了对留出模型家族的预测。家族聚类区间量化了不确定性。事后鲁棒性分析包括家族内中心化和构念原生重新评分。

### 3.2 评估模式

文本评估构成了主要基准测试。VLM 评估是对三个范式的目标性跨模态适应性检查,而智能体评估是一个探索性试点,涉及四个模型。所有三个模式都使用共享的 Gymnasium 风格接口,一个单一的 reset/step 契约,其观察空间和回合长度因模式而异。完整的 API 和环境规格见附录。

- **• 文本 LLM。** 所有13个范式都使用文本提示和特定于范式的评分。十个使用单次回应的评估;n-back、操作广度和 CVLT 使用多轮回合(第4节)。
- **• VLM。** 对于 Stroop、Flanker 和错误信念,图像刺激替代文本描述。
- **• 智能体试点。** 来自测试组合的 n-back 和错误信念,加上威斯康星卡片分类测试,使用多轮工具访问以进行记忆、计算和记笔记。

## 4 实验设置

#### 模型池。
我们评估了来自九个家族的20个开放权重文本 LLM,参数数量从0.5B到47B不等。这个主要池用于每个范式的准确率、行为特征和跨模态分析。维度结构和缩放鲁棒性分析额外使用了一个来自超过20个家族的55个模型的扩展池。开放检查点提供了已知的参数数量和家族血统,同时实现了可重复的本地评估。我们还评估了六个 VLM 在三个基于图像的范式上,以及四个文本 LLM 在智能体试点中。完整的检查点列表见表 S1。

#### 项目与管理。
所有模型都接收相同的程序化生成的项目。大多数范式包含50个项目,分为三个设计难度级别;Stroop 和 Flanker 包含66个项目,涵盖一致和不一致条件。十个范式使用单轮评估,而 n-back、操作广度和 CVLT 作为多轮回合进行管理。多轮提示保留初始指令和一个滑动窗口,大小为[待续...]

相似文章

从孤立任务到结构化能力:大型语言模型的多层分类法

arXiv cs.CL

本文提出了一种面向大型语言模型的多层分类法,包含14个能力域和91个子技能,借鉴人类认知科学来组织超越孤立任务的LLM评估。通过映射主要AI会议上的15,934篇论文,展示了其实用性,揭示了语言语义能力和推理的集中关注,同时识别出探索不足的领域。

NeuroCogMap揭示大型语言模型的认知组织结构

Hugging Face Daily Papers

NeuroCogMap是一个受认知神经科学启发的框架,将大型语言模型的内部特征映射为功能性脑区,并将其与可解释的认知功能联系起来,揭示模型失败(如幻觉和偏见)的迹象。

超越当前观察:在可控非马尔可夫游戏中评估多模态大语言模型

Hugging Face Daily Papers

本文介绍了RNG-Bench,一个基准测试套件,用于评估多模态基础模型在多步交互中重建过去观察并利用它们进行决策的能力。该套件包含两个游戏(Matching Pairs和3D Maze),具有可控难度参数和一个记忆差距指标,用于区分遗忘与糟糕的决策。