从孤立任务到结构化能力:大型语言模型的多层分类法
摘要
本文提出了一种面向大型语言模型的多层分类法,包含14个能力域和91个子技能,借鉴人类认知科学来组织超越孤立任务的LLM评估。通过映射主要AI会议上的15,934篇论文,展示了其实用性,揭示了语言语义能力和推理的集中关注,同时识别出探索不足的领域。
arXiv:2607.22182v1 公告类型:新
摘要:大型语言模型(LLM)的评估涵盖了多样化的任务和基准,但证据仍围绕任务而非其所探究的能力来组织。这种碎片化限制了跨研究的比较,掩盖了任务所涉及的能力,并使覆盖缺口难以识别。
我们提出了一种跨原始层、构造层和整合层的14个能力域和91个子技能的多层分类法。能力定义和组织借鉴人类认知科学,而非LLM架构。层级分配基于发展优先顺序和假设的功能支持,同时将人类起源的概念适配为可观察的模型行为。
为了展示操作实用性,我们筛选了2023年至2025年间ACL、AAAI、ICML和NeurIPS的31,505篇论文,并通过多模型标注、共识和仲裁映射了15,934篇以LLM为中心的论文。直接研究关注集中在语言语义能力(3,551篇;22.3%)、推理(3,388篇;21.3%)、规划与决策(2,149篇;13.5%)和感知(1,954篇;12.3%),而有六个领域出现在不到2%的论文中。在领域内,最常见的子技能中位流行率为97.9%,并且在14个领域中的10个中出现在至少90%的论文中。语言语义能力和推理构成了最高数量的配对(n = 1,864;11.7%;提升度=2.47),而心智理论与社会推理及互动在至少20次共现的配对中显示出最高的提升度(n = 62;提升度=30.84)。
通过将分析单位从孤立任务转向结构化能力,该分类法支持研究组织、覆盖审计、评估解释以及用于诊断、训练和迁移的可测试假设。
查看缓存全文
缓存时间: 2026/07/27 07:40
# 从孤立任务到结构化能力:大语言模型的多层分类法 来源:https://arxiv.org/html/2607.22182 石鑫方,贾晨沃,江思涵\*,文娟秦\*,杨华肖 复旦大学 fangshixin@fudan\.edu\.cn;25213050400@m\.fudan\.edu\.cn jiangsihang@fudan\.edu\.cn;qin\_wenjuan@fudan\.edu\.cn;shawyh@fudan\.edu\.cn \*共同通讯作者 ###### 摘要 大语言模型(LLM)评估涵盖众多任务和基准,但现有证据仍以任务而非其所探测的能力为中心进行组织。这种碎片化限制了跨研究比较,模糊了任务所需的能力,并使覆盖范围的缺口难以识别。我们引入了一个多层分类法,包含基础层、建构层和整合层中的14个能力域和91项子技能。能力定义和组织由人类认知科学指导,而非LLM架构。层级分配依据发展优先顺序和假设的功能支持,而源自人类的构念则被调整为可观察的模型行为。为展示其操作实用性,我们筛选了2023年至2025年间ACL、AAAI、ICML和NeurIPS会议的31,505篇论文,并通过多模型标注、共识和仲裁,映射了15,934篇聚焦LLM的论文。直接研究注意力集中在*语言-语义能力*(3,551篇;22.3%)、*推理*(3,388篇;21.3%)、*规划与决策制定*(2,149篇;13.5%)和*感知*(1,954篇;12.3%),而有六个能力域出现在不到2%的论文中。在域内,最常见的子技能中位出现频率为97.9%,并且在14个域中的10个域里出现在至少90%的论文中。*语言-语义能力*和*推理*构成了最高频的成对组合(n = 1,864;11.7%;提升度= 2.47),而*心理理论*和*社会推理与互动*在至少共现20次的组合中显示出最高的提升度(n = 62;提升度= 30.84)。通过将分析单位从孤立任务转向结构化能力,该分类法支持研究组织、覆盖范围审计、评估解读以及用于诊断、训练和迁移的可检验假设。 ## 1 引言 人类认知常被描述为一个由基础性过程和高级过程相互作用、随时间发展的系统(Diamond, 2013)。然而,当代大语言模型(LLM)常常展现出非常不同的能力轮廓。最先进的LLM现在能在困难的知识和多步推理评估中取得强劲表现(OpenAI, 2025; Wei et al., 2022)。但与此同时,它们在基本的规则控制操作上,包括计数和简单的符号转换,可能仍然脆弱(McCoy et al., 2024)。这种脆弱性即使在表面成功之后也可能持续存在:当任务前提或规则被反事实地修改时,性能可能会下降(Wu et al., 2024)。我们将这种模式称为能力反转:一个模型可能在通常被认为在认知上高级的任务上表现强大,同时却在人类一旦理解相关规则后通常能稳定执行的基本操作上表现不可靠。对于LLM评估,能力反转将一个明显的异常现象变成了一个测量问题,因为仅凭基准测试的成功并不能表明底层能力是否稳定、可迁移或具有组合支持。 这个测量问题反映了LLM能力被表征、研究和评估方式上的结构性限制。大多数基准测试是以任务为中心的:它们测量在特定数据集、任务或场景上的表现,而没有指定正在探测的是哪种能力、该任务还调用了哪些额外能力、或者失败意味着模型更广泛的能力轮廓有何问题。因此,基准测试分数通常是描述性的,而非诊断性的。例如,如果一个模型在推理任务上失败,失败可能反映了推理本身、记忆或注意力的局限性,或者是协调这些能力方面出现了问题。现有的评估更多告诉我们模型得了多少分,而不是它为什么成功或失败。 以任务为中心的评估带来的另一个相关后果是研究注意力在认知能力上的分布不均。一项对来自顶级NLP和ML会议的445个LLM基准的系统回顾发现,仅推理一项就占所有被评估现象的18.5%,且覆盖面集中在少数几个领域(Bean et al., 2025)。使用布鲁姆分类法进行的补充分析发现,现有数据集集中在较低层次的记忆和理解上,而元认知和创造性推理则代表性不足(Zhang et al., 2025)。心理学和以人为中心的构念在当前的LLM评估中仍然碎片化且标准化不足(Chang et al., 2024; Ye et al., 2025)。这引出了一个实证问题:研究注意力在更广泛的认知能力空间(例如,包括社会、文化或道德领域)中是如何分布的。这种集中也可能塑造后续的评估和发展优先事项,使得较少被研究的领域相对而言测量不足且难以诊断。 现有方法部分解决了这些诊断和覆盖范围问题。最近的基准测试框架扩展了LLM评估的广度和现实性,包括专家级知识评估、编码、多模态推理和面向智能体的评估,例如《人类的最后考试》(Phan et al., 2025)、LiveCodeBench(Jain et al., 2025)和BrowseComp(Wei et al., 2025)。然而,许多框架仍然是围绕任务或部署场景组织的,而非围绕这些评估所针对的能力的结构化描述。数据驱动的方法可以揭示任务和技能之间的经验相似性或迁移关系(Chen et al., 2023),但这些关系本身并不能提供能力空间的广泛认知组织。受认知启发的评估,如CogBench(Coda-Forno et al., 2024)、CogLM(Wang et al., 2024)、CognitivEval(de Langis et al., 2025)和NeuroCognition(Haznitrama et al., 2026),展示了基于心理学的构念在解释超 越总分 的LLM行为方面的价值。然而,它们的主要分析单位仍然是所测量的构念或任务,而不是跨能力域的系统性关系。 最近的框架,包括CDT(Mo et al., 2025)和Burnell等人(2026)的认知框架,在更结构化的层面上组织能力。Burnell等人(2026)明确区分了基本能力和复合能力,并承认认知能力相互作用并相互构建,但他们的框架和CDT都没有联合使用发展优先顺序和假设的功能支持来定义多层分类法。像HELM这样的整体框架通过联合考虑场景和多个期望属性,将评估扩展到准确性之外,但它们的组织单位仍然是场景和指标,而不是认知能力关系(Liang et al., 2023)。 总之,这些进展留下了一个核心的表征问题未解决:如何将碎片化的任务级证据组织到一个通用能力空间中,以支持系统比较、覆盖范围分析和诊断假设生成。人类认知为解决这一差距提供了原则性参考。LLM可能在人类觉得简单的任务上失败,却在大多数人都认为困难的任务上成功。这种不对称性表明,人类认知可能为LLM的能力差距生成有用的结构性假设。来自发展、神经认知和认知传统的趋同研究将认知描述为涉及具有异质性发展轨迹和协调功能支持的相互作用过程(Diamond, 2013; Gogtay et al., 2004; Miller & Cohen, 2001; Piaget, 1952; Vygotsky, 1978)。因此,人类认知研究为分类法构建提供了三种资源:一个广泛的能力候选空间、关于能力间组织关系的证据,以及可以调整为LLM研究可观察目标的确立构念。 这些资源引出了研究LLM的三个设计决策:包含哪些能力、如何组织它们以及如何使它们对LLM研究具有可操作性。它们激发了三个原则。首先,人类认知科学为识别现有任务和基准类别之外的能力提供了广泛的参考空间。其次,能力应根据发展优先顺序和假设的功能支持来组织,而不是被表示为一个独立的技能扁平列表。第三,人类认知构念必须被调整为用于研究和评估LLM的可观察且操作上有用的目标。这些原则并不意味着LLM复制了人类认知架构或遵循人类发展轨迹。相反,它们定义了一个结构化的能力空间,可以组织现有研究,揭示覆盖和忽视的模式,并生成关于能力间关系的可检验假设。 基于这些原则,我们提出了一个多层分类法,将LLM认知能力表示为一个结构化空间,包含跨越三个层级的14个领域:基础认知能力(L1)、建构认知能力(L2)和整合认知能力(L3)(图1)。该分类法表示了跨层的候选垂直关系以及层内的横向关系。它不是仅通过应用领域、任务、基准或输出相似性来组织LLM研究,而是允许根据研究明确研究的能力以及通过这些能力进行操作化的子构念来映射研究产物。这种结构化表示支持研究和基准映射,揭示能力覆盖中的空白和不平衡,并为目标明确的后续评估生成可检验的假设。 本文做出三项贡献。首先,它引入了一个多层分类法,将14个认知能力领域和91项子技能组织成基础层、建构层和整合层,层级分配基于人类认知中的发展优先顺序和假设的功能支持。其次,它将分类法操作化为一个标注手册和可扩展的映射流程,区分了作为主要目标研究的能力和仅间接或背景性地出现的能力。第三,它映射了15,934篇关注LLM的论文,揭示了哪些能力领域获得关注、哪些子技能在其中占主导地位以及哪些能力被一起研究的系统性不对称性。这些贡献为比较评估证据、识别能力图景中的盲点以及生成可检验的诊断假设提供了共同基础。 参见标题图1:认知能力的多层分类法。 ## 2 分类法设计原则与构建 本节描述所提出的分类法的设计原则和构建过程。它围绕三个问题展开:什么样的能力空间应作为LLM研究的参考?该空间内的能力应如何相互组织?以及源自人类认知的构念应如何被重新表述为LLM研究可观察且操作上有用的目标?这些问题激发了三个设计原则:将人类认知作为一般认知能力的参考空间、多层组织,以及特定于LLM的适应和操作化。 ### 2.1 范围与设计目标 该分类法是一个结构化的能力空间,用于描述、组织和关联LLM中的认知能力。它不是LLM内部架构的模型,也不是一组基准测试。相反,它提供了一个表征层,可以支持文献综合、评估设计、能力诊断和面向发展的分析,而不受任何单一LLM应用场景的定义。人类认知研究为我们的分类法构建提供了三种资源:一套成熟的用于区分能力的词汇、关于它们功能关系的经验和理论解释,以及可以为构念操作化和任务设计提供信息的确立测量传统。因此,该分类法代表了可观察的能力构念以及它们之间候选的功能关系。 ### 2.2 设计原则 这三个原则对应于三个不同的设计决策:如何定义初始能力空间,如何在该空间内组织能力,以及如何将人类认知构念转化为与LLM兼容的概念性和操作性分类法。 #### 2.2.1 原则一:将人类认知作为一般认知能力的参考空间 人类认知科学为识别与一般认知能力相关的能力提供了一个成熟且广泛的参考空间。因此,我们从认知心理学、认知科学、认知神经科学及相关领域反复出现的构念中导出了初始的候选空间。我们的起始来源包括广泛使用的综合性教科书和手册,例如《认知心理学:学生手册》(Eysenck & Keane, 2020)、《认知:探索心智科学》(Reisberg, 2013)和《认知神经科学》(Banich & Compton, 2023)。在这些来源中,一组相对稳定的构念反复出现,包括感知、注意、记忆、语言、推理与问题解决、判断与决策制定以及认知控制。 这个参考空间涵盖了随着LLM被部署在智能体、教育、咨询、人际交往和具有社会影响力的环境中而变得越来越重要的能力。因此,一个旨在表征具有广泛能力的系统的分类法必须扩展到语言熟练度、事实知识和抽象推理之外。更广泛的文献还突出了情感、创造力、元认知、规划、社会认知以及认知的文化和发展背景。 #### 2.2.2 原则二:多层组织 第二个原则涉及能力如何相互关联地组织。层级分配借鉴了两种互补的证据形式:人类发展优先顺序和功能支持。发展优先顺序涉及一种能力是相对较早出现,还是通过协调更早建立的能力发展而来;而功能支持涉及一种能力是否为另一种能力的发展提供表征或操作基础。这些标准被用作趋同的组织证据,而非声称LLM再现了人类发展轨迹或认知架构。 发展优先顺序为区分相对基础性的能力和那些涉及更多协调与整合的能力提供了证据。认知发展的广泛理论将发展描述为通过协调先前水平建立的技能,逐步构建日益复杂的技能的过程(Fischer, 1980)。例如,注意和记忆的早期表现可以通过视觉注意和再认记忆范式在婴儿期测量(Reynolds & Richards, 2019),而规划与决策制定中的规划组件则遵循一个更漫长的轨迹,在困难的策略规划问题上的表现会持续改善到青春期后期甚至成年早期(Albert & Steinberg, 2011)。当代
相似文章
能力的坐标系:用于大语言模型评估的统一MTMM几何框架
这篇知识系统化论文提出了一种用于评估大语言模型的统一多特质多方法(MTMM)几何框架,将不同的指标整合到一个共享的潜在坐标空间中,以解决当前基准测试中的构念效度问题。
超越排行榜:大型语言模型代理中工具使用、规划与推理失败的综合分析
本文综合了2023-2026年间27篇基准测试、分类学和审计论文,形成了一个统一的LLM代理局限性分类体系,识别出六大失败集群,包括工具调用错误、规划失败、长期退化、多代理协调问题、安全性问题以及测量有效性问题。
CogArena:大语言模型中认知能力结构的多元方法评估
CogArena 引入了一个程序化生成的 13 范式基准,用于评估大语言模型是否展现出可分离的认知能力还是单一的通用能力,结果仅发现对 55 个模型稳定五维特征的支持较弱。
从结构到协同:多模态大语言模型中视觉-语言感知范式演进的综述
本综述论文系统回顾了多模态大语言模型(MLLMs)中统一视觉-语言感知的范式演进,提出了五阶段分类法,并指出了通向通用多模态智能的开放挑战。
大语言模型的记忆
本综述系统性地提出了大型语言模型中记忆机制的分类法,从表示、更新动态和持久性三个维度进行分类,并形式化了底层机制组件。