LLMs 未显示出个体化元认知迹象

arXiv cs.LG 论文

摘要

本文研究了前沿大语言模型是否表现出个体化元认知——即超越共享信号评估自身项目级别能力的能力。通过对20个模型和六个基准进行因子分析和成对校准,作者未发现此类元认知的证据;置信度差异归结为一个单一的共享难度因子,表明模型依赖于共同的难度信号而非模型特定的自我认知。

arXiv:2605.24299v1 公告类型:新 摘要:置信度加权路由、选择性弃权和集成加权都假设模型陈述的置信度能够反映其在所回答问题上的能力。这些方法预设了功能性元认知,即在不实际执行任务的情况下评估自身能力的能力。聚合校准已得到广泛研究,结果不一,但所引发置信度的底层结构仍不明确。我们采用四分因子分析结合成对校准,对20个前沿大语言模型(LLMs)在六个基准上的二元置信度判断进行分解,探究置信度不同的两个模型是否在性能上也存在差异。在事实回忆和信息检索基准上,跨模型置信度矩阵近似秩为一,单个主导因子捕获了大部分潜在方差。检索事实的模型共享一个项目级难度轴,主要区别在于沿该轴的决策阈值。在所有基准上,一旦移除所有模型一致认同的项目,置信度与性能之间的关系便不复存在。模型间的成对校准即使具有统计显著性,数值也很小,而一旦控制了共享因子上的基准率差异,剩余部分便消失殆尽。数学推理看似是例外,但这实则是一个混淆因素:推理模型通过在其思维链中尝试解答问题来回答关于置信度的问题,从而绕过了我们试图测量的次符号自我认知。我们未发现任何测试领域存在显著的言语化个体化元认知证据。
查看原文
查看缓存全文

缓存时间: 2026/05/26 09:03

# LLMs 未显示出个体化元认知的迹象  
**来源:** https://arxiv.org/html/2605.24299  
**M. Moran**<br>**Mark Whiting**††footnotemark:Pareto AI<br>Pareto AI<br>[email protected]<br>[email protected]  

###### 摘要  
置信度加权路由、选择性避答和集成加权都假设模型陈述的置信度能反映其在被问问题上的能力。它们预设了一种功能性元认知——即在不实际执行能力的情况下评估自身能力的能力。总体校准已有大量研究,结果不一,但对所引发置信度的潜在结构了解较少。我们通过四分因子分析结合成对校准,将20个前沿大语言模型(LLM)在六个基准上的二元置信度判断进行分解,探究两个置信度不同的模型是否也在性能上存在差异。在事实回忆和信息检索基准上,跨模型置信度矩阵近似秩为一,一个主导因子捕获了大部分潜在方差。检索事实的模型共享一个项目级难度轴,主要差异在于沿着该轴的决策阈值。在所有基准中,一旦移除所有模型一致同意的项目,置信度与性能之间的关系便消失。模型间成对校准即使在统计上显著也较小,并且一旦控制了共享因子上的基率差异,剩下的校准信号便化为乌有。数学推理似乎是例外,但这其实是一个混淆:推理模型在被问及置信度时会尝试在思维链中求解问题,从而绕过了我们试图测量的亚符号自我知识。我们在任何测试领域都没有发现显著的口头个体化元认知证据。在半个基准上,对置信度判断推理文本表层特征的简单逻辑回归,以同等信息量击败了中位数置信度模型的重复采样判断,这表明从推理轨迹中提取不确定性可恢复二元判断所未能捕捉的信号。  
**关键词:** 元认知、校准、大语言模型、置信度引发、因子分析、成对校准、AI评估  

## 1 引言  
置信度加权路由(Chen et al., 2024 (https://arxiv.org/html/2605.24299#bib.bib5); Aggarwal et al., 2024 (https://arxiv.org/html/2605.24299#bib.bib1))、选择性避答(Geifman and El-Yaniv, 2017 (https://arxiv.org/html/2605.24299#bib.bib10); Kamath et al., 2020 (https://arxiv.org/html/2605.24299#bib.bib19))和集成加权(Wang et al., 2023 (https://arxiv.org/html/2605.24299#bib.bib41); Jiang et al., 2023b (https://arxiv.org/html/2605.24299#bib.bib17))都假设模型陈述的置信度能反映其被问项目上的能力。表层校准已有大量研究(Kadavath et al., 2022 (https://arxiv.org/html/2605.24299#bib.bib18); Lin et al., 2022 (https://arxiv.org/html/2605.24299#bib.bib25)),但这些信号在模型间的结构尚不明确。校准信号在多大程度上是每个模型私有的,以及它相对于其他模型与性能的对齐程度,仍是未解问题。  

**定义 1.1** 个体化元认知——模型在项目层面上评估自身能力的能力,这种能力是模型特有的,且无需实际执行这些能力,超越共享信号所能解释的部分。  

我们发现模型拥有关于整个语言模型类所能完成之事的通用知识,但对自身特定能力知之甚少。前沿模型之间的置信度差异主要归结为少量主导的共享困难估计轴加上模型特定的阈值,而非高维的个体化自我知识基。此外,每个模型在这些轴上的位置与实际性能关联不大。性能本身也是本质低维的,为LLM的g因子提供了进一步证据(Burnell et al., 2023 (https://arxiv.org/html/2605.24299#bib.bib4); Ilić and Gignac, 2024 (https://arxiv.org/html/2605.24299#bib.bib15)),但潜在置信度轴与潜在性能轴之间的相关性在普遍一致同意的项目之外很低。正如我们用成对校准测量明确显示的,一个模型比另一个模型更自信与性能之间的相关性,在控制性能基率差异后几乎为零。  

我们在六个基准上评估了20个前沿LLM,涵盖事实回忆、多领域知识、法律推理、数学和科学代码生成。除了发现低维结构和缺乏个体化校准信号外,一个对模型自身置信度判断推理文本特征的简单逻辑回归,在六个基准中的三个上击败了其二元自我评估,表明引发的推理包含了模型最终答案未使用的信息。  

我们的核心发现:  
- **置信度在知识任务上主要归结为共享困难估计轴。** LLM在事实、检索和法律基准上的二元置信度分解为单个主导的四分因子,解释了基率伪影。模型主要沿着该共享轴在响应阈值上存在差异,而非底层信号。推理任务显示更复杂的结构,但这并未转化为更高的个体化校准(§3 (https://arxiv.org/html/2605.24299#S3))。  
- **置信度和性能都是低秩的,但沿着不同轴。** 两个信号都归结为单个共享项目级轴,因此低维置信度启发式在原则上是正确的方法。然而,主要的置信度轴与主要的性能轴仅在所有人一致同意的项目(琐碎的底线和不可能的上限)上对齐。在有争议的项目上,两者很大程度上相互独立(§3.3 (https://arxiv.org/html/2605.24299#S3.SS3))。  
- **LLM置信度引发生成的信息未被最终响应使用。** 一个基于置信度判断推理文本的手工特征构建的简单分类器,在六个基准中的三个上匹配或击败了模型自身的二元自我评估。一个类似的分类器读取出答案尝试文本,在另外两个基准上获胜。这两个分类器都是弱下界,表明模型生成了做出此类判断所需的信息,但并未可靠地使用它(§3.4 (https://arxiv.org/html/2605.24299#S3.SS4), §A.1 (https://arxiv.org/html/2605.24299#A1.SS1))。  
- **在没有性能差异的情况下,成对校准在统计上不显著。** 所有基准上模型对之间Kendall-τ的分布仅略高于基率对齐的经验零分布。统计上显著但效应量较小的信号在控制性能基率差异后消失,而基率差异本身就能产生微小的增益(§3.3 (https://arxiv.org/html/2605.24299#S3.SS3))。成对校准可以通过性能的巨大差异轻易实现——因此,尽管整体成对信号微小但统计显著,这仍未能满足个体化元认知的必要条件。简而言之,Claude的自我评估与Gemini的实际性能一样可能描述其自身性能。  
- **强化学习引发了符号捷径。** 表面上的MathBench成对校准异常在仔细检查后消失。信号完全集中在推理-非推理模型对中,其中经过推理训练的模型在被问及置信度时内联尝试求解问题。这是一种符号变通,而非我们试图测量的亚符号自我知识(§3 (https://arxiv.org/html/2605.24299#S3))。  

## 2 相关工作  
表层LLM校准已有大量研究,结果不一。大型模型总体上校准较好(Kadavath et al., 2022 (https://arxiv.org/html/2605.24299#bib.bib18)),并且RLHF聊天模型上的口头数值置信度在单模型校准时可能优于logit基线(Tian et al., 2023 (https://arxiv.org/html/2605.24299#bib.bib36)),然而跨提供方和提示,口头置信度显示出系统性过度自信和较差的项目级准确性(Xiong et al., 2024 (https://arxiv.org/html/2605.24299#bib.bib43))。基于采样的熵(Kuhn et al., 2023 (https://arxiv.org/html/2605.24299#bib.bib24))和外部分类器(Ulmer et al., 2024 (https://arxiv.org/html/2605.24299#bib.bib39); Pedapati et al., 2025 (https://arxiv.org/html/2605.24299#bib.bib31))改善了自我报告,但并未解决任何模型的置信度是否反映个体化能力评估的问题。最近关于推理训练模型的工作报告称,校准精度随判断前推理的长度和内容而扩展(Podolak and Verma, 2025 (https://arxiv.org/html/2605.24299#bib.bib32); Yoon et al., 2025 (https://arxiv.org/html/2605.24299#bib.bib46)),我们将在§3 (https://arxiv.org/html/2605.24299#S3)中重新审视这一发现。  

元认知——对自身认知的认知——在人类和动物认知科学中有着悠久的历史。基础性工作区分了对自身心理过程的监测和控制(Nelson and Narens, 1990 (https://arxiv.org/html/2605.24299#bib.bib28); Koriat, 1997 (https://arxiv.org/html/2605.24299#bib.bib22))。信号检测框架(Fleming and Lau, 2014 (https://arxiv.org/html/2605.24299#bib.bib8))将元认知敏感性测量为受试者的置信度区分自身正确和错误响应的能力,从而将自我知识与底层任务能力分开,并在受试者内部形式化为meta-d’(Maniscalco and Lau, 2012 (https://arxiv.org/html/2605.24299#bib.bib27))。邓宁-克鲁格效应(Kruger and Dunning, 1999 (https://arxiv.org/html/2605.24299#bib.bib23))是一个众所周知的失败模式,低表现者系统性地高估自身能力。最近的LLM研究询问大型模型是否表现出类似能力,显示微调后的模型在预测自身行为方面优于外部观察者(Binder et al., 2025 (https://arxiv.org/html/2605.24299#bib.bib3))。采用Nelson和Narens (1990 (https://arxiv.org/html/2605.24299#bib.bib28))的术语,我们将注意力限制在元认知监测——即模型对自身知识状态的评估上。  

潜在因子分析和心理测量方法近年来越来越多地应用于LLM。Kipnis等人 (2025 (https://arxiv.org/html/2605.24299#bib.bib21));Burnell等人 (2023 (https://arxiv.org/html/2605.24299#bib.bib4));Ilić和Gignac (2024 (https://arxiv.org/html/2605.24299#bib.bib15))将因子分析应用于LLM性能,发现LLM任务性能的相关结构是低维的,甚至在某些领域是单维的。我们将这种因子分析分解从性能扩展到口头置信度,作为面向用户的函数式元认知的探针,并表明置信度加权路由背后的个体化假设失败,任何模型的难度估计对于另一个模型性能的信息量与其自身性能大致相同。  

## 3 置信度分解  
我们在六个基准上评估了20个LLM,这些基准涵盖不同的认知需求(表1 (https://arxiv.org/html/2605.24299#S3.T1)),同时测量性能和置信度。  

**定义 3.1** 校准(区分性含义)——校准在区分性含义下测量模型的置信度是否对项目级结果进行排序。文献中也使用频率含义(期望校准误差、可靠性图(Guo et al., 2017 (https://arxiv.org/html/2605.24299#bib.bib13))),询问陈述的是率是否与观测到的准确率匹配。我们在本文中始终使用区分性含义。  

基准套件包括SQuAD (Rajpurkar et al., 2016 (https://arxiv.org/html/2605.24299#bib.bib34))、MMLU-Pro (Wang et al., 2024 (https://arxiv.org/html/2605.24299#bib.bib42))、LegalBench (Guha et al., 2023 (https://arxiv.org/html/2605.24299#bib.bib12))、MATH数据集 (Hendrycks et al., 2021 (https://arxiv.org/html/2605.24299#bib.bib14))(本文中称为MathBench)、Omni-MATH (Gao et al., 2025 (https://arxiv.org/html/2605.24299#bib.bib9))和SciCode (Tian et al., 2024 (https://arxiv.org/html/2605.24299#bib.bib37))。模型包括来自Anthropic (Anthropic, 2024 (https://arxiv.org/html/2605.24299#bib.bib2))(Claude 3 Haiku 至 Sonnet 4.5)、OpenAI (OpenAI, 2023 (https://arxiv.org/html/2605.24299#bib.bib29))(GPT-4o 至 GPT-5.2)、Google (Gemini Team, Google, 2024 (https://arxiv.org/html/2605.24299#bib.bib11))(Gemini 2.0 Flash 至 3.1 Pro)、DeepSeek (DeepSeek-AI, 2025 (https://arxiv.org/html/2605.24299#bib.bib7))(R1)、Meta (Llama Team, Meta AI, 2024 (https://arxiv.org/html/2605.24299#bib.bib26))(Llama 3.1-70B, 3.3-70B)、Mistral (Jiang et al., 2023a (https://arxiv.org/html/2605.24299#bib.bib16))(Medium 3.1, Small 3.2-24B)和Qwen (Yang et al., 2024a (https://arxiv.org/html/2605.24299#bib.bib44); Qwen Team, 2024 (https://arxiv.org/html/2605.24299#bib.bib33))(2.5-72B, 2.5-Coder-32B)的代表。GPT-5.2指的是数据收集时相应标识符的OpenAI API端点。提供方引用是系列级的参考文献,指向写作时可获得的最新技术报告;并非每个测试的单独变体都有独立的模型卡。  

我们将每个基准问题分解为最小问题规范和可选附加上下文。每个基准的分解程序在§D (https://arxiv.org/html/2605.24299#A4)中描述。SQuAD已通过移除原始维基百科段落并将其视为可选上下文,修改为通用知识基准;SciCode由于原始问题集中存在明显歧义,已由前沿LLM转译为新的模式。两项更改都保留了原始问题,并在§D (https://arxiv.org/html/2605.24299#A4)中记录。  

对于每个基准,我们在一种或两种模式——前瞻性(§3 (https://arxiv.org/html/2605.24299#S3))和反事实性(§3 (https://arxiv.org/html/2605.24299#S3))中引发二元(是/否)置信度判断。LegalBench仅包含前瞻性探针,因为其任务缺乏反事实探针所需的问题加可移除上下文结构(见§D (https://arxiv.org/html/2605.24299#A4))。  

**定义 3.2** 前瞻性判断——前瞻性判断在模型尝试问题之前评估能力(“没有上下文段落你能回答这个问题吗?”)。模型看不到附加上下文,但被告知其存在。  

**定义 3.3** 反事实判断——反事实判断在事后评估信息必要性,过滤条件为模型在完整信息下成功完成任务(“既然你正确回答了,没有上下文段落你也能正确回答吗?”)。  

**表1:** 六个基准涵盖事实回忆、法律推理、数学和科学代码生成。对于给定基准无法稳定符合输出模式的模型被排除在该基准分析之外。  

我们使用单次二元而非采样或分级置信度引发,原因有三。首先,并非所有提供方都提供完整logits,且推理字符串以不透明方式预先决定最终答案的logits,这需要多次采样才能平均。

相似文章

LLMs 能内省吗?现实检验

arXiv cs.AI

本文认为,近期关于LLMs内省能力的说法并不成立,因为仅凭行为证据无法区分真正的内省与基于表面线索的模式匹配。作者重新审视了两种评估范式,发现模型依赖于输入层特征,而非真正访问内部状态。

元认知监测电池:LLM自我监测的跨域基准

arXiv cs.CL

一个包含524个项目的新型跨域基准(元认知监测电池)使用人类心理测量方法评估LLM在六个认知领域的自我监测能力。应用于20个前沿LLM后,揭示了三种不同的元认知配置,并表明准确率排名与元认知敏感性排名基本相反。