@omarsar0: 强烈推荐的LLM元认知概述。(请收藏) LLM中有趣的行为如置信度校准…
摘要
本文首次全面概述了LLM中的元认知,认为置信度校准和自我验证等行为是统一元认知能力的各个方面,并对评估和提升这些能力以增强LLM可靠性和透明性的方法和基准进行了分类。
查看缓存全文
缓存时间: 2026/07/14 16:28
强烈推荐的大型语言模型元认知概述。(请收藏)大型语言模型中诸如置信度校准、自我验证、知道何时停止以及知道自己不知道等有趣行为,大多是被孤立研究的。这篇综述认为它们是同一件事——元认知——的不同方面,并提出了一个全面的图谱。作者对衡量和评估大型语言模型元认知能力的方法和基准进行了分类,然后将这些能力与能力、可靠性和透明度联系起来。随着智能体承担更长的任务周期,监控和调节自身推理的能力成为衡量可靠性的重要方式。论文:https://arxiv.org/abs/2607.11881 在我们的学院中学习构建有效的AI智能体:https://academy.dair.ai
大型语言模型中的元认知:基础、进展与机遇
来源:https://arxiv.org/html/2607.11881 Gabrielle Kaili-May Liu¹, Areeb Gani¹∗, Jacqueline Lu¹∗, Jordan Thomas¹∗, & Mark Steyvers², Arman Cohan¹ ¹耶鲁大学 ²加州大学尔湾分校 {kaili.liu, arman.cohan}@yale.edu
摘要
元认知是智能的基础组成部分,对于有效学习、问题解决、决策、沟通等至关重要。近年来,它已被日益认为是能力强、透明的AI系统的基石。然而,尽管LLMs在多样的现实任务中取得了显著进展,但目前尚不清楚它们何时、如何或在多大程度上能够展现或被赋予有效的元认知能力,也不清楚如何调整这些能力以提升AI系统的基础能力、可靠性和智能。本文通过呈现首篇关于LLMs元认知知识现状的全面综述来弥合这一差距。我们分析并分类了这个新兴领域的格局,总结了近期技术进展,包括衡量和评估LLMs元认知能力的方法和基准、激发、改进和应用LLMs元认知的技术,以及正在进行的研究的发现和启示。我们还讨论了应用、开放问题和挑战,以及未来工作的有希望方向。我们的目标是提供关于这一主题的详细且最新的综述,并激发有意义的研究和讨论。整理后的论文列表可在https://github.com/yale-nlp/LLM-Metacognition找到。 **脚注文本:这些作者对本文贡献相等。 参见图1:当前大型语言模型元认知研究分类。 元认知描述系统评估和调节自身认知的能力。元认知循环包括两个交互过程:监控(例如,形成对不确定性、任务表现或进展的判断)和控制(例如,基于监控进行计划、策略选择或努力重新分配)。 内容
1引言
元认知[81(https://arxiv.org/html/2607.11881#bib.bib81),212(https://arxiv.org/html/2607.11881#bib.bib212),69(https://arxiv.org/html/2607.11881#bib.bib69)]指的是监控、评估和调节自身认知过程的能力。它对于学习、决策和沟通至关重要,并在跨不同环境的行为和技能持续适应中发挥核心作用[282(https://arxiv.org/html/2607.11881#bib.bib282),139(https://arxiv.org/html/2607.11881#bib.bib139),208(https://arxiv.org/html/2607.11881#bib.bib208)]。在人类中,元认知使个体能够内省并校准自我能力评估,选择合适的策略完成任务,并优化学习过程和任务表现[204(https://arxiv.org/html/2607.11881#bib.bib204),140(https://arxiv.org/html/2607.11881#bib.bib140),43(https://arxiv.org/html/2607.11881#bib.bib43)]。这种元认知灵活性使推理对未见问题具有鲁棒性,能够高效地解决问题,并支持迭代、在线学习[2(https://arxiv.org/html/2607.11881#bib.bib2),281(https://arxiv.org/html/2607.11881#bib.bib281)]。因此,元认知的研究在心理学、教育学、哲学和计算机科学领域都很重要。
由于元认知是智能的标志,常被认为在当前的AI系统中缺失[238(https://arxiv.org/html/2607.11881#bib.bib238),124(https://arxiv.org/html/2607.11881#bib.bib124),284(https://arxiv.org/html/2607.11881#bib.bib284)],越来越多的研究开始将LLMs与元认知联系起来。在过去几年中,LLMs在自然语言处理及更广泛领域取得了显著进展,推动了医疗诊断[123(https://arxiv.org/html/2607.11881#bib.bib123),333(https://arxiv.org/html/2607.11881#bib.bib333)]、法律咨询[59(https://arxiv.org/html/2607.11881#bib.bib59),158(https://arxiv.org/html/2607.11881#bib.bib158)]和科学发现[258(https://arxiv.org/html/2607.11881#bib.bib258),326(https://arxiv.org/html/2607.11881#bib.bib326)]等高危领域的进步。随着LLMs在多样任务中日益模仿人类的认知能力[269(https://arxiv.org/html/2607.11881#bib.bib269),292(https://arxiv.org/html/2607.11881#bib.bib292),96(https://arxiv.org/html/2607.11881#bib.bib96)],一个自然的问题是,这些模型是否能够展现元认知行为——以及赋予基于LLM的系统元认知能力是否能够提升其性能和能力、增强学习效率,并在人机协作环境中改善结果和可靠性[30(https://arxiv.org/html/2607.11881#bib.bib30),117(https://arxiv.org/html/2607.11881#bib.bib117)]。例如,已有研究表明,提示模型进行元认知自我反思可以显著增强推理任务的表现[93(https://arxiv.org/html/2607.11881#bib.bib93),10(https://arxiv.org/html/2607.11881#bib.bib10),134(https://arxiv.org/html/2607.11881#bib.bib134),183(https://arxiv.org/html/2607.11881#bib.bib183),227(https://arxiv.org/html/2607.11881#bib.bib227),77(https://arxiv.org/html/2607.11881#bib.bib77)],并提高模型言语化不确定性的忠实度[180(https://arxiv.org/html/2607.11881#bib.bib180),181(https://arxiv.org/html/2607.11881#bib.bib181)]。由于元认知支撑着以透明方式评估和沟通不确定性的能力,它在LLMs中可能观察到的程度对于理解其局限性和更安全部署的前景至关重要[261(https://arxiv.org/html/2607.11881#bib.bib261)]。此外,元认知可能呈现出自我改进的自然路径[7(https://arxiv.org/html/2607.11881#bib.bib7),185(https://arxiv.org/html/2607.11881#bib.bib185)]。
尽管有这些有希望的方向,关于LLMs元认知的调查和讨论仍然相对稀疏和零散,对于如何定义、表征、实现和评估此类系统中的元认知能力缺乏统一方向或共识。目前尚不清楚LLMs是否能够真正展现或模仿元认知行为,在哪些设置下以及多大程度上能够做到这一点,后训练如何塑造元认知能力,以及如何利用这些能力来推进LLMs的能力。例如,Ackerman [1(https://arxiv.org/html/2607.11881#bib.bib1)],Chen et al. [47(https://arxiv.org/html/2607.11881#bib.bib47)],Li et al. [162(https://arxiv.org/html/2607.11881#bib.bib162)]等研究表明,LLMs可以展现出类似于元认知处理的反思行为,而Prasad和Nguyen [224(https://arxiv.org/html/2607.11881#bib.bib224)],Cash et al. [36(https://arxiv.org/html/2607.11881#bib.bib36)],Sha et al. [245(https://arxiv.org/html/2607.11881#bib.bib245)]等研究则得出结论,LLMs距离能够做出元认知有效的置信度判断还很远。这种紧张关系在Steyvers和Peters [260(https://arxiv.org/html/2607.11881#bib.bib260)]中得到呼应,他们认为人类和LLM元认知之间仍然存在重要差异,包括元认知能力能否通过反馈和训练得到提升,以及这些技能是领域通用还是任务特定的[80(https://arxiv.org/html/2607.11881#bib.bib80),207(https://arxiv.org/html/2607.11881#bib.bib207),33(https://arxiv.org/html/2607.11881#bib.bib33)]。
在本文中,我们提供了LLMs元认知的全面概述(图1(https://arxiv.org/html/2607.11881#S0.F1)),呈现了关于这一新兴主题的当前研究和知识的首篇详尽且有组织的综述,旨在激发有洞见的讨论和未来工作。我们首先通过定义和阐明元认知的概念(§2(https://arxiv.org/html/2607.11881#S2))及其重要性(§3(https://arxiv.org/html/2607.11881#S3))来开始探索。随后,我们关注引发和评估LLMs元认知能力的方法和基准(§4.1(https://arxiv.org/html/2607.11881#S4.SS1))、这项研究的关键发现和启示(§4.2(https://arxiv.org/html/2607.11881#S4.SS2))、在LLMs、LRMs和智能体系统中实例化和改进元认知技能的技术(§5(https://arxiv.org/html/2607.11881#S5)),以及受元认知启发的方法来改进各种LLM能力(§6(https://arxiv.org/html/2607.11881#S6))。最后,我们概述了LLM元认知的应用(§7(https://arxiv.org/html/2607.11881#S7)),反思了该领域的当前状态(§8(https://arxiv.org/html/2607.11881#S8)),并讨论了未来的研究方向(§9(https://arxiv.org/html/2607.11881#S9))。据我们所知,之前没有工作全面、系统地检查LLMs中元认知的趋势、技术进展和关键发现。因此,我们旨在弥合这一差距,阐明LLMs元认知作为一个关键但未被充分探索的方面,可以推动向更有能力、更可靠和更自主的系统迈进。
2什么是元认知?
元认知描述监控和调节自身认知过程的能力。尽管该术语在科学、哲学和教育文献中都有使用,但每个领域强调不同的方面、应用和含义。为了帮助阐明这一概念,我们总结了元认知的核心机制、组成部分和功能,这些在人类中普遍被认可,并在基于LLM的智能系统背景下具有更广泛的实用性。
人类元认知。
元认知起源于认知心理学,并在发展心理学和教育环境中得到广泛研究[81(https://arxiv.org/html/2607.11881#bib.bib81),204(https://arxiv.org/html/2607.11881#bib.bib204),212(https://arxiv.org/html/2607.11881#bib.bib212),141(https://arxiv.org/html/2607.11881#bib.bib141),140(https://arxiv.org/html/2607.11881#bib.bib140),69(https://arxiv.org/html/2607.11881#bib.bib69),68(https://arxiv.org/html/2607.11881#bib.bib68),139(https://arxiv.org/html/2607.11881#bib.bib139)]。它通常被概念化为一个由自我评估(元认知监控)和自我调节(元认知控制)组成的内部感知-行动循环:个体评估自己在任务上的能力,并利用这种评估来指导后续行动的策略选择和控制。在此框架内,元认知可以分解为几个不同但相互作用的组成部分。 元认知知识指的是对自己认知过程和能力的意识(例如,意识到自己的思维模式)。它分为陈述性知识、程序性知识和条件性知识,分别捕捉个体作为学习者对自己了解什么、如何应用认知策略,以及何时及为何特定策略是合适的。 元认知调节涵盖后续过程,如计划(例如,设定目标,为任务选择合适策略)和评估(例如,反思所应用策略的有效性)。 元认知体验指的是在任务执行过程中出现的主观内部状态——如知道感、学习判断或信心(例如,解决问题时的愉悦感)。这些信号支持元认知判断,即个体在任务之前、之中或之后评估自己的表现[241(https://arxiv.org/html/2607.11881#bib.bib241)]。这些判断的有效性可以通过元认知准确性(即敏感性)——个体的置信度区分正确和错误回答的能力——以及元认知校准——个体的置信度反映其正确概率或任务准确性的程度——等指标来衡量。 总之,元认知知识和调节支持设定目标和决策等过程。元认知策略不同于认知策略[4(https://arxiv.org/html/2607.11881#bib.bib4)],对于有效的资源分配和性能优化至关重要[202(https://arxiv.org/html/2607.11881#bib.bib202),53(https://arxiv.org/html/2607.11881#bib.bib53),43(https://arxiv.org/html/2607.11881#bib.bib43)]。元认知的效用在教育环境中得到充分证明,与学业表现密切相关[120(https://arxiv.org/html/2607.11881#bib.bib120),318(https://arxiv.org/html/2607.11881#bib.bib318)]。表现差的学生往往高估自己的能力并准备不足,而信心不足的学生可能效率低下地分配精力[144(https://arxiv.org/html/2607.11881#bib.bib144),70(https://arxiv.org/html/2607.11881#bib.bib70)];这些模式反映了可以通过有针对性的训练或获取更多经验来改善的系统性校准偏差,甚至在年仅三岁的儿童中也是如此[240(https://arxiv.org/html/2607.11881#bib.bib240),143(https://arxiv.org/html/2607.11881#bib.bib143),38(https://arxiv.org/html/2607.11881#bib.bib38)]。这些发现可能为构建和增强智能系统中的元认知能力提供见解。除此之外,一些证据表明动物也拥有元认知监控并用其调节学习,对人工系统中的学习有进一步启示[125(https://arxiv.org/html/2607.11881#bib.bib125)]。
语言模型中的元认知。
语言模型元认知的概念自2023年以来已经获得关注,但对其包含的内容没有明确定义。在文献中,“元认知”常被用于描述模型输出的简单反思和(反馈驱动的)修订,特别是在推理任务中。然而,这种用法往往与心理学文献中的元认知原则松散对齐。更普遍的是,缺乏共识,该术语的使用方式多种多样,根据研究设置的不同而采用不同的实例化[167(https://arxiv.org/html/2607.11881#bib.bib167)]。例如,Li等人[165(https://arxiv.org/html/2607.11881#bib.bib165)]将元认知定义为基于内部表征评估能力的能力;Lu等人[189(https://arxiv.org/html/2607.11881#bib.bib189)]将“元认知置信度”定义为模型对于它知道一个主张的内部信念,无论事实正确与否;Lv等人[191(https://arxiv.org/html/2607.11881#bib.bib191)]将“元认知推理”定义为评估LM是否知道某件事;Bilal等人[18(https://arxiv.org/html/2607.11881#bib.bib18)]将“元思考”定义为模型自我反思、评估、
相似文章
大语言模型中的元认知:基础、进展与机遇
本文全面概述了大语言模型中的元认知,涵盖了测量方法、改进技术及未来方向。
LLMs 未显示出个体化元认知迹象
本文研究了前沿大语言模型是否表现出个体化元认知——即超越共享信号评估自身项目级别能力的能力。通过对20个模型和六个基准进行因子分析和成对校准,作者未发现此类元认知的证据;置信度差异归结为一个单一的共享难度因子,表明模型依赖于共同的难度信号而非模型特定的自我认知。
元认知监测电池:LLM自我监测的跨域基准
一个包含524个项目的新型跨域基准(元认知监测电池)使用人类心理测量方法评估LLM在六个认知领域的自我监测能力。应用于20个前沿LLM后,揭示了三种不同的元认知配置,并表明准确率排名与元认知敏感性排名基本相反。
前沿大语言模型中的领域级元认知监控:一份33个模型图谱
本研究提出了一份涵盖33个模型的图谱,利用MMLU基准分析了前沿大语言模型中的领域级元认知监控,揭示了聚合指标所掩盖的不同知识领域中置信度校准的显著差异。
LLMs 能内省吗?现实检验
本文认为,近期关于LLMs内省能力的说法并不成立,因为仅凭行为证据无法区分真正的内省与基于表面线索的模式匹配。作者重新审视了两种评估范式,发现模型依赖于输入层特征,而非真正访问内部状态。