TRIAGE:在资源约束下评估大语言模型的前瞻性元认知控制

arXiv cs.AI 论文

摘要

介绍了TRIAGE,一个在令牌预算下评估大语言模型前瞻性元认知控制的框架,发现它们在跨问题有效分配计算资源的能力上存在显著差距。

arXiv:2605.13414v1 公告类型:新 摘要:将语言模型部署为自主智能体需要的不仅仅是每项任务的准确性:当一个智能体在有限的令牌预算下面临一系列问题时,它必须在没有任何执行反馈之前决定尝试哪些问题、以什么顺序以及每个问题投入多少计算资源。这就是人类认知中研究了几十年的前瞻性元认知控制形式,但语言模型是否具备这种能力尚未得到检验。我们引入了TRIAGE,一个评估框架,其中模型接收一个任务池和一个根据其自身基线成本校准的令牌预算,并制定一个有序计划,该计划联合编码了选择、排序和每个问题的资源分配。计划根据一个完全了解模型在每个问题上的可解性和成本的oracle进行评分,得出一个通用尺度上的分诊效率比。我们评估了前沿和开源模型,无论是否启用推理,涉及竞赛数学、研究生级科学、代码生成和专家多学科知识,发现当前的语言模型在预期元认知控制方面存在显著差距,揭示了一个先前未测量的能力维度,对资源高效的智能体部署有直接影响。
查看原文
查看缓存全文

缓存时间: 2026/05/14 06:16

# 分诊:评估资源约束下LLM的前瞻性元认知控制 来源:https://arxiv.org/html/2605.13414 ###### 摘要 将语言模型部署为自主智能体需要的不仅仅是逐个任务的准确率:当一个智能体在有限token预算下面对一系列问题时,它必须决定尝试哪些问题、按什么顺序进行、以及为每个问题分配多少计算量——这一切都要在得到任何执行反馈之前完成。这就是人类认知研究中研究了数十年的前瞻性元认知控制形式,但语言模型是否具备这种能力仍未得到检验。我们引入了TRIAGE,一个评估框架,其中模型接收一个任务池和一个根据其自身基线成本校准的token预算,并提交一个单一的有序计划,该计划联合编码了选择、排序和每个问题的分配。计划根据一个拥有模型在每个问题上可解性和成本完全信息的理想评分者进行评分,从而得到一个通用尺度上的分诊效率比。我们评估了前沿模型和开源模型(启用和不启用推理),涵盖竞赛数学、研究生级科学、代码生成和专家多学科知识,发现当前语言模型在前瞻性元认知控制方面存在显著差距,揭示了一个此前未测量的能力维度,对资源高效的智能体部署具有直接影响。 机器学习, ICML, 元认知, 大语言模型, 资源约束 ## 1 引言 扩展测试时计算已成为提升LLM推理的主要范式(Snellet al.,2025 (https://arxiv.org/html/2605.13414#bib.bib1)),但这同时也使得计算分配成为一个核心未解问题:当前的推理模型缺乏对其自身计算消耗的可靠前瞻性控制,而针对每个问题自适应分配计算量可以在统一预算的基础上带来显著的效率提升(Snellet al.,2025 (https://arxiv.org/html/2605.13414#bib.bib1); Alomraniet al.,2025 (https://arxiv.org/html/2605.13414#bib.bib2))。推理模型即使对简单问题也会生成数千个token(Chenet al.,2024 (https://arxiv.org/html/2605.13414#bib.bib3)),并且对难题思考不足,过早放弃有希望的推理路径(Wanget al.,2025 (https://arxiv.org/html/2605.13414#bib.bib4))。同样,无约束的智能体在智能体任务上可能消耗数千个token却仍然失败,表现出分析瘫痪和计算浪费,这与性能下降相关(Cuadronet al.,2025 (https://arxiv.org/html/2605.13414#bib.bib5))。这就产生了一个具体的部署问题:基于这些模型构建的智能体面临真实的资源约束——token预算、工具调用限制、延迟窗口——并且必须在投入资源之前决定要尝试哪些任务。一个资源理性的智能体应该将有限的计算分配给预期回报最高的任务(Lieder and Griffiths,2020 (https://arxiv.org/html/2605.13414#bib.bib6))。在实践中,这意味着一个面对一系列问题且受限于token预算的LLM应该放弃尝试它无法解决的问题,在简单问题上花费更少,并且为每个尝试的问题安全地投入足够资源,从而避免因分配不足而将预算浪费在无回报的部分或不完整解决方案上——这与学生在限时考试中采用的策略相同——即Nelson和Narens(1990 (https://arxiv.org/html/2605.13414#bib.bib7))形式化的*元认知控制*:基于对自己知识状态的判断来调节努力分配。 最近的研究表明,LLM在孤立情况下具备部分这种能力:大语言模型可以预测自己是否能正确回答某个问题(Kadavathet al.,2022 (https://arxiv.org/html/2605.13414#bib.bib8)),然而经过推理训练的模型在知道何时弃权方面表现更差——而不是更好(Kirichenkoet al.,2025 (https://arxiv.org/html/2605.13414#bib.bib9))。Barkanet al.(2025 (https://arxiv.org/html/2605.13414#bib.bib10))发现前沿模型对其自身能力存在系统性过度自信,并且这种过度自信不会随着规模或推理增强而减弱。对于LLM规划者来说,关键能力不仅仅是预测token成本或知道何时放弃单个问题,而是管理一个组合:给定一组任务和一个共享预算,选择要尝试的任务、估计成本、并排序执行以最大化价值。这是许多真实世界智能体部署所面临的问题——处理积压问题的编码智能体、将查询分解为不同难度的子问题的研究智能体、以及在更大目标的子任务间预算计算量的规划智能体——所有这些都需要在有限计算下进行跨任务优先级排序。现有的单任务预算方法为单个问题估计token成本(Hanet al.,2025 (https://arxiv.org/html/2605.13414#bib.bib40); Liet al.,2025 (https://arxiv.org/html/2605.13414#bib.bib12)),外部批处理调度器为了吞吐量对请求进行排序或路由(Jinet al.,2023 (https://arxiv.org/html/2605.13414#bib.bib13); Fuet al.,2024 (https://arxiv.org/html/2605.13414#bib.bib14))。然而,LLM本身是否能够执行联合优化——在共享预算下评估自身可行性、成本和跨异构任务集的优先级——仍未得到检验,而回答这个问题是构建能够规划并优化自身资源使用(而非依赖外部编排)的智能体的先决条件。 我们引入了TRIAGE,一个用于资源约束下前瞻性元认知控制的评估框架。该构念包含三个组成部分。**元认知控制**是指利用自我知识来调节行为,根据模型计划的结果(而非口头表达的置信度)进行分级(Ackerman,2026 (https://arxiv.org/html/2605.13414#bib.bib15))。**前瞻性**表示所有决策在尝试任何任务之前就已确定,这使TRIAGE区别于回顾性的置信度测量或事后校准(Kadavathet al.,2022 (https://arxiv.org/html/2605.13414#bib.bib8); Koriat,1997 (https://arxiv.org/html/2605.13414#bib.bib19))。**资源约束**指的是一个有限的共享预算——默认情况下是输出token——模型的行为会消耗它(Hanet al.,2025 (https://arxiv.org/html/2605.13414#bib.bib40))。在TRIAGE中,模型接收一组问题、每个问题的分值以及一个根据其在该集合上的自身基线成本校准的token预算。它返回一个单一的有序计划,指定要尝试哪些问题、为每个问题分配多少token以及按什么顺序进行。这种设计将Nelson和Narens(1990 (https://arxiv.org/html/2605.13414#bib.bib7))的三个基础控制功能以其前瞻性形式操作化:选择(尝试哪些问题)、分配(每个问题投入多少计算量)和终止(事先在哪里设定预算截止点)。TRIAGE直接评估控制输出,而不是要求模型口头表达其潜在判断——这对LLM是合适的,因为自我报告是不可靠的内部状态信号,而元认知更能通过行为测量(Ackerman,2026 (https://arxiv.org/html/2605.13414#bib.bib15))。正如人类学习者在时间压力下规划努力分配(Son and Metcalfe,2000 (https://arxiv.org/html/2605.13414#bib.bib16)),自主智能体必须在有限推理限制下联合优化这些方面以最大化期望效用。 我们评估了20个模型架构——4个标准LLM和16个推理增强LLM,分别在启用和不启用思考的情况下进行评估——涵盖四个领域:竞赛数学(AIME 2024–2025)、研究生级科学(GPQA Diamond;Reinet al.,2024 (https://arxiv.org/html/2605.13414#bib.bib45))、代码生成(LiveCodeBench;Jainet al.,2024 (https://arxiv.org/html/2605.13414#bib.bib17))和跨学科专家知识(Humanity’s Last Exam;Phanet al.,2025 (https://arxiv.org/html/2605.13414#bib.bib18))。我们发现当前语言模型在前瞻性元认知控制方面存在显著且不均衡的差距。在一个领域中的强自我评估很少迁移到另一个领域,扩展推理提高了任务级准确率却没有提高分诊质量,并且经过推理训练的模型在面对任务池中无法解决的项时更不容易识别出来。在所有预算水平上,咨询性制度和强制性制度之间的差距很大,表明模型有时能够选择尝试什么,但很少能够提交它们自身能够遵守的预算。综上所述,这些实验刻画了一个此前未测量的能力维度,对资源高效的智能体部署具有直接影响。 ## 2 相关工作 ### 2.1 大语言模型中的元认知 元认知,即监控和调节自身认知过程的能力(Nelson and Narens,1990 (https://arxiv.org/html/2605.13414#bib.bib7)),已成为LLM评估中的一个核心问题。研究已经经历了三个层次的调查:元认知**知识**(模型能否识别任务需要什么?)、元认知**监控**(模型能否判断自己是否会成功?)以及元认知**控制**(模型能否根据这些判断采取行动来调节自身行为?)。现有工作在头两个层次取得了进展;第三个层次仍未得到检验,因为目前没有评估迫使模型在共享预算下提前承诺一个任务组合——在这种制度下,控制与监控在操作上有所区别。 #### 元认知知识和监控。 Kadavathet al.(2022 (https://arxiv.org/html/2605.13414#bib.bib8))提供了关于监控的基础性结果,表明LLM可以预测自己将正确回答哪些问题,并且校准能力随规模提升而改善。Didolkaret al.(2024 (https://arxiv.org/html/2605.13414#bib.bib61))证明了LLM也具备元认知**知识**:给定一个数学问题,前沿模型可以分配有意义的技能标签,并使用技能匹配的示例来改进推理,从而确立了模型可以评估任务属性。Xionget al.(2024 (https://arxiv.org/html/2605.13414#bib.bib62))系统地基准测试了置信度引出方法,发现LLM在口头表达置信度时始终过度自信,尽管校准和失败预测都随规模改善。Wang等人(2025 (https://arxiv.org/html/2605.13414#bib.bib63))通过他们的DMC框架将元认知能力与原始认知能力分离进行形式化,发现更强的LLM表现出更强的元认知,并且增强元认知可以减轻幻觉。在机制层面,Ji-Anet al.(2025 (https://arxiv.org/html/2605.13414#bib.bib21))通过神经反馈范式证明了LLM可以监控和控制其内部激活的低维子空间——这是元认知访问内部状态的直接证据,尽管仅限于当前激活而非前瞻性任务级判断。 这些结果被系统性失败证据所平衡。Kapooret al.(2024 (https://arxiv.org/html/2605.13414#bib.bib20))表明,对于开放式生成,口头表达的置信度校准不佳,而基于内部特征训练的分类器在性能上大幅优于提示——这意味着元认知监控潜在于表征中,但无法通过自然输出可靠访问。Griot等人(2025 (https://arxiv.org/html/2605.13414#bib.bib64))发现,即使正确答案完全不存在,LLM也会对医学问题提供自信的回答,揭示了口头置信度与实际能力之间的脱节。Ackerman(2026 (https://arxiv.org/html/2605.13414#bib.bib15))使用行为范式(模型必须在回答之前决定尝试还是推迟——委托游戏)发现了仅初级的、依赖上下文的元认知,这种元认知取决于训练方案而非规模。Steyvers and Peters(2025 (https://arxiv.org/html/2605.13414#bib.bib22))通过区分元认知**灵敏度**(跨项目对自身表现进行排序)和**校准**(将置信度与成功率匹配)来组织这些混合发现,指出两者可以独立变化,并且没有一个在模型和领域间都可靠地强。 #### 从监控到控制。 上述工作衡量了模型能否评估自身能力。实际部署需要**根据**这些评估**行动**来分配资源。与我们工作最接近的是Barkanet al.(2025 (https://arxiv.org/html/2605.13414#bib.bib10)),他们明确区分了提前置信度与事后置信度,并在编码和智能体任务(SWE-Bench Verified)上测试了前瞻性自我评估。他们发现前沿模型系统性地过度自信,并且规模或推理增强都不能提高预测准确性。他们的资源获取实验——在不同成本下接受或拒绝连续工作合同——是目前最接近预算约束决策的现有类比。但是这种评估设计——顺序的、独立的接受/拒绝决策——其构建方式无法暴露联合选择、分配和在共享预算下排序的组合问题,因为尝试一个问题会减少所有其他问题可用的资源。 AbstentionBench(Kirichenkoet al.,2025 (https://arxiv.org/html/2605.13414#bib.bib9))将监控问题扩展到基准测试环境,测试模型在20个数据集上是否从无法回答的问题中弃权,发现推理微调会使弃权率降低约\{\sim\}24%。他们现有基准的不可回答变体为我们的不可解注入实验提供了参考。但那里的弃权是**问题**的属性——有些可回答,有些不可回答。在TRIAGE中,相关属性是**模型-任务-预算三元组**:一个问题可能原则上可回答,但在此模型、此预算下却不可回答。 纵观这一领域,出现了一致的图景:LLM具备元认知知识和一定的监控能力,但两者在程度上都存在争议,且在不同领域间脆弱。更重要的是,所有现有评估都是每次一个任务进行。组合层面的问题更难——准确监控任何一个任务都是必要但不充分的,因为模型还必须跨任务比较可行性和成本,同时遵守共享约束。当前模型能否实现从单任务监控到组合级资源分配的转变,正是TRIAGE设计要测试的内容。 ### 2.2 LLM推理的计算分配 测试时计算扩展范式(Snellet al.,2025 (https://arxiv.org/html/2605.13414#bib.bib1))使计算分配成为一个实际问题。推理思维模型在简单问题上过度思考(Chenet al.,2024 (https://arxiv.org/html/2605.13414#bib.bib3)),在难题上思考不足(Wanget al.,2025 (https://arxiv.org/html/2605.13414#bib.bib4)),并且在智能体设置中表现出与性能下降相关的分析瘫痪(Cuadronet al.,2025 (https://arxiv.org/html/2605.13414#bib.bib5))。现有方法解决了这种浪费,但在谁分配和什么粒度上存在分歧,而且任何一方都没有涵盖全部问题。 在自我评估方面,TALE(Hanet al.,2025 (https://arxiv.org/html/2605.13414#bib.bib40))让LLM在解决问题之前估计自己的token成本,而SelfBudgeter(Liet al.,2025 (https://arxiv.org/html/2605.13414#bib.bib12))训练模型在思维链之前发出一个预算。两者都是前瞻性的且自我评估的,但限于单个任务:模型决定花费多长时间,而从不决定是否尝试。

相似文章

用 LLM 优化 LLM:面向测试时扩展的智能体发现方法

Hugging Face Daily Papers

本文提出了 AutoTTS,这是一种环境驱动的框架,通过将测试时扩展(TTS)策略的发现过程形式化为控制器合成,自动发现用于大型语言模型(LLM)的测试时扩展策略。该框架在数学推理基准测试上展示了更优的准确率-成本权衡,且计算开销极小。