能力自我评估:教会LLMs认识自身局限

arXiv cs.AI 论文

摘要

本文针对大语言模型提出了能力自我评估(CSA)方法,并将其建模为策略学习问题。实验表明,强化学习能够有效教会模型识别自身局限并委托处理无法解决的查询,效果优于监督微调,且具有良好的分布外泛化能力。

arXiv:2606.00251v1 Announce Type: new 摘要:识别自身局限性并决定是解决问题还是委托处理的能力,是可靠智能系统的基础。然而,我们证明现代大语言模型系统性地缺乏这种能力:在不同模型家族和规模中,它们高估自身能力,尝试无法解决的查询。我们将这种能力称为能力自我评估(CSA),并将其建模为策略学习问题,旨在提升自我评估能力的同时保留模型的原始能力。我们的结果表明,强化学习能有效教会CSA,显著优于监督微调,同时保留原始能力。相比之下,监督微调严重损害了模型本应评估的能力。此外,学到的自我评估行为具有良好的分布外泛化能力,表明CSA是一种可迁移的模型特质。最后,CSA具有实际用途:它能在推理时改善本地-云端决策,并为训练中目标数据选择提供信号。
查看原文
查看缓存全文

缓存时间: 2026/06/02 15:45

# 教大语言模型认识自身能力边界 来源:https://arxiv.org/html/2606.00251 ## 能力自我评估:教大语言模型认识自身能力边界 Haoyan Yang¹, Reza Shirkavand²¹¹footnotemark:1, Yukai Jin³, Jiawei Zhou¹, Shangqian Gao³²²2我们在数学上训练1个epoch,在科学上训练3个epoch。唯一的例外是Qwen3-0.6B,更长的训练会导致模型崩溃,总是选择DELEGATE;因此我们应用早停,训练60步。, Heng Huang²²22我们在数学上训练1个epoch,在科学上训练3个epoch。唯一的例外是Qwen3-0.6B,更长的训练会导致模型崩溃,总是选择DELEGATE;因此我们应用早停,训练60步。 ¹石溪大学 ²马里兰大学 ³佛罗里达州立大学 同等贡献。通讯作者:Jiawei Zhou ([email protected]), Shangqian Gao ([email protected]), Heng Huang ([email protected])。 ###### 摘要 识别自身局限性,并决定是解决问题还是委派给他人,是可靠智能系统的根本能力。然而,我们表明现代大型语言模型系统地缺乏这种能力:在多种模型族和规模上,它们高估自身能力,尝试那些无法解决的任务。我们将这种能力称为能力自我评估(Capability Self-Assessment, CSA),并将其形式化为一个策略学习问题,旨在提升自我评估能力的同时保持模型的原始能力。我们的结果表明,强化学习有效地教会了CSA,显著优于监督微调,同时保持了原始能力。相比之下,监督微调严重损害了模型本应评估的能力。此外,学到的自我评估行为在分布外也能很好地泛化,表明CSA是一种可迁移的模型特质。最后,CSA在实际中有用:它在推理时改进了本地-云端决策,并在训练期间为针对性数据选择提供了信号。¹¹代码可在https://github.com/Joyyang158/llm-csa获取。 ## 1 引言 一个理想的智能系统不仅能很好地解决问题,还能认识到自己的极限。当问题超出其能力范围时,它会寻求帮助,或者利用失败来确定下一步该学习什么,正如人类所做的那样madras2018predictresponsiblyimprovingfairness (https://arxiv.org/html/2606.00251#bib.bib43)。然而,大型语言模型(LLMs)被训练用来生成答案,而不是决定是否应该回答。我们经验性地发现,在多种模型族和规模中,普遍存在能力高估:LLMs即使在无法可靠解决的问题上也选择回答。 其后果是具体的。模型在其能力边界之外作答,产生幻觉farquhar2024detecting-hallucinations-entropy (https://arxiv.org/html/2606.00251#bib.bib16)和浪费计算资源shirkavand2025costaware (https://arxiv.org/html/2606.00251#bib.bib55)。这种是否回答的决策常常与答案本身同等重要:在尝试一个查询之前,模型应判断该问题是否在其自身能力范围内,或者是否应委派给更强的模型或人类。 我们将能力自我评估(Capability Self-Assessment, CSA)定义为模型判断一个查询是否属于其可解集的能力,并将其作为我们的核心视角。先前的工作通过校准kadavath2022llms-mostly-know (https://arxiv.org/html/2606.00251#bib.bib34)、置信度估计yin2023do-llms-know-what-they-dont-know (https://arxiv.org/html/2606.00251#bib.bib72);kapoor2024llms-must-be-taugh (https://arxiv.org/html/2606.00251#bib.bib35)、指令微调zhang2024r (https://arxiv.org/html/2606.00251#bib.bib74)和弃权wen2025abstention-survey (https://arxiv.org/html/2606.00251#bib.bib64)研究了相关问题。然而,这些工作并未将自我评估视为一个独立的能力学习问题。校准和置信度估计主要提取与模型预测相关的分数,而指令微调和弃权通常将解决或委派行为混入特定任务中。 为了将能力评估与执行分开,并直接测试模型是否能学习自身的能力边界,我们构建了一个可操作的CSA任务,采用简单的格式:在`Self-SOLVE`(尝试自行解决查询)和`DELEGATE`(将查询交给更强的模型)之间进行二元选择。我们将此任务视为一个*策略学习*问题,而不是普通的监督分类。目标不是训练一个独立的裁判,也不仅仅是获取一个校准的置信分数。相反,我们希望模型本身将CSA作为行为性能力来掌握,同时保留其必须评估其边界的底层能力。这使得强化学习(RL)尤其自然。我们关注的是动作,而非孤立的标签,而且正确性是基于结果的。如果模型确实能解决该查询,则`Self-SOLVE`决策是正确的;否则`DELEGATE`是正确的。这给出了一个清晰的可验证奖励lambert2024tulu (https://arxiv.org/html/2606.00251#bib.bib39);shao2024deepseekmath (https://arxiv.org/html/2606.00251#bib.bib54);guo2025deepseek-r1 (https://arxiv.org/html/2606.00251#bib.bib28),使CSA成为政策优化与基于结果反馈的自然实例。相比之下,在决策标签或理由上进行监督微调(SFT)可以教模型模仿想要的输出,而不保留这些输出所应反映的能力。 在广泛的模型族、规模和领域上,我们表明CSA是一种可教的特质。RL显著提高了这种能力,优于监督替代方案,同时保持了模型原有的问题解决能力。由此产生的行为还能跨领域迁移,表明CSA不仅仅是领域特定的启发式方法,而是一种更通用、可重用的能力评估技能。 我们在两个具体应用中展示了CSA作为一种可学习模型能力的更广阔视角。在推理时,学到的CSA通过识别哪些查询应路由到更强的模型来改进本地-云端路由,从而获得更好的成本-准确性权衡。此外,由于`DELEGATE`样本位于或超越模型当前能力边界,基于CSA的信号可在训练过程中用于针对性数据选择。通过这种方式,学到的CSA可以发挥类似于有效问题解决中能力评估的双重作用:在推理时指导何时行动或委派,在训练时指导下一步学习什么。 总之,我们的贡献是: 1. 我们将能力自我评估(CSA)形式化为一个策略学习问题,模型在`Self-SOLVE`和`DELEGATE`之间做决定,这源于我们在当前LLMs中观察到的严重能力高估。 2. 我们表明CSA是一种可教的特质:与SFT不同,RL在不损害任务能力的情况下,跨模型规模和领域提升了能力评估。学到的策略还能泛化到分布外设置。 3. 我们证明了学到的CSA在实践中的有用性,包括本地-云端路由和能力感知的数据选择。 ## 2 相关工作与动机 ### 2.1 相关工作 自我评估、校准和选择性预测与弃权。一条核心研究路线探讨语言模型是否能评估自身输出的正确性。Kadavath等人kadavath2022llms-mostly-know (https://arxiv.org/html/2606.00251#bib.bib34)表明,LLMs可以产生有用的自我评估信号,如`P(True)`和`P(IK)`,从而将自我知识视为一个校准问题gneiting2007calibration1 (https://arxiv.org/html/2606.00251#bib.bib20);guo2017calibration2 (https://arxiv.org/html/2606.00251#bib.bib27)。后续工作研究了不可回答问题和不确定性感知的微调,表明通过显式训练而非提示可以获得更好的不确定性估计yin2023do-llms-know-what-they-dont-know (https://arxiv.org/html/2606.00251#bib.bib72);kapoor2024llms-must-be-taugh (https://arxiv.org/html/2606.00251#bib.bib35)。密切相关的工作关于选择性预测和弃权,探究模型何时应回答而非放弃,通常通过置信度阈值或风险-覆盖权衡chow2003optimum (https://arxiv.org/html/2606.00251#bib.bib12);el2010foundations (https://arxiv.org/html/2606.00251#bib.bib15);bartlett2008classification (https://arxiv.org/html/2606.00251#bib.bib5);geifman2019selectivenet (https://arxiv.org/html/2606.00251#bib.bib18);xin2021-art-of-abstetion (https://arxiv.org/html/2606.00251#bib.bib66);gu2023evaluation (https://arxiv.org/html/2606.00251#bib.bib25);wen2025abstention-survey (https://arxiv.org/html/2606.00251#bib.bib64)。 总之,这些工作大多将自我知识视为一个*标量*置信度估计问题。 不确定性信号和RL训练出的决策行为。相关文献通过自一致性、语义不确定性或隐藏状态探针研究不确定性和幻觉检测manakul2023selfcheckgpt (https://arxiv.org/html/2606.00251#bib.bib44);farquhar2024detecting-hallucinations-entropy (https://arxiv.org/html/2606.00251#bib.bib16);kossen2024semantic-entropy (https://arxiv.org/html/2606.00251#bib.bib36);azaria2023internal (https://arxiv.org/html/2606.00251#bib.bib3);slobodkin2023curious (https://arxiv.org/html/2606.00251#bib.bib56);han2025simple-factuality-probes (https://arxiv.org/html/2606.00251#bib.bib30);cencerrado2025no-answer-needed (https://arxiv.org/html/2606.00251#bib.bib8)。这些工作表明,模型含有关于自身不可靠性的有用信号,但它们主要针对*事后检测*。在优化方面,DeepSeek-R1guo2025deepseek-r1 (https://arxiv.org/html/2606.00251#bib.bib28)表明,RL可以诱导出有用的行为特质,如自我反思和验证,而近期基于RL的求助工作则研究模型何时应依赖外部工具feng2025retool (https://arxiv.org/html/2606.00251#bib.bib17);gul2025mash (https://arxiv.org/html/2606.00251#bib.bib26)。 我们的贡献定位。我们不将自我评估视为一个*标量*置信度估计或一种*检测*方法,而是研究模型自身能否学习一个显式的`Self-Solve/Delegate`*策略*。目标是将CSA作为一种内在能力注入模型,而不是训练一个独立的路由器或裁判。这使得策略学习比监督分类更合适:置信分数或委派标签只指定了期望的输出,而RL允许模型发展其自身内部的能力评估策略。我们的实验证实了这一区别的重要性(第4.2节 (https://arxiv.org/html/2606.00251#S4.SS2))。相关工作的完整讨论见附录A (https://arxiv.org/html/2606.00251#A1)。 ### 2.2 实证研究:当前模型缺乏CSA 参见图标题 图1:当前模型缺乏CSA,跨模型族和规模,在组合的数学测试集上评估。▼标记每个模型的*自行解决率*,▲标记其*实际准确率*。阴影条代表两者之间的差距,差距越大表示CSA越弱。 与先前工作表明LLMs高估自己成功可能性或答案正确性一致barkan2026do (https://arxiv.org/html/2606.00251#bib.bib4);xiong2023can-llm-express-uncertainty (https://arxiv.org/html/2606.00251#bib.bib67);sun2025large (https://arxiv.org/html/2606.00251#bib.bib58);chhikara2025mind (https://arxiv.org/html/2606.00251#bib.bib11),我们经验性地发现,大多数当前模型缺乏可靠的CSA。我们的评估涵盖Qwen3yang2025qwen3technicalreport (https://arxiv.org/html/2606.00251#bib.bib69)、Gemma3gemmateam2025gemma3technicalreport (https://arxiv.org/html/2606.00251#bib.bib59)、Llama3grattafiori2024llama3herdmodels (https://arxiv.org/html/2606.00251#bib.bib22)、OLMo2olmo20252olmo2furious (https://arxiv.org/html/2606.00251#bib.bib47)、GPT-5openai2025gpt5 (https://arxiv.org/html/2606.00251#bib.bib48)和Gemini-3.1google2026gemini31 (https://arxiv.org/html/2606.00251#bib.bib21)群组,包括开源权重和前沿闭源权重模型。对于每个模型,我们使用来自组合数学测试集的查询,并要求其在`Self-SOLVE`和`DELEGATE`之间选择。我们记录*自行解决率*,即选择`Self-SOLVE`的样本百分比,并与*实际准确率*(模型实际正确回答的百分比)进行比较。如图1 (https://arxiv.org/html/2606.00251#S2.F1)所示,比较这两个指标揭示出,在所有评估的模型中,自行解决率都显著高于实际准确率。这表明当前模型系统性地高估了自身能力。提示模板、数学测试集详情和推理设置见附录B.1 (https://arxiv.org/html/2606.00251#A2.SS1)、D.2 (https://arxiv.org/html/2606.00251#A4.SS2)和D.3 (https://arxiv.org/html/2606.00251#A4.SS3)。 ## 3 通过训练获得CSA 基于当前模型缺乏可靠CSA的发现(第2.2节 (https://arxiv.org/html/2606.00251#S2.SS2)),本节我们探究*CSA是否可以通过训练获得*。图2 (https://arxiv.org/html/2606.00251#S3.F2)展示了我们的方法。 参见图标题 图2:将CSA注入语言模型的框架概述。 (1) CSA标签构建:模型对每个查询尝试KK次;将预测与真实值比较并聚合,以分配标签yi∈{Self-Solve,Delegate}yi∈{Self-Solve,Delegate}。 (2) CSA训练策略:我们探索四种方法:*(a)* SFTlabel{}``text{label}只使用裸标签,*(b)* SFTself{}``text{self}使用自生成理由,*(c)* SFTteacher{}``text{teacher}使用教师理由,以及*(d)* RLVR是两阶段GRPO,包含多样性过滤预热(DFW),随后进行完整GRPO训练。 (3) CSA推理与评估:训练后的模型M′M′判断每个新查询是自行解决还是委派;评估时,重新探测M′M′以获得y~iy~i,通过比较y^iy^i与y~iy~i来衡量CSA性能。 ### 3.1 CSA标签构建 教给模型CSA需要真实的标签,我们通过探测模型自身来构建这些标签。给定数据集D={(qi,ai∗)}Ni=1D={(qi,ai∗)}i=1N,包含查询和答案,我们对每个查询运行模型MKK次,得到预测{â(k)i}Kk=1{âi(k)}k=1K。采样KK次可以减少解码噪声,使标签反映模型的底层能力。然后通过与真实值的比较进行聚合来分配标签: yi={Self-Solve,Delegate,if g({1[â(k)i=ai∗]}Kk=1)=1,otherwise,yi={Self-Solve,if g({1[âi(k)=ai∗]}k=1K)=1,Delegate,otherwise,(1)其中g(·)是一个聚合函数(例如,pass@K或多数投票)。生成的标签捕捉了模型能解决和不能解决的查询,并在所有训练策略中共享。重要的是,这些标签在训练前构建并在整个过程中固定不变。因此它们的有效性依赖于一个关键假设:获得CSA不会损害模型底层的问题解决能力,因此训练后的模型之前的

相似文章