大型语言模型中的稳定校准错误:高置信度错误的实用视角

arXiv cs.AI 论文

摘要

本文探讨大型语言模型中的稳定校准错误现象,即高置信度错误在微小扰动下局部保持稳定。通过审计分数和探测等诊断方法评估校准程度和内部敏感性。

arXiv:2608.13591v1 公告类型:新 摘要:大型语言模型中的高置信度错误通常被视为内部推理脆弱性的证据。我们研究另一种可能性:稳定校准错误,即自信的错误答案在微小扰动下局部保持稳定。我们结合两种诊断方法:一种是标签感知的输出级审计分数,根据置信度变化和强制回答基线下的过度自信错误对领域进行排序;另一种是内部敏感性探测,测量隐藏状态的变化。在多领域二元事实审计集上,该审计分数跟踪了弃权感知自我批评减少决策损失的情况,尽管直接标注基线对相同增益的排名更强。内部上,自我批评提示在三个开源模型的各层中一致降低隐藏状态敏感性。这支持提示诱导的局部稳定化,而非纯粹输出级的弃权模式,但这并不意味着校准:审计定义的过度自信错误并不明显比自信正确答案更局部敏感,因此一些高置信度错误可能是稳定且校准错误的,而非简单脆弱。
查看原文
查看缓存全文

缓存时间: 2026/08/17 09:39

# 1 引言
来源:https://arxiv.org/html/2608.13591
marginparsep 已被更改。topmargin 已被更改。marginparpush 已被更改。页面布局违反了 ICML 样式。请勿更改页面布局,或包含诸如 geometry、savetrees 或 fullpage 等会为您更改布局的程序包。我们无法可靠地撤销对样式的任意更改。请移除有问题的程序包或布局更改命令,然后重试。

大语言模型中的稳定误校准:高置信度错误的实践视角

Akira Okutomi1

††footnotetext:1ToppyMicroServices OÜ,爱沙尼亚塔林。通讯作者:Akira Okutomi,日本东京\。
第二届机器学习认知智能研讨会 (EIML@ICML 2026),韩国首尔。版权所有 2026 由作者\(s\)保留。###### 摘要

大语言模型中的高置信度错误常被视为脆弱内部推理的证据。我们研究了一种不同的可能性:稳定误校准,即一个自信的错误答案在微小扰动下局部保持稳定。我们结合了两种诊断方法:一种标签感知的输出层级审计分数,该分数按置信度变化和在强制回答基线下的过度自信错误对领域进行排序;以及一种内部敏感性探针,用于测量隐藏状态的移动。在一个多领域二元事实审计集上,该审计分数追踪了拒绝感知的自我批评减少决策损失的领域,尽管直接的标签基线对这些增益的排序更强。在内部,自我批评提示在三个开源模型的各层中一致降低了隐藏状态的敏感性。这支持了提示诱导的局部稳定化,而非纯粹的输出层级拒绝模式,但这并不意味着校准:审计定义的过度自信错误与自信正确的答案相比,其局部敏感性并无明显差异,因此一些高置信度错误可能是稳定且误校准的,而不仅仅是脆弱的。

大语言模型(LLM)中的高置信度幻觉常被描述为内部脆弱性的标志:如果一个微小的提示或上下文变化就能翻转答案,那么一个高置信度的错误看起来就像一个脆弱的失败模式Jiet al.\.\(2023 (https://arxiv.org/html/2608.13591#bib.bib11)\); Manakulet al\.\(2023 (https://arxiv.org/html/2608.13591#bib.bib9)\); Jooet al\.\(2025 (https://arxiv.org/html/2608.13591#bib.bib10)\)\。这种描述看似合理,但并非唯一。一个错误答案也可能是*稳定的*:模型在微小扰动下可能保持接近相同的内部状态,同时仍然产生自信的错误。我们将这种可能性称为*稳定误校准*\。

这种区分对不确定性估计很重要。如果高置信度错误主要源于局部脆弱性,那么扰动敏感性应该能够区分过度自信的错误和正确的高置信度答案。如果它们反而反映了稳定的误校准,那么高置信度错误在决策中可能很重要,但并非异常脆弱。对于难以解释的 LLM,完整的内部解释通常无法实现,因此我们专注于从置信度响应和小型内部探针中可以学到什么。

因此,我们提出一个更窄但更尖锐的问题:当高置信度错误在实践中重要时,我们能从实际可测量的置信度响应和扰动行为中推断出什么?高置信度错误可以被视为认知意识的失败:模型表现得仿佛其证据是充分的,即使决策仍然不可靠。

我们的工作处于拒绝感知决策策略Wenet al\.\(2025 (https://arxiv.org/html/2608.13591#bib.bib1)\); Tayebatiet al\.\(2025 (https://arxiv.org/html/2608.13591#bib.bib2)\); An and Xu \(2025 (https://arxiv.org/html/2608.13591#bib.bib3)\)、LLM 中的校准与过度自信Guoet al\.\(2017 (https://arxiv.org/html/2608.13591#bib.bib4)\); Kadavathet al\.\(2022 (https://arxiv.org/html/2608.13591#bib.bib5)\); Xiaoet al\.\(2025 (https://arxiv.org/html/2608.13591#bib.bib6)\); Wanget al\.\(2026 (https://arxiv.org/html/2608.13591#bib.bib7)\),以及用于事实可靠性的扰动或一致性探针Jiet al\.\(2024 (https://arxiv.org/html/2608.13591#bib.bib8)\); Manakulet al\.\(2023 (https://arxiv.org/html/2608.13591#bib.bib9)\); Jooet al\.\(2025 (https://arxiv.org/html/2608.13591#bib.bib10)\)的交叉点。我们提出三个主张。

1. 1\. 稳定误校准是一个有用的不确定性假设。一个线性高斯闭环抽象表明,局部稳定性和正确性不必一致。
2. 2\. 标签感知的审计分数可以对干预有效的领域进行排序。一个基于策略级置信度变化和强制回答基线下的过度自信错误构建的领域级分数,与拒绝感知的自我批评减少策略感知损失的领域相关。由于该分数使用了观测的正确性,它应被解读为有标签的审计诊断。
3. 3\. 提示诱导的局部稳定化在内部可见,但它不是脆弱性分隔符。在三个开源模型中,自我批评提示降低了逐层的隐藏状态敏感性。然而,审计定义的过度自信错误项与审计定义的自信正确项相比,并未显示出明显的敏感性差异。

主要观点并非完全的机制还原,而是一个实践教训:对决策重要的不确定性相关行为,有时可以通过置信度响应进行研究,即使内部机制仅被部分理解。

## 2 相关工作

最相关的工作分为三类。首先,拒绝感知预测将拒绝视为决策选项而非失败模式,近期的 LLM 研究强调拒绝的有用性既取决于校准也取决于任务价值Wenet al\.\(2025 (https://arxiv.org/html/2608.13591#bib.bib1)\); Tayebatiet al\.\(2025 (https://arxiv.org/html/2608.13591#bib.bib2)\); An and Xu \(2025 (https://arxiv.org/html/2608.13591#bib.bib3)\)\。我们的策略感知损失遵循这一观点:问题不仅在于策略是否准确,还在于它是否在正确的地方回答。

其次,校准研究表明语言模型可能保持过度自信,近期研究质疑口头表达的置信度是否能可靠地转化为良好的决策Guoet al\.\(2017 (https://arxiv.org/html/2608.13591#bib.bib4)\); Kadavathet al\.\(2022 (https://arxiv.org/html/2608.13591#bib.bib5)\); Xiaoet al\.\(2025 (https://arxiv.org/html/2608.13591#bib.bib6)\); Wanget al\.\(2026 (https://arxiv.org/html/2608.13591#bib.bib7)\)\。我们建立在此文献基础上,但我们的目标比新的校准基准更窄。我们询问是否一个基于可观察置信度行为构建的实用分数,能够对可能受益于干预的领域进行排序。

第三,扰动和一致性探针使用内部表示或输出变化来研究微小输入变化下的可靠性Jiet al\.\(2024 (https://arxiv.org/html/2608.13591#bib.bib8)\); Manakulet al\.\(2023 (https://arxiv.org/html/2608.13591#bib.bib9)\); Jooet al\.\(2025 (https://arxiv.org/html/2608.13591#bib.bib10)\)\。我们同时使用这两种视角:一个用于领域排序的输出层级分数,以及一个用于测试过度自信错误是否确实更局部脆弱的逐层内部探针。

## 3 稳定误校准的实践视角

我们使用线性高斯闭环模型仅作为简单的抽象Kalman \(1960 (https://arxiv.org/html/2608.13591#bib.bib12)\),而非 LLM 推理的字面模型。一个最小化的局部版本是

zt\+1=Azt\+b\+ηt,ηt∼N\(0,Σ\)\。z\_\{t\+1\}=Az\_\{t\}\+b\+\\eta\_\{t\},\\qquad\\eta\_\{t\}\\sim\\mathcal\{N\}\(0,\\Sigma\)\。\(1\)
如果ρ\(A\)<1\\rho\(A\)<1,则微小扰动会被衰减,状态局部收敛。然而,不动点z⋆=\(I−A\)−1bz^\{\\star\}=\(I\-A\)^\{\-1\}b仍可能位于一个其标签与真相不符的决策区域中。因此,局部稳定性与系统性误校准是兼容的。这就是我们称之为*稳定误校准*的图景。在此我们专注于该图景对我们可直接测量的量意味着什么。

实践要点很简单。如果稳定误校准是真实的,那么两个可观察信号变得重要。首先,当同一项目在相近的决策策略下被审视时,置信度可能会显著移动。其次,即使其行为是局部稳定的,参考策略也可能积累相当数量的自信错误。我们的领域分数正是为了捕捉这两个信号而设计的。

对于 LLM,我们用一个基于置信度移动和过度自信错误(OCW)指标构建的可观察分数来总结领域风险:

Hproxy\(d\)\\displaystyle H\_\{\\mathrm\{proxy\}\}\(d\)=1\|Dd\|∑i∈Dd\[Stdc∈\{C0,C1,C2\}\(pi,c\)\\displaystyle=\\frac\{1\}\{\|D\_\{d\}\|\}\\sum\_\{i\\in D\_\{d\}\}\\Big\[\\mathrm\{Std\}\_\{c\\in\\\{C0,C1,C2\\\}\}\(p\_\{i,c\}\)\(2\)\+λOCW\(i\)\]\。\\displaystyle\\qquad\\qquad\+\\;\\lambda\\,\\mathrm\{OCW\}\(i\)\\Big\]\。其中 C0 是强制回答基线,C1 是谨慎拒绝策略,C2 是自我批评拒绝策略(见第 4 节 (https://arxiv.org/html/2608.13591#S4))。值 pi,c∈\[0,1\]p\_\{i,c\}\\in\[0,1\] 是项目 ii 在策略 c 下报告的 P\(correct\)P\(\\mathrm\{correct\}\),拒绝被映射为中性值 0\.50\.5。过度自信错误(OCW)指标当 C0 过度自信错误时为 1:它回答了该项目,超过了高置信度阈值,且是错误的;否则为 0。当置信度在不同策略间变化时,第一项较大;当强制回答基线犯下自信错误时,第二项较大。我们使用单一的高置信度阈值 0\.8,并在全文设置 λ=1\\lambda=1。

由于过度自信错误项使用了正确性,HproxyH\_\{\\mathrm\{proxy\}\} 是一个有标签的审计诊断工具,而非用于未标记输入的部署时估计器。其目的并非替代直接的结果诊断(如 C0 错误率或 C0 Brier 风险),而是分离两个与干预相关的信号:策略移动和过度自信错误质量。操作上,值越大意味着该领域表现出策略移动、过度自信失败或两者兼有。线性高斯图景仅作为指导:它阐明了为何局部稳定性与正确性可以分离,使得这些可观察信号成为自然的审计量。

因此,两个具有相似平均准确率的领域可能获得不同的代理分数。一个可能具有相对稳定的置信度和较少的自信错误,而另一个在平均意义上看起来安全,但一旦引入相近策略或拒绝,就变得有风险。该分数是为第二个问题设计的:不是“哪个领域在抽象意义上最难”,而是“哪个领域最容易暴露于代价高昂的过度自信,且最有可能从干预中受益”。

## 4 实验设置

我们使用 N=532N=532 个简短的二元事实项目,分为 11 个领域。这是一个冻结的审计集,而非命名的公共基准;再现包包括项目字符串、领域标签、黄金标签和策略输出。领域规模从 35 到 64 个项目不等。这些领域涵盖医学流行病学、社会统计、地理旅行、文化产业、发展地区、娱乐活动、文学媒体、宏观指数、历史外交、体育和技术标准。每个项目都在相同的三个策略下进行评估,因此领域级的比较是成对的。附录提供了代表性项目示例,工件库包含用于所有报告数字的冻结输入Okutomi \(2026 (https://arxiv.org/html/2608.13591#bib.bib16)\)\。

项目文件在策略评估前已冻结。二元黄金标签独立于模型输出分配,缺少或模糊书面真相条件的项目已从冻结审计集中排除。领域标签仅用于聚合,不显示给模型。

#### 策略。
C0 是强制回答基线,必须输出“是”或“否”。C1 允许在项目过于未指定而无法负责任地回答时拒绝。C2 在最终决策前增加了明确的自我批评检查,也可能拒绝。所有三个策略使用相同的项目措辞;只有决策策略改变。

#### 输出层级策略模型。
所有 C0–C2 策略日志均使用 “gpt\-4\.1\-mini” 收集。日志脚本未设置显式温度参数;因此精确重放可能依赖于 API 默认值和托管模型快照。每个策略被提示返回一个决策和一个口头 P\(correct\)P\(\\mathrm\{correct\}\) 分数;黄金标签从不包含在提示中。我们使用此口头置信度作为报告的置信度信号,而非模型保证的已校准概率。我们发布用于输出层级分析的冻结策略输出 CSV。

#### 置信度与策略感知损失。
当策略回答时,它还报告 P\(correct\)∈\[0,1\]P\(\\mathrm\{correct\}\\in\[0,1\]。如果它拒绝,我们分配中性值 0\.50\.5,这会产生固定的平方损失惩罚 0\.250\.25。我们使用 Brier 风格的平方损失Brier \(1950 (https://arxiv.org/html/2608.13591#bib.bib13)\); Gneiting and Raftery \(2007 (https://arxiv.org/html/2608.13591#bib.bib14)\) 评估分配给阳性“是”标签的概率的策略增益。领域级增益始终相对于 C0 测量。

这种设计很重要,因为评估是有意感知干预的。策略可以通过改进答案本身,或者通过在基线倾向于自信错误时拒绝来提供帮助。因此,损失奖励了有用的拒绝,而未将拒绝视为零成本。

对于一个具有二元标签 yi∈\{0,1\}y\_\{i\}\\in\\\{0,1\\\} 的项目,我们写

SEpolicy\(i,c\)=\(p~i,c−yi\)2,SE\_\{\\mathrm\{policy\}\}\(i,c\)=\(\\tilde\{p\}\_\{i,c\}\-y\_\{i\}\)^\{2\},\(3\)
其中 p~i,c\\tilde\{p\}\_\{i,c\} 是在策略 c 下分配给阳性“是”标签的概率。如果策略回答“是”,则 p~i,c=P\(correct\)\\tilde\{p\}\_\{i,c\}=P\(\\mathrm\{correct\}\);如果回答“否”,则 p~i,c=1−P\(correct\)\\tilde\{p\}\_\{i,c\}=1\-P\(\\mathrm\{correct\}\);如果拒绝,则 p~i,c=0\.5\\tilde\{p\}\_\{i,c\}=0\.5。领域级增益是相对于 C0 的此损失变化的成对平均值。

#### 内部探针。
为了探测局部内部敏感性,我们使用三个开源指令微调模型:Llama\-3\.1\-8B\-Instruct、DeepSeek\-R1\-Distill\-Llama\-8B 和 Qwen2\.5\-7B\-Instruct。我们添加尺度为 σ=0\.01\\sigma=0\.01 的高斯嵌入扰动,并在每个项目上平均 40 次试验。自信正确(CC)和过度自信错误(OCW)组继承自冻结的 “gpt\-4\.1\-mini” C0 审计日志,而非从每个开源模型自身的答案重新计算。当该 C0 日志正确且报告的置信度至少为 0\.8 时,项目为 CC;当该 C0 日志错误且报告的置信度至少为 0\.8 时,项目为 OCW。该阈值是用于此审计的固定高置信度截止值,并非优化常数。因此,该探针询问当相同项目文本在开源模型上运行时,审计模型的高置信度失败是否显示出更大的隐藏状态敏感性。然后我们比较相同项目在自我批评提示下的情况,该提示要求模型在回答前检查缺失的证据或反向考虑。此比较还测试了自我批评是否诱导了提示层级的局部稳定化在隐藏状态中,而不仅仅是 OCW 项是否更脆弱。第 5 节 (https://arxiv.org/html/2608.13591#S5) 还报告了在两个模型上使用更密集的 σ\\sigmasweep 和一个策划的语义重写检查,每个模型使用 12 个自信正确和 12 个过度自信错误项。

在每个选择的

相似文章

大型语言模型中的置信度校准

arXiv cs.AI

本文分析了11个主流大型语言模型的置信度校准情况,发现它们普遍过于自信,尤其在困难任务上,而在简单任务上则信心不足。文章引入了LifeEval,这是一个用于评估不同难度级别下校准效果的测试。