校准过度自信而不牺牲置信度:面向LLMs的探针条件化头部干预

arXiv cs.LG 论文

摘要

本文介绍了一种推理时方法——探针条件化头部干预(PCHI),该方法通过在模型可能错误但保持高置信度时条件性地重新缩放注意力头输出,有选择地减少对错误答案的过度自信,同时不会显著降低对正确答案的置信度。

arXiv:2606.09876v1 公告类型:新 摘要:大型语言模型常常在错误的答案上表现出高置信度。标准的校准方法通常全局或在校准分数层面上起作用,这会减少不当自信,但也可能削弱正确答案上的合理自信。我们提出探针条件化头部干预(PCHI),一种推理时方法,它使用一个冻结的探针来检测可能错误但高置信度的响应,并在置信度生成过程中条件性地重新缩放下游注意力头的输出。在Qwen3-4B-Instruct解决OpenMathInstruct问题(带有结构化二元置信度字段)时,读出头PCHI将原本错误-yes的置信读出头中的82.2%转换为$\texttt{no}$,而跨上游置信度模板token的联合干预将ECE从21.9%降低到9.2%,且仅损害5.1%的原本正确-yes读出头。读出头效应在Gemma3-4B上同样出现,尽管上游干预较弱且更依赖掩码。这些结果表明,通过条件性应用的内部干预,可以有选择地减少言语化的过度自信,从而部分地将抑制不当自信与损失合理自信分离开来。
查看原文
查看缓存全文

缓存时间: 2026/06/10 06:15

# 校准过度自信而不牺牲信心:面向大语言模型的探针条件化头部干预
来源:https://arxiv.org/html/2606.09876
柯力1,2张崇哲1,311footnotemark:1曾子凡1,4刘锋1张群力1胡峥1 1华为海森堡研究中心2洛桑联邦理工学院3柏林工业大学4慕尼黑工业大学

###### 摘要

大型语言模型在给出错误答案时,常常表现出高度自信。标准的校准方法通常全局作用或在分数层面操作,虽能减少不合理的自信,但也可能侵蚀正确答案中应有的自信。我们提出*探针条件化头部干预*(Probe-Conditioned Head Intervention, PCHI),这是一种推理时方法,它使用一个冻结的探针来检测可能“错误但自信”的响应,并在自信生成过程中有条件地重新缩放下游注意力头输出。在Qwen3-4B-Instruct模型上,使用结构化二元自信字段(is_confident)解决OpenMathInstruct问题时,读出令牌PCHI将原本82.2%的“错误-是”自信读出转换为“否”,而联合干预上游自信模板令牌可将ECE(期望校准误差)从21.9%降低至9.2%,且仅损害5.1%的原本“正确-是”读出。该读出令牌效应在Gemma3-4B上同样出现,尽管上游干预效果较弱且更依赖掩码。这些结果表明,通过有条件应用内部干预,可以有选择性地减少口头表达的过度自信,从而部分解耦抑制不合理自信与损失应有自信之间的矛盾。

校准过度自信而不牺牲信心:面向大语言模型的探针条件化头部干预

柯力1,2††thanks:这些作者贡献相同。张崇哲1,311footnotemark:1曾子凡1,4刘锋1张群力1胡峥11华为海森堡研究中心2洛桑联邦理工学院3柏林工业大学4慕尼黑工业大学

## 1 引言

对于一个用于决策的语言模型而言,仅仅答案经常正确是不够的;基于这些答案行动的系统或人员还必须能够判断何时可以信任这些答案(Guo等,2017 (https://arxiv.org/html/2606.09876#bib.bib2))。这使得模型所表达自信的可靠性成为一个重要问题。然而,大型语言模型即使在答案错误时也常常表现出高度自信,使得口头表达的自信难以成为正确性的良好指南(Xiong等,2024 (https://arxiv.org/html/2606.09876#bib.bib1);Geng等,2024 (https://arxiv.org/html/2606.09876#bib.bib6))。

一个自然的回应是重新校准。标准的后处理方法,如温度缩放(Guo等,2017 (https://arxiv.org/html/2606.09876#bib.bib2)),对每个响应应用统一的调整;而经过指令或RLHF微调的模型可能继承了偏向高自信(无论正确性如何)的奖励信号(Leng等,2025 (https://arxiv.org/html/2606.09876#bib.bib7))。这类方法可以提高整体校准效果,但并未明确针对“错误但自信”的子集。将自信压低到足以抑制“错误但自信”响应的程度,也可能降低对正确答案应有的自信,这一张力在经典网络(Joy等,2022 (https://arxiv.org/html/2606.09876#bib.bib3))和语言模型(Xie等,2024 (https://arxiv.org/html/2606.09876#bib.bib8))中均有记载。

这激发了一种更具选择性的校准形式:仅当响应可能“错误但自信”时才采取行动。条件性、适应性的干预已有证据表明模型行为可以非均匀地控制,例如在拒绝(Lee等,2025 (https://arxiv.org/html/2606.09876#bib.bib9))、跨语言迁移(Maraia等,2026 (https://arxiv.org/html/2606.09876#bib.bib10))以及两阶段自信引导(Miao and Ungar,2026 (https://arxiv.org/html/2606.09876#bib.bib11))中。然而,这些方法并未通过干预产生最终自信读出的内部计算来直接隔离“错误但自信”的响应。

最近的机制性工作表明,这种内部干预是可行的。口头表达的自信似乎是在答案附近或模板位置形成,并在之后读出(Kumaran等,2026 (https://arxiv.org/html/2606.09876#bib.bib16)),而膨胀的自信则与特定后期位置组件有关(Zhao等,2026 (https://arxiv.org/html/2606.09876#bib.bib17))。如果在最终自信值输出之前,关于一个自信答案是否正确这一证据已经存在内部表示,那么基于该证据的条件干预就可能减少不合理的自信,而无需全局抑制所有自信。

我们将这一思想实例化为*探针条件化头部干预*(PCHI)。一个冻结的探针读取自信模板上的隐藏状态,并估计该响应是否可能为“错误但自信”。探针得分随后用于门控一个学习到的下游注意力头输出重新缩放,因此干预的程度与错误-自信证据成正比,而不是对所有响应均匀施加。

## 2 相关工作

#### 校准语言模型信心。

大量工作致力于使模型的自信与其准确性对齐。一条路线直接以自然语言从模型中引出自信,并发现此类口头自信可以是正确性的一个有意义但非完美信号(Lin等,2022 (https://arxiv.org/html/2606.09876#bib.bib20));相关地,模型保留了一定的自我评估答案是否正确的能力(Kadavath等,2022 (https://arxiv.org/html/2606.09876#bib.bib21))。第二条路线后验地调整自信。诸如温度缩放(Guo等,2017 (https://arxiv.org/html/2606.09876#bib.bib2))等方法在保留集上拟合单个参数并统一重新缩放所有预测;在语言模型中,这种校准误差因RLHF而加剧,其奖励模型倾向于自信的响应(Leng等,2025 (https://arxiv.org/html/2606.09876#bib.bib7))。由于统一的重新缩放使每个预测向同一方向移动,它无法同时提高自信过低之处并降低自信过高之处——这一限制在经典网络中已被注意(Joy等,2022 (https://arxiv.org/html/2606.09876#bib.bib3)),并在语言模型中通过预测输入相关温度来解决(Xie等,2024 (https://arxiv.org/html/2606.09876#bib.bib8))。这些方法作用于输出自信分布。更接近我们场景的是,最近的工作通过探测内部表示来*估计*自信,例如从扰动表示的稳定性(Khanmohammadi等,2025 (https://arxiv.org/html/2606.09876#bib.bib22))。我们的干预在性质上有所不同:它不是估计一个自信分数,而是在模型内部行动以*修改*自信读出,并且仅应用于被探针判定为“错误但自信”的响应,从而保留其余响应的应有自信。

#### 激活干预与条件控制。

越来越多的工作通过修改内部表示来引导模型行为,通常是在残差流中添加固定方向(Turner等,2024 (https://arxiv.org/html/2606.09876#bib.bib12);Li等,2024 (https://arxiv.org/html/2606.09876#bib.bib13);Zou等,2025 (https://arxiv.org/html/2606.09876#bib.bib14))。已知此类无条件引导缺乏选择性,会同时影响相关行为(Wehner等,2025 (https://arxiv.org/html/2606.09876#bib.bib15))。条件变体使干预依赖于输入:条件激活引导通过门控是否进行引导来编程拒绝行为(Lee等,2025 (https://arxiv.org/html/2606.09876#bib.bib9)),而探针门控引导则在探针预测出类别后选择特定于类别的变换(Maraia等,2026 (https://arxiv.org/html/2606.09876#bib.bib10))。相比之下,因果头部门控从下一个词元目标中学习每个注意力头的一个固定、输入无关的标量门,以便为可解释性分配头部的因果角色(Nam等,2025 (https://arxiv.org/html/2606.09876#bib.bib4))。我们的方法共享逐头门控的机制,但有两方面不同:门控由冻结探针对错误-自信的连续估计在每个响应上调制,并且被部署用于有选择地纠正口头表达的过度自信,而非描述头部角色。

#### 口头自信的机制。

近期工作探究口头自信在何处以及如何计算。自信似乎是在答案邻近位置形成并在之后读出(Kumaran等,2026 (https://arxiv.org/html/2606.09876#bib.bib16));膨胀的自信被归因于特定组件在后期词元位置写入(Zhao等,2026 (https://arxiv.org/html/2606.09876#bib.bib17));而支配校准的方向被发现与支配口头自信的方向几乎正交(Miao and Ungar, 2026 (https://arxiv.org/html/2606.09876#bib.bib11))。一条补充性线表明,模型的内部状态携带了可解码的证据,表明其自身答案是否正确,可通过简单探针恢复(Azaria and Mitchell, 2023 (https://arxiv.org/html/2606.09876#bib.bib23); MacDiarmid等,2024 (https://arxiv.org/html/2606.09876#bib.bib24))。这些分析主要是描述性的,而在它们进行干预时,是为了刻画机制而非选择性纠正错误。尽管如此,它们激励了我们的方法:如果与正确性相关的信息在内部存在并且部分地与所表达自信的信号可分,那么一个条件性内部干预应该能够作用于前者而不均匀地干扰后者。

## 3 方法

请参见图注图1:探针条件化头部干预(PCHI)概览。(1)模型产生结构化自我评估输出。(2)在自信模板词元t处,一个冻结的线性探针读取层lp的隐藏状态,并预测该响应是“错误但自信”(WY)而非“正确-自信”(CY),得到得分pt。(3)一个可选的注意力掩码,仅应用于lp之后的层,限制模板查询t可以关注的上下文区域(提示、推理、答案);直到并包括lp的层保留原始注意力,因此探针得分不受影响。(4)在下游层中,每个注意力头通过一个学习到的系数gh重新缩放,该系数大多通过稀疏性惩罚保持在1附近,其强度由探针得分调节:z'_{t,h} = (1 + (g_h - 1) s_t) z_{t,h},其中如果p_t >= τ则s_t = p_t,否则为0。因此,干预仅在探针标记为错误-自信的响应上生效。

探针条件化头部干预在模型准备输出其自信值的时刻纠正口头表达的过度自信。该方法有三个概念性组件:一个暴露二元自信读出的结构化自我评估格式、一个检测错误-自信响应潜在证据的自信模板探针,以及一个仅当该证据存在时才应用的探针条件化头部级干预。这种设计将过度自信纠正视为一个选择性控制问题:模型应纠正错误答案上的自信,同时基本保留正确答案上的应有自信。

核心设计原则是将*检测*与*干预*分离。探针估计一个自信响应是否可能是错误的,而学习到的头部参数则指定当检测到此类证据时如何重新缩放下游注意力头。分离这些角色使该方法有了直接的选择性目标:将错误-自信响应从“是”转换为“否”,而不全局抑制正确-自信的响应。

我们仅在模型产生其推理和答案之后进行干预。在推理或答案区间内进行干预可能会改变支持问题解决的隐藏状态轨迹,可能使模型进入后续推理和最终答案不可靠的区域。相比之下,自信模板是答案与自信值之间的固定区间。在推理时,这些模板词元可以被强制而非采样,因此干预会改变决定最终自我评估的计算,同时保持生成的答案和模板词元序列不变。

### 3.1 结构化自我评估与读出

我们在固定的JSON输出格式下研究口头表达的自信。对于每个输入问题x_i,模型被指示生成具有三个字段的响应(附录A.1 (https://arxiv.org/html/2606.09876#A1.SS1)):

{reasoning, answer, is_confident}。

其中,answer字段包含最终答案,is_confident字段包含一个二元自我评估,值为yes或no。记a_i为解析出的答案,c_i ∈ {0, 1}指示在任务评估器下a_i是否正确。记r_i ∈ {yes, no}为解析出的自信值。因此,每个响应属于四组之一:正确-是(CY)、正确-否(CN)、错误-是(WY)和错误-否(WN)。

我们的干预针对WY响应。WY响应是有问题的,因为模型给出了错误答案却明确报告高自信。因此,一个有用的干预应降低WY示例上的自信,但不广泛抑制CY示例上的自信。我们通过是-否逻辑间隔来测量自信读出:

Δ_i = LSE_{v ∈ V_yes} o_{i,v} - LSE_{v ∈ V_no} o_{i,v}, (1)

其中LSE表示log-sum-exp,o_i是自信值预测位置的下一个词元逻辑向量,V_yes和V_no是两个自信值的候选词元。正的Δ_i支持yes;负的Δ_i支持no。

### 3.2 自信模板证据探针

自信模板是answer值之后、is_confident值之前的词元区间。记T_i为例i的对齐模板坐标。对于模板坐标t ∈ T_i和变换器层l,令h_{i,t}^{(l)} ∈ R^d为该坐标经过层l后的隐藏状态。

我们训练特定于位置和层的线性探针来检测错误-自信的证据。对于每个模板坐标t和层l,探针预测一个自信响应是否错误:

p_{i,t}^{(l)} = σ( (w_{t,l})^T h_{i,t}^{(l)} + b_{t,l} ), (2)

其中正例为WY响应,负例为CY响应。我们使用校准的线性探针,使得所得分数可解释为错误-自信证据的等级估计,同时保持检测器足够简单以在线运行。

探针层lp必须满足两个要求:探针应可靠地区分WY与CY,并且在同一前向传播中要有可用的下游层进行干预。我们将干预限制在lp之后的层,以便探针消耗的隐藏状态保持在探针训练时所使用的分布上。这一点很重要,因为探针在中间层开始区分WY与CY:修改早期层会改变探针所见的状态,从而可能改变其检测线索。

相似文章

大语言模型对其自身回应过度自信

Hugging Face Daily Papers

本文探究为何经过指令微调的大语言模型对其自身回应表现出过度自信,并识别出一种“所有权偏差”,即模型对自我生成的答案赋予更高置信度。文章提出一种简单的推理时策略,将模型答案重新表述为用户输入,无需重新训练即可将校准度提升高达26%。

LLM置信度估计的不同方法基准测试

Reddit r/artificial

本文对LLM置信度估计的各种黑盒与白盒方法进行了基准测试,包括口头化置信度、语言不确定性、推理长度、P(Answer)、P(True)和自我一致性,比较它们在主动学习和安全分类等任务中的有效性。