从语言模型轨迹中读取校准后的不确定性

arXiv cs.LG 论文

摘要

本文介绍了一种校准语言模型不确定性的方法,该方法从每层MLP更新轨迹中提取十一个尺度不变几何特征,并将其输入稀疏线性探测器,在选择性弃权条件下比MSP表现更好,AURC分数最高提升21点。

arXiv:2605.22864v1 Announce Type: new 摘要:最大softmax概率(MSP)是评估结构化输出语言模型生成的不确定性量化时的默认方法。虽然计算成本低,但其校准往往不佳。探测模型内部激活的方法将原始隐藏状态输入不透明分类器,将激活视为静态快照进行读取,而忽略了表示形成的逐层轨迹。然而,相似的终点可能源于截然不同的路径,且证据如何在深度上累积、加强或逆转,可能会揭示最终概率掩盖的不确定性。我们提取了十一个尺度不变几何特征,追踪每层MLP更新的累积路径,并将其输入稀疏线性探测器。该探测器在选择性弃权条件下优于MSP,其增益随基线校准误差的增加而增加,最高可达21个AURC点。由于每个特征都具有封闭形式的几何意义,探测器的系数追踪了误差在深度上如何以及何处形成——哪些层过早决策,哪些层与运行状态矛盾,哪些轨迹偏离其终点。
查看原文
查看缓存全文

缓存时间: 2026/05/25 08:54

# 从语言模型轨迹中读取校准后的不确定性
来源:https://arxiv.org/html/2605.22864
Alexander Herzog,Xiaoyu Liang,Marie Vasek,Enrico Mariconti,Lorenzo Cavallaro

###### 摘要

最大 softmax 概率 \(MSP\) 是评估结构化输出语言模型生成不确定性量化的默认方法。虽然计算成本低,但它通常存在校准偏差。那些探测模型内部激活的方法将原始隐藏状态馈送到不透明的分类器中,将激活作为静态快照读取,隐含地忽略了表示形成的逐层轨迹。然而,相似的终点可能源于非常不同的路径,证据如何在深度方向上积累、加强或反转,可能揭示最终概率所掩盖的不确定性。我们提取十一个尺度不变的几何特征,追踪逐层 MLP 更新的累积路径,并将其输入稀疏线性探针。该探针在选择性弃权设置下优于 MSP,且性能提升与基线的误校准程度成比例,最高可达 21 AURC 点。由于每个特征都有封闭形式的几何意义,探针的系数可以追溯错误沿深度方向形成的方式和位置——哪些层过早承诺,哪些层与运行状态相矛盾,以及轨迹在何处偏离其终点。

机器学习, ICML

## 1 引言

一个值得信赖的语言模型应该知道何时可能出错。校准后的不确定性量化 (Uncertainty Quantification, UQ) 捕捉了这一要求:模型的置信度应反映其正确的可能性。两个准确率相同的模型在可靠性上却可能存在显著差异。如果模型对其大多数错误分配了低置信度,那么不确定的预测可以被延迟、放弃或提交给人类审查。相反,当置信度与正确性对齐不良时,高置信度的错误将与可靠的预测难以区分。在临床分诊中,前一种模型会将其不确定的病例留给临床医生审查;而后一种模型则可能将一个危及生命的病例排在常规病例之后,两者都被同样强烈的置信度标记为高风险。因此,校准后的不确定性起到了一种分诊功能,使不确定性能够指导哪些预测需要干预或验证。

在离散选择设置中,UQ 的默认方法是最大 softmax 概率 (Maximum Softmax Probability, MSP) (Vashurin et al., 2025;Dakhmouche et al., 2025),它使用预测 token 的 softmax 概率作为置信度分数。MSP 不产生额外的计算成本,而且往往出人意料地具有竞争力。然而,它可能继承众所周知的误校准问题:置信度分数无法反映正确的真实可能性,即使在预测错误时也通常保持较高水平 (Guo et al., 2017)。另一条并行的工作路线直接读取模型的激活,其前提是导致生成的内部计算包含了输出分布本身所不具备的关于其真实性的信息。Azaria 和 Mitchell (2023) 证明了一个简单的分类器训练在隐藏激活上可以预测 LLM 的回答是否真实,此后越来越多的研究追溯了这种“真实性几何”的轮廓 (Li et al., 2023b;Marks and Tegmark, 2023;Dakhmouche et al., 2025;Liu et al., 2024;Beigi et al., 2024;Azizian et al., 2025)。

然而,在这些文献中,激活通常被读取为静态快照——从一个层提取的隐藏状态,或跨层平均,然后分析其中包含的信息。这丢弃了表示形成的逐层轨迹。最终的隐藏状态是通过表示空间路径的终点,相似的终点可能源自性质不同的轨迹。某些表示可能稳定发展,另一些可能后期才出现,波动,或在稳定前部分逆转。这些轨迹对于预测并非无关紧要,因为它们编码了证据如何跨深度积累、加强、减弱或修正。因此,我们不仅将激活视为状态,更将其视为表示轨迹;我们表明,它们的几何结构揭示了最终概率可能掩盖的不确定性。

我们通过追踪答案位置残差流作为前向传播过程中逐层 MLP 写入向量诱导的累积路径来进行校准。我们通过计算尺度不变的几何特征来总结这一轨迹,并将其输入稀疏线性探针。置信度校准通过选择性弃权下的 AURC (Geifman et al., 2018) 进行评估。这导致了一种可解释的 UQ 方法,它超越了单点评估 (MSP),同时避免了在原始激活上使用稠密探针的不透明性。

总而言之,我们的主要贡献如下:

1. 我们提出了一个紧凑的几何特征集合,描述表示如何随网络深度演化,并将其输入稀疏线性探针,该探针在选择性弃权下优于 MSP,且性能提升与基线的误校准程度成比例。
2. 我们考虑了探针的端到端可解释性:每个特征都有封闭形式的几何意义,其系数不仅揭示了模型是否可能犯错,还揭示了如何犯错——哪些层过早承诺,哪些层与运行状态相矛盾,以及轨迹在何处偏离其终点。我们展示了具有相同 MSP 分数的正确预测和错误预测留下不同的轨迹特征,暴露了原本被输出分布扁平化的信息。
3. 我们在来自三个模型家族(Qwen、Llama、DeepSeek)的 9 个指令微调 LLM 上进行了全面的实证实验,参数范围从 3B 到 72B,涵盖五个具有代表性的自然语言处理任务。

表 1:按测量内容分组的十一个逐层轨迹特征。符号在正文中定义。涉及 \(m_{\ell-1}\) 或 \(s_{\ell-1}\) 的特征在 \(\ell=1\) 处未定义,并分配约定值(*连续余弦*为 1,*曲率*和*更新-状态对齐*为 0)。†*带符号的最终支持*在数值上与*更新到最终*相同;两行都被保留,因为它们对应于不同的几何表述(L1 探针对此不变)。

## 2 背景

### 2.1 不确定性量化

预测不确定性通常分解为两个部分:认知不确定性 (epistemic uncertainty),源于有限的数据或模型设定错误,原则上可减少;以及偶然不确定性 (aleatoric uncertainty),反映数据生成过程的内在随机性,因此不可减少 (Kendall and Gal, 2017)。LLM 文献中出现了一种相关的二分法:事实不确定性 (factual uncertainty) 涉及生成内容相对于真实知识的正确性,而语义不确定性 (semantic uncertainty) 则源于提示允许的多种有效延续;前者本质上是认知的,后者是偶然的 (Liu et al., 2025)。由于事实不确定性是自动化决策中的主要关注点 (Dakhmouche et al., 2025),我们将分析限制在此部分。我们采用多项选择题,这作为一种降噪机制,通过中和开放式文本中发现的语义不确定性来隔离事实差距 (Li et al., 2026)。

UQ 方法旨在将每个预测关联一个标量分数,指示其正确性,从而支持下游决策,如弃权、推迟或选择性生成。现有的 LLM 不确定性估计方法分为三类,主要区别在于计算成本。单样本方法通过单次前向传播推导不确定性,使用诸如最大 token 对数概率 (Manakul et al., 2023)、困惑度 (Margatina et al., 2023) 和熵 (Kadavath et al., 2022; Kuhn et al., 2023) 等信号。多样本方法跨多个生成聚合信号,通过其一致性、相似性或变异性来评分不确定性。代表性的例子包括语义熵 (Farquhar et al., 2024) 和预测熵 (Kadavath et al., 2022)、共形预测 (Kumar et al., 2023) 以及成对相似性方法 (Lin et al., 2023)。基于探针的方法则是在内部激活上训练轻量级预测器,直接从模型的隐藏表示中推断不确定性 (Azaria and Mitchell, 2023; Dakhmouche et al., 2025; Liu et al., 2024)。

### 2.2 选择性分类

选择性分类 (Chow, 1970; Geifman and El-Yaniv, 2017) 为预测器增加了弃权的选项,通过牺牲覆盖率来降低保留输入上的错误率。形式上,选择性分类器是一对 \((f, g)\),其中 \(f: \mathcal{X} \to \mathcal{Y}\) 是预测器,\(g: \mathcal{X} \to \{0,1\}\) 是门控函数:当 \(g(x)=1\) 时返回预测 \(f(x)\),否则保留。在实践中,\(g\) 是通过对置信度分数 \(\kappa: \mathcal{X} \to \mathbb{R}\) 进行阈值化得出的,因此性能降低为 \(\kappa\) 作为输入按其可能正确性排序的质量问题。

两个量描述了这种分类器:*覆盖率*,即 \(f\) 承诺预测的输入比例,以及*选择性风险*,即这些输入上的平均损失。改变 \(\kappa\) 上的阈值描绘出风险-覆盖率曲线 (Geifman et al., 2019),其面积 (AURC) 概括了所有操作点的性能。因此,选择性分类为不确定性估计器提供了一个天然的测试平台:一个可靠的置信度信号应报告在所有覆盖率水平上的低选择性风险 (Ding et al., 2020)。

## 3 方法

我们通过考虑顺序逐层处理过程中的轨迹信息来捕捉语言模型的不确定性。在 Transformer 架构的每一层,MLP 都会对残差流做出贡献。这些贡献的累积和形成了通过表示空间的轨迹。我们假设这些轨迹的几何结构,包括更新幅度在深度上的分布、局部方向的变化以及路径接近其终点的效率,包含有关不确定性的信息 (图 1)。我们使用十一个标量描述符来总结轨迹几何,并将其与模型的 MSP 结合在一个稀疏线性模型中。

本章的其余部分描述了表示基础 (第 3.1 节)、提取的轨迹特征 (第 3.2 节) 以及稀疏线性探针 (第 3.3 节)。重现实验的代码可在 https://anonymous.4open.science/r/uq-motion-66CC/ 获取。所有实验均在配备 NVIDIA H100 NVL GPU 的服务器上进行。

### 3.1 设置与基础

我们考虑有限选择分类,候选集 \(\mathcal{Y}\),\(|\mathcal{Y}|=K\)。给定提示 \(x \in \mathcal{X}\),模型 \(f_{\theta}\) 通过对 \(K\) 个候选标识 token 的下一个 token logits 应用 softmax,诱导出 \(\mathcal{Y}\) 上的分布 \(p_{\theta}(y \mid x)\)。通过单次前向传播,我们估计一个不确定性分数 \(u: \mathcal{X} \to [0,1]\),对应于错误的概率。我们使用经典的基于 MSP 的分数 \(1-m(x)\) 作为基线 (Hendrycks and Gimpel, 2016)。

作为 \(u\) 的基础,我们在最终提示位置(用于计算 \(\mathcal{Y}\) 上下一个 token logits 的读出位置)提取一个层索引的 MLP 残差更新序列。每个 Transformer 模块 \(\ell\) 包含一个多层感知机 (MLP) 子层,它向残差流写入一个贡献 \(m_{\ell}(x) \in \mathbb{R}^{H}\),其中 \(H\) 是模型的隐藏维度;我们通过放置在 MLP 子模块上的前向钩子捕获每个模块 \(\ell=1, \dots, L\) 的 \(m_{\ell}(x)\),记录其在提示最终 token 处的输出。

我们专注于 MLP 写入向量,因为先前的机制可解释性工作将 Transformer MLP 识别为事实知识存储和检索的重要场所 (Geva et al., 2021; Meng et al., 2022; Yu et al., 2024)。这激发了使用 MLP 写入向量作为分析单元来研究预测是如何跨层组装的。我们还考虑了部分和:

\[
s_{\ell}(x) = \sum_{k \le \ell} m_{k}(x),
\tag{1}
\]

其中 \(m_{k}(x)\) 是第 \(k\) 层的 MLP 写入向量。序列 \(\{s_{\ell}(x)\}_{\ell=1}^{L}\) 在残差流空间中描绘出一条离散轨迹,其中 \(s_{L}(x)\) 是前向传播过程中 MLP 驱动的总位移,而 \(\hat{u}(x) = s_{L}(x) / \|s_{L}(x)\|\) 是其单位方向。我们记 \(\bar{n} = L^{-1} \sum_{k} \|m_{k}\|\) 为平均更新范数,\(T = \sum_{k} \|m_{k}\|\) 为总路径长度。

### 3.2 轨迹特征

我们通过十一个逐层标量特征 (表 1) 来描述每条轨迹 \((m_{\ell}, s_{\ell})_{\ell=1}^{L}\)。这些特征是尺度不变的,允许跨不同隐藏维度的模型进行比较,并分为四个几何描述符:

1. (G1) 深度分配:计算工作量如何跨层分布;
2. (G2) 局部形状:轨迹的局部几何结构;
3. (G3) 终点对齐:每一层如何与轨迹终点相关;
4. (G4) 轨迹效率:轨迹到达其终点的直接程度。

G1 捕捉了更新幅度的深度分布。*相对更新幅度*标记了其贡献相对于逐层平均值异常大的层,而*累积路径分数*则揭示了模型是前置还是后置其计算。

G2 表征了局部轨迹形状。*连续余弦*衡量连续更新的方向一致性,高值表示通过表示空间的平滑路径,而*曲率*则突出了方向上的急剧变化。

相似文章

概率校准是大语言模型中的一项可训练能力

arXiv cs.CL

本文研究了语言模型的概率校准能力是否可以通过微调得到提升,并在12种模型上比较了软目标和硬目标两种方法。结果表明,校准能力是可以训练的,但有时会导致下游算术推理能力的下降。

CALIBER:语言模型中推理前后的置信度校准

arXiv cs.CL

本文介绍了CALIBER,一种通过获取推理前后的置信度估计并匹配信息状态的监督目标来校准推理语言模型置信度的方法。它在多个基准测试上显著降低了期望校准误差(最多52.5%),并取得了强劲的Brier分数和AUROC。