整合局部与全局熵的LLM不确定性量化

arXiv cs.LG 论文

摘要

本文提出全局-局部不确定性(GLU),一种无监督单次评分方法,融合词元级局部熵与隐藏状态几何全局熵,用于LLM不确定性量化,证明两者近乎正交,共同捕捉自信但错误的失效模式。

arXiv:2606.09875v1 公告类型:新 摘要:大型语言模型会自信地产生幻觉,因此不确定性量化(UQ)对于可靠部署至关重要。现有方法主要依赖于词元级信号,而对中间隐藏状态的几何结构利用不足。本文中,我们将隐藏状态矩阵的几何复杂度作为LLM全局不确定性的度量,同时将词元级不确定性估计视为局部度量。我们证明隐藏状态几何熵(全局不确定性)与词元级熵(局部不确定性)在统计上近乎正交,它们捕捉了可靠性预测中不同的失效模式。特别是,全局几何恢复了局部信号系统性地遗漏的“自信但错误”的失效模式。基于此,我们提出全局-局部不确定性(GLU),一种无监督单次评分方法,通过乘法门融合两个信号。在三个模型族和六个基准上,GLU匹配或超越了所有无监督基线,同时仅需单次前向传播,且保持长度归一化和架构无关性。
查看原文
查看缓存全文

缓存时间: 2026/06/10 06:15

# 融合局部与全局熵的大语言模型不确定性量化

来源:https://arxiv.org/html/2606.09875

Johanne Medina  
卡塔尔计算研究所,哈马德·本·哈利法大学  
多哈,卡塔尔  
[email protected]  

&Tianyi Zhou  
瑞典皇家理工学院  
斯德哥尔摩,瑞典  
[email protected]  

&Keivin Isufaj  
卡塔尔计算研究所,哈马德·本·哈利法大学  
多哈,卡塔尔  
[email protected]  

&Aristides Gionis  
瑞典皇家理工学院  
斯德哥尔摩,瑞典  
[email protected]  

&Sanjay Chawla  
卡塔尔计算研究所,哈马德·本·哈利法大学  
多哈,卡塔尔  
[email protected]  

###### 摘要

大语言模型会自信地产生幻觉,因此不确定性量化(UQ)对于其可靠部署至关重要。现有方法主要依赖词元级别的信号,对中间隐藏状态的几何结构利用不足。在本文中,我们将隐藏状态矩阵的几何复杂度视为LLM的*全局*不确定性度量,而将词元级别的不确定性估计视为*局部*度量。我们证明,隐藏状态几何熵(*全局*不确定性)与词元级别熵(*局部*不确定性)在统计上接近正交,能够捕捉到可靠性预测中不同的失败模式。特别地,全局几何能够恢复局部信号系统性遗漏的“自信但错误”的失败模式。在此基础上,我们提出全局-局部不确定性(GLU),这是一种无监督、单次前向传播的分数,通过乘法门融合这两个信号。在三个模型家族和六个基准测试中,GLU在仅需单次前向传播、保持长度归一化且架构无关的条件下,匹配或超越了所有无监督基线方法。代码可在 https://github.com/qcri/GLU.git 获取。

## 1 引言

幻觉仍然是大语言模型(LLM)最持久的失败模式之一。尽管能力快速提升,前沿系统仍会生成流畅、具体但错误的答案。最近的一项跨领域基准测试涵盖了42个主题的6000个问题,发现只有不到1%的评估模型在 \[-100,100] 可靠性指数上得分高于零,表现最好的前沿模型也仅达到33(Jackson等,2025)。不确定性量化(UQ)提供了一条有原则的前进道路,人们提出了多种方法,从词元级别熵(Zhang等,2024)和基于采样的一致性(Farquhar等,2024;Yadkori等,2024a),到证据方法(Sensoy等,2018;Ma等,2025)和基于注意力的方法(Sriramanan等,2024;Skean等,2025);然而很少有方法被实际部署。尽管其他方法至少施加了以下障碍之一:多次生成遍历、任务特定监督、对响应长度的敏感性或架构假设,但我们认为一个实用的UQ分数应该是*无监督*的、通过*单次前向传播*计算、*长度归一化*且*架构无关*的。

线性表示假设(Park等,2024)认为高层概念被编码为LLM隐藏状态空间中的方向。当模型检索到一个良好编码的事实时,其隐藏状态会沿着一个紧密、一致的方向移动,这意味着检索的几何结构是紧凑的。当模型缺乏可靠的事实依据时,隐藏状态会漂移过松散相关的方向,同时生成听起来合理的回答。考虑一个模型被问及某个人物的出生年份,而它并没有可靠地编码这个信息。它可能产生一个自信的四位数,同时其表示却漂移在相邻概念之间,而非收敛于特定的记忆。我们观察到这种漂移是可测量的。受Skean等人(2025)的启发——他们表明中间隐藏层比最终层编码更丰富的表示,且信息论几何度量能有效表征表示质量——我们通过隐藏状态轨迹特征值分布的熵来量化这种漂移。这种几何信号直接从标准贪婪生成的隐藏状态中计算,无需额外的前向传播。

嵌入层(隐藏状态向量空间)与去嵌入层(下一个词元预测)之间的区别不仅仅是架构上的。Park等人(2024)表明嵌入空间遵循非欧几里得几何,其中概念被编码为方向,且这种结构与计算词元概率的输出空间根本不同。这种分离为词元级别熵和隐藏状态几何复杂度度量不同事物提供了有原则的基础:一个在下一个词元分布空间中运行,另一个在语义方向空间中运行,二者不必一致。由于这两种失败模式源于结构上不同的层,我们将其分别称为*全局*(隐藏状态几何复杂度)和*局部*(词元级别熵)不确定性,并研究如何最好地结合它们。图1证实两个信号各自都有信息量,但都不足以单独使用。正确响应紧密聚集在低局部不确定性区域,而错误响应集中在高全局不确定性区域,但词元级别方法声称置信度的低局部不确定性区域仍然包含非平凡比例的错误响应,仅凭词元熵无法恢复。联合起来,这两个信号覆盖了比单独任何一个都宽得多的判别范围。我们研究了跨架构和任务的加性和乘性融合策略,发现乘性组合始终占优。

本文做出以下贡献:
(1) 我们从两个不同的表示层提取互补的不确定性信号:通过隐藏状态轨迹的矩阵Rényi熵从嵌入层提取全局几何信号,以及通过香农熵和证据认知熵从去嵌入层提取局部词元级别信号。它们共同提供了超越仅logit方法的LLM不确定性的有原则的多视角观点。
(2) 我们经验性地证明这两个信号在统计上接近正交,并覆盖不同的不确定性区域。特别地,全局信号能够恢复局部信号系统性遗漏的*自信但错误*的失败模式。
(3) 我们提出全局-局部不确定性(GLU),一种轻量级的两个信号乘性融合方法,无需标注数据,无需额外前向传播,并且对响应长度进行了归一化。
(4) 我们在三个模型家族和六个基准测试上验证了GLU,并对局部和全局不确定性估计器的选择进行了全面的消融研究,展示了框架的有效性以及每个组件的单独贡献。

## 2 相关工作

#### 局部和输出分布不确定性。
一种常见的方法通过生成时的信号估计LLM可靠性,例如序列似然、词元熵、模型诱导的置信度或下一个词元推理的概率视图(Kadavath等,2022;Dalal和Misra,2024;Ma等,2025)。LogTokU尤其相关,因为它认为单独的概率会丢失证据强度信息,因此直接根据logits估计词元级别的偶然不确定性和认知不确定性,建立在更广泛的证据学习观点之上,即不确定性可以通过类概率上的证据来表征(Sensoy等,2018;Ma等,2025)。Zhou等人进一步表明词元级别不确定性对于编造检测是有用的,他们利用它来选择和聚合隐藏状态,用于响应级别的可靠性预测(Zhou等,2026)。其他方法使用解码过程中的局部分布特征,例如逐层logits对比,或者生成多个样本并测量一致性或语义分散度(Zhang等,2024;Manakul等,2023;Farquhar等,2024;Nikitin等,2024;Yadkori等,2024a)。这些方法有效且通常侵入性最小,但它们主要测量词元或采样输出中的不确定性,而非模型内部轨迹的全局一致性。

#### 基于表示和全局不确定性。
另一条互补的研究路线是研究可靠性是否编码在隐藏状态、层激活、表示几何或注意力行为中。逐层(Layer-by-Layer)表明中间层可以包含特别具信息量的表示,并使用信息论、几何和基于不变性的度量来分析它们(Skean等,2025)。RAUQ同样超越输出概率,通过识别不确定性感知的注意力头,其注意力模式与错误生成相关,从而产生高效的序列级不确定性估计,无需任务特定标签(Vazhentsev等,2026)。更广泛地,探针和基于表示的方法使用隐藏状态或激活来预测事实性、编造或响应可靠性(Li等,2024;Orgad等,2024;Zhou等,2026;Sriramanan等,2024)。这些方法能够捕捉词元概率可能遗漏的响应级失败,但仅表示信号可能忽略输出分布中已经可见的局部知识缺口。

#### 监督检测器和校准依赖性。
几种幻觉检测器从标注或伪标注的生成中学习可靠性决策边界(Li等,2024;Orgad等,2024;Zhou等,2026;Du等,2024)。虽然在分布内有效,但这些方法依赖于校准数据,并且可能对跨数据集、模型家族或生成设置的偏移敏感。我们在附录A中包含了监督检测器的比较。相反,GLU在不学习检测器的情况下结合了局部和全局不确定性。它利用隐藏状态几何在响应轨迹发散时放大词元级不确定性,从而无需标注校准数据、伪标签或重新训练即可捕获局部不确定性和响应级漂移。

## 3 预备知识

我们正式介绍本文的符号。令 x 表示一个提示,y = (y₁, ..., yT) 表示一个长度为 T 的生成响应,其中每个词元 yt 从一个大小为 V 的词表 V 中抽取。在生成步骤 t 和 Transformer 层 ℓ,语言模型产生一个隐藏状态向量 h_t^(ℓ) ∈ R^d。然后模型使用最终层表示自回归地预测下一个词元。具体来说,最终隐藏状态被映射到 logit 向量 z_t = W_U h_t^(L) ∈ R^V,其中 W_U 是去嵌入矩阵。下一个词元上的条件分布由下式给出:
p(y_t | x, y_<t) = softmax(z_t) ∈ Δ^(V-1)。

## 4 方法

### 4.1 局部不确定性:去嵌入层

我们使用词元级别香农熵和证据认知熵(LogTokU,Ma等,2025)作为局部不确定性估计。给定第 t 个时间步的 logits z_t,我们定义:
R_t = (1 - λ) · H_shannon(p_t) + λ · H_evidential(z_t),
其中 H_shannon(p_t) = -∑_i p_t_i log p_t_i 是香农熵,H_evidential(z_t) 是基于从 logits 导出的狄利克雷分布的认知不确定性。我们使用 λ = 0.5 进行平衡。响应级别的局部不确定性 R̄ 是跨所有时间步的平均值:
R̄ = (1/T) ∑_t R_t。

### 4.2 全局不确定性:嵌入层

我们通过从所有层收集隐藏状态轨迹来量化全局不确定性。对于生成中的每个词元 t 和层 ℓ,我们有一个隐藏状态 h_t^(ℓ) ∈ R^d。对于每个层 ℓ,我们收集所有时间步的隐藏状态到一个矩阵 H^(ℓ) ∈ R^(T×d)(行对应时间步)。然后我们构造格拉姆矩阵 K^(ℓ) = H^(ℓ) (H^(ℓ))^T ∈ R^(T×T)。为了量化这个矩阵的分散程度,我们使用矩阵 Rényi 熵。对于具有特征值 λ_i 的矩阵 K,我们首先归一化特征值得到 λ̃_i = λ_i / tr(K)。然后 Rényi 熵为:
S_α(K) = (1/(1-α)) log (∑ λ̃_i^α), α>0, α≠1。
我们使用 α=2(碰撞熵),它具有闭式解:
S_2(K) = -log tr((K/tr(K))^2) = -log (‖K‖_F^2 / tr(K)^2),
因此只需要 K 的平方 Frobenius 范数,而不需要完整的特征分解。构造 K = HH^T 的代价为 O(T²d),然后 ‖K‖_F^2 在 O(T²) 内计算;而特征分解替代方案代价为 O(T³)。这个优势在实践中很重要,因为对于大语言模型 d ≫ T(隐藏维度 d 为数千,响应长度 T 为几十到几百)。低 S_2 表示轨迹集中在少数主导方向上(连贯生成);高 S_2 表示扩散的轨迹(几何上不连贯的生成)。我们在附录 B 中给出了详细证明。

#### 交叉响应和交叉模型可比性的归一化。
我们采用两种归一化使 S̃ 在响应和模型之间具有可比性。首先,S_2(K^(ℓ)) 随 T 增长,当谱均匀时(λ̃_i = 1/T)达到最大值 log T;因此我们除以 1 + log T,使归一化分数在 [0,1) 内,与响应长度无关。其次,由于表示质量随深度变化且没有单一层在所有架构中都均匀具信息量,我们计算所有 L 层的长度归一化熵的平均值:
S̃ = (1/L) ∑_ℓ (S_2(K^(ℓ)) / log T) ∈ [0,1]。
这种层无关的公式避免了特定于模型的层选择,并产生一个单一的、可在一次前向传播中计算的响应级不确定性分数。

### 4.3 全局-局部融合

这两个信号覆盖不同的区域(图1):正确响应在低局部不确定性处聚集但沿 S̃ 广泛分布,而错误响应包括一个*自信但错误*的子集,具有低词元熵但升高的几何复杂度,这是词元级检测器完全遗漏的。我们通过乘法门融合这两个信号:
GLU = (1 + S̃) · R̄
因子 (1 + S̃) 充当几何放大器,使得当轨迹发散时局部不确定性被加权;当轨迹紧凑时,GLU 仅降为局部信号。这直接针对自信但错误的失败模式,而加法融合无法将其隔离,因为它将全局信号视为固定偏移而非调制器。

## 5 实验与消融研究

相似文章

观点:大型语言模型中的不确定性量化仅是无监督聚类

arXiv cs.CL

这篇观点论文认为,当前大型语言模型的不确定性量化方法本质上属于无监督聚类,测量的是内部一致性而非外部正确性,因此无法检测出自信的幻觉。作者主张进行范式转变,将不确定性建立在客观真理之上。

超越语义等价:用于LLM不确定性量化的逻辑图

arXiv cs.AI

本文提出逻辑图不确定性(LGU)框架,该框架对答案之间的蕴含关系与不相容性进行建模,以改进大语言模型的不确定性估计。在多个基准测试中,LGU相较语义熵基线方法,AUROC最高提升7.1%,AUARC最高提升3.5%。

大型语言扩散模型的不确定性量化

arXiv cs.CL

本文首次系统研究了大型语言扩散模型(LLDMs)的不确定性量化(UQ),提出了从迭代去噪过程中衍生的轻量级零样本不确定性信号,并表明LLDMs能够在实现快速推理的同时,提供可靠的幻觉检测,与基于采样的基线方法相比,计算开销降低高达100倍。

GEM:用于最优LLM数据策展的几何熵混合

arXiv cs.LG

GEM将LLM数据策展重新表述为超球面上的变分问题,使用几何熵混合和最小化-最大化算法来发现平衡的语义簇,在数据混合策略中实现了高达1.2%平均下游准确率的最先进改进。