观点:大型语言模型中的不确定性量化仅是无监督聚类
摘要
这篇观点论文认为,当前大型语言模型的不确定性量化方法本质上属于无监督聚类,测量的是内部一致性而非外部正确性,因此无法检测出自信的幻觉。作者主张进行范式转变,将不确定性建立在客观真理之上。
arXiv:2605.19220v1 公告类型:新
摘要:不确定性量化(UQ)被广泛认为是高风险领域部署大型语言模型(LLM)的主要保障。然而,我们认为该领域存在类别错误:主流的LLM不确定性量化方法仅仅是无监督聚类算法。我们证明,大多数现有方法本质上量化的是模型生成结果的内部一致性,而非其外部正确性。因此,当前方法基本上对事实现实视而不见,无法检测出“自信的幻觉”——模型对稳定但错误的答案表现出高置信度。因此,当前的不确定性量化方法在部署模型时可能会营造一种虚假的安全感。具体来说,我们指出了因依赖内部状态而产生的三种关键病理:超参数敏感性危机导致部署不安全;内部评估循环将稳定性与真理混为一谈;以及缺乏基本事实依据,迫使依赖不稳定的代理指标来评估不确定性。为打破这一僵局,我们主张对不确定性量化进行范式转变,并为研究界勾勒出一条路线图,以采用更好的评估指标和设置,实施机制变革以实现原生不确定性,并将验证锚定于客观真理,确保模型置信度成为现实可靠的代表。
查看缓存全文
缓存时间: 2026/05/20 08:24
# 观点:大语言模型中的不确定性量化就是无监督聚类
来源:https://arxiv.org/html/2605.19220
###### 摘要
不确定性量化(Uncertainty Quantification, UQ)被广泛视为在高风险领域部署大语言模型(Large Language Models, LLMs)的主要安全保障。然而,我们认为该领域存在一种范畴错误:主流的LLM不确定性量化方法实际上只是无监督聚类算法。我们证明,当前大多数方法本质上是衡量模型生成内容的内在一致性,而非其外部正确性。因此,这些方法从根本上对事实现实无感知,未能检测出“自信幻觉”——即模型在稳定但错误的答案上表现出高置信度。这导致当前UQ方法在部署模型时可能营造一种虚假的安全感。具体而言,我们识别出这种依赖内部状态所导致的三种关键病理:超参数敏感性危机,使得部署变得不安全;内部评估循环,将稳定性与真实性混为一谈;以及根本缺乏真实标签,迫使评估不确定性时依赖不稳定的代理指标。为打破这一僵局,我们倡导UQ领域的范式转变,并为研究社区提出路线图:采用更优的评估指标与设置,实施机制变革以实现原生不确定性,以及将验证锚定在客观事实上,确保模型置信度成为现实世界的可靠代理。
不确定性量化,大语言模型,立场论文,ICML
## 1 引言
大语言模型(LLMs)展现了卓越的能力(Abdinet al., 2024 (https://arxiv.org/html/2605.19220#bib.bib57); Touvronet al., 2023 (https://arxiv.org/html/2605.19220#bib.bib56); Daet al., 2024b (https://arxiv.org/html/2605.19220#bib.bib83)),但由于幻觉问题,其在医疗、法律等高风险领域的部署仍具挑战性。为弥合可靠部署的鸿沟,学界聚焦于不确定性量化(UQ)(Liuet al., 2025a (https://arxiv.org/html/2605.19220#bib.bib92); Chenet al., 2026b (https://arxiv.org/html/2605.19220#bib.bib138))。通过为给定模型的问题附加不确定性分数,我们可以过滤错误或确保安全,方法范围从基于熵的度量(McCabeet al., 2025 (https://arxiv.org/html/2605.19220#bib.bib93); Kuhnet al., 2023 (https://arxiv.org/html/2605.19220#bib.bib12))到基于图的方法(Linet al., 2023 (https://arxiv.org/html/2605.19220#bib.bib79); Daet al., 2024a (https://arxiv.org/html/2605.19220#bib.bib44), 2025b (https://arxiv.org/html/2605.19220#bib.bib137))。与此同时,研究者发现生成内容的不一致性在很大程度上代表了LLM的不确定性,并成为主流的LLM UQ方法。然而,尽管UQ方法不断发展,我们面临严峻形势:模型对其幻觉越来越自信,常常使当前的不确定性分数具有欺骗性。在本文中,我们主张这一悖论源于UQ的根本范畴错误。我们认为,主流LLM UQ在机制上与无监督聚类问题同构,它衡量的是内部一致性,未能充当实用保障。尽管表面各异,我们证明主流方法都归结为这一单一范式:语义熵(Kuhnet al., 2023)通过将意义离散化为“答案类别”实现显式聚类;基于图的方法(Linet al., 2023)对响应相似性进行谱聚类;口头化方法(Kadavathet al., 2022)则隐式聚类内部信念。因此,这些方法继承了无监督学习的内在局限:它们只能衡量数据点的分离程度,而非语义正确性。当前UQ方法因而无法区分事实确定性与“自信幻觉”(Simhiet al., 2025),导致高风险应用中的潜在失败。这种无监督本性体现在三种直接危及高风险领域安全的严重失效中。首先,我们面临**超参数敏感性危机**:当前UQ分数随超参数剧烈波动(Cecereet al., 2025)。实践中,这种敏感性使方法在实际部署中不可行,因为最优参数因下游约束的刚性而未知。这可能会掩盖内在不稳定性,并基于参数过拟合营造安全的假象。其次,该领域仍陷于**内部评估循环**,从根本上将自洽性与正确性混为一谈,无法检测“自信幻觉”,导致高风险领域的错误决策。第三,我们面临根本的**缺乏真实标签**问题,这为UQ创造了一个递归的“评判者问题”(Liuet al., 2025b)。由于模型的“真实不确定性”本质上是不可观测的,评估方法必须依赖与答案正确性的相关性作为代理度量,然而为开放任务获取客观正确性标签恰恰面临同样的真实标签缺失。在高风险部署中,这种循环依赖使安全保障无效,因为我们在使用一把同样弹性且不稳定的尺子来验证关键系统。为解决这一问题,我们认为UQ研究者必须放弃追求更好的无监督启发式方法,转而寻求**有监督的保证**。具体而言,学界应采用三支柱路线图以弥合内部信念与外部现实之间的鸿沟。首先,研究者应以**最差情况鲁棒性**评估取代平均情况基准,明确对自信幻觉进行压力测试(Carliniet al., 2022)。其次,研究者不应仅优化评估表现,而应实施**机制变革**:通过训练原生不确定性的模型,或部署具有不确定性的下游应用(Quachet al., 2023; Guiet al., 2024; Chenet al., 2026a)。第三,他们应将不确定性量化锚定在**客观事实上**,通过原子事实验证(Xieet al., 2025; Zhenget al., 2025)消除对不稳定基于模型评判者的依赖。通过这些集体行动,该领域可以超越不稳定的聚类,确保UQ成为事实正确性的真正代理,从而防止过分自信模型的部署,确保AI系统在关键领域可靠运行。
## 2 主流UQ为何是“聚类”:机制视角
### 2.1 语义熵:显式聚类
语义熵(Semantic Entropy, SE)(Kuhnet al., 2023 (https://arxiv.org/html/2605.19220#bib.bib12))是LLM不确定性量化中的基础技术,因其能够从不同采样生成中分离语言多样性。在该框架下,SE及其变体:语义字母估计(SAE)(McCabeet al., 2025)、语义能量(SEN)(Maet al., 2025)、核语言熵(KLE)(Nikitinet al., 2024)、语义最近邻熵(SNNE)(Nguyenet al., 2025)以及语义多样化语言生成(SDLG)(Aichbergeret al., 2025)代表了当前研究中最显式的聚类范式实现。还有其他集成令牌级概率和多次采样的LLM UQ方法(Vashurinet al., 2026; Caoet al., 2026),也属于我们的主张范畴。
**机制**。在标准生成中,样本空间是庞大的可能令牌序列集合。然而,SE认为这是错误的层面。相反,它将具有相同含义的序列聚合为类别,有效将每个语义簇 $C_i$ 视为一个独特的“答案类别”。每个答案类别具有唯一的语义含义(例如,“巴黎”与“法国首都”属于同一答案类别)。该方法生成采样序列集 $\mathcal{S}$,使用自然语言推理(NLI)模型(Heet al., 2021)将其分组为簇 $C_1,\dots,C_M$,然后计算这些诱导类别上的熵:
$$U_{\text{SE}}(C|x)=-\sum_{i=1}^{M} p(C_i|x) \log p(C_i|x)$$
这里 $p(C_i|x)$ 表示第 $i$ 个独特答案类别的输出概率。通过将语义簇视为离散类别,SE有效将不确定性量化问题从估计连续生成的密度转化为对这些导出答案类别的离散分类问题。较低的熵值意味着模型的概率质量集中在一个答案类别上,而较高值则表明分布在多个相互冲突的答案类别中。
**为何这是聚类**。从机制上看,语义熵作为一个显式聚类算法,将模型的输出分布离散化。它将生成文本的空间映射到一组离散的语义簇。NLI模型充当聚类准则,决定类别归属,而熵计算则衡量这些簇的纯度。因此,不确定性分数的有效性受限于聚类的质量。稳健的聚类能正确地将语言变体合并到单一语义根中,而糟糕的聚类则会将一致的信念分裂为多个虚假的组,人为地膨胀估计的不确定性。
参照图注
图1:LLM的常见UQ方法及其代表性工作(带*标记的名称),供第2节(https://arxiv.org/html/2605.19220#S2)的归纳讨论使用。
### 2.2 基于图的量化:隐式聚类
基于图的UQ方法(Linet al., 2023)可以被广义地解释为在采样响应诱导的图上执行**隐式聚类**(Daet al., 2024a),例如星形图连通性(SGC)构建响应-响应或主张-响应图并通过连通性模式量化不确定性(Liet al., 2025),图不确定性(GU)使用主张-响应二分结构上的图中心性(Jianget al., 2024),还包括语义图密度(SGD)(Liet al., )、层次结构熵(SeSE)(Zhaoet al., 2025)、多级图聚合(GENUINE)(Wanget al., 2025)或方向性蕴涵关系(D-UE)(Daet al., 2024a)等方法。在这些方法中,例如,不确定性可以通过响应集碎裂为多个语义连贯组件的程度来表征。这一不确定性量化思想的一种常见且原则性的实例化是通过**图拉普拉斯谱分析**(U-eigV),其中谱编码了响应分布中语义模态的有效数量。
##### 机制。给定输入 $x$,模型生成一组 $m$ 个响应 $\mathcal{S}=\{s_1,\dots,s_m\}$。在黑箱设置下,由于无法获取令牌级概率或隐藏表示,该方法首先计算响应之间的成对语义相似度分数 $a_{j_1,j_2}$(例如使用外部NLI模型(Heet al., 2020))。这些分数定义了一个加权相似度图,其邻接矩阵为(Daet al., 2024a; Linet al., 2024):
$$W=(w_{j_1,j_2}), \quad w_{j_1,j_2}=\frac{a_{j_1,j_2}+a_{j_2,j_1}}{2} \tag{1}$$
令 $D$ 为对角度数矩阵,$D_{j_1,j_1}=\sum_{j_2} w_{j_1,j_2}$。归一化图拉普拉斯定义为:
$$L=I-D^{-1/2}WD^{-1/2}. \tag{2}$$
不确定性通过 $L$ 的特征值 $\lambda_1\leq \lambda_2 \leq \dots \leq \lambda_m$ 量化:
$$U_{\text{EigV}}=\sum_{k=1}^{m} \max\left(0,\,1-\lambda_k\right) \tag{3}$$
这可以解释为响应集中**语义含义数量的连续估计**。
**为何这是聚类**。该过程是**谱聚类**的直接实例化,尽管没有显式的簇分配(Nget al., 2001)。谱图理论中的一个经典结论:对于无权图,拉普拉斯零特征值的重数与连通分量数量相等(Von Luxburg, 2007)。因此,如果邻接矩阵 $W$ 编码了精确的语义等价,那么计算近零特征值的数量就等同于统计语义簇的数量。实践中,$W$ 是稠密且加权的,产生单一连通分量。然而,谱聚类依赖于小特征值和特征间隙的分布来推断**有效聚类数**。从这个角度看,$U_{\text{EigV}}$ 充当了一个**内部簇有效性指标**:较大值表明响应质量碎裂为多个连贯的语义模态,而较小值表明集中在单一主导模态上。反之,当响应表达多个不兼容或弱相关含义时,许多特征值保持小值,产生显著更大的不确定性分数。
参照图注
图2:Qwen2.5-32b-Instruct 在 QASC 数据集上估计 P(true) 时隐藏状态的 PCA 可视化。该可视化表明模型在 P(true) 期间的内部状态在几何上被划分为不同的信念簇,经验上验证了 P(true) 作为一种隐式聚类的功能。
### 2.3 口头化信念作为潜在置信度聚类
P(true)(Kadavathet al., 2022 (https://arxiv.org/html/2605.19220#bib.bib16))是最广泛使用的口头化不确定性量化方法,它要求LLM显式评估自身生成答案的正确性,并将由此产生的置信度解释为不确定性信号。后续工作通过探索不同形式的置信度激发和自省扩展了这一范式,包括置信度内省(CIn)(Xiet al.,相似文章
大型语言扩散模型的不确定性量化
本文首次系统研究了大型语言扩散模型(LLDMs)的不确定性量化(UQ),提出了从迭代去噪过程中衍生的轻量级零样本不确定性信号,并表明LLDMs能够在实现快速推理的同时,提供可靠的幻觉检测,与基于采样的基线方法相比,计算开销降低高达100倍。
「very likely」意味着「不确定」?大模型与人类在语言不确定性量化上的差异
本文以心理学文献中的人类言语不确定性标记为基准对大模型进行评测,并提出 VOCAL——一种基于优化的算法,可直接从大模型的输出中学习最优的标记-不确定性映射,揭示了大模型与人类在语言表达置信度方面存在的系统性差异。
整合局部与全局熵的LLM不确定性量化
本文提出全局-局部不确定性(GLU),一种无监督单次评分方法,融合词元级局部熵与隐藏状态几何全局熵,用于LLM不确定性量化,证明两者近乎正交,共同捕捉自信但错误的失效模式。
超越语义等价:用于LLM不确定性量化的逻辑图
本文提出逻辑图不确定性(LGU)框架,该框架对答案之间的蕴含关系与不相容性进行建模,以改进大语言模型的不确定性估计。在多个基准测试中,LGU相较语义熵基线方法,AUROC最高提升7.1%,AUARC最高提升3.5%。
收敛点理论:为什么LLM的不确定性由主题决定,而非模型
本文提出收敛点理论,该理论通过论证不确定性由人类对某一主题的共识密度决定,统一了各种LLM不确定性现象,并识别出三个区域(完全共识、部分共识和非共识)。该理论对训练过程中对未解决的哲学问题进行强制收敛提出了担忧。