SpanUQ:跨度级不确定性量化用于大语言模型生成
摘要
SpanUQ 引入了一种轻量级探针,用于大语言模型中的跨度级不确定性量化,采用 DETR 风格的解码器和 Beta 分布混合,实现了优于基于采样的方法的错误定位和更快的推理速度。
arXiv:2607.05721v1 公告类型:新
摘要:不确定性估计不仅对于大语言模型(LLM)的可信部署至关重要,也是 LLM 生成中自我完善的基础。然而,现有方法在次优粒度上运行:标记级分数缺乏语义连贯性,而序列级分数无法定位错误。我们形式化了跨度级不确定性估计(SLUE),这是一个针对不确定性的自然粒度的新任务:语义连贯的文本跨度,每个跨度传达一个可评估的语义单元。为了解决这一任务,我们引入了 SPANUQ,一种轻量级探针,它将昂贵的多样本推理中的不确定性知识蒸馏到 LLM 隐藏状态的单次前向传播中。SPANUQ 采用了 DETR 风格的跨度解码器,通过 Beta 分布混合同时检测跨度并估计其不确定性,使用基于 Beta NLL 回归和对比排序目标的原理性组合进行训练。我们构建了 SPANUQ-BENCH,第一个跨度级不确定性基准,包含 20K 个提示、293K 个注释跨度,以及从多样本声明验证中得出的连续软标签。在五个 LLM 骨干网络上的实验表明,SPANUQ 始终达到最佳的跨度级不确定性质量,优于最强的探针基线和所有基于采样的方法,同时速度快 10-20 倍。其基于 DETR 的跨度检测器达到了 0.910 的 F1 分数,超出最佳启发式方法 39.4%,实现了序列级方法无法提供的精确错误定位。该框架跨两个模型系列的五个 LLM 具有泛化能力。
查看缓存全文
缓存时间: 2026/07/08 04:41
# 面向大语言模型生成的跨度级不确定性量化
来源:https://arxiv.org/html/2607.05721
Yimeng Zhang¹, Yingying Zhuang¹, Ziyi Wang², Yuxuan Lu², Pei Chen¹, Aman Gupta¹, Zhe Su¹, Ming Tan¹, Zhilin Zhang¹, Qun Liu¹, Manikandarajan Ramanathan¹, Rajashekar Maragoud¹, Edward Vul¹, Jing Huang¹, Dakuo Wang²
¹亚马逊,²东北大学
###### 摘要
不确定性估计不仅对大型语言模型(LLMs)的可信部署至关重要,也是 LLM 生成中自我完善的基础。然而,现有方法在次优的粒度上运行:词元级别的分数缺乏语义连贯性,而序列级别的分数则无法定位错误。我们形式化定义了 **跨度级不确定性估计(SLUE)**,这是一个针对不确定性自然粒度的新任务:语义连贯的文本跨度,每个跨度传达一个可评估的意义单元。为了解决这个任务,我们引入了 **SpanUQ**,一个轻量级(约~25M 参数)探针,它将昂贵的多样本推理中的不确定性知识蒸馏到一次对 LLM 隐藏状态的前向传播中。SpanUQ 采用 DETR 风格的跨度解码器,通过 Beta 分布混合同时检测跨度并估计其不确定性,该解码器通过 Beta NLL 回归和对比排序目标的原理性组合进行训练。我们构建了 **SpanUQ-Bench**,这是第一个跨度级不确定性基准,包含 20K 个提示,约~293K 个标注跨度,以及从多样本声明验证中导出的连续软标签。在五个 LLM 骨干网络上的实验表明,SpanUQ 始终取得最佳的跨度级不确定性质量(AUROC 0.908–0.944,MAE 0.110–0.129),优于最强的探针基线和所有基于采样的方法,同时速度提升 10–20 倍。其基于 DETR 的跨度检测器达到了 0.910 F1 分数,超过最佳启发式方法 39.4%,实现了序列级方法无法提供的精确定位错误。该框架在跨越两个模型族(AUROC 0.908–0.944)的五个 LLM 上具有泛化能力,并且我们额外观察到序列级不确定性是部分可分解的:学习到的重要性加权跨度组合达到了 ρ_seq = 0.839,表明跨度级估计将序列级作为特例包含在内。项目页面可在 https://damon-demon.github.io/SpanUQ.html 获取。
## 1 引言
大型语言模型(LLMs)在广泛的任务中生成流畅且连贯的文本,然而它们倾向于生成事实不正确的陈述,通常称为幻觉,这仍然是其在医疗保健、法律分析和科学研究等高安全领域部署的关键障碍 [6]。迈向可信 LLM 部署的基本步骤是能够估计模型对其生成的每一条信息 *不确定性有多高*。
现有的不确定性估计方法在两种极端的粒度上运行。
**词元级方法** 使用预测熵或学习到的探针 [8, 5, 34] 为单个词元计算分数。虽然计算效率高,但这些分数在语义上不完整:一个单独的词元很少构成一个可验证的事实,而功能词获得的分数不携带任何信息价值。
**序列级方法** 通过对多个输出进行采样并测量其语义离散度 [11, 23, 31],为整个响应产生一个单一的分数。这些方法捕获了有意义的语义不确定性,但需要 10–20 倍的推理成本,并且无法定位响应的 *哪些部分* 不可靠。
考虑图 1 中的例子:一个 LLM 生成“玛丽·居里是一位波兰物理学家,她于 1901 年获得了诺贝尔奖。”词元级方法 (a) 为每个词元分配单独的分数;像“是一位”和“一位”这样的功能词获得低但无意义的分数,而“物理学家”虽然是正确的,但仅仅因为它是较不可预测的延续,就获得了中等分数。序列级方法 (b) 将整个响应压缩成一个单一分数 (u = 0.52),将正确和错误的声明平均成一个无法行动的中间地带。用户实际需要的是**跨度**级别的不确定性 (c):“波兰物理学家” (u = 0.08, 自信),“诺贝尔奖” (u = 0.12, 自信),以及“1901” (u = 0.81, 不确定),因为诺贝尔物理学奖是在 1903 年颁发的,而非 1901 年。
我们将**跨度**定义为一个连续的文本片段,传达一个单一的、连贯的意义单元,其不确定性可以独立评估。在实践中,跨度通常对应于事实验证文献中所谓的*声明*或*原子事实* [19],但这个概念更通用:任何携带自包含信息的句子以下片段都符合条件。在上面的例子中,“波兰物理学家”、“诺贝尔奖”和“1901”各自是一个跨度。与缺乏独立意义的子词单元的词元不同,也与可能捆绑多个可靠性不同断言的完整序列不同,跨度是不确定性估计的自然单元:每个跨度携带一条可评估的信息,使其不确定性分数直接可解释和可操作。
这一观察使我们形式化定义了 **跨度级不确定性估计(SLUE)** 作为一个新任务:给定一次 LLM 前向传播,联合检测跨度并为每个跨度分配连续的不确定性分数。
为了解决这个任务,我们引入了 **SpanUQ**(图 2),一个轻量级(约~25M 参数)探针,它将昂贵多样本推理捕获的不确定性知识蒸馏到一次对冻结 LLM 隐藏状态的前向传播中。我们构建了 **SpanUQ-Bench**,这是第一个跨度级不确定性基准,包含 5 个领域的 20K 个查询和 293K 个跨度,并在跨越 4B–30B 参数、包含密集和混合专家架构的五个 LLM (Qwen3-14B/8B/4B/30B-A3B, Mistral-7B) 上进行评估。
我们的**主要贡献**如下。
(1) **问题形式化**。我们将 SLUE 形式化为一个新任务,它弥合了词元级和序列级不确定性估计之间的差距,在可验证声明的自然粒度上运行。
(2) **框架**。我们引入了 SpanUQ,将一个 DETR 风格的跨度解码器、Beta 分布混合不确定性估计和不确定性条件迭代细化组合成一个轻量级探针(约~25M 参数),将多样本不确定性蒸馏到单次前向传播中。
(3) **基准**。我们构建了 SpanUQ-Bench,这是第一个具有连续软标签的跨度级不确定性基准,涵盖五个领域和 20K 个查询,以及一个自动将 LLM 响应分解为原子跨度并导出连续不确定性标签的多样本蒸馏流程。
(4) **实证结果**。在五个 LLM 骨干网络上的实验表明,SpanUQ 始终取得最佳的跨度级不确定性质量(AUROC 0.908–0.944,MAE 0.110–0.129),优于最强的探针基线和所有基于采样的方法,同时速度提升 10–20 倍。此外,我们观察到序列级不确定性是部分可分解为跨度级组件的(ρ_seq = 0.839),表明跨度级估计将序列级作为特例包含在内。
## 2 相关工作
**LLM 生成中的不确定性估计**。对 LLM 的不确定性估计已在多个粒度上进行了研究。在**词元级别**,预测熵是一个自然的基线 [8],轻量级的隐藏状态探针可以改进它 [5, 26]。然而,事实正确性很少是单个词元的属性:一个幻觉性的声明,如“出生于巴黎”,作为一个单元是错误的,但词元级分数为每个词分配独立的值。为了捕获更广泛的语义,**序列级**方法聚合了整个生成的不确定性。语义熵 [11] 按意义对采样输出进行聚类并计算聚类上的熵;核语言熵 [21] 用基于核的相似性替换离散聚类。其他方向包括认知-随意分解 [32]、声明级别蕴含图 [4] 以及通过口头化置信度进行自我校准 [31]。**句子级**方法 [3] 部分定位不确定性,但依赖于可能与语义单元不对齐的句法边界。UncertaintyRAG [16] 向跨度级估计迈出了一步,通过在固定滑动窗口内计算词元自信息的信噪比(SNR);然而,其跨度由刚性窗口(长度 20,步长 10)定义,而非学习到的语义边界,并且产生的分数用于 RAG 块检索而非生成质量评估。所有这些方法要么为每个生成产生单一分数,要么产生词元级分数,在**跨度**级别(事实声明的自然粒度)留下了一个空白。SpanUQ 通过联合检测可变长度跨度并为每个跨度分配连续的不确定性分数来填补这一空白。
**幻觉检测**。一系列并行的工作探究 LLM 内部表示是否编码了真实性信号。隐藏状态探针可以检测到基于输出的方法无法发现的幻觉 [1, 22],语义熵探针 [9] 将多样本信号蒸馏成单次分类器。这些方法确立了隐藏状态是事实性信息的丰富来源,但它们在词元或句子级别操作,并产生二元而非连续的估计。从输出方面来看,诸如 FActScore [19] 和 SAFE [30] 等外部知识方法将生成分解为原子声明并针对知识源进行验证,而 SelfCheckGPT [18] 则在不检索的情况下测量跨样本一致性。FAVA [20] 微调一个模型来检测和编辑幻觉跨度,Mu-SHROOM 共享任务 [27] 对跨度级幻觉检测进行基准测试,尽管参与系统依赖启发式跨度提取。一个关键区别是幻觉检测是二元的,并且通常需要外部验证,而不确定性估计仅从内部信号产生连续的置信度分数。SpanUQ 通过从隐藏状态中学习连续的不确定性来连接两者,作为副产品,在二元幻觉预测上实现了 AUROC > 0.93。
**跨度检测**。跨度检测有着丰富的历史,从命名实体识别 [13] 到共指消解 [14] 和关系抽取 [28]。传统的 BIO 标注无法表示重叠的跨度,这对于不确定性估计来说是一个限制,因为一个句子内可能存在多个声明。最近受 DETR [2] 启发的集合预测方法解决了这个问题:CLUE [29] 使用 DETR 风格的架构进行声明级不确定性,HaluNet [25] 将类似的范式应用于幻觉跨度检测。SpanUQ 采用了 DETR 框架,但在两个方面有所不同:(1) 我们检测与**不确定性相关**的跨度,即任何语义完整、其事实性可以被评估的单位,而不是命名实体或预定义的声明类型;(2) 跨度检测器与不确定性评分器联合训练,学习对不确定性估计具有最大信息量的边界。
## 3 方法:SpanUQ
我们提出 SpanUQ,一个框架,它从一次通过冻结的大型语言模型的前向传播中,在跨度级别估计不确定性。核心思想是将昂贵的多样本推理所捕获的不确定性知识蒸馏到一个直接操作于 LLM 隐藏状态的轻量级模块中。给定一个 LLM 对输入提示 x 生成的响应 y = (y_1, ..., y_T),SpanUQ 同时执行 (i) 检测有语义意义的跨度 {s_k = (b_k, e_k)}_{k=1}^K 和 (ii) 为每个跨度估计一个连续的不确定性分数 u_k ∈ [0,1],其中 0 表示完全置信,1 表示最大不确定性。图 2 提供了一个概述,图 A1 用具体示例说明了端到端的跨度级不确定性估计过程(完整设计原理见附录 A)。训练需要真实跨度及其不确定性标签:每个跨度对应一个表达单个可验证断言的连续文本片段,其标签 u_k^* ∈ [0,1] 衡量随机样本中该断言不受支持的比例(详见第 4.1 节)。我们首先描述模型架构(第 3.1 节),然后是训练过程(第 3.2 节)和带迭代细化的推理(第 3.3 节)。
### 3.1 模型架构
[冻结 LLM] → H^(l1), H^(l2), H^(l3) 隐藏状态 → [均值融合] → [投影 d → dp] → [Transformer 编码器] → Z → [跨度查询 Q] → [DETR 解码器] → [富化门控] → content pool相似文章
大型语言扩散模型的不确定性量化
本文首次系统研究了大型语言扩散模型(LLDMs)的不确定性量化(UQ),提出了从迭代去噪过程中衍生的轻量级零样本不确定性信号,并表明LLDMs能够在实现快速推理的同时,提供可靠的幻觉检测,与基于采样的基线方法相比,计算开销降低高达100倍。
从信号到迁移:基于探针的大语言模型不确定性估计的分解研究
本文对大语言模型中基于探针的不确定性估计进行了分解研究,表明原始隐藏状态和注意力特征在域内表现良好,但结构化特征在分布偏移下更为鲁棒,并提供了预训练探针作为现成基线。
基于推理的不确定性估计:LLM在多语言和跨语言MCQA性能中的大规模研究
本文对LLM在22种语言中的九种不确定性估计方法进行了大规模评估,发现提示模型用英语推理可改善低资源语言的不确定性估计,且方法的选择取决于模型规模。
观点:大型语言模型中的不确定性量化仅是无监督聚类
这篇观点论文认为,当前大型语言模型的不确定性量化方法本质上属于无监督聚类,测量的是内部一致性而非外部正确性,因此无法检测出自信的幻觉。作者主张进行范式转变,将不确定性建立在客观真理之上。
使用子采样马尔可夫链蒙特卡罗的潜变量模型大规模不确定性量化
本文针对SGLD-Gibbs发展了标度极限理论,为大规模潜变量模型中实现有意义的不确定性量化提供原则性的超参数调优指导。