大型语言扩散模型的不确定性量化

arXiv cs.CL 论文

摘要

本文首次系统研究了大型语言扩散模型(LLDMs)的不确定性量化(UQ),提出了从迭代去噪过程中衍生的轻量级零样本不确定性信号,并表明LLDMs能够在实现快速推理的同时,提供可靠的幻觉检测,与基于采样的基线方法相比,计算开销降低高达100倍。

arXiv:2605.14570v1 公告类型:新 摘要:大型语言扩散模型(LLDMs)正成为自回归模型的替代方案,通过更高的并行性实现更快的推理。与自回归LLMs类似,它们仍然容易产生幻觉,因此可靠的不确定性量化(UQ)对于安全部署至关重要。然而,现有的UQ方法从根本上与这一新范式不符:它们要么假设自回归分解,要么使用昂贵的重复采样,从而抵消了LLDMs的效率。在这项工作中,我们首次对LLDMs的UQ进行了系统研究,并提出了从迭代去噪过程中衍生的轻量级零样本不确定性信号,利用了中间生成、令牌重新掩蔽动态和去噪复杂度。我们进一步通过结合掩蔽扩散似然和基于轨迹的语义不相似性,将一种最先进的UQ方法适应于LLDMs。我们证明了预期轨迹不相似性下界于掩蔽扩散训练目标,这激发了其作为不确定性分数的使用。跨三个任务、八个数据集和两个模型的综合实验表明,我们的方法实现了出色的性价比权衡:它接近最强的基于采样的基线,同时计算开销降低高达100倍。我们的工作表明,LLDMs能够同时提供快速推理和可靠的幻觉检测。
查看原文
查看缓存全文

缓存时间: 2026/05/15 06:23

# 大规模语言扩散模型的不确定性量化 来源:https://arxiv.org/html/2605.14570 ###### 摘要 大规模语言扩散模型(LLDMs)正成为自回归模型的替代方案,通过更高的并行性实现更快的推理。与自回归LLMs类似,它们仍然容易产生幻觉,因此可靠的不确定性量化对于安全部署至关重要。然而,现有的不确定性量化方法从根本上与新范式不匹配:它们假设自回归因子分解或使用昂贵的重复抽样,从而抵消了LLDMs的效率。在这项工作中,我们首次对LLDMs的不确定性量化进行了系统研究,并提出了轻量级、零样本的不确定性信号,这些信号源自迭代去噪过程,利用了中间生成、令牌重新掩码动态和去噪复杂度。我们进一步通过将掩码扩散似然与基于轨迹的语义不相似性相结合,将最先进的不确定性量化方法适应于LLDMs。我们证明了期望轨迹不相似性对掩码扩散训练目标的下界,这为其作为不确定性分数提供了动机。跨三个任务、八个数据集和两个模型的综合实验表明,我们的方法实现了极佳的成本-性能权衡:它接近最强的基于抽样的基线,同时计算开销降低高达100倍。我们的工作证明,LLDMs可以同时实现快速推理和可靠的幻觉检测。 ## 1 引言 大型语言模型(LLMs)已知会产生幻觉(Huang et al., 2025 (https://arxiv.org/html/2605.14570#bib.bib18)),生成流畅但事实不正确的输出,这使得可靠的不确定性量化(UQ)成为一个关键问题(Kuhn et al., 2023 (https://arxiv.org/html/2605.14570#bib.bib22))。虽然大多数关于UQ的先前工作都集中在自回归模型上,但大规模语言扩散模型(LLDMs)最近已成为一种有竞争力的替代方案(Ye et al., 2025 (https://arxiv.org/html/2605.14570#bib.bib45); Nie et al., 2025 (https://arxiv.org/html/2605.14570#bib.bib26); Bie et al., 2025 (https://arxiv.org/html/2605.14570#bib.bib4)),通过半自回归解码实现更快的生成,其中块内的多个令牌并行生成并迭代优化(Wu et al., 2026 (https://arxiv.org/html/2605.14570#bib.bib43))。然而,现有的UQ方法与这种基于扩散的范式不匹配。标准方法要么针对逐令牌的自回归生成(Malinin and Gales, 2021 (https://arxiv.org/html/2605.14570#bib.bib24)),要么由于重复抽样而计算成本高昂(Duan et al., 2024 (https://arxiv.org/html/2605.14570#bib.bib10); Vashurin et al., 2025b (https://arxiv.org/html/2605.14570#bib.bib39)),使其不适合LLDMs,其中效率是主要目标(Sahoo et al., 2026a (https://arxiv.org/html/2605.14570#bib.bib34))。在这项工作中,我们研究了扩散特定的UQ信号,并引入了利用扩散轨迹、掩码动态和生成复杂度的不确定性度量,如图1 (https://arxiv.org/html/2605.14570#S1.F1) 所示。这些信号使得UQ既有原则性又高效。我们的结果表明,LLDMs提供了双重优势:快速推理和可靠的UQ,而无需依赖自回归UQ方法通常所需的昂贵抽样过程(Vashurin et al., 2025a (https://arxiv.org/html/2605.14570#bib.bib38))。我们将主要贡献总结如下: 1. 1. **扩散特定的不确定性信号**。我们引入了一组新颖的、针对LLDMs定制的不确定性信号,包括轨迹语义不稳定性、轨迹统计和重新掩码行为。 2. 2. **理论基础**。我们正式证明,期望轨迹不相似性(本文引入的最强UQ信号之一)是离散掩码扩散训练目标的一个有原则的替代,这为其作为不确定性分数提供了动机。 3. 3. **D-CoCoA:一种有效且高效的LLDMs UQ方法**。我们将最先进的UQ方法CoCoA适应于LLDMs,将其对数似然分量替换为扩散感知的替代,将其基于抽样的分量替换为沿去噪轨迹生成的中间状态,从而得到一种既有效又高效的方法。 4. 4. **首次大规模系统实证研究LLDMs的UQ**。我们在多样化的任务和数据集上进行了实验,表明我们提出的扩散感知D-CoCoA方法在性能-效率权衡方面优于标准的基于抽样的方法和纯扩散特定信号。我们的结果表明,LLDMs不需要在快速推理和可靠UQ之间做出妥协。 参见图注图 1:提出的D-CoCoA-G方法示意图。给定提示x\mathbf{x},LLDM通过迭代去噪状态zT,...,z1\mathbf{z}_{T},\dots,\mathbf{z}_{1}生成输出y\mathbf{y}。D-CoCoA-G分数结合了三种扩散特定信号:(1) 轨迹语义不稳定性,测量argmax\operatorname*{arg\,max}解码的中间状态与最终输出之间的语义不相似性D(y~t,y)D(\tilde{\mathbf{y}}_{t},\mathbf{y});(2) 轨迹统计,通过函数评估次数捕捉生成复杂度;(3) 掩码扩散似然,近似条件对数似然。 ## 2 相关工作 文本生成的UQ已在自回归LLMs中广泛研究。白盒方法利用内部模型信号,聚合令牌级概率、预测熵或似然来估计序列级不确定性(Malinin and Gales, 2021 (https://arxiv.org/html/2605.14570#bib.bib24); Fomicheva et al., 2020 (https://arxiv.org/html/2605.14570#bib.bib14); Vazhentsev et al., 2025b (https://arxiv.org/html/2605.14570#bib.bib41))。一些工作提出了基于隐藏状态(Azaria and Mitchell, 2023 (https://arxiv.org/html/2605.14570#bib.bib1); Su et al., 2024 (https://arxiv.org/html/2605.14570#bib.bib37); Vazhentsev et al., 2025c (https://arxiv.org/html/2605.14570#bib.bib42))或注意力图(Chuang et al., 2024 (https://arxiv.org/html/2605.14570#bib.bib8); Vazhentsev et al., 2025a (https://arxiv.org/html/2605.14570#bib.bib40))的有监督幻觉检测器。黑盒UQ方法通常基于通过重复抽样获得的生成一致性。诸如语义熵(Kuhn et al., 2023 (https://arxiv.org/html/2605.14570#bib.bib22); Farquhar et al., 2024 (https://arxiv.org/html/2605.14570#bib.bib13))、SAR(Duan et al., 2024 (https://arxiv.org/html/2605.14570#bib.bib10))和CoCoA(Vashurin et al., 2025b (https://arxiv.org/html/2605.14570#bib.bib39))等方法将一致性与基于概率的信号相结合。 最近,扩散模型通过缓解自回归解码瓶颈,成为自然语言生成的一种高效方法(Xu et al., 2025 (https://arxiv.org/html/2605.14570#bib.bib44); Sahoo et al., 2025 (https://arxiv.org/html/2605.14570#bib.bib33), 2026b (https://arxiv.org/html/2605.14570#bib.bib35))。基于掩码扩散的模型,如LLaDA(Zhu et al., 2025 (https://arxiv.org/html/2605.14570#bib.bib48))和Dream(Ye et al., 2025 (https://arxiv.org/html/2605.14570#bib.bib45)),已经展示了与自回归对应模型(如LLaMA-3.1 (Grattafiori et al., 2024 (https://arxiv.org/html/2605.14570#bib.bib16)))相竞争的质量。虽然UQ已在基于扩散的图像生成中进行了研究(Jazbec et al., 2025 (https://arxiv.org/html/2605.14570#bib.bib19); Kou et al., 2024 (https://arxiv.org/html/2605.14570#bib.bib21); Berry et al., 2024 (https://arxiv.org/html/2605.14570#bib.bib3)),但这些方法通常不能直接迁移到文本生成,其中中间状态是离散令牌预测,语义含义高度非线性和不可微。少数工作利用LLDMs中的去噪轨迹进行幻觉检测(Chang et al., 2026 (https://arxiv.org/html/2605.14570#bib.bib6); Qian et al., 2026 (https://arxiv.org/html/2605.14570#bib.bib28))。然而,这些方法严格有监督,因此缺乏无缝适应新任务或领域所需的泛化能力。 总之,没有先前工作为LLDMs引入系统性的UQ框架。我们通过提出一系列无监督方法来解决这一空白,这些方法明确利用迭代去噪过程的独特属性进行UQ。特别是,我们展示了中间去噪轨迹、扩散统计、掩码动态和去噪复杂度可以重新用于有效且高效的无监督不确定性分数。 ## 3 方法论 ### 3.1 背景 **LLDMs中的生成**。设x\mathbf{x}表示输入提示,y=(y1,...,y|y|)\mathbf{y}=(y_{1},\dots,y_{|\mathbf{y}|})为生成的序列。与自回归LLMs从左到右顺序生成文本不同,LLDMs通过迭代去噪过程生成序列。生成从完全破坏的状态zT=(M,...,M)\mathbf{z}_{T}=(\mathbf{M},\dots,\mathbf{M})开始,其中M\mathbf{M}是特殊的[MASK]\left[\mathrm{MASK}\right]令牌。然后,模型通过应用学习到的反向去噪过程逐步重建干净的文本序列: zT∼q(zT),zt−1∼pθ(zt−1∣zt,x),t=T,T−1,...,1.\mathbf{z}_{T}\sim q(\mathbf{z}_{T}),\qquad\mathbf{z}_{t-1}\sim p_{\theta}(\mathbf{z}_{t-1}\mid\mathbf{z}_{t},\mathbf{x}),\qquad t=T,T-1,\ldots,1. 这里,zt\mathbf{z}_{t}表示在第tt步的中间序列,z0=y\mathbf{z}_{0}=\mathbf{y}是最终生成的文本,pθp_{\theta}是由θ\theta参数化的神经去噪模型。这种非自回归推理并行修正多个令牌,使得基于扩散的生成更快,但在概念上与标准LLMs中实现的下一令牌预测不同。 在训练期间,模型学习从掩码损坏zt\mathbf{z}_{t}中恢复原始序列y\mathbf{y}。一个常见的训练目标是去噪损失: L(θ)=−Et,x,y,zt[1t∑i=1|y|1[zt,i=M]logpθ(yi∣zt,x)].\mathcal{L}(\theta)=-\mathbb{E}_{t,\mathbf{x},\mathbf{y},\mathbf{z}_{t}}\left[\frac{1}{t}\sum_{i=1}^{|\mathbf{y}|}\mathbf{1}[z_{t,i}=\mathbf{M}]\log p_{\theta}(y_{i}\mid\mathbf{z}_{t},\mathbf{x})\right]. **用于幻觉检测的UQ方法** 在自回归LLMs中,通常利用(1)白盒信号,如令牌级概率p(yl∣y<l,x)p(y_{l}\mid\mathbf{y}_{<l},\mathbf{x}),聚合成序列级分数,例如序列似然P(y∣x)=∏l=1Lp(yl∣y<l,x)P(\mathbf{y}\mid\mathbf{x})=\prod_{l=1}^{L}p(y_{l}\mid\mathbf{y}_{<l},\mathbf{x}),以及(2)抽样生成的一致性{y(i)}i=1M\left\{\mathbf{y}^{(i)}\right\}_{i=1}^{M}, y(i)∼p(y∣x)\mathbf{y}^{(i)}\sim p(\mathbf{y}\mid\mathbf{x}),其中不确定性通过样本之间的词汇和语义不相似性度量计算(Lin et al., 2024 (https://arxiv.org/html/2605.14570#bib.bib23); Zhang et al., 2024 (https://arxiv.org/html/2605.14570#bib.bib47); Nikitin et al., 2024 (https://arxiv.org/html/2605.14570#bib.bib27))。(3)一些方法将抽样的信息与LLMs估计的令牌概率分布相结合:蒙特卡洛序列熵(Malinin and Gales, 2021 (https://arxiv.org/html/2605.14570#bib.bib24))、语义熵(Kuhn et al., 2023 (https://arxiv.org/html/2605.14570#bib.bib22); Farquhar et al., 2024 (https://arxiv.org/html/2605.14570#bib.bib13))以及最近提出的CoCoA方法(Vashurin et al., 2025b (https://arxiv.org/html/2605.14570#bib.bib39))。 然而,在将这些信号应用于LLDMs生成的UQ时,会出现两个主要问题。首先,LLDMs本身不使用标准LLMs的自回归左到右因子分解,因此令牌级概率p(yl∣y<l,x)p(y_{l}\mid\mathbf{y}_{<l},\mathbf{x})不能直接获得。此外,扩散模型通常不允许精确的可处理似然,而是通过下界目标进行优化,使得其产生的概率作为序列似然的估计不可靠。其次,从LLMs中抽样多个生成在实践中通常不可行,对于LLDMs尤其如此,因为这些模型专为快速高效的生成而设计(Wu et al., 2026 (https://arxiv.org/html/2605.14570#bib.bib43); Sahoo et al., 2026a (https://arxiv.org/html/2605.14570#bib.bib34))。通过重复抽样将推理成本增加一个大的乘法因子会削弱其主要优势之一。 我们认为,迭代去噪过程为UQ提供了额外的信号。例如,中间状态的结构化轨迹{zt}t=1T\{\mathbf{z}_{t}\}_{t=1}^{T}反映了生成随时间的演变,自然捕捉了模型中间预测的变化。在下一节中,我们将探索这些源自模型生成轨迹的扩散特定信号用于UQ。 ### 3.2 用于不确定性量化的扩散特定信号 我们提出了一组直接利用去噪生成过程的不确定性分数,包括来自LLDM的生成似然估计、轨迹统计和重新掩码动态。 **负对数似然估计**。Nie等人 (2025 (https://arxiv.org/html/2605.14570#bib.bib26)) 提出了一个基于掩码扩散目标的、负对数似然的上界ELBO-样替代的蒙特卡洛估计器。该量可以作为生成序列的不确定性分数。令NmcN_{mc}表示蒙特卡洛样本数。对于每个m∈{1,...,Nmc}m\in\{1,\dots,N_{mc}\},我们通过从y\mathbf{y}中无放回抽样lm∼Uniform{1,...,|y|}l_{m}\sim\mathrm{Uniform}\{1,\dots,|\mathbf{y}|\}个令牌进行掩码,得到zt\mathbf{z}_{t}。然后,蒙特卡洛掩码负对数似然(MCNLL)估计器定义为: uMCNLL(x,y)=−1Nmc∑m=1Nmc|y|lm∑i=1|y|1[zt,i=M]logpθ(yi∣x,zt).\mathbf{u}_{\mathrm{MCNLL}}(\mathbf{x},\mathbf{y})=-\frac{1}{N_{mc}}\sum_{m=1}^{N_{mc}}\frac{|\mathbf{y}|}{l_{m}}\sum_{i=1}^{|\mathbf{y}|}\mathbf{1}[z_{t,i}=\mathbf{M}]\log p_{\theta}(y_{i}\mid\mathbf{x},\mathbf{z}_{t}). (1) 一个长度归一化的变体,uMCNLLnorm(x,y)=uMCNLL(x,y)/|y|\mathbf{u}_{\mathrm{MCNLL}}^{\mathrm{norm}}(\mathbf{x},\mathbf{y})=\mathbf{u}_{\mathrm{MCNLL}}(\mathbf{x},\mathbf{y})/|\mathbf{y}|,能够在不同长度的输出之间进行更一致的比较。 **来自去噪轨迹的基于似然的信号**。由于去噪过程会生成带有概率分布的中间状态轨迹,因此可以通过沿该轨迹计算的统计信息自然地进行UQ。对于半自回归LLDMs,y\mathbf{y}被划分为BB个长度为LbL_b的块,BvalidB_{\mathrm{valid}}表示非空生成块的数量(即包含至少一个非特殊令牌的块)。我们将y~b,t,k=argmaxy′∈Vpθ(y′∣x,z<b,t,k)\tilde{y}_{b,t,k}=\operatorname*{arg\,max}_{y'\in\mathcal

相似文章

观点:大型语言模型中的不确定性量化仅是无监督聚类

arXiv cs.CL

这篇观点论文认为,当前大型语言模型的不确定性量化方法本质上属于无监督聚类,测量的是内部一致性而非外部正确性,因此无法检测出自信的幻觉。作者主张进行范式转变,将不确定性建立在客观真理之上。

基于大语言模型的运筹学不确定性感知仿真推断

arXiv cs.LG

本文提出了一种无需训练、不确定性感知的推断框架,用于在运筹学中应用大语言模型。该方法使用短视前瞻仿真和重要性重采样来提高数学公式表述的一致性,在OR基准测试上优于标准基线。