不确定但确信:揭示扩散语言模型中的表征-置信度差距

arXiv cs.CL 论文

摘要

本文识别出扩散语言模型中的“表征置信度差距”:内部状态能准确检测输入噪声,但报告的置信度在高噪声下仍保持高位,答案排序能力下降。本文引入了一种轻量级、无需训练的信息提取工具,利用隐藏状态改进排序,而无需修改基础模型。

arXiv:2608.08791v1 公告类型:新 摘要:扩散语言模型利用广泛上下文生成文本,这表明它们可能比标准模型更能处理输入噪声。测试结果显示,这种能力仅是部分成立。在内部,扩散模型对文本错误的检测非常准确。在外部,它们报告的置信度却忽略了这个信号。随着噪声导致准确率下降,置信度仍接近最大值,而正确排序答案的能力则退化至随机水平。我们将这种不匹配称为表征置信度差距。高置信度分数的可见集中是一种误导性的表面症状。标准的数学调整可以消除这种集中,但无法修复潜在的排序顺序丢失。这种排序缺陷使标准模型在噪声条件下更具优势,并且常规补救措施难以奏效。匹配训练可以恢复准确率,但无法恢复排序;分数重新校准和输入级错误信号无法对最终答案重新排序。然而,正确评估答案所需的信息保留在隐藏状态中。一种轻量级提取工具利用这一信号来改进排序。该方法非常高效,因为它使基础模型完全冻结,并且不需要额外的文本生成步骤。我们展示这一工具以证明信号的存在,同时明确说明其局限性。最终,在噪声条件下,置信度的可靠性比整体准确率更加紧迫。
查看原文
查看缓存全文

缓存时间: 2026/08/11 08:09

# 不确定但自信:揭示扩散语言模型中的表征-置信度差距

来源:https://arxiv.org/html/2608.08791

###### 摘要

扩散语言模型利用广泛的上下文来生成文本,这表明它们可能比标准模型更能处理输入噪声。测试结果表明这仅部分成立。在内部,扩散模型检测文本错误的高度准确性。在外部,它们报告的置信度却忽略了这一信号。随着噪声导致准确率下降,置信度保持在接近最大值,而对答案进行正确排序的能力则退化至接近随机水平。我们将这种不匹配称为表征-置信度差距。可见的高置信度分数集中是一种误导性的表面症状。标准的数学调整可以消除这种集中,但无法修复 underlying 的排序顺序损失。这种排序缺陷在噪声条件下使标准模型更占优势,并且难以通过常见方法修复。匹配训练可以恢复准确率,但无法恢复排序,而分数重新校准和输入级错误信号都无法重新排列最终答案。然而,正确评估答案所需的信息仍然存在于隐藏状态中。一种轻量级提取工具利用这一信号来改进排序。这种方法非常高效,因为它完全冻结基础模型,并且不需要额外的文本生成步骤。我们展示这一工具以证明该信号的存在,同时也明确指出其局限性。最终,在噪声条件下,置信度的可靠性比整体准确率是更紧迫的限制。

## 引言

像 LLaDA(Nie et al. 2025 (https://arxiv.org/html/2608.08791#bib.bib1))和 DREAM(Ye et al. 2025 (https://arxiv.org/html/2608.08791#bib.bib2))这样的扩散语言模型,通过揭示具有广泛上下文的完整序列来生成文本,而不是逐词猜测(Austin et al. 2021 (https://arxiv.org/html/2608.08791#bib.bib5); Sahoo et al. 2024 (https://arxiv.org/html/2608.08791#bib.bib7); Lou et al. 2024 (https://arxiv.org/html/2608.08791#bib.bib6))。这种广阔的视角表明,它们可能比标准模型更能处理输入噪声。测试结果表明,针对真实系统实际遇到的噪声,这一假设仅部分成立。我们使用四种常见的文本错误类型,在逻辑谜题上测试了 LLaDA 8B 和 DREAM 7B,以衡量准确率和置信度可靠性。扩散模型的内部状态能非常准确地检测错误。然而,最终输出却忽略了这一信号。随着噪声导致准确率下降,整体置信度仍然很高,而对答案进行正确排序的能力则退化至接近随机水平。调整这些分数的规模无法解决问题,因为这不会改变答案的顺序。该模型经常在报告高置信度的同时预测错误答案。我们将这种不匹配称为*表征-置信度差距*(图 1 (https://arxiv.org/html/2608.08791#Sx1.F1))。

参见图注

图 1:表征-置信度差距与潜在正确性读取器。在噪声条件下,模型回答错误但仍报告高置信度分数,因此置信度不再清晰区分正确答案与错误答案。*应用*(上):在单次通过中,我们在特定层对答案词编号取平均,用一个简单的数学工具对其打分,若分数低于设定阈值则跳过该问题。*一次性拟合*(下):该简单工具使用相同的冻结提取过程,在一小组带标签示例上离线训练,基础模型权重完全不改动。

以往研究表明,标准模型的内部状态比最终概率更能追踪正确性(Burns et al. 2023 (https://arxiv.org/html/2608.08791#bib.bib34); Azaria and Mitchell 2023 (https://arxiv.org/html/2608.08791#bib.bib35); Kossen et al. 2024 (https://arxiv.org/html/2608.08791#bib.bib37))。我们关注的是,当输入文本存在错误时,这种内部信号有多少能在最终分数中幸存。对于扩散模型来说,这种信号损失尤为明显。在我们的特定测试中,噪声条件下,标准模型比扩散模型保留了更多的排序能力。在干净文本上,各组之间的结果要接近得多。扩散模型的置信度高度集中在量表的最顶端。例如,LLaDA 在面对错误时,对其绝大多数错误都报告高置信度,而标准 LLaMA 3 8B 模型则很少如此。这种可见的集中是误导性的表面症状。标准的温度调整降低了整体置信度分数,但并不改变实际排序顺序。在这个调整点进行评估时,模型类型之间的大差异显著缩小。集中的高分掩盖了潜在的正确排序损失。这表明扩散模型对其猜测的排序方式并非主要问题的全部原因。

我们分离准确率和置信度来评估稳健性。准确率很容易恢复。一种基本的匹配训练方法可以恢复大部分丢失的准确率,其表现与我们测试的三种特定扩散方法相当。然而,这种训练并不能解决置信度问题。它只是强制让噪声猜测匹配干净的猜测,而干净的猜测本就高度自信。标准的数学调整(Li et al. 2026 (https://arxiv.org/html/2608.08791#bib.bib31))也因结构性原因而不足。它们降低了整体误差测量,但使答案保持完全相同的顺序。因为顺序不变,模型仍然难以安全地跳过不确定的问题。噪声破坏了排序,简单的分数调整无法恢复它。

模型内部存在一个可用于改善这种排序的有用信号。我们的错误检测器观察整个问题,因此其分数在所有可能的答案中大致相同。将这个分数加入会改变整个问题的置信度,而不会重新排列答案,其作用类似于基本的数学调整。两种试图将这个信号输入最终分数的方法恰好如预期那样未能改善排序。要修复跳过问题的能力,需要一个与特定答案相关联的信号。因此,我们引入了*潜在正确性读取器*,即 LCR。这是一个轻量级提取工具,通过观察答案词的内部状态来估计正确性。这种方法非常高效,因为它完全冻结基础模型,并且不需要额外的文本生成步骤。它使用与基本调整相同的一小组示例即可快速拟合。

我们的贡献如下。首先,我们定义了现实世界文本噪声下扩散语言模型中的表征-置信度差距。我们将高分集中的表面问题与排序能力丧失的深层问题区分开来。其次,我们解释了明显修复方法失败的结构性原因。匹配训练和基本分数调整保持答案的原始顺序。此外,问题级错误信号在所有可能的答案中基本保持不变,因此它们也无法重新排列最终答案。我们通过展示两种未能改善结果的路由方法来支持这一论点。第三,我们表明安全跳过问题所需的信息仍然存在于隐藏状态中。我们使用一种轻量级工具提取此信号,该方法非常高效,无需模型更新,也无需额外的生成过程。我们展示这一工具以证明该信号的存在,同时也明确指出其局限性。

## 背景与问题设定

掩码扩散语言模型

掩码扩散模型通过逆转一个隐藏文本的过程来生成文本(Austin et al. 2021 (https://arxiv.org/html/2608.08791#bib.bib5); Sahoo et al. 2024 (https://arxiv.org/html/2608.08791#bib.bib7))。在生成过程中,模型运行固定数量的步骤。在每一步,每个隐藏位置都会获得一个概率分布。系统承诺具有最高概率的位置,并将其余位置留待后续处理。这种基于置信度的调度是扩散生成所特有的。我们记录每个答案位置在其被揭示时的置信度。

置信度校准与选择性预测

我们使用答案各个单词置信度的几何平均值来对生成的答案进行评分

c(q)=(∏i∈Aκi⋆)1/|A|, c(\bm{q})=\Big(\textstyle\prod_{i\in\mathcal{A}}\kappa_{i}^{\star}\Big)^{1/|\mathcal{A}|}, (1)

取遍答案位置。该平均值与模型的训练数学一致,并受最不确定单词的影响很大。它包含选择效应,因为系统只在分数是剩余隐藏词中最高时才记录。这种选择改变了整体置信度尺度,我们稍后会表明这与模型对答案进行排序的方式是分开的。我们以两种方式评估这个分数。校准使用期望校准误差检查置信度是否与实际准确率匹配(Naeini et al. 2015 (https://arxiv.org/html/2608.08791#bib.bib24); Guo et al. 2017 (https://arxiv.org/html/2608.08791#bib.bib23))。选择性预测(Geifman and El-Yaniv 2017 (https://arxiv.org/html/2608.08791#bib.bib29))检查置信度分数是否有助于模型跳过问题,在回答率与错误风险之间取得平衡。我们使用接受者操作特征曲线下的面积来衡量这种排序质量,其中 0.5 表示随机机会。区分校准与排序至关重要,因为简单的数学调整可以在不重新排序答案的情况下修复校准。修正置信度尺度与修复答案排序完全不同。

## 关于模型稳健性的诊断发现

我们在此总结激励我们方法的研究发现,完整设置在实验设置部分详述。除非另有说明,数字适用于 LLaDA 8B 在 GSM8K 测试集上、字符交换噪声下的情况。每次干净与噪声比较都使用完全相同的 400 个提示以确保公平。

从内部状态检测错误:一个简单的工具评估冻结的内部状态,能以非常高的可靠性区分干净文本和噪声文本,在多个层上的得分在 0.996 到 0.997 之间。该检测器的一个受限版本仍然达到 0.986。模型显然能记录其输入何时包含错误。

噪声下置信度仍然很高:虽然噪声下准确率从 0.560 下降到 0.373,但平均置信度分数几乎不变,从 0.988 降至 0.982。与此同时,校准误差从 0.428 上升到 0.610。这些模型在干净文本上已经高度自信,而噪声通过降低准确率同时使高置信度基本不受影响,使情况更糟。

置信度与准确率失去联系:这种失败不仅仅是一个简单的尺度偏移。在噪声测试集上,正确答案的置信度仅比错误答案高 0.0022。这个千分之二的微小差距对于决定是否信任某个特定答案毫无用处,尤其是在存在更大准确率差距的情况下。排序质量从 0.666 降至 0.575。我们将这种行为描述为:对答案不确定,但对报告的分数却很有把握。

标准修复方法无法迁移:标准的温度调整(Li et al. 2026 (https://arxiv.org/html/2608.08791#bib.bib31))无法修复已被破坏的排序顺序。在干净文本上,它们显著降低了校准误差,同时不损害有用的排序。在噪声下,它们将校准误差从 0.610 降低到 0.133,但排序分数冻结在 0.575。调整后的温度达到了我们搜索范围的绝对极限,将置信度分数完全压平。扩展搜索范围只会改变校准误差,而不会改变 underlying 的排序失败。

基本的匹配训练恢复了噪声导致的大部分准确率损失,而我们测试的三种特殊扩散方法没有带来可靠的改进。噪声下的准确率可以用现有工具处理,但置信度可靠性需要不同的方法。

## 方法:从损坏路由到正确性读取器

我们建立在一种恢复准确率的基本训练方法之上,并探索如何获得可靠的置信度分数。我们最初尝试将模型的内部错误信号输入其最终置信度输出。这一尝试因结构性原因而失败,这指向需要一种专门关注生成答案的评分方法。

准确率基线与一致性

我们训练模型使其噪声预测与干净预测匹配

L_cons(θ)=E_{i∈A}[KL(sg[f_{θ_0}(⋅∣q)_i]∥f_θ(⋅∣q~)_i)], \mathcal{L}_{\mathrm{cons}}(\theta)=\mathbb{E}_{i\in\mathcal{A}}\left[\text{KL}\left(\text{sg}\left[f_{\theta_{0}}(\cdot\mid\bm{q})_{i}\right]\parallel f_{\theta}(\cdot\mid\tilde{\bm{q}})_{i}\right)\right], (2)

其中 θ_0 是冻结的基础模型,sg[⋅] 停止梯度更新。这种方法恢复了大部分丢失的准确率。然而,因为它复制了干净文本的行为,所以也复制了原有的过度自信,使置信度问题未得到修复。

路由错误信号及其失败原因

从错误检测器中,我们获得一个冻结分数

g_i=σ(β(w⊤h_i^{l⋆}(q~)−b))∈[0,1] g_{i}=\sigma(\beta(\bm{w}^{\top}\bm{h}_{i}^{\ell^{\star}}(\tilde{\bm{q}})-b))\in[0,1]

在每个词位置。我们测试了两种将该分数输入最终置信度的方法:一种是在标记位置降低置信度的训练惩罚,另一种是在检测到错误时延迟决策的解码规则。两种方法都没有在基本训练之上改善排序。虽然训练惩罚达到了我们测量的最高准确率,但其排序能力没有统计学上的改善。这种失败有结构性原因。成功跳过问题取决于不同可能答案的置信度分数的相对顺序。错误检测器分数是输入问题的一个属性,这意味着无论模型生成哪个答案,它都几乎保持不变。将这个分数加入会整体上调或下调整个问题的置信度,但不会改变候选答案的内部排序。这使得输入级检测器类似于标准的数学调整:它们可能标记一个困难的问题,但无法帮助决定该信任哪个特定答案。一个有用的评分方法必须直接着眼于答案。

潜在正确性读取器

设 h_i^l(q~) 表示答案位置 i∈A 在层 l 的隐藏状态。我们对这些状态在答案上取平均,并使用一个简单的逻辑工具对正确性进行评分

h̄^l=1/|A|∑_{i∈A} h_i^l(q~), r(q~)=σ(u⊤ h̄^l+b), \bar{\bm{h}}^{\ell}=\frac{1}{|\mathcal{A}|}\sum_{i\in\mathcal{A}}\bm{h}_{i}^{\ell}(\tilde{\bm{q}}),\qquad r(\tilde{\bm{q}})=\sigma\left(\bm{u}^{\top}\bar{\bm{h}}^{\ell}+b\right), (3)

其中我们在带标签的小示例集上拟合参数 (u,b)。我们将 r 称为*潜在正确性读取器*(LCR),并用它对答案进行排序和决定何时跳过问题。特定层与数学设置仅使用训练数据上的标准测试来选取,始终倾向于中后层。

两个属性使这种方法既实用又具有启发性。首先,它不需要更新主语言模型,在标准处理器上使用缓存数据即可在数秒内完成拟合。其次,因为它着眼于完整的内部状态而不是最终概率,所以它在不同可能答案之间会变化,并能重新排列它们。这正是标准数学调整和输入级检测器无法做到的。因为它不增加文本生成步骤,所以额外成本极低。

相似文章

置信捷径:掩码扩散模型的一种推理失效模式

arXiv cs.AI

本文识别了掩码扩散语言模型中的一种失效模式:基于置信度的解码在复杂推理任务中导致高置信度错误,并表明置信对齐训练会加剧此问题,而随机掩码则能保持推理性能。

扩散语言模型:实验分析

arXiv cs.AI

一项系统性的实验分析,评估了八种最先进的扩散语言模型在多个基准测试上的表现,分析了生成质量与计算效率之间的权衡。