注意力分散作为大型语言模型中幻觉的诊断信号

arXiv cs.CL 论文

摘要

本文提出了一种基于注意力分散的无监督指标,用于检测大型语言模型中的幻觉,在使用Qwen2.5模型家族的数学推理基准测试中显示出显著的AUC提升。

arXiv:2609.18320v1 公告类型:新 摘要:大型语言模型(LLMs)经常表现出幻觉,这是复杂推理任务中可靠性的主要障碍。虽然传统的检测方法依赖于基于输出的置信度指标,但这些逻辑值往往被现代对齐技术错误校准。在本文中,我们研究了内部注意力机制的时间波动性,作为不依赖输出校准的幻觉替代诊断信号。通过引入注意力分散的无监督指标,我们表明认知不确定性在中间层内留下可测量的痕迹,其中注意力熵的峰值与推理崩溃相关。我们在数学推理基准(GSM8K和MATH-500)上使用Qwen2.5模型家族(1.5B和3B参数)评估了我们的方法,发现在所有测试条件下,相比基于输出的基线,AUC有统计显著的提升,最高达+0.076。这些发现表明,注意力分散是传统幻觉检测方法的有前途的补充,需要在更广泛的模型家族和任务领域进行进一步研究。
查看原文
查看缓存全文

缓存时间: 2026/09/17 09:16

# 注意力分散作为大型语言模型幻觉的诊断信号
来源:https://arxiv.org/html/2609.18320
Shardul P\. More隶属机构:Rajarambapu技术学院隶属机构:印度马哈拉施特拉邦Ishwarpur邮箱:[shardulmore112@gmail\.com](mailto:)Tanuja S\. Pawar隶属机构:Rajarambapu技术学院隶属机构:印度马哈拉施特拉邦Ishwarpur邮箱:[tanujapawar203@gmail\.com](mailto:)

###### 摘要

大型语言模型(LLMs)经常出现幻觉现象,这对其在复杂推理任务中的可靠性构成了主要障碍。传统的检测方法依赖于基于输出的置信度指标,但现代对齐技术往往导致这些逻辑值校准失准。本文研究了内部注意力机制的时间波动性,将其作为不依赖于输出校准的幻觉诊断信号。通过引入一种无监督的注意力分散度量,我们证明认知不确定性会在中间层留下可测量的痕迹,其中注意力熵的尖峰与推理崩溃相关。我们在数学推理基准测试(GSM8K和MATH-500)上使用Qwen2.5模型系列(1.5B和3B参数)评估了我们的方法,发现在所有测试条件下,AUC相比基于输出的基线平均提高了0.076。这些发现表明,注意力分散是对传统幻觉检测方法的有力补充,需要在更广泛的模型系列和任务领域中进一步研究。

## 1引言

大型语言模型(LLMs)的快速增长和普及给识别幻觉带来了挑战,即模型对其输出的置信度很高但事实错误。初始的不确定性估计方法严重依赖于模型的输出概率,利用最大softmax概率作为检测错误的基线(Hendrycks和Gimpel,2018 (https://arxiv.org/html/2609.18320#bib.bib2))。进一步的研究表明,大型语言模型可以通过自我评估提示来评估其自身主张的有效性(Kadavath等人,2022 (https://arxiv.org/html/2609.18320#bib.bib1))。然而,最近的对齐策略,例如基于人类反馈的强化学习(RLHF),往往导致模型表现出系统性的、言语上的过度自信,而不论实际响应质量如何(Leng等人,2025 (https://arxiv.org/html/2609.18320#bib.bib3))。因此,输出逻辑值在结构上作为诊断指标已受损。

最近的方法探索了内部表示以绕过受损的逻辑值。SAPLMA(Azaria和Mitchell,2023 (https://arxiv.org/html/2609.18320#bib.bib4))等分类器用于直接从隐藏层激活中提取真实性信号。更重要的是,这些方法通常不考虑序列推理的动态、多步性质。尽管中层充当关键信息瓶颈(Skean等人,2025 (https://arxiv.org/html/2609.18320#bib.bib5)),但注意力机制在这些层上的时间波动或波动性尚未作为诊断工具被彻底研究。

我们假设幻觉不仅是静态表示错误,还是推理稳定性的动态失败。合理的推理在transformer的深度中保持一致的注意力轨迹,而认知失败则表现为不稳定的、高度分散的注意力转移。我们的贡献是三方面的:(1)我们提出了理论框架,即注意力熵的时间分散可以作为认知失败的零样本、内部指标;(2)我们引入了一个指标step\_attn\_stdstep\\\_attn\\\_std,用于追踪中间层之间的推理波动,而不依赖于输出逻辑值;(3)我们在GSM8K和MATH-500上提供了经验证据,证明动态注意力分散提供了幻觉检测的预测信号,无需额外的探测训练。

## 2相关工作

为增强大型语言模型推理的可靠性和测量其不确定性,研究人员探索了基于采样的方法。自一致性被引入作为一种方法,从多条推理路径中选择出现频率最高的答案,在逻辑和常识任务中均显示出显著改进(Wang等人,2023 (https://arxiv.org/html/2609.18320#bib.bib7))。类似地,语义熵被提出,用于根据语义等效性对多个响应进行聚类,通过测量这些聚类的不确定性来检测幻觉(Farquhar等人,2024 (https://arxiv.org/html/2609.18320#bib.bib12))。虽然这些策略提供了稳健的不确定性信号,但它们需要针对每个输入进行多次生成。例如,语义熵需要5到10次生成,导致计算成本更高。为减轻这种开销,最近的研究提出了语义熵探针(SEPs),直接从单次生成的隐藏状态近似语义不确定性(Kossen等人,2024 (https://arxiv.org/html/2609.18320#bib.bib6))。

另一条研究线是言语化置信度,要求语言模型明确报告生成答案的确定性水平。在CalibratedMath基准上的研究表明,可以通过报告数值概率或描述性的语言特征来训练模型表达不确定性(Lin等人,2022 (https://arxiv.org/html/2609.18320#bib.bib8))。此外,置信度引出已扩展到对RLHF对齐的模型,发现言语化置信度有时比模型的条件概率提供更好的校准(Tian等人,2023 (https://arxiv.org/html/2609.18320#bib.bib9))。然而,尽管模型可以用自然语言有意义地估计置信度,但该信号仍然依赖于模型的明确语言输出,这可能仍受对齐导致的过度自信影响(Leng等人,2025 (https://arxiv.org/html/2609.18320#bib.bib3))。

为绕过依赖于输出的指标,机制可解释性分析了模型的内部计算。先前的工作映射了Transformer电路以理解组件交互(Elhage等人,2021 (https://arxiv.org/html/2609.18320#bib.bib10)),并确定中间层前馈网络是事实预测的关键中介(Meng等人,2022 (https://arxiv.org/html/2609.18320#bib.bib11))。这些研究证实,稳健的知识表示严格存在于中间层。在此基础上,我们从静态特征提取转向动态追踪这些注意力机制的时间不稳定性。

## 3方法论

我们的目标是量化大型语言模型(LLM)在序列推理过程中的知识相关稳定性,而不依赖于其输出逻辑值。为此,我们引入了一个框架,用于测量网络各层在每个生成步骤中的注意力熵的时间分散。

### 3\.1逐层注意力熵

考虑一个具有LL层的Transformer模型。在生成步骤t时,模型关注长度为k的先前上下文。对于给定的层l∈\{1,...,L\}l\\in\\\{1,\\dots,L\\\}和注意力头h∈\{1,...,H\}h\\in\\\{1,\\dots,H\\\},令αl,h\(t\)∈Rk\\alpha\_\{l,h\}^{\(t\)}\\in\\mathbb\{R\}^{\{k\}}表示上下文token上的注意力概率分布。

为了量化模型在层l处的位置或空间焦点,我们首先计算注意力分布的香农熵。我们将层l的层注意力熵El\(t\)E\_\{l\}^{\(t\)}定义为该层所有H个注意力头的平均熵:

El\(t\)=1H∑h=1H\(−∑i=1kαl,h,i\(t\)logαl,h,i\(t\)\)E\_\{l\}^{\(t\)}=\\frac\{1\}\{H\}\\sum\_\{h=1\}^{\{H\}}\\left\(\-\\sum\_\{i=1\}^{\{k\}}\\alpha\_\{l,h,i\}^{\{t\}}\\log\\alpha\_\{l,h,i\}^{\{t\}}\\right\)

低熵值表示尖锐、高度局部化的注意力焦点,而高熵值表示注意力在上下文中广泛分散。

### 3\.2时间注意力分散

由于中间层系统性压缩语义特征(Skean等人,2025 (https://arxiv.org/html/2609.18320#bib.bib5)),合理的推理应显示出通过此深度的良好连接且稳定的注意力熵轨迹。相比之下,我们提出认知失败会破坏此轨迹,导致注意力熵在层间剧烈波动。

为测量这种波动性,我们计算整个模型深度上层熵的标准差。首先,我们定义步骤t时所有层的平均注意力熵:

E ̄\(t\)=1L∑l=1LEl\(t\)\\bar\{E\}^{\{t\}}=\\frac\{1\}\{L\}\\sum\_\{l=1\}^{\{L\}}E\_\{l\}^{\{t\}}

接下来,我们定义主要指标——时间注意力分散(step\_attn\_stdstep\\\_attn\\\_std),即这些层熵相对于均值的标准差:

step\_attn\_std\(t\)=1L∑l=1L\(El\(t\)−E ̄\(t\)\)2step\\\_attn\\\_std^{\{t\}}=\\sqrt\{\\frac\{1\}\{L\}\\sum\_\{l=1\}^{\{L\}}\\left\(E\_\{l\}^{\{t\}}\-\\bar\{E\}^{\{t\}}\\right\)^\{2\}\}

通过在每个生成步骤提取step\_attn\_std\(t\)step\\\_attn\\\_std^{\{t\}},我们获得了模型推理稳定性的动态、零样本信号。该指标严格从内部自注意力机制计算得出,使其完全独立于校准失准的输出逻辑值。

## 4实验

为验证我们的假设,即时间注意力分散是认知失败的可靠信号,我们在多个推理数据集和模型规模上评估了我们的指标与标准输出置信度指标的对比。

### 4\.1数据集和模型

我们选择了两个需要多步序列逻辑的复杂数学推理基准测试,其中输出级别的幻觉极为普遍:GSM8K(Cobbe等人,2021 (https://arxiv.org/html/2609.18320#bib.bib13)),一个高质量的初中数学应用题数据集;以及MATH-500(Lightman等人,2023 (https://arxiv.org/html/2609.18320#bib.bib14)),MATH数据集的一个精选子集,包含高度复杂、竞赛级别的数学问题。

为评估我们方法的可扩展性和鲁棒性,我们从Qwen系列(Yang等人,2024 (https://arxiv.org/html/2609.18320#bib.bib15))的两个不同模型中提取内部状态和输出:一个1.5B参数模型(在GSM8K和MATH-500上评估)和一个3B参数模型(在MATH-500上评估)。使用严格的、基于栈的LaTeX解析算法提取真实标签,以使模型生成与带框数学解答完美对齐。

### 4\.2特征提取

对于每个生成的轨迹,我们将步骤级指标聚合成序列级特征,以训练一个轻量级的幻觉分类器。对于输出基线特征,我们计算输出层预测熵的均值和最大值(mean\_out\_entropymean\\\_out\\\_entropy, max\_out\_entropymax\\\_out\\\_entropy),以及序列级输出概率(out\_tauout\\\_tau)。对于我们提出的注意力特征,我们聚合空间注意力熵(mean\_attn\_entropymean\\\_attn\\\_entropy, max\_attn\_entropymax\\\_attn\\\_entropy)和序列级注意力置信度(attn\_tauattn\\\_tau)。关键的是,我们还包含了跨层的注意力时间分散度,并在序列上进行聚合(mean\_attn\_stdmean\\\_attn\\\_std)。

### 4\.3评估协议

我们将幻觉检测框定为一个二元分类任务,目标是预测推理失败(即,最终生成的答案是否不正确)。我们使用Scikit-learn(Pedregosa等人,2018 (https://arxiv.org/html/2609.18320#bib.bib16))训练一个标准逻辑回归分类器,使用平衡类权重基于提取的特征预测失败。

为确保模型性能的稳健估计并防止过拟合,我们采用重复分层K折交叉验证策略(5折,10次重复)。所有特征在训练前均进行标准化。我们使用ROC曲线下面积(ROC-AUC)评估模型。为确定基于注意力的特征与基于输出的基线之间性能的统计显著性,我们计算了性能差异的95%置信区间,并应用单侧Wilcoxon符号秩检验。

## 5结果与分析

请参考标题图1:在MATH-500(3B)上的折外ROC曲线。内部注意力特征优于标准输出指标,而组合模型获得了最高的AUC。
请参考标题图2:MATH-500(3B)上的逻辑回归系数。正权重强烈预测推理失败。

我们的评估表明,内部注意力分散为幻觉检测提供了一个预测性的、正交的信号,在复杂推理任务上始终优于传统的基于输出的指标。

### 5\.1在推理基准测试上的性能

表1 (https://arxiv.org/html/2609.18320#S5.T1)总结了不同基准测试和模型规模上的分类性能。所提出的注意力驱动特征集在所有测试配置下均优于基线。

在评估的设置中,注意力分散在更大模型和更具挑战性的推理任务中似乎信息量更丰富。然而,这些观察是提示性的而非结论性的,因为在我们的实验中模型规模和推理复杂度未独立控制。虽然所提出的指标在GSM8K基准测试上产生了适度的提升(+0.0093 AUC),但在更具挑战性的MATH-500基准测试上性能提升更大,1.5B模型达到+0.0486 AUC,3B模型达到+0.0759 AUC。

表1:评估结果,显示了模型和数据集的AUC性能。95%置信区间(CI)和p值(Wilcoxon符号秩检验)确认了这些提升的统计显著性。
如图2 (https://arxiv.org/html/2609.18320#S5.F2)进一步说明,结合两种信号(Combined)产生了最高的预测能力,表明时间注意力分散捕获了输出逻辑值单独无法很好反映的失败模式。

### 5\.2机制性特征重要性

为了解这些性能的驱动因素,我们分析了训练好的逻辑回归分类器的特征权重。分析显示,mean\_attn\_entropymean\\\_attn\\\_entropy和max\_attn\_entropymax\\\_attn\\\_entropy权重显著,但关键的是,它们作用方向相反。较高的最大注意力熵预测失败,这符合我们的假设,即突然、分散的注意力尖峰表示推理焦点的崩溃。

即使在out\_tauout\\\_tau等输出指标可用的情况下,分类器仍依赖于这些内部注意力特征,这表明注意力波动性携带了仅凭输出置信度无法捕获的幻觉风险信息——这一模式与我们的假设一致,尽管需要跨模型系列和任务类型的进一步工作来建立普遍性。

## 6结论

我们研究了内部注意力机制的时间波动性作为LLMs幻觉的诊断信号。我们的结果表明,认知不确定性在中间层留下了可测量的痕迹,提供了一种较少受到输出校准失准影响的信号。

相似文章

使用分流解码的大语言模型幻觉检测

arXiv cs.CL

本文提出分流解码(diversion decoding)方法,通过在解码阶段主动挑战模型响应来提取特征,训练不确定性启发式模型,从而检测大语言模型中的幻觉,实现了更优的性能和更低的计算复杂度。

HalluSAE:利用稀疏自编码器检测大型语言模型中的幻觉

arXiv cs.CL

北京航空航天大学等机构的研究人员提出了HalluSAE,这是一个结合稀疏自编码器与相变理论的框架。该框架通过将生成过程建模为穿越势能地形的轨迹,来检测大型语言模型(LLM)中的幻觉,并精准定位发生事实性错误的关键过渡区域。