幻觉可从量化大语言模型中间层隐藏状态线性解码
摘要
本文研究开源量化大语言模型的隐藏状态中是否编码了线性可分的真实性信号。在三个7B-8B指令调优模型上,对单个网络中间层的线性探针在幻觉检测基准上达到0.904-1.000 AUROC,优于基于采样的方法。
arXiv:2606.02628v1 公告类型: 新
摘要: 我们研究开源大语言模型的隐藏状态中是否编码了线性可分的真实性信号,以及该信号在哪个网络深度最强。在三个$7$B--$8$B指令调优模型(Llama-3.1-8B, Mistral-7B, Qwen2.5-7B)上,以$4$位NF4量化加载,我们在四个幻觉基准(TruthfulQA, HaluEval-QA, FEVER, 和一个受控合成集)上提取每层隐藏状态,并比较四种检测方法:线性探针和MLP探针、INSIDE EigenScore、自一致性以及注意力熵。对单个网络中间层的线性探针在保留集上达到$0.904$--$1.000$ AUROC,而基于采样的检测器在相同协议下不超过$0.541$ AUROC。真实性信号近似线性:MLP探针很少比线性探针高出$0.01$ AUROC以上。在自然语言基准上,峰值探针层跨模型家族落在一致的波段内——Llama和Mistral的 blocks~$13$--$18$ of~$32$,以及Qwen的 blocks~$19$--$25$ of~$28$。第一块的注意力熵在基于知识的设定中提供了互补信号(HaluEval-QA上$0.866$--$0.941$ AUROC),且无需额外推理成本。在此协议下,采样方法的低区分性反映了配对标签评估与这些方法可访问信息之间的结构性不匹配,而非这些方法的固有限制。代码和数据已发布,可在单个$8$\,GB GPU上完全复现。
查看缓存全文
缓存时间: 2026/06/03 09:39
# 幻觉可从量化大语言模型的中间层隐藏状态线性解码
来源:https://arxiv.org/html/2606.02628
11institutetext:澳门大学
11email:mc25101@um\.edu\.mo###### 摘要
我们研究开源大语言模型是否在其隐藏状态中编码了线性可分离的真实性信号,以及该信号在哪个网络深度最强。三个7B–8B指令微调模型(Llama-3.1-8B、Mistral-7B、Qwen2.5-7B)以4-bit NF4量化加载,我们在四个幻觉基准(TruthfulQA、HaluEval-QA、FEVER和一个受控合成集)上提取逐层隐藏状态,并比较四种检测方法:线性探测器和MLP探测器、INSIDE EigenScore、自一致性以及注意力熵。在单个中间网络层上的线性探测器在保留测试集上达到0.904–1.000 AUROC,而基于采样的检测器在相同协议下不超过0.541 AUROC。真实性信号近似线性:MLP探测器很少超过线性探测器0.01 AUROC以上。在自然语言基准上,峰值探测层在不同模型家族间落在一致区间——Llama和Mistral的32层中第13–18层,Qwen的28层中第19–25层。第一块的注意力熵在知识接地场景中提供了互补信号(HaluEval-QA上0.866–0.941 AUROC),且无需额外推理成本。在此协议下采样方法的低区分性反映了成对标签评估与这些方法访问的信息之间的结构性不匹配,而非这些方法的固有限制。代码和数据已发布,可在单张8GB GPU上完全复现。
## 1 引言
幻觉,即流畅但事实不支持的生成,仍然是大型语言模型在实际部署中的一个普遍失效模式\[11 (https://arxiv.org/html/2606.02628#bib.bib1),10 (https://arxiv.org/html/2606.02628#bib.bib2)\]。在推理时检测幻觉是一个关键的实际问题。日益增长的研究提供了两个互补的检测器家族。*基于采样*的方法对同一提示生成多个随机序列,并在词汇\[23 (https://arxiv.org/html/2606.02628#bib.bib7),17 (https://arxiv.org/html/2606.02628#bib.bib8)\]、语义\[13 (https://arxiv.org/html/2606.02628#bib.bib5),8 (https://arxiv.org/html/2606.02628#bib.bib6)\]或内部状态\[4 (https://arxiv.org/html/2606.02628#bib.bib4)\]层面标记不一致。*基于表示*的方法训练一个小型分类器(探针)直接从中间隐藏状态解码真实性\[2 (https://arxiv.org/html/2606.02628#bib.bib3),3 (https://arxiv.org/html/2606.02628#bib.bib17),15 (https://arxiv.org/html/2606.02628#bib.bib18),1 (https://arxiv.org/html/2606.02628#bib.bib22)\]。这两个家族在计算量上差异显著:采样需要每个提示额外生成K≥5次,而探针仅需一次前向传播。然而,它们很少在相同模型和数据集上进行直接比较,尤其是在从业者在消费级硬件上部署的小型、开源、量化场景中。
我们通过一个统一的评估框架来解决这一差距,该框架可在单张8GB GPU上端到端运行。我们研究三个以4-bit NF4量化\[7 (https://arxiv.org/html/2606.02628#bib.bib15)\]加载的7B–8B指令微调模型(Llama-3.1-8B-Instruct\[9 (https://arxiv.org/html/2606.02628#bib.bib12)\]、Mistral-7B-Instruct-v0.3\[12 (https://arxiv.org/html/2606.02628#bib.bib13)\]和Qwen2.5-7B-Instruct\[19 (https://arxiv.org/html/2606.02628#bib.bib14)\]),涵盖四个幻觉数据集:TruthfulQA\[16 (https://arxiv.org/html/2606.02628#bib.bib9)\]、HaluEval-QA\[14 (https://arxiv.org/html/2606.02628#bib.bib10)\]、FEVER\[21 (https://arxiv.org/html/2606.02628#bib.bib11)\]和一个受控合成基准。对于每个(模型,数据集)组合,我们评估四种检测方法:(i) SAPLMA风格的线性探测器和MLP探测器\[2 (https://arxiv.org/html/2606.02628#bib.bib3)\],作用于逐层隐藏状态;(ii) INSIDE EigenScore\[4 (https://arxiv.org/html/2606.02628#bib.bib4)\],基于多个采样补全;(iii) 自一致性\[23 (https://arxiv.org/html/2606.02628#bib.bib7),17 (https://arxiv.org/html/2606.02628#bib.bib8)\],通过精确匹配多数和句子嵌入相似度\[20 (https://arxiv.org/html/2606.02628#bib.bib21)\]评分;(iv) 注意力熵摘要,来自三个变换器块。我们的主要发现和贡献如下。
##### 贡献。
(1) 在三个开源7B–8B聊天模型上,对四种幻觉检测方法进行了逐层头对头比较,涵盖四个数据集,通过4-bit量化可在消费级硬件上完全复现。(2) 实验证据表明,真实和幻觉隐藏状态在中间到晚期变换器块中是线性可分离的,不同模型家族的峰值探测块一致——Llama和Mistral的32层中第13–18层,Qwen的28层中第19–25层。(3) 一个负面结果:在成对标签协议下,INSIDE和自一致性不提供区分性信号,我们将其归因于评估设置与这些方法访问的信息之间的结构性不匹配(§5 (https://arxiv.org/html/2606.02628#S5.SS0.SSS0.Px2))。
## 2 相关工作
幻觉分类。\[11 (https://arxiv.org/html/2606.02628#bib.bib1)\]和\[10 (https://arxiv.org/html/2606.02628#bib.bib2)\]提供了全面综述,区分了*内在*(与输入矛盾)和*外在*(输入不支持)幻觉。我们关注外在/事实正确性维度,因为我们所有四个数据集都提供每个(提示,答案)对的二元真实/幻觉标签。
基于表示的检测。线性分类器探针\[1 (https://arxiv.org/html/2606.02628#bib.bib22)\]揭示了网络内部状态中存在但未必使用的信息。SAPLMA\[2 (https://arxiv.org/html/2606.02628#bib.bib3)\]将此思想应用于LLM生成语句的真假分类;CCS\[3 (https://arxiv.org/html/2606.02628#bib.bib17)\]无需标签即可提取真实性方向;ITI\[15 (https://arxiv.org/html/2606.02628#bib.bib18)\]沿该方向编辑激活以提高事实性。我们的框架在三个现代开源聊天模型上端到端重新实现了SAPLMA的逐层探测协议,并在匹配计算条件下与基于采样的基线进行对比。
基于采样的不确定性。自一致性\[23 (https://arxiv.org/html/2606.02628#bib.bib7)\]使用生成一致性作为置信信号;SelfCheckGPT\[17 (https://arxiv.org/html/2606.02628#bib.bib8)\]将其扩展到黑盒幻觉检测。语义熵\[13 (https://arxiv.org/html/2606.02628#bib.bib5),8 (https://arxiv.org/html/2606.02628#bib.bib6)\]通过意义聚类获得更鲁棒的不确定性估计。INSIDE\[4 (https://arxiv.org/html/2606.02628#bib.bib4)\]用采样补全内部状态正则化协方差的对数行列式(EigenScore)替代语义聚类;这是一种近期且有竞争力的采样与内部状态混合方法,我们将其作为主要采样基线。
交叉检查与外部监督。其他工作线涉及查询第二个模型以检测错误\[5 (https://arxiv.org/html/2606.02628#bib.bib19)\]或使用外部知识监督幻觉标签。我们在此不考虑这些:我们的目标是单个部署模型内部的白盒检测。
量化推理。4-bit NF4\[7 (https://arxiv.org/html/2606.02628#bib.bib15)\]和8-bit\[6 (https://arxiv.org/html/2606.02628#bib.bib16)\]量化使7B–8B模型在消费级GPU上可用。我们的结果表明,*在4-bit权重量化下隐藏状态探测仍然有效*,峰值AUROC在HaluEval-QA上达到0.998,在合成基准上达到1.000。
定位。上述每种方法通常单独评估或在不同模型家族上评估,我们尚未发现之前在相同计算预算下对相同模型进行探针型和基于采样的检测器进行逐层头对头比较的工作。我们的研究将所有四种方法纳入一个统一框架,并提供证据表明评估协议(成对标签 vs. 生成再判断)是影响它们相对性能的关键因素(§3.1 (https://arxiv.org/html/2606.02628#S3.SS1))。
## 3 方法
模型。我们研究三个公开可用的开源聊天模型,以4-bit NF4量化\[7 (https://arxiv.org/html/2606.02628#bib.bib15)\]加载,采用双量化和bfloat16计算数据类型(完整配置见附录0.R (https://arxiv.org/html/2606.02628#Pt0.A18))。这三个模型,总结于表1 (https://arxiv.org/html/2606.02628#S3.T1),涵盖了三个广泛部署的开源家族(Llama、Mistral、Qwen)和两种架构规模(28块和32块变换器)。
表1:本研究所用模型,均以4-bit NF4量化和bfloat16计算数据类型加载。VRAM表示量化权重占用,不包括激活值。
数据集。我们将每个数据集上限设为N=400项。对于每个数据集,我们将同一提示的真实(标签=1)和幻觉(标签=0)答案配对,从而获得近乎完美的50:50类别平衡(正类比例范围从0.500到0.513)。
TruthfulQA。我们使用TruthfulQA\[16 (https://arxiv.org/html/2606.02628#bib.bib9)\]的多选配置,对于每个问题,将规范的正确选项与一个随机抽样的错误选项配对。这产生了可控的对抗性配对,即看似合理但错误的延续,是我们四个基准中最困难的,因为错误答案被明确选择为模仿常见的人类错误。
HaluEval-QA。HaluEval\[14 (https://arxiv.org/html/2606.02628#bib.bib10)\]提供了一个知识条件下的问答分割,包括由GPT类模型生成并配对的正确(标签1)和幻觉(标签0)答案。我们将提供的知识预置于问题前,给予模型一个其他数据集所缺乏的显式证据通道。
FEVER。FEVER\[21 (https://arxiv.org/html/2606.02628#bib.bib11)\]提供维基百科支持的声明,标记为*支持*(1)或*反驳*(0);排除证据不足的声明以保持二元清晰性。
合成。一个受控基准,包含关于世界首都、化学符号、文学作者和行星轨道的成对真/假陈述,从四个知识库生成(见附录0.I (https://arxiv.org/html/2606.02628#Pt0.A9))。对中的两项共享相同提示,仅在一个实质性标记上不同,从而提供干净的类别信号。
### 3.1 成对标签协议
一个对于我们结果解释至关重要的设计选择是*成对标签协议*。在每个数据集中,候选答案由基准提供而非模型生成。我们将提示和候选答案拼接,运行单次前向传播,并按照SAPLMA惯例\[2 (https://arxiv.org/html/2606.02628#bib.bib3)\]提取隐藏状态。因此,基于探针的检测器观察到模型对所提供答案的内部表示,而基于采样的检测器(INSIDE、自一致性)则仅从提示中抽取K次自由补全,并测量其多样性,*而不以提供的候选答案为条件*。
这种不对称性有两个后果。首先,探针接收到干净的二元信号,具有近乎完美的50:50类别平衡。其次,K次随机补全不受所提供候选答案的约束,因此EigenScore和自一致性分数衡量的是*生成多样性*,与所提供答案的真实性只有微弱相关性。因此,在此协议下,两个检测器家族回答的是*不同的问题*(§5 (https://arxiv.org/html/2606.02628#S5.SS0.SSS0.Px2))。
### 3.2 隐藏状态与注意力提取
对于每一对⟨提示,答案⟩,我们运行单次前向传播,并提取所有L+1个隐藏状态张量(嵌入输出加上L个变换器块输出)。每个张量通过*最后标记*池化(在答案跨度上)归约为单个向量,遵循SAPLMA惯例\[2 (https://arxiv.org/html/2606.02628#bib.bib3)\],从而为每个(模型,数据集)对生成形状为[N, L+1, D]的表示(N=400,D=隐藏维度)。
对于注意力分析,我们在第一个、中间和最后一个变换器块(索引0, ⌊L/2⌋, L-1)捕获注意力权重矩阵。从每个块,我们计算每个头的最后答案标记注意力分布的香农熵,从而得到一个紧凑的逐头熵向量e ∈ ℝ^H。
### 3.3 检测方法
SAPLMA风格探针。对于每个块索引ℓ ∈ {0, …, L},我们在D维隐藏向量上训练两个探针:(a) *线性*探针——单个仿射逻辑斯蒂头;(b) *MLP*探针——两个隐藏层(256→64, GELU, 0.2 dropout),后接softmax头。探针使用AdamW(lr=10^{-3},权重衰减10^{-4})训练30个epoch,批量大小128,采用按类别分层的70:10:20训练/验证/测试分割。每个探针运行3个随机种子,并报告AUROC、AUPRC、准确率和F1的均值与标准差。峰值块和峰值AUROC总结模型的探测分数。
INSIDE EigenScore。遵循\[4 (https://arxiv.org/html/2606.02628#bib.bib4)\],对于每个提示,我们采样K=10次随机补全(温度0.7,top-p 0.95,64个标记),并捕获每个补全在最终块的最后标记隐藏状态。将这些堆叠为H ∈ ℝ^{K×D},EigenScore为:
EigenScore(H) = log det( (1/D) X X^⊤ + α I_K ), (1)
其中X = H - H̄ 对行进行中心化,α = 10^{-3}。为效率起见,我们在K×K Gram空间中进行计算。较高的EigenScore表示补全间更大的分散性,被解释为幻觉的证据。
自一致性。对于每个提示,我们以相同生成参数抽取K=5次随机补全,并通过以下方式衡量它们的一致性:(a) 精确匹配多数(归一化字符串的最大等价类大小除以K),以及(b) 它们句子嵌入的平均成对余弦相似度\[20 (https://arxiv.org/html/2606.02628#bib.bib21)\]。幻觉分数为1 - 一致性。
注意力熵。对于每个保留的注意力块ℓ ∈ {0, ⌊L/2⌋, L-1},我们通过头平均香农熵总结最后答案标记的注意力分布,并将该标量视为连续幻觉信号(高熵 ⇒ 弥散注意力 ⇒ 证据不明确)。
度量与层几何。探针在保留测试集上以AUROC、AUPRC、准确率和F1(阈值0.5)进行评估。其余信号直接以AUROC和AUPRC评估,以及在Youden-J最优阈值下的准确率和F1。我们还报告每个块的免分类器几何统计量:质心距离、类内散布,以及相似文章
关注未见质量:通过软混合字母估计揭示 LLM 幻觉
研究者提出 SHADE,一种混合估计器,在仅能获取少量黑盒样本时,融合 Good-Turing 覆盖率与图谱线索,量化语义不确定性并检测大模型幻觉。
可读但不可控:医疗大语言模型幻觉的神经元层面证据
本文探讨了医疗大语言模型中的幻觉是否可以在神经元层面被检测和控制。作者发现,虽然幻觉信号在众多神经元中可被检测到(AUROC 0.77-0.86),但通过引导这些相同神经元并不容易纠正它们。
将幻觉视为异常:通过概率电路进行动态干预
本文提出了 PCNet,这是一种在大型语言模型(LLM)残差流上训练为可计算密度估计器的概率电路,用于将幻觉检测为几何异常。同时,本文还引入了 PC-LDCD,一种仅在生成幻觉 token 时才进行干预的动态修正方法,实现了近乎完美的检测率并降低了错误修正率。
LLMs为何在结构化知识上产生幻觉:对线性化表示推理的机制分析
本文对LLMs在推理线性化结构化知识时产生幻觉的原因进行了机制分析,发现幻觉源于系统的内部动态,例如对捷径线索的关注以及前馈层中语义基础的失败,而非随机噪声。
大语言模型真的知道自己不知道什么吗?内部状态主要反映知识回忆而非真实性
本文质疑了大语言模型能够通过内部信号可靠区分幻觉输出和事实输出的假设,论证内部状态主要反映知识回忆而非真实性。作者提出了一套幻觉分类法(相关性幻觉与非相关性幻觉),并证明相关性幻觉的隐藏状态几何特性与事实输出重叠,使得标准检测方法失效。