幻觉检测中的自动层选择
摘要
本文提出了用于大语言模型幻觉检测的自动层选择方法,并引入了固有维度首个有效峰值(FEPoID),这是一种无需训练的标准,能够一致地识别出最优中间层,优于现有启发式方法。
arXiv:2605.26366v1 公告类型:新
摘要:关于幻觉检测的最新研究表明,与大语言模型(LLM)的最终层相比,中间层编码了更强的幻觉相关信号。尽管越来越多的工作试图利用这一特性进行幻觉检测,但如何自动选择高性能层仍未被充分探索,且缺乏原则性的方法。为填补这一空白,我们首先提出了若干关于这些信号为何出现在中间层的假设,并评估了相应的自动层选择标准,涵盖不同LLM架构、规模及任务(包括问答和摘要幻觉检测基准)。然而,我们发现这些标准均未能持续提供令人满意的性能。因此,我们提出了一种新的选择标准——固有维度首个有效峰值(FEPoID),它能够一致地识别最优或接近最优的层,并优于前述标准及现有的幻觉检测基线。FEPoID无需训练,且计算开销可忽略不计。此外,我们研究了LLM的生成行为,并引入了一种简单有效的截断策略,进一步放大了幻觉相关信号,显著提升了整体检测性能。代码已公开于 https://github.com/DesoloYw/Automatic-Layer-Selection-for-Hallucination-Detection.git
查看缓存全文
缓存时间: 2026/05/27 09:04
# 幻觉检测的自动层选择
来源:https://arxiv.org/html/2605.26366
###### 摘要
近期关于幻觉检测的研究表明,与大语言模型(LLMs)的最终层相比,中间层更强烈地编码了与幻觉相关的信号。尽管越来越多的工作尝试利用这一特性进行幻觉检测,但如何自动选择高性能层仍未得到充分探索,且缺乏原则性的方法。为填补这一空白,我们首先提出了关于这些信号为何在中间层产生的若干假设,并评估了相应的自动层选择标准,涵盖多种LLM架构、规模及任务,包括问答和摘要幻觉检测基准。然而,我们发现这些标准均未能始终提供令人满意的性能。因此,我们提出一种新的选择标准——第一有效本征维度峰值(FEPoID),它能够一致地识别最优或接近最优的层,并优于前述标准及现有的幻觉检测基线。FEPoID无需训练,计算开销极低。此外,我们研究了LLM的生成行为,并引入了一种简单而有效的截断策略,该策略进一步放大了与幻觉相关的信号,并显著提升了整体检测性能。代码已公开在https://github.com/DesoloYw/Automatic-Layer-Selection-for-Hallucination-Detection.git
机器学习,ICML
## 1 引言
参见标题(a) LLaMA-3.1-8B-Instruct,标题(b) Mistral-7B-Instruct-v0.3,标题(c) 使用我们基于层选择策略的性能提升
图1:在统一实验设置下的幻觉检测性能。所有实验中,我们从每层提取最后token表示,并训练一个MLP分类器进行幻觉检测。(顶部):在oracle训练下的逐层AUROC,其中性能最佳层(星标)始终位于中间层。(底部):不同层选择策略下跨数据集的平均AUROC。FEPoID始终优于最后一层启发式,且与截断策略结合后,各模型性能进一步提升。
幻觉检测是在实际应用中部署大语言模型(LLMs)时面临的关键挑战,因为LLMs可能生成流畅但事实错误或内部不一致的输出。因此,在不修改或微调底层模型的情况下检测此类幻觉是一个重要的实际问题(Huang et al., 2025 (https://arxiv.org/html/2605.26366#bib.bib17); Farquhar et al., 2024 (https://arxiv.org/html/2605.26366#bib.bib10); Li et al., 2024 (https://arxiv.org/html/2605.26366#bib.bib28))。先前的工作已使用基于不确定性的估计(Farquhar et al., 2024 (https://arxiv.org/html/2605.26366#bib.bib10); Malinin & Gales, 2021 (https://arxiv.org/html/2605.26366#bib.bib31))或口头化不确定性(Xiong et al., 2024 (https://arxiv.org/html/2605.26366#bib.bib43); Zhou et al., 2023 (https://arxiv.org/html/2605.26366#bib.bib48))来检测幻觉。相比之下,近期研究表明,与幻觉相关的信号在LLM的内部表示中比在最终输出中编码得更强烈,这促使使用隐藏状态进行幻觉检测(Orgad et al., 2025 (https://arxiv.org/html/2605.26366#bib.bib32); Azaria & Mitchell, 2023 (https://arxiv.org/html/2605.26366#bib.bib2); Chen et al., 2024 (https://arxiv.org/html/2605.26366#bib.bib5); Yin et al., 2024 (https://arxiv.org/html/2605.26366#bib.bib45); Ji et al., 2024 (https://arxiv.org/html/2605.26366#bib.bib19))。然而,大多数现有方法要么以数据无关和任务无关的方式选择预先确定的中间层,要么完全评估每个候选层,后者由于计算成本而不切实际。为了说明为什么层选择具有挑战性,我们在图1 (https://arxiv.org/html/2605.26366#S1.F1) 中可视化了幻觉检测中性能最佳的层,该层始终位于中间层,但其确切位置在不同数据集和模型架构间差异很大。这种变异性促使了本文的核心问题:*我们能否设计一个实用且原则性的标准,自动识别用于幻觉检测的最具信息量的中间层?*
在这项工作中,我们在隐藏状态探针框架内研究该问题,其中预训练的LLM保持冻结状态,并在从所选层提取的表示上训练一个轻量级多层感知器(MLP)用于幻觉检测。我们首先提出了几个假设,解释为何与幻觉相关的信号会出现在中间层。在这些假设的指导下,我们系统地评估了一系列候选层选择标准,包括信息论、基于梯度和几何标准,涵盖多种LLM架构、规模及任务,覆盖问答和摘要幻觉检测基准。实证结果表明,这些标准均无法有效且可靠地识别高性能层。相反,受我们对本征维度在层间演化方式的实证观察启发,我们提出了一种新的选择标准:第一有效本征维度峰值(FEPoID)。跨模型和数据集,我们观察到一个反复出现的模式:本征维度首先在中间层达到峰值,随后在输出层附近达到另一个(通常更高)的峰值。我们假设这两个峰值反映了不同的表示复杂性形式:较早的峰值捕捉了与幻觉检测特别相关的抽象语义信息,而较晚的峰值主要捕捉表面层面的复杂性,使得其对这一任务的信息量较少。我们的实证结果进一步支持了这一点:选择第一个有效ID峰值始终能识别出最优或接近最优的层,使得FEPoID优于前述标准,并比现有基线获得更强的幻觉检测性能。
虽然选择合适的层对于有效的隐藏状态探针至关重要,但幻觉检测的性能也关键依赖于用于表示提取的*token位置*。一个常见的启发式是提取最后一个生成token的表示,其动机是该token能通过自回归属性关注整个上下文。然而,近期研究表明,最后一个token表示对生成序列末尾引入的噪声敏感(Springer et al., 2025 (https://arxiv.org/html/2605.26366#bib.bib42); Lee et al., 2025 (https://arxiv.org/html/2605.26366#bib.bib23)),并且在下游任务上往往表现较差(Orgad et al., 2025 (https://arxiv.org/html/2605.26366#bib.bib32))。这引出了我们工作的第二个研究问题:*我们能否识别一个简单、无需监督的规则,以产生信息量丰富的表示?* 我们通过评估在第一个生成句子的最后一个token处提取的表示来探索这个问题,该句子通过一个简单的基于规则的首句截断(FST)识别。通过大量实验,我们发现,如图1 (https://arxiv.org/html/2605.26366#S1.F1) 所示,在第一个句子末尾提取的表示一致地产生了更强的检测性能。这一发现源于我们的观察:最后生成token的表示常常因序列末尾噪声而退化,这些噪声来自退化重复、不一致延续和语义漂移。此外,FST持续提升了各种幻觉检测基线的性能,表明其有效性并不依赖于任何特定的建模假设,而是通过系统性减少生成后期引入的噪声来实现。
总之,我们的主要贡献有三点:
1. i) 我们首次系统性地评估了先前工作中已显示与下游性能相关的标准,以及用于层选择性微调的标准,这些在实用的层选择中仍未得到充分探索。
2. ii) 我们引入了第一有效本征维度峰值(FEPoID),这是一个简单而高效的标准,能在各种数据集和预训练模型上自动选择接近最优的中间层。
3. iii) 我们重新审视了隐藏状态探针的token位置选择,并表明在第一个生成句子的最后一个token处提取表示一致优于常见的最后一个token启发式。此外,应用FST改善了本工作中考虑的所有幻觉检测基线,表明在减轻生成后期引入的噪声方面具有方法无关的优势。
## 2 相关工作
#### 中间层选择标准
Skean等人(2025 (https://arxiv.org/html/2605.26366#bib.bib40))表明,中间层可以在各种架构和领域中编码丰富的信息。Lee等人(2023 (https://arxiv.org/html/2605.26366#bib.bib24))研究了分布偏移下的选择性微调,并使用监督信号如相对梯度范数(RGN)和信噪比(SNR)来决定更新哪些层;我们重新利用这些标准来选择探针层,并表明它们在我们的设置中表现不佳。Hosseini和Fedorenko(2023 (https://arxiv.org/html/2605.26366#bib.bib16))引入了曲率来量化句子嵌入的逐层平坦化,这已被证明与下游性能相关(Skean et al., 2025 (https://arxiv.org/html/2605.26366#bib.bib40))。Rao等人(2025 (https://arxiv.org/html/2605.26366#bib.bib34))表明,学习到的地理表示的本征维度与下游任务性能正相关,并能捕捉数据中有意义的结构属性。Cheng等人(2025 (https://arxiv.org/html/2605.26366#bib.bib6))表明,接近最大ID的层往往是首先有效迁移到下游任务的层。然而,这些标准尚未被系统地研究用于自动层选择和幻觉检测,而这正是本工作的重点。
表1:假设及相应标准。
#### 中间层尝试
现有利用预训练模型表示进行下游任务的工作通常选择一个固定的中间层(通常是中间层)(Chen et al., 2024 (https://arxiv.org/html/2605.26366#bib.bib5)),或将评估限制在预定义的层子集(例如,中间层和最终层)(Liu et al., 2024 (https://arxiv.org/html/2605.26366#bib.bib30); Ahdritz et al., 2024 (https://arxiv.org/html/2605.26366#bib.bib1); Ji et al., 2024 (https://arxiv.org/html/2605.26366#bib.bib19))。一些先前的工作通过评估更广泛但仍有限的候选集来探索层选择。例如,Azaria和Mitchell(2023 (https://arxiv.org/html/2605.26366#bib.bib2))在一个小网格的层(例如,在32层模型中,层16、20、24、28和最后一层)上进行探针,并观察到某些中间层表现最佳。类似地,Orgad等人(2025 (https://arxiv.org/html/2605.26366#bib.bib32))评估了稀疏层集(层1、6、11、...、31)上的幻觉检测,并发现中间范围内的层往往信息量更大。尽管这些方法可以优于单独的最后一层,它们也突显了缺乏一种实用且原则性的方式来可靠地识别强中间层。
#### 提取的Token位置
一个广泛使用的启发式是提取*最后一个生成token*的隐藏状态,其动机是自回归属性允许它关注所有前面的上下文,但这种表示对序列末尾噪声敏感(Springer et al., 2025 (https://arxiv.org/html/2605.26366#bib.bib42); Lee et al., 2025 (https://arxiv.org/html/2605.26366#bib.bib23))。另一种替代方案是从最后一个提示token提取特征;然而,仅解码器LLM的单向性质阻止该表示反映采样输出之间的正确性差异(Slobodkin et al., 2023 (https://arxiv.org/html/2605.26366#bib.bib41))。另一个选项是对跨token位置的表示进行平均,但先前的研究(Li et al., 2025 (https://arxiv.org/html/2605.26366#bib.bib26); Zhang et al., 2025 (https://arxiv.org/html/2605.26366#bib.bib47))表明,在因果注意力下,平均池化的效果不如最后一个token特征,因为前面的token无法关注未来的token。Orgad等人(2025 (https://arxiv.org/html/2605.26366#bib.bib32))评估了多个token位置——包括最后一个生成token、最后一个提示token和“确切答案”token——并发现,在隐藏状态探针框架内,确切答案位置的表示取得了最佳下游性能。这表明与真实性相关的信息更集中在与答案对齐的token位置上。然而,定位“确切答案”token需要以真实答案作为参考,这是不切实际的,因为它是一个先有鸡还是先有蛋的问题。此外,对于开放式场景,识别“确切答案”token通常依赖于辅助LLM,这会带来额外的计算开销。
## 3 层选择标准
我们寻求能够捕捉中间层表示与下游任务性能之间关系的标准。我们的选择受到几个关于中间层表示为何能优于最终层表示的假设的指导:
1. (i) 中间层编码了丰富多样的语义信息,有利于探针任务。
2. (ii) 某些中间层捕捉了任务相关的特征,有助于有效的探针训练。
3. (iii) 中间层在保留任务相关结构的同时压缩了冗余信息。
4. (iv) 中间层表现出有意义的统计结构,具有较高的有效信息容量。
受这些假设的启发,我们引入了一组层选择标准,这些标准构成了高效和自动层选择的基础,并分为以下三个家族。表1 (https://arxiv.org/html/2605.26366#S2.T1)总结了这些假设与层选择标准之间的对应关系。
### 3.1 符号表示
对于具有层索引 l∈{1,...,L} 的LLM,令 H_i^{(l)}∈R^{T×d} 表示在层 l 处第 i 个输入样本 x_i 的逐token表示,其中 T 是输入中的token数量,d 是表示维度。我们记 z_{t,i}^{(l)} = H_{t,i}^{(l)}∈R^d 为在层 l 和token位置 t 处提取的第 i 个样本的表示。收集整个数据集的表示,我们形成矩阵 Z_t^{(l)}∈R^{N×d},其中每一行对应一个样本在层 l 和位置 t 处的表示,N 表示样本数量。为简化符号,我们省略token位置索引 t,并在需要时在上下文中指定所选的token位置。对于表示提取,LLM的输入由连接...组成相似文章
重访最大池化网络:分析语义概率在幻觉检测多重实例学习中的作用
本文分析了大语言模型中的幻觉检测问题,提出了一种最大池化方法,该方法通过消除昂贵的语义一致性计算来提高效率,同时保持具有竞争力的性能。
FLaG:细粒度潜在分组用于幻觉检测
FLaG 是一个轻量级的幻觉检测框架,适用于大语言模型,通过潜在证据组和基于能量的路由对正确性进行建模,在多个基准测试中实现了 SOTA 性能。
将幻觉视为异常:通过概率电路进行动态干预
本文提出了 PCNet,这是一种在大型语言模型(LLM)残差流上训练为可计算密度估计器的概率电路,用于将幻觉检测为几何异常。同时,本文还引入了 PC-LDCD,一种仅在生成幻觉 token 时才进行干预的动态修正方法,实现了近乎完美的检测率并降低了错误修正率。
关注未见质量:通过软混合字母估计揭示 LLM 幻觉
研究者提出 SHADE,一种混合估计器,在仅能获取少量黑盒样本时,融合 Good-Turing 覆盖率与图谱线索,量化语义不确定性并检测大模型幻觉。
PARALLAX: 区分真实幻觉检测与基准构建伪影
本文揭示了LLM幻觉检测领域报道的许多进展实际上源于基准构建伪影,其中真实答案被嵌入到提示中,使得简单的文本相似度基线方法能够获得近乎完美的分数。通过大规模受控评估,作者证明,在适当控制下,大多数方法的表现接近随机水平,除了对上层隐藏状态的监督探针(如SAPLMA)以及他们提出的DRIFT。