FLaG:细粒度潜在分组用于幻觉检测
摘要
FLaG 是一个轻量级的幻觉检测框架,适用于大语言模型,通过潜在证据组和基于能量的路由对正确性进行建模,在多个基准测试中实现了 SOTA 性能。
arXiv:2606.00301v1 公告类型:新
摘要:大语言模型(LLMs)中的幻觉源于异构的失败机制,这使得任何单一的全局不确定性分数都难以实现可靠的检测。在这项工作中,我们将幻觉检测形式化为一个机制感知的证据聚合问题,其中多种表示级和词元级信号必须在多个潜在解释下进行解读。我们提出了 FLaG,一个轻量级的幻觉检测框架,通过一组潜在证据组对正确性进行建模。每个实例通过基于能量的路由机制与多个组软关联,并且组条件可靠性信号通过原则性的对数边缘聚合进行组合。这种设计使 FLaG 能够捕捉异构的幻觉模式,同时对决策阈值和评估指标保持不变性。该框架作为冻结模型的头部运行,不需要对底层语言模型进行修改,并且计算开销极小。我们进一步提供了一个理论视角,将 FLaG 与异构错误机制下的最优证据聚合联系起来,表明贝叶斯最优检验统计量必然采用对数边缘形式,而 FLaG 构成了一种可处理的近似,具有可控的误差界。在多个基准测试和 LLM 骨干网络上的大量实验表明,FLaG 持续取得 SOTA 性能,同时在数据集和模型之间表现出稳健的迁移能力,并在有限监督下保持有效。
查看缓存全文
缓存时间: 2026/06/02 15:40
# FLaG:面向幻觉检测的细粒度潜在分组 来源:https://arxiv.org/html/2606.00301 Liyao Li¹, Zhiqing Xiao¹, Muzhi Zhu¹, Jiaqi Hu¹, Zhanming Shen¹, Xiaomeng Hu¹, Sean Du², 和 Haobo Wang¹(通讯作者:[email protected]) ¹浙江大学,浙江杭州,中国 ²南洋理工大学,新加坡,新加坡 (2026) ###### 摘要 大型语言模型(LLM)中的幻觉源于多种不同的失效机制,这使得任何单一的全局不确定性分数都难以进行可靠检测。在这项工作中,我们将幻觉检测形式化为一个机制感知的证据聚合问题,其中多种表示层和词元层信号需要在多个潜在解释下进行解读。我们提出了 **FLaG**,一个轻量级的幻觉检测框架,它通过一组潜在证据组来建模正确性。每个实例通过一种基于能量的路由机制与多个组软关联,并且组条件可靠性信号通过一种原则性的对数边缘聚合方式进行组合。这种设计使 FLaG 能够捕捉异质的幻觉模式,同时对决策阈值和评估指标保持不敏感。该框架作为一个冻结模型头部运行,无需修改底层语言模型,并且计算开销极小。我们进一步提供了理论视角,将 FLaG 与异质错误机制下的最优证据聚合联系起来,表明贝叶斯最优检验统计量必然具有对数边缘形式,而 FLaG 构成了一个具有可控误差界的可处理近似。跨多个基准测试和 LLM 主干网络的广泛实验表明,FLaG 始终达到最先进的性能,同时在数据集和模型之间展现出鲁棒的迁移能力,并且在监督有限的情况下仍然有效。 大型语言模型,幻觉,潜在分组 ††版权:ACM授权 ††出版年份:2026 ††DOI:10.1145/3770855.3818137 ††会议:第32届ACM SIGKDD知识发现与数据挖掘会议;2026年8月9日至13日,韩国济州岛 ††ISBN:979-8-4007-2258-5/2026/08 ††CCS:安全与隐私 信任框架 ††CCS:计算方法 自然语言处理 ## 1. 引言 大型语言模型(LLM)在自然语言理解和生成方面展现出了卓越的能力(Zhao 等人,2023)。尽管取得了这些进展,LLM 仍容易出现幻觉,即输出流畅且看似连贯,但事实错误或缺乏依据。这种幻觉响应在医学、法律和科学决策等高风险应用中带来了严重风险,因为这些场景对可靠性要求极高(Zhang 等人,2023;Pal 等人,2023)。因此,使 LLM 能够可靠地评估自身生成内容的真实性,已成为构建可信赖 LLM 系统的核心挑战。 幻觉检测的一个核心挑战在于,幻觉并非源于单一、同质的故障模式。经验上,幻觉输出在表示层信号、词元级概率轨迹和生成动态上呈现出多样化的模式。有些故障表现为与提示的语义漂移,有些表现为局部不一致的概率分配,还有一些表现为过度自信但在全局上不合理的延续。因此,没有任何单一的不确定性信号或全局评分规则能够在所有数据集、模型和生成场景下可靠地捕捉所有幻觉行为。然而,大多数现有的检测器(Burns 等人,2023;Azaria 和 Mitchell,2023;Marks 和 Tegmark,2024;Yin 等人,2024;Du 等人,2024;Chen 等人,2024;Li 等人,2024;Kossen 等人,2024)都隐含地假设了一个同质的幻觉概念,将所有可用证据压缩成一个单一分数。虽然这些方法在特定设置下可能有效,但它们难以泛化(图1)。在实践中,依赖单一不确定性视图或固定决策边界的检测器往往过度拟合于特定的幻觉类型,导致在设置变化时性能脆弱。 在这项工作中,我们采取不同的视角。我们不将幻觉视为单一现象,而是将其视为异质潜在失效机制的结果。在这种观点下,每个实例可能对其证据生成方式有多个竞争性的解释,而可靠的检测需要对这些替代方案进行推理。关键在于,这一视角表明幻觉检测不仅仅是一个分类问题,而是一个在潜在机制不确定性下的证据聚合问题。我们通过将幻觉检测形式化为学习一个实值可靠性分数来具体化这一直觉,该分数聚合了异质证据源,同时对决策阈值和评估指标保持不敏感。我们的公式自然引出了一个机制感知的评分规则,其中证据首先在多个潜在机制下被解释,然后以概率一致的方式进行聚合。 基于这一公式,我们提出了 **FLaG**(细粒度潜在分组),一个明确建模潜在证据组的轻量级幻觉检测框架。FLaG 从表示几何和概率生成轨迹中提取互补证据,将它们投影到一个共享的潜在空间,并将每个实例与多个潜在组软关联起来。每个组提供一个组条件可靠性信号,这些信号通过一种原则性的对数证据聚合规则进行组合。重要的是,这种聚合并不承诺于单一解释,而是对竞争性的潜在机制进行边缘化,从而使检测器能够自适应地捕捉多样化的幻觉模式。FLaG 被设计为一个冻结模型头部,无需修改底层语言模型,并且计算开销极小。该框架通过一种基于排序的目标函数自然支持监督学习、弱监督学习和半监督学习,该目标函数直接优化相对正确性而非绝对标签。 (a)普通分类 (b)FLaG 图1. 普通方法与 FLaG 的分数分布对比。前者是对最后一个词元嵌入训练分类器。 除了实证性能,我们还提供了理论视角,将 FLaG 与异质错误机制下的最优证据聚合联系起来。我们证明,在一般的机制混合模型下,贝叶斯最优检验统计量必然采用机制条件证据的对数边缘形式。FLaG 可被视为该最优统计量的一个可学习的、可处理的近似,且随着潜在机制数量的增加,近似误差界得到改善。最后,我们在多个幻觉基准测试和语言模型主干网络上评估了 FLaG。结果表明,在全监督和半监督设置下,FLaG 均比强基线方法持续取得最先进的性能,并且在数据集和模型之间展现出鲁棒的迁移能力。这些发现共同支持了本文的核心主张:幻觉检测受益于对异质潜在失效机制进行显式建模,而不是将所有证据压缩成一个统一的分类器。 • 我们将幻觉检测形式化为异质潜在故障模式下的机制感知证据聚合,在一个统一的真实性评分框架内整合表示层和词元层信号。 • 我们提出了 **FLaG**,一个轻量级的冻结模型检测头部,它软推断潜在证据组,并通过一种原则性的对数边缘聚合方式组合组条件信号,从而产生阈值不敏感的排序。 • 我们提供了学习方法和理论:一个基于排序的目标函数,自然扩展到弱监督和半监督设置;以及一个理论分析,将 FLaG 与贝叶斯最优对数边缘统计量联系起来,并具有可控的近似误差界。 ## 2. 相关工作 ### 2.1. 幻觉检测 幻觉检测已成为一个重要的研究课题,因为它与在现实应用中部署 LLM 的潜在风险密切相关(Huang 等人,2023)。大量工作将幻觉检测视为不确定性估计问题,并设计了各种不确定性评分函数。基于逻辑的方法(Ren 等人,2022;Malinin 和 Gales,2021;Kuhn 等人,2023)直接利用词元级概率来量化不确定性。而口头化方法(Lin 等人,2022a;Xiong 等人,2024)则提示 LLM 明确生成基于自然语言的不确定性信号。基于一致性的方法(Manakul 等人,2023;Chen 等人,2024)利用同一 LLM 多次并行采样中响应的不一致性。更近期的研究假设与幻觉相关的信号隐式编码在模型的隐藏状态中,并训练分类器来提取这些信号(Azaria 和 Mitchell,2023;Marks 和 Tegmark,2024)。其中,HaloScope(Du 等人,2024)通过嵌入分解识别与幻觉相关的子空间,而 TSV(Park 等人,2025)学习一个引导向量来重构内部表示。最近的工作(Su 等人,2025)将幻觉检测形式化为一个推理任务,并应用强化学习来训练 LLM,从长上下文中定位特定的幻觉跨度。相比之下,FLaG 将幻觉归因于异质失效机制的混合,并通过组感知学习自动发现这些潜在机制。 ### 2.2. 混合专家 混合专家(MoE)模型已被广泛研究(Jacobs 等人,1991;Shazeer 等人,2017),作为一种通过将复杂分布分解为一组专门组件来建模数据异质性的原则性框架。在现代深度学习系统中,MoE 已被广泛采用以提高模型容量和效率,特别是在 LLM 中通过稀疏专家路由(Fedus 等人,2022)。除了作为一种可扩展的结构,MoE 还被探索为一种机制感知的建模范式。在此背景下,不同的专家专门处理不同的输入模式、潜在因素或故障模式(Jordan 和 Jacobs,1994)。例如,优先网络(PNs)允许输入被软分配到多个专家,并聚合专家特定的预测(Malinin 和 Gales,2018)。在我们的论文中,一个专门设计的 MoE 风格模块被用作轻量级的检测框架,而不是作为生成架构。 图2. FLaG 概览。对于实例 \(\mathbf{x}=(\mathbf{q},\mathbf{a})\),我们从冻结的 LLM 中提取几何和概率轨迹证据,将其融合为 \(\mathbf{r}(\mathbf{x})\),将 \(\mathbf{r}(\mathbf{x})\) 软路由到由 \(K\) 个原型定义的潜在组,并通过组级分数的对数边缘聚合得到最终的真实性分数 \(s(\mathbf{x})\)。 ## 3. 方法论 ### 3.1. 问题形式化 设 \(\mathbf{q}=(q_1,\dots,q_n)\) 表示用户提示,\(\mathbf{a}=(a_1,\dots,a_m)\) 表示模型生成的输出。为简单起见,我们在检测中定义一个统一的实例为 \(\mathbf{x}=(\mathbf{q},\mathbf{a}) \in \mathcal{X}\)。幻觉检测的任务旨在识别在指定评估协议下输出 \(\mathbf{a}\) 是否真实。该过程可以形式化为学习一个二分类器 \(G: \mathcal{X} \to \{0,1\}\),其中 \(G(\mathbf{x})=1\) 表示输出真实,而 \(0\) 表示幻觉输出。在本文中,我们考虑一个通用的学习设置,其中训练集由标记和未标记实例混合组成。给定一个训练集 \(\mathcal{D}\),它可以分解为 \(\mathcal{D} = \mathcal{D}_\ell \cup \mathcal{D}_u\),其中 \(\mathcal{D}_\ell = \{(\mathbf{x}, y)\}\) 包含有监督标签 \(y \in \{0,1\}\) 的实例,而 \(\mathcal{D}_u = \{\mathbf{x}\}\) 包含未标记实例。全监督设置对应 \(\mathcal{D}_u = \varnothing\)。 ### 3.2. 多视图证据表示 给定一个实例 \(\mathbf{x}=(\mathbf{q},\mathbf{a})\),我们的目标是提取能够捕捉与真实性(或幻觉)相关证据的表示。在先前的工作中,分类器的输入特征通常依赖于单个全局表示,例如来自最后一层的最后一个词元嵌入(Park 等人,2025)。然而,幻觉的证据通常是异质的,分布在生成过程的不同遥测信号中(Min 等人,2026)。因此,我们考虑聚合来自以下信号源的证据: #### 3.2.1. 作为证据信号的潜在几何 在条件生成 \(\mathbf{q} \to \mathbf{a}\) 之后,我们将拼接的词元序列 \(\mathbf{q} \oplus \mathbf{a}\) 重新输入冻结的 LLM。然后,我们计算提示和输出跨度上的平均池化隐藏状态,分别记为 \(\bar{\mathbf{h}}_{\mathbf{q}}\) 和 \(\bar{\mathbf{h}}_{\mathbf{a}}\)。组合的语义几何证据为: \[ \bm{\psi}(\mathbf{x}) = [\mathbf{h}_{\mathrm{end}} ; \bar{\mathbf{h}}_{\mathbf{a}} ; \bar{\mathbf{h}}_{\mathbf{a}} - \bar{\mathbf{h}}_{\mathbf{q}}] \in \mathbb{R}^{3d}, \tag{1} \] 其中 \(\mathbf{h}_{\mathrm{end}}\) 表示最后一个非填充词元的隐藏状态。我们从潜在几何的角度解释这些隐藏状态。
相似文章
RAGognizer:通过检测头集成实现幻觉感知微调
RAGognizer 提出了一种幻觉感知微调方法,该方法将轻量级检测头集成到大语言模型(LLMs)中,以实现语言建模与幻觉检测的联合优化,适用于 RAG 系统。论文介绍了 RAGognize,一个包含自然发生的闭域幻觉及其词元级标注的数据集,并展示了在降低幻觉率的同时,实现了最先进的幻觉检测性能,且不损害语言质量。
幻觉检测中的自动层选择
本文提出了用于大语言模型幻觉检测的自动层选择方法,并引入了固有维度首个有效峰值(FEPoID),这是一种无需训练的标准,能够一致地识别出最优中间层,优于现有启发式方法。
关注未见质量:通过软混合字母估计揭示 LLM 幻觉
研究者提出 SHADE,一种混合估计器,在仅能获取少量黑盒样本时,融合 Good-Turing 覆盖率与图谱线索,量化语义不确定性并检测大模型幻觉。
从令牌到语义:利用互补信号在黑盒LLMs中检测幻觉
本文提出通过结合语义熵和令牌级不确定性信号来检测黑盒LLMs中的幻觉的方法,评估了TopK、CoCoA、Gated和Stacked等技术在多个基准测试中的表现,发现没有单一方法普遍最强,但Stacked通常表现最佳。
HalluSAE:利用稀疏自编码器检测大型语言模型中的幻觉
北京航空航天大学等机构的研究人员提出了HalluSAE,这是一个结合稀疏自编码器与相变理论的框架。该框架通过将生成过程建模为穿越势能地形的轨迹,来检测大型语言模型(LLM)中的幻觉,并精准定位发生事实性错误的关键过渡区域。