重访最大池化网络:分析语义概率在幻觉检测多重实例学习中的作用

arXiv cs.CL 论文

摘要

本文分析了大语言模型中的幻觉检测问题,提出了一种最大池化方法,该方法通过消除昂贵的语义一致性计算来提高效率,同时保持具有竞争力的性能。

arXiv:2605.08863v1 公告类型:新论文 摘要:幻觉检测对于提高大语言模型(LLMs)的可靠性变得越来越重要。最近,诸如 HaMI 等混合方法通过多重实例学习(MIL)将语义一致性与内部模型状态相结合,取得了最先进的性能。然而,由于重复采样和昂贵的语义相似性计算,这些方法会产生巨大的计算开销。在本研究中,我们首先从决策边距的角度对 HaMI 进行了理论分析,揭示了使用语义一致性缩放内部状态会导致决策边距扩大。受这一见解的启发,我们从扩大边距的角度重新审视了经典的句子分类模型,通过最大池化聚合词元级特征,并使用轻量级 MLP 直接估计句子得分。我们的方法无需进行语义一致性计算,通过自适应聚合内部特征表示,在保持与最先进基线具有竞争力性能的同时,实现了显著的效率提升。
查看原文
查看缓存全文

缓存时间: 2026/05/12 07:04

# 重访最大池化网络:分析多重实例学习中语义概率在幻觉检测中的作用

来源: https://arxiv.org/html/2605.08863
Issei Satosato@g\.ecc\.u\-tokyo\.ac\.jp
东京大学计算机科学系

###### 摘要

幻觉检测对于提高大型语言模型(LLMs)的可靠性变得越来越重要。最近,诸如 HaMI 等混合方法通过多重实例学习(MIL)将语义一致性内部模型状态相结合,取得了最先进的性能。然而,由于需要重复采样和昂贵的语义相似度计算,这些方法带来了巨大的计算开销。在本工作中,我们首先从决策边距的角度对 HaMI 进行了理论分析,揭示了利用语义一致性扩展内部状态可以增大决策边距。受这一见解的启发,我们从边距扩大的角度重新审视经典的句子分类模型,通过最大池化聚合 token 级特征,并使用轻量级 MLP 直接估计句子得分。我们的方法无需进行语义一致性计算,在保持与最先进基线具有竞争力性能的同时,通过自适应聚合内部特征表示,实现了显著的效率提升。

## 1 引言

尽管大型语言模型(LLMs)表现出强大的性能,但幻觉问题阻碍了它们的实际部署 \[11 (https://arxiv.org/html/2605.08863#bib.bib34),13 (https://arxiv.org/html/2605.08863#bib.bib11)\]。这个问题在医疗等高利害领域尤为关键,错误的建议可能导致严重后果。 prior work 表明,模型可能会生成上下文不一致或错误的信息 \[19 (https://arxiv.org/html/2605.08863#bib.bib13)\],甚至可能通过提示暴露敏感的训练数据 \[7 (https://arxiv.org/html/2605.08863#bib.bib12)\]。因此,确保输出可靠性至关重要,这使得幻觉检测成为一个关键挑战。

现有的幻觉检测方法主要分为三类。首先,基于不确定性的方法从模型概率或多个采样响应的语义多样性中估计置信度,例如考虑语义等效性的语义熵(Semantic Entropy)\[9 (https://arxiv.org/html/2605.08863#bib.bib7)\]。其次,基于检索的方法查询外部知识源或 LLMs 以验证事实一致性 \[28 (https://arxiv.org/html/2605.08863#bib.bib4)\]。第三,基于表示的方法利用内部隐藏状态 \[3 (https://arxiv.org/html/2605.08863#bib.bib35),10 (https://arxiv.org/html/2605.08863#bib.bib5)\],通常是在固定的 token 位置(如最后一个 token)上训练分类器 \[25 (https://arxiv.org/html/2605.08863#bib.bib6)\]。

近期的一种混合方法 HaMI \[23 (https://arxiv.org/html/2605.08863#bib.bib2)\] 将幻觉检测 formulate 为一个多重实例学习(MIL)问题,并通过自适应 token 选择和语义-概率加权来提高鲁棒性。HaMI 的一个主要局限性在于其依赖外部模型来估计语义不确定性,这引入了大量的计算开销和延迟。频繁的 API 调用不仅增加了经济成本,还引发了隐私问题,并阻碍了实时部署。因此,在实际的大规模或交互式场景中,最小化推理延迟至关重要。

尽管 HaMI 在经验上取得了成功,但语义概率加权为何能提高检测性能尚不清楚。为了更好地理解这个问题,我们首先从理论角度分析了 HaMI 的机制。我们的分析表明,通过语义不确定性加权有效地增加了 logits 级别的分类边距。受这一观察的启发,我们提出了一种完全基于模型内部状态的检测框架。我们的方法不是基于外部不确定性信号对单个 token 进行缩放,而是通过对 token 级特征的有结构聚合来扩大边距,从而更有效地捕获句子级表示。

具体而言,我们重新审视了经典的句子分类架构,引入了一个轻量级的特征变换层,随后进行特征级最大池化 \[16 (https://arxiv.org/html/2605.08863#bib.bib26)\]。这一设计的动机在于,幻觉相关的信号可能在 token 之间是稀疏的,并且可以通过最大池化更好地保留。与依赖外部不确定性信号不同,我们的方法如表1所示 (https://arxiv.org/html/2605.08863#S1.T1),直接作用于内部隐藏状态。Token 级表示首先通过 MLP 进行变换,随后通过特征级最大池化聚合跨 token 的最具信息量的信号。这一过程在保持高计算效率的同时,实现了忠实响应与幻觉响应之间更清晰的分离。

我们的贡献总结如下:

- • 我们提供了 HaMI 的理论分析,表明语义概率加权通过增大分类边距来提高性能(定理 1 (https://arxiv.org/html/2605.08863#Thmtheorem1))。
- • 我们从理论角度分析了基于最大池化的网络,重点关注其对边距和泛化的影响(定理 2 (https://arxiv.org/html/2605.08863#Thmtheorem2) 和 3 (https://arxiv.org/html/2605.08863#Thmtheorem3),以及命题 1 (https://arxiv.org/html/2605.08863#Thmproposition1))。
- • 我们提出了一个完全自包含的检测框架,在性能相当的情况下显著提高了速度(第 5.2 节 (https://arxiv.org/html/2605.08863#S5.SS2) 和 5.3 节 (https://arxiv.org/html/2605.08863#S5.SS3))。

表 1:HaMI 与本研究之间的架构设计比较。

## 2 预备知识

### 2.1 问题设置

幻觉是指响应与事实现实相矛盾的现象,通常发生在 LLMs 缺乏足够的内部知识或未能正确使用其内部知识时 \[29 (https://arxiv.org/html/2605.08863#bib.bib10)\]。令 $D=\{(q_i, a_i)\}_{i=1}^N$ 表示一个问答数据集,其中 $q_i$ 和 $a_i$ 分别代表一个问题及其真实答案。给定一个问题 $q$,LLM 产生一个响应序列 $\mathcal{A}=(t_1, t_2, ..., t_n)$。对于每个生成的 token $t_i$,我们从中间层提取隐藏表示 $h_i \in \mathbb{R}^d$。生成响应 $\mathcal{A}$ 的事实正确性由外部评估 LLM 进行评估,该评估器分配一个二元标签 $y \in \{-1, 1\}$,指示响应是否在事实上正确。

### 2.2 语义概率

遵循语义熵框架 \[9 (https://arxiv.org/html/2605.08863#bib.bib7)\],我们通过分析每个问题 $q$ 的随机样本 $G=\{\mathcal{A}_1, ..., \mathcal{A}_K\}$ 的语义多样性来量化不确定性。

#### 语义聚类

为了将语言多样但语义等效的响应分组,我们使用外部 LLM 评估关系 $R_{ij} := R(\mathcal{A}_i, \mathcal{A}_j) \in \{E, C, N\}$(蕴含、矛盾、中立)。我们将等效定义为:
$\mathcal{A}_i \equiv \mathcal{A}_j \iff (R_{ij}, R_{ji}) \in \{(E, E), (E, N), (N, E)\}$
集合 $G$ 因此被划分为语义簇 $\{\mathcal{C}_1, ..., \mathcal{C}_s\}$。

#### 不确定性指标

簇的概率是其序列似然的归一化总和:
$P_{\mathcal{C}} = \frac{\sum_{\mathcal{A} \in \mathcal{C}} P(\mathcal{A} \mid q)}{\sum_{k=1}^{K} P(\mathcal{A}_k \mid q)}$。
基于此,语义概率 \[23 (https://arxiv.org/html/2605.08863#bib.bib2)\] 定义为:
$P_{\text{sem}}^{(i)} = P_{\mathcal{C}^{(i)}}$,其中 $\mathcal{C}^{(i)}$ 是包含 $\mathcal{A}_i$ 的簇。

### 2.3 通过多重实例学习的幻觉检测

我们在多重实例学习(MIL)框架内 formulate 幻觉检测问题 \[6 (https://arxiv.org/html/2605.08863#bib.bib19),12 (https://arxiv.org/html/2605.08863#bib.bib3),20 (https://arxiv.org/html/2605.08863#bib.bib32)\]。一个响应被视为一个包 $B=\{\mathbf{h}_{B,1}, ..., \mathbf{h}_{B,T_B}\}$,带有标签 $y_B$。令 $\mathcal{S}$ 为数据集中的包集合。我们将正样本和负样本的子集定义如下:
$\mathcal{S}_{pos} = \{B \in \mathcal{S} \mid y_B = 1\}$, $\mathcal{S}_{neg} = \{B \in \mathcal{S} \mid y_B = -1\}$
为了确保置换不变性,评分函数 $S(B)$ 必须是对称的。

#### 聚合策略

1. **基于实例的聚合**:每个 token $\mathbf{h}_{B,i}$ 首先映射到标量 $s_{B,i} = f_1(\mathbf{h}_{B,i})$。然后响应级得分通过池化算子 $g_1$ 获得:
   $S(B) = g_1(\{f_1(\mathbf{h}_{B,i})\}_{i=1}^{T_B})$
2. **基于嵌入的聚合**:我们首先使用池化算子 $g_2$ 将 token 级隐藏状态聚合成包级嵌入。最终得分通过评分函数 $f_2$ 计算为:
   $S(B) = f_2(g_2(\{\mathbf{h}_{B,i}\}_{i=1}^{T_B}))$。

## 3 HaMI 分析 \[23 (https://arxiv.org/html/2605.08863#bib.bib2)\]

### 3.1 HaMI 架构公式化

HaMI 架构如图 1 所示 (https://arxiv.org/html/2605.08863#A1.F1)。令一个包表示为 $B=\{\mathbf{h}_{B,i}\}_{i=1}^{T_B}$,其中 $\mathbf{h}_{B,i} \in \mathbb{R}^d$。每个实例通过神经网络 $f$ 变换为 logit $z_{B,i}$:
$z_{B,i} = f(\mathbf{h}_{B,i}) = w^\top \mathrm{ReLU}(\mathrm{BN}(\mathbf{x}_{B,i} + \mathbf{b}_1)) + b_2$,
其中 $\mathbf{x}_{B,i} = \mathbf{W}\mathbf{h}_{B,i}$,$\mathrm{BN}(\cdot)$ 表示批归一化(Batch Normalization),$\mathbf{b}_1, \mathbf{b}_2$ 是偏置项。

在 HaMI 中,实例表示由语义概率 $P_{\mathrm{sem}}^B$ 缩放:
$\tilde{\mathbf{h}}_{B,i} = (1 + \lambda P_{\mathrm{sem}}^B) \mathbf{h}_{B,i}$,
其中 $\lambda > 0$。我们将缩放后的 logit 表示为 $\tilde{z}_{B,i} = f(\tilde{\mathbf{h}}_{B,i})$。包级得分 $S(B)$ 是包中前 $K_B$ 个实例得分的平均值。

#### 边距公式化

我们定义包数据集 $\mathcal{S}$ 上的 logit 空间边距:
$M_{\text{hami}}(\lambda) = \frac{1}{\|\mathcal{S}\|} \sum_{B \in \mathcal{S}} y_B \tilde{Z}_B, \quad \tilde{Z}_B = \frac{1}{k} \sum_{i \in \mathcal{K}_B} \tilde{z}_{B,i}$。

我们使用 logit 空间边距而不是 sigmoid 概率,因为边距分析关注的是有符号的决策边界距离。虽然 sigmoid 是单调的,但它不保持距离。对于大的 $\|z\|$,$z$ 的变化会导致 $\sigma(z)$ 的变化微乎其微。因此,概率空间可能会低估边距。我们在 sigmoid 非线性压缩之前在 logit 空间中评估边距。

### 3.2 通过对称缩放的边距增强

我们分析缩放因子 $p_B = \lambda P_{\mathrm{sem}}^B$ 的效果。前向传递中带有缩放的归一化前特征是 $(1 + p_B) \mathbf{x}_{B,i} + \mathbf{b}_1$。在推理期间,运行均值 $\mu_j$ 和标准差 $\sigma_j$ 是固定的。BN 输出的第 $j$ 维分解为:

$$
\begin{aligned}
\mathrm{BN}((1 + p_B) \mathbf{x}_{B,i} + \mathbf{b}_1)_j &= \gamma_j \frac{(1 + p_B) x_{B,i,j} + b_{1,j} - \mu_j}{\sigma_j} + \beta_j \\
&= \mathrm{BN}(\mathbf{x}_{B,i} + \mathbf{b}_1)_j + p_B \gamma_j \frac{x_{B,i,j}}{\sigma_j}.
\end{aligned}
$$

令 $\mathcal{A}_{B,i}$ 表示 ReLU 激活严格为正的活动索引集。假设活动集在缩放 $p_B$ 下保持不变,精确的缩放 logit $\tilde{z}_{B,i}$ 变为:

$$
\begin{aligned}
\tilde{z}_{B,i} &= \sum_{j \in \mathcal{A}_{B,i}} w_j \left( \mathrm{BN}(\mathbf{x}_{B,i} + \mathbf{b}_1)_j + p_B \gamma_j \frac{x_{B,i,j}}{\sigma_j} \right) + b_2 \\
&= z_{B,i} - p_B C(\mathbf{x}_{B,i}),
\end{aligned}
$$

其中 $C(\mathbf{x}_{B,i}) = -\frac{\partial \tilde{z}_{B,i}}{\partial p_B} = -\sum_{j \in \mathcal{A}_{B,i}} w_j \gamma_j \frac{x_{B,i,j}}{\sigma_j}$。

为了清晰起见,我们假设局部不变的活动集来展示推导过程。然而,利用 ReLU 网络是连续分段仿射(CPWA)映射的性质 \[2 (https://arxiv.org/html/2605.08863#bib.bib30)\],我们可以通过路径积分推广这种敏感性分析。这种推广确保我们的公式 $Z_B(p_B) = Z_B(0) - p_B \bar{C}_B^{\mathrm{int}}$ 即使在激活模式动态变化下也保持数学上的严谨性,如附录 C (https://arxiv.org/html/2605.08863#A3) 中所推导。

经验上,我们观察到以下三个属性(附录 G (https://arxiv.org/html/2605.08863#A7)):

1. $\bar{C}_B > 0$,其中 $\bar{C}_B = \frac{1}{k} \sum_{i \in \mathcal{K}_B} C(\mathbf{x}_{B,i})$
2. $\mathbb{E}_{neg}[P_{\mathrm{sem}}^B] > \mathbb{E}_{pos}[P_{\mathrm{sem}}^B]$
3. $\mathbb{E}_{neg}[\bar{C}_B] > \mathbb{E}_{pos}[\bar{C}_B]$

相似文章

幻觉检测中的自动层选择

arXiv cs.AI

本文提出了用于大语言模型幻觉检测的自动层选择方法,并引入了固有维度首个有效峰值(FEPoID),这是一种无需训练的标准,能够一致地识别出最优中间层,优于现有启发式方法。

将幻觉视为异常:通过概率电路进行动态干预

arXiv cs.CL

本文提出了 PCNet,这是一种在大型语言模型(LLM)残差流上训练为可计算密度估计器的概率电路,用于将幻觉检测为几何异常。同时,本文还引入了 PC-LDCD,一种仅在生成幻觉 token 时才进行干预的动态修正方法,实现了近乎完美的检测率并降低了错误修正率。

HalluSAE:利用稀疏自编码器检测大型语言模型中的幻觉

arXiv cs.CL

北京航空航天大学等机构的研究人员提出了HalluSAE,这是一个结合稀疏自编码器与相变理论的框架。该框架通过将生成过程建模为穿越势能地形的轨迹,来检测大型语言模型(LLM)中的幻觉,并精准定位发生事实性错误的关键过渡区域。