ASK-NN:一种检测自然语言中分布漂移的非对称最近邻测试
摘要
ASK-NN 是一种非对称最近邻测试,用于检测参考样本与查询样本之间的分布漂移,可应用于LLM幻觉检测和人工文本检测。该方法计算高效,具有理论保证,并且在合成和真实世界基准测试中与基线方法相比表现出竞争力。
arXiv:2607.15607v1 公告类型:新
摘要:LLM生成输出中的幻觉和人工文本通常表现为提示与响应隐藏状态分布之间的分布偏差。由于提示或检索到的上下文通常作为参考样本,响应作为查询样本,且两者长度差异显著,这种非对称性促使我们采用对两个样本区别对待的变化检验统计量。我们考虑了一种基于有向k-最近邻图的非对称双样本测试ASK-NN。我们的统计量计算在合并样本中其最近邻也是参考点的参考点数量。在置换零假设下,它具有精确的有限样本条件均值和方差;我们进一步建立了在固定备择假设下的渐近正态性和一致性。ASK-NN计算高效且易于实现。实验表明,在合成基准测试、人工文本检测以及基于token级隐藏状态的LLM幻觉检测中,它与基于核和图的基线方法具有竞争力。
查看缓存全文
缓存时间: 2026/07/20 09:30
# ASK-NN: 一种检测自然语言分布漂移的非对称最近邻检验
来源:https://arxiv.org/html/2607.15607
###### 摘要
大规模语言模型生成输出中的幻觉与人工文本通常表现为提示与响应隐藏状态分布之间的分布偏差。由于提示或检索到的上下文通常作为参考样本,响应作为查询样本,且两者长度差异显著,这种不对称性促使我们采用对两个样本区别对待的变化检验统计量。我们考虑一种基于有向k近邻图的非对称双样本检验ASK-NN。该统计量统计的是那些在合并样本中其最近邻也属于参考样本的参考样本点数。在置换零假设下,该统计量具有精确的有限样本条件均值和方差;我们进一步建立了其渐近正态性和在固定备择假设下的一致性。ASK-NN计算高效且易于实现。实验表明,在合成基准测试、人工文本检测以及基于词级隐藏状态的大规模语言模型幻觉检测中,该测试与基于核函数和图的方法相比具有竞争力。
机器学习, ICML
## 1 引言
大规模语言模型越来越多地部署于各类应用,并在决策支持流程中得到扩展使用 [Liu et al., 2024]。由于训练数据截止日期带来的记忆和信息限制,它们通常与检索增强生成(RAG)系统结合 [Lewis et al., 2020; Fan et al., 2024],期望模型生成的响应能够*忠实*于证据。实现可靠性的一个核心障碍是*幻觉*:模型可能生成与给定上下文无支持或相矛盾的陈述 [Zhang et al., 2025]。
检测方法强调,在RAG中,可以通过利用模型内部信号测量上下文与生成内容之间的*不匹配*来暴露幻觉 [Ricco et al., 2025]。例如,提示与响应隐藏状态分布之间的概率距离(如使用考虑依赖重采样的MMD) 提供了一种无需训练的分数,该分数在出现幻觉时会增大,并且可以通过从估计的零分布计算的p值在不同长度的序列间进行比较 [Oblovatny et al., 2025]。另一类工作分析注意力图结构 [Chuang et al., 2024],并报告某些注意力头在不同数据集上展示出稳健的幻觉特征,这些特征可以通过注意力诱导图上的拓扑散度进行总结 [Bazarova et al., 2025]。
尽管这些方法考虑了大语言模型遇到的各种模式,但它们大多忽略了大多数任务的内部结构。通常,我们有一个*参考*分布(例如检索到的证据或可信提示的嵌入)和一个*查询*分布(生成响应的嵌入)。关键在于,操作目标往往是*非对称的*:我们希望当响应良好基于参考时严格控制误报,同时对表明幻觉的偏差保持敏感。当提示和生成响应的长度可能显著不同时,也会出现不对称性,这使得大多数方法在存在大上下文时效率低下。经典的对称双样本检验无法完全捕获这种不对称性,因为它们对两个样本的处理是可互换的。
在本文中,我们将幻觉检测和人工文本检测问题形式化为一个非对称双样本检验问题,并开发了一种针对这种情况定制的最近邻图检验。近邻方法在高维空间中具有吸引力,因为它们避免了密度估计,仅依赖于局部几何结构。Henze提出的经典非参数最近邻重合检验统计的是两组中一个点及其最近邻属于同一样本的次数,具有可证明的强统计性质 [Henze, 1988]。我们提出并分析了一个单向变体,该变体*仅*统计参考样本内部的最近邻重合。这产生了一个统计量,它 (i) 与幻觉检测的参考-查询结构一致,(ii) 在置换零假设下(给定合并的位置)具有精确的有限样本条件均值和方差,以及 (iii) 保留了类似于对称情况的渐近正态性和一致性性质。
我们的工作采用了一种*参考侧*计数规则,仅关注参考内部的最近邻重合。这种非对称构造更好地匹配了如幻觉检测等操作场景,其中一个样本扮演锚定分布的角色,并且产生了一个具有易处理条件矩和类似大样本行为的统计量。我们的理论分析密切遵循 Henze [1988] 的框架,同时将统计量、零假设矩、渐近校准和一致性论证调整适用于非对称单向设置。我们进一步展示了如何将这种非对称检验应用于使用隐藏状态表示的现实世界大语言模型生成问题。
我们的贡献如下:
- • **非对称双样本统计量 ASK-NN。** 我们引入了一种基于k-NN图中参考内部重合的非对称双样本统计量ASK-NN,其动机来自一个样本提供锚定分布的参考-查询设置。
- • **为ASK-NN建立了理论性质。** 对于ASK-NN统计量,我们推导了在置换零假设下的精确条件均值和方差,并获得了一个渐近正态的校准。我们的理论贡献还包括在固定备择假设下对极限分离泛函的表征,并且表明当且仅当两个分布重合时该泛函最小,这意味着所提检验的一致性。
- • **ASK-NN具有竞争力的实验性能。** 我们在合成高斯基准测试、人工文本检测和大语言模型幻觉检测上评估了该方法,展示了其与MMD、Sinkhorn、Hotelling's T²和对称k-NN基线相比具有竞争力的性能。
## 2 相关工作
#### 基于图和最近邻的检验。
基于图的检验构成了一类非参数双样本检验。它们仅依赖于合并样本的几何结构,而不是基础分布的参数模型。具体来说,它们在合并的观测值上构建一个图,例如使用最近邻图或最小生成树(MST),并测量边连接同一样本点的频率。众所周知的例子包括基于MST的Friedman-Rafsky检验 [Friedman and Rafsky, 1979],以及最近邻检验,如Henze最近邻重合检验 [Henze, 1988]。后者对称地统计两个样本内最近邻对的数量,并在零假设下建立渐近正态性,在备择假设下建立一致性。
#### 双样本检验与核方法。
双样本问题有着悠久的历史,现代非参数方法包括基于核的检验和基于图的检验。最大均值差异(MMD)是一种广泛使用的核双样本统计量,具有很强的理论保证和实际性能 [Gretton et al., 2012]。对于依赖数据,wild-bootstrap变体为退化核检验提供了有效的校准 [Chwialkowski et al., 2014]。两个样本之间的连通性也在文献 [Friedman and Rafsky, 1979; Henze and Penrose, 1999] 中得到探索,其中作者考虑最小生成树中连接不同样本节点的边的数量。类似的想法出现在 [Barannikov et al., 2021] 的工作中,但从拓扑角度出发,同时具有被证明的统计性质 [Mironenko et al., 2026]。这些方法直接与大语言模型中违反i.i.d.假设的词序列嵌入相关。
#### 通过内部信号进行幻觉检测。
越来越多的工作通过提取模型内部的不确定性或一致性线索来检测幻觉,而无需外部知识,例如多次生成的自一致性 [Farquhar et al., 2024]、基于熵的置信度 [Fadeeva et al., 2024] 以及隐藏状态探针 [Sky et al., 2024]。在RAG中,一个特别有效的方法是直接量化提供的上下文与生成响应之间的关系 [Es et al., 2024]。一种方法测量提示与响应隐藏状态分布之间的概率距离,并使用考虑依赖的重采样(例如wild bootstrap)计算校准后的p值,从而得到长度归一化的幻觉分数 [Oblovatny et al., 2025]。并行地,TOHA分析由注意力矩阵诱导的图,并使用提示与响应子图之间的非对称拓扑散度,报告称一小部分注意力头跨数据集和模型产生稳定的幻觉特征 [Bazarova et al., 2025]。
#### 人工文本检测。
机器生成文本(MGT)检测旨在区分人类撰写的文本与大规模语言模型的输出。这项任务变得越来越具有挑战性,因为现代大语言模型生成流畅、高质量的文本,使得人类与生成文本之间的分布差异变得微妙。
现有方法包括基于语言模型统计量的度量检测器,如似然、熵、排名或基于扰动的分数 [Gehrmann et al., 2019; Mitchell et al., 2023],基于模型训练的分类器以区分人类和生成的样本 [Guo et al., 2023],以及明确将检测视为统计双样本问题的分布方法。特别是,最近的工作使用基于MMD的标准不仅用于测量人类撰写与机器生成文本之间的差异,还用于优化对此类分布差异敏感的检测器 [Zhang et al., 2024]。
我们使用这个领域作为现实世界数据的来源,其中人类撰写和LLM生成的文本形成两个紧密相关的分布,为评估我们双样本统计量的敏感性提供了一个有用的基准。
## 3 方法
### 3.1 假设检验问题
设 X₁, ..., X_{n₁}, Y₁, ..., Y_{n₂} 为独立同分布的 ℝ^d 值随机向量,维度 d ≥ 1。在本文中,X-样本被视为参考样本,Y-样本被视为查询或可能偏移的样本。X_i 的分布具有未知的概率密度函数 f(x),Y_i 的分布具有未知的概率密度函数 g(x)。我们考虑双样本检验问题:H₀: f ≡ g 对比 H₁: f ≢ g。
### 3.2 基于最近邻的统计量
设
Z_i =
\begin{cases}
X_i, & 1 ≤ i ≤ n₁, \\
Y_{i - n₁}, & n₁ + 1 ≤ i ≤ n,
\end{cases}
其中 n = n₁ + n₂。然后,对于合并后的样本 {Z_i},我们定义 N_r(Z_i) 为 Z_i 在全体样本中的第 r 个最近邻,A(Z_i) = I(1 ≤ i ≤ n₁) 是第一组点的指示函数。
要研究的统计量 ASK-NN 为:
T_n = Σ_{i=1}^n Σ_{r=1}^k A(Z_i) A(N_r(Z_i)). (1)
因此,T_n 统计的是其 k 个最近邻也在合并样本中的参考点个数,因为其等于 Σ_{i=1}^{n₁} Σ_{r=1}^k A(N_r(Z_i))。我们的目标是研究 T_n 的性质,并将其与 Henze 提出的版本
T_n^{full} = Σ_{i=1}^n Σ_{r=1}^k [A(Z_i)A(N_r(Z_i)) + (1 - A(Z_i))(1 - A(N_r(Z_i)))]
的性质进行比较。我们将证明 T_n 具有与原始版本很大程度上相似的性质,同时需要更少的计算量,如表1 中 n₁ ≪ n 所示。
| 方法 | 时间 |
| :--- | :--- |
| 基于MST的检验 (Henze et al., 1999) | O(n²d) |
| MMD [Gretton et al., 2012] | O(n²d) |
| MTopDiv [Mironenko et al., 2026] | O(n²(d + log n)) |
| T_n^{full} [Henze, 1988] | O(n(k + nd)) |
| T_n (本文) | O(n₁(k + nd)) |
表 1:不同非参数双样本统计量的计算成本。
### 3.3 在 H₀ 下的分布
如果 H₀ 成立,我们可以使用置换分布来表示随机序列 Z₁, ..., Z_n,类似于 Henze [1988]。Z₁, ..., Z_n 是独立同分布的 d 维随机向量。额外的随机变量 U_{n1}, ..., U_{nn} 具有分布:
P(U_{nj} = u_j; 1 ≤ j ≤ n) =
\begin{cases}
\binom{n}{n₁}^{-1}, & \text{若 } Σ_{i=1}^n I(u_i = 1) = n₁, \\
0, & \text{否则}.
\end{cases}
其中 u_j ∈ {1, 2} 是 U_{nj} 的所有可能值。这些变量表示 Z_j 的样本类型:相应地是 X 或 Y 类型。对于 1 ≤ i ≠ j ≤ n, 1 ≤ r ≤ k,我们引入事件
A_{ij}^{(r)} = [Z_j = N_r(Z_i)],
B_j = [U_{nj} = 1].
这里我们只研究一种样本类型 (U_{nj} = 1),因此,检验变为非对称。
在 H₀ 下,公式 (1) 中定义的 T_n 与以下变量同分布:
T̃_n = Σ_{i,j=1}^n Σ_{r=1}^k I(B_i) I(B_j) I(A_{ij}^{(r)}).
给定 Z_i相似文章
击中移动目标:持续分布漂移下AI文本检测的测试时自适应
本文提出了一种基于半监督学习的测试时自适应方法,用于AI文本检测,能够适应来自新LLM、对抗性人工化和时间漂移的持续分布变化,性能优于最先进的监督式检测器。
基于注意力折扣的自适应采样器用于掩码扩散语言模型
本文介绍了ADAS,一种无需训练的重排序规则,用于并行掩码扩散解码。它利用注意力对强烈关注不确定位置的token进行折扣,从而在低NFE设置下提升推理和代码任务的性能,且运行时开销极小。
漂移发生:关于神经架构对时间分布偏移鲁棒性的实证研究
本文介绍了一项实证研究,比较不同神经架构(MLPs、CNNs、RNNs、预训练transformer)在图像和文本领域的时间分布偏移下的性能退化,发现利用局部特征的模型退化最快,而预训练编码器的漂移较为缓慢。
通过内部激活的频谱分析检测神经网络故障
本文识别了神经网络在错误分类期间内部激活中的频谱漂移,并引入了自检测神经网络(SDNN),通过监控频谱动态来检测故障,在CIFAR-10上实现了79%的AUROC,比基于置信度的方法高出25-30个百分点。
注意力漂移:自回归投机解码模型学到了什么
本文指出了自回归投机解码模型中的“注意力漂移”现象,即草稿模型的注意力从提示词转移到了其自身生成的令牌上。作者提出了架构上的改进,例如后归一化(Post-norm)和 RMSNorm,这些改进在各种基准测试中提高了接受率和鲁棒性。