测试的测试:类分割异常检测中的分数方向不稳定性
摘要
该论文揭示了在类分割异常检测评估中,由于表示空间中的分布重叠,异常分数可能变得不稳定甚至反转,并引入了一种无训练的邻域类泄漏诊断来预测此现象。
arXiv:2606.02601v1 公告类型: 新
摘要:数据集内类分割评估被广泛用作完全无条件的分布外异常检测的代理。我们表明,当被排除的异常类在表示空间中与正常混合分布重叠时,该协议可能变得不适定。在这种情况下,异常分数可能降至随机水平甚至反转,且最佳分数方向可能依赖于未知的异常类。我们引入了一种简单的无需训练的诊断方法——邻域类泄漏,并展示了它在Fashion-MNIST、CIFAR-10和Imagenette数据集上,在像素空间和VAE潜空间中预测分数方向的不稳定性。我们的结果表明,类分割异常检测基准应被视为几何依赖的压力测试,而非无条件异常检测能力的证据。
查看缓存全文
缓存时间: 2026/06/03 09:38
# 检验测试:类分裂异常检测中的分数方向不稳定性
来源:https://arxiv.org/html/2606.02601
###### 摘要
数据集内类分裂评估被广泛用作完全无条件分布外异常检测的代理方法。我们证明,当被留出的异常类在表示空间内与正常混合分布发生重叠时,该协议可能成为病态问题。在此情况下,异常分数可能趋向于随机水平甚至发生反转,且最佳分数方向可能依赖于未知的异常类。我们引入了一种简单的、无需训练的诊断方法——邻域类泄露——并表明它在 Fashion-MNIST、CIFAR-10 和 Imagenette 数据集上,在像素空间和 VAE 潜空间中均能预测分数方向不稳定性。我们的结果表明,类分裂 AD 基准应被视为依赖于几何结构的压力测试,而非无条件异常检测能力的证据。
异常检测,OOD 检测,类分裂基准,AUROC 反转,分数方向不稳定性,邻域泄露,基准诊断
## 1 引言
异常检测(AD)中一种常见的评估策略(Chalapathy and Chawla, 2019 (https://arxiv.org/html/2606.02601#bib.bib1); Pang et al., 2021 (https://arxiv.org/html/2606.02601#bib.bib2))是通过重新利用现有标注数据集来*模拟*异常。两种协议主导了实践。首先,*跨数据集*评估在一个数据集上训练,并将来自另一个数据集的样本视为异常,例如 CIFAR vs. SVHN (Krizhevsky and Hinton, 2009 (https://arxiv.org/html/2606.02601#bib.bib3); Netzer et al., 2011 (https://arxiv.org/html/2606.02601#bib.bib4))。其次,*数据集内类分裂*评估将某些语义类指定为正常,其他类指定为异常(例如,“99 个正常类 vs. 11 个异常类”)。该协议很有吸引力,因为它看起来“更接近”完全无条件 OOD AD:异常并非来自外部来源,语义边界也较少刻意为之。然而,正如我们所展示的,在完全无条件 OOD 机制下,这类分裂协议在精确的操作意义上可能成为*病态问题*。
核心问题是分布重叠。在许多自然图像数据集中,指定“异常类”的样本集可能比相当一部分正常样本本身*更接近*(多类)正常混合分布的绝大多数区域。在这种机制下,与正常性距离单调相关的 AD 分数可能会因异常类的选择而不稳定:AUROC 可能降至随机水平,甚至可能对于某些异常类发生*反转*(AUROC < 0.5)。一种诱人的反应是将反转视为表面伪影——例如,通过翻转分数方向——或者认为足够强的检测器会“再次反转”排序并恢复 AUROC。我们认为这忽略了根本的失效模式:当“异常性”的方向依赖于(未知的)异常类型时,低分数不再能以一致的方式被解释。因此,基准结论变得脆弱,可能奖励那些利用数据集和分裂特定怪癖的方法,而非反映鲁棒的完全无条件 OOD AD 能力。
本文针对这一现象开发了一种实用的诊断方法和实证刻画。我们通过给定表示空间中类条件流形之间的*重叠*视角来审视类分裂 AD 基准。我们引入了一种简单的、无需训练的*病态指数*,基于局部邻域类泄露,该指数量化了类标签与几何结构对齐的程度。跨数据集和表示,我们表明该指数预测了类分裂完全无条件 OOD AD 何时可能产生不稳定或反转的排序。
### 贡献。
我们的贡献是:
- • 我们识别并形式化了完全无条件 OOD 异常检测中数据集内类分裂评估的一个实际失效模式:由正常-异常重叠导致的类相关分数方向不稳定性、AUROC 塌缩和反转。
- • 我们提出了一种简单的、无需训练的诊断方法(基于邻域泄露的病态指数),该指数可预测在给定表示空间中类分裂基准何时不可靠。
- • 我们在一个受控的设置矩阵中实证验证了这一现象和诊断方法:三个数据集涵盖了递增的视觉复杂性(Fashion-MNIST 作为阴性对照,CIFAR-10 和 Imagenette),两种表示(像素空间和完全无条件 OOD VAE 潜空间),以及多个评分族(kNN、孤立森林和局部异常因子)。
## 2 问题设置与评估协议
考虑一个带有类标签 y ∈ {1, ..., K} 的标注数据集。在数据集内类分裂协议中,子集 N 被指定为正常,不相交的子集 A 被指定为异常。AD 方法仅在来自 D_N 的未标注样本上拟合,然后通过对来自 D_N ∪ D_A 的样本进行评分来评估。我们关注常见的 K-1 vs. 1 协议:每个类 c 依次被留出作为异常类,产生每个类的 AUROC 分数 AUC(c) (Fawcett, 2006 (https://arxiv.org/html/2606.02601#bib.bib12))。类标签仅用于构建评估分裂、计算指标以及计算下面的诊断方法;不执行依赖于类的调优或表示学习。
### 假设检验视角。
我们将类分裂协议解释为一个隐式测试,检验固定表示和评分规则是否诱导出一个稳定的排序,在该排序中,留出类比正常混合分布更不典型。在这一观点下,低 AUROC 并非唯一的失效模式。更结构性的失效发生在首选分数方向随留出类而变化时:那么基准不再测试单个与类无关的异常性概念。下面的泄露诊断旨在将此前提条件用作检查,然后再将类分裂 AUROC 值用作无条件 OOD AD 能力的证据。
## 3 病态类分裂基准的诊断方法
数据集内类分裂协议隐式假设被指定的异常类在所选表示空间中与正常混合分布充分分离。当这一假设失败时——即,当类条件流形强烈重叠时——基准可能表现出 AUROC 塌缩和类相关的分数方向不稳定性。我们现在引入一种简单的、无需训练的诊断方法,量化这一重叠,并预测类分裂完全无条件 OOD AD 评估何时可能不可靠。
### 表示空间。
令 r: X → R^d 表示一个固定的表示映射。在我们的实验中,r(x) 要么是向量化的输入(像素空间),要么是由仅在正常数据上以完全无条件 OOD 方式训练的 VAE 编码器产生的潜码。以下所有定义适用于任何固定的表示。
### 邻域类泄露。
给定一个仅*用于*分析的标注评估集 T = {(xi, yi)}i=1^m,其中 yi ∈ {1, ..., K},令 N_k(i) 表示在欧氏距离下 r(xi) 在 {r(xj)}_j≠i 中的 k 个最近邻的索引。¹ 我们将样本 i 的 *kNN 类泄露*定义为其邻居中标签与其自身不同的比例:
l_k(i) = (1/k) * Σ_{j ∈ N_k(i)} I[yj ≠ yi]. (1)
直观上,l_k(i) 衡量了表示空间中的局部几何结构与语义类结构的对齐程度:l_k(i) ≈ 0 表示 xi 的邻域是类纯净的,而 l_k(i) ≈ 1 表示与其他类高度混合。
### 数据集级病态指数。
我们通过平均将点态泄露聚合成一个数据集级诊断指标:
L_k(T; r) = (1/m) * Σ_{i=1}^m l_k(i). (2)
我们将 L_k 称为表示空间 r 中类分裂基准的*病态指数*。L_k 的高值表明类条件流形的强重叠,并暗示将语义类留出作为“异常”可能不会产生清晰的正常-异常分离。
### 为什么泄露能预测不稳定性。
在表示空间 r(x) 中,大多数经典的无条件 OOD AD 分数要么 (i) 与正常训练集的经验支持的距离单调,要么 (ii) 与相对于邻域估计的局部密度单调。如果被指定的异常类占据了表示空间中正常样本密集分布的区域(高局部混合),那么许多异常点将获得低异常分数,而一些正常尾点可能获得更高分数。结果,由 s(x) 诱导的排序变得对留出类的选择敏感,并且可能对某些异常类翻转方向。式 (2) 中的泄露指数为这种重叠以及基准的病态性提供了一个直接的、无需训练的代理。
## 4 类分裂 AD 的不稳定性与方向性指标
现在,我们定义汇总统计量,量化数据集内类分裂评估何时作为完全无条件 OOD 异常检测的代理不可靠。通篇固定一个具有 K 个语义类的数据集,并考虑“K-1 vs. 1”协议,其中异常类是单个留出类 c ∈ {1, ..., K}。对于固定的表示 r 和评分函数 s,令 AUC(c) ∈ [0, 1] 表示当类 c 被视为异常且剩余的 K-1 个类形成(未标注的)正常训练集时获得的 AUROC。
### AUROC 离散度。
我们报告 AUC(c) 跨留出异常类的均值、方差和四分位距。高离散度表明基准对异常类的随意选择敏感。
### 近随机率。
为了衡量该协议产生有效随机水平排序的频率,我们定义宽容度 ε > 0 下的近随机率为:
ρ_rnd(ε) = (1/K) * Σ_{c=1}^K I[|AUC(c) - 1/2| ≤ ε]. (3)
在实验中,我们使用较小的固定宽容度(例如,ε = 0.05)来量化模糊排序的普遍性。
### 反转率。
当 AUROC 被*反转*时,会出现更强的失效模式:异常样本被系统地排序为*比正常样本更正常*,导致 AUC(c) < 0.5。我们通过反转率来量化:
ρ_inv = (1/K) * Σ_{c=1}^K I[AUC(c) < 1/2]. (4)
虽然单个反转可能在小型测试集上偶然发生,但集中在特定类上的持续性反转表明所选表示中存在显著的正常-异常重叠。
### 方向不稳定性。
对反转的一种常见反应是“翻转”分数方向。然而,如果首选方向依赖于(未知的)异常类型,那么基准就没有定义一个一致的异常性概念。我们通过跟踪偏离随机水平的符号来捕捉这一点:
d(c) = sign(AUC(c) - 1/2) ∈ {-1, 0, +1}, (5)
如果 |AUC(c) - 1/2| ≤ ε,则 d(c) = 0。然后我们定义方向不稳定率:
ρ_dir(ε) = 1 - (1/K) * max{ Σ_{c=1}^K I[d(c)=+1], Σ_{c=1}^K I[d(c)=-1] }. (6)
当单个分数方向在异常类之间被一致偏好时,该量接近 0,当基准表现出混合方向时,该量增加到 0.5 左右(此外,如果存在 d(c)=0 的情况,则 ρ_dir 也可能超过 0.5,此时 ρ_rnd 也应增加)。该统计量操作化了以下直觉:当不同的异常类诱导出不同的排序方向时,“再次反转”分数并不能解决潜在的模糊性。
## 5 实验设置
我们评估三个视觉复杂度递增的数据集:Fashion-MNIST (Xiao et al., 2017 (https://arxiv.org/html/2606.02601#bib.bib5)) 作为低重叠阴性对照,CIFAR-10 (Krizhevsky and Hinton, 2009 (https://arxiv.org/html/2606.02601#bib.bib3)),以及 Imagenette (Howard, 2019 (https://arxiv.org/html/2606.02601#bib.bib6); Russakovsky et al., 2015 (https://arxiv.org/html/2606.02601#bib.bib7))。对于每个数据集,我们运行 K-1 vs. 1 类分裂协议,遍历被留出的异常类 c。我们评估两种表示空间:像素空间和来自 VAE (Kingma and Welling, 2014 (https://arxiv.org/html/2606.02601#bib.bib8)) 的潜码 r(x) = E_φ(x),该 VAE 具有类 ResNet 组件 (He et al., 2016 (https://arxiv.org/html/2606.02601#bib.bib9)),仅在未标注的正常池上训练。在每个表示中,我们在正常池上拟合三个标准的无条件 AD 评分器:kNN 距离、孤立森林 (Liu et al., 2008 (https://arxiv.org/html/2606.02601#bib.bib10)) 和局部异常因子 (Breunig et al., 2000 (https://arxiv.org/html/2606.02601#bib.bib11))。超参数预先固定,不按异常类调整。
## 6 结果
表 1 (https://arxiv.org/html/2606.02601#S6.T1) 显示了泄露与基准不稳定性之间的诊断关系。Fashion-MNIST 具有低泄露和相对稳定的类分裂行为,尤其是在像素空间中。相比之下,CIFAR-10 和 Imagenette 在像素空间和 VAE 潜空间中都具有高泄露,并表现出显著的反转和方向不稳定率。在对 kNN、孤立森林和 LOF 进行平均后,该模式在多个评分族中持续存在,表明失效不是单个检测器或表示的伪影。图 1 (https://arxiv.org/html/2606.02601#S6.F1) 显示了 CIFAR-10 在像素空间中每个类级别的这种效应:尽管使用相同的分数约定,几个异常类低于随机水平,而其他异常类则显著高于随机水平。
### 解释。
该诊断不应被视为 AUROC 的替代品,而应被视为对基准本身的前提条件检查。低泄露支持这样的解释:类分裂 AUROC 在所选表示中衡量的是异常分离度。高泄露,连同大的 ρ_inv 或 ρ_dir,表明该协议更适合被视为依赖于几何结构的压力测试,而非一般无条件 OOD 检测性能的证据。
表 1:邻域泄露与基准不稳定性之间的诊断关系。每一行是一个数据集-表示对。不稳定性指标是对 kNN、孤立森林和 LOF 的平均值。
参见图注
图 1:CIFAR-10 在像素空间下采用 9-vs.-1 类分裂协议的每个类 AUROC。虚线标记了随机水平。相似文章
重新思考结构性异常检测:从决策边界到投影算子
本文重新思考结构性异常检测,将重点从决策边界转向低维正常数据流形上的投影算子,证明投影对齐方法优于现有的基于边界和基于重建的方法。
多变量时间序列基准中的异常大多数是单变量的
本文介绍了一种用于多变量时间序列异常检测基准的诊断框架,发现标记的异常大多可以从单个通道检测到,这对跨通道建模的必要性提出了挑战。作者呼吁开发更多结构多样的评估数据集。
选择性信号分类中的虚假安全感:对风险控制的边界紧密性与可交换性的审计
本文审计了信号域检测器中用于选择性分类的无分布风险控制方法的可靠性,发现朴素阈值法常常超出其声称的预算,并且可交换性违反导致证书失败。
利用语言特定统计图的领域感知发音错误检测与诊断
提出一种利用语言特定统计图构建的领域感知发音错误检测与诊断方法,在L2-ARCTIC基准上达到59.52%的F1分数,优于多个基线模型。
Perturbation Sensitivity at Convergence: A Simple Signal for Identifying Spuriously Correlated Samples
This paper proposes a method to identify spuriously correlated samples after model convergence by measuring prediction fragility under input perturbation, requiring no group labels or early-stopping epochs. Rebalancing training with detected samples improves worst-group accuracy on Waterbirds from 57.3% to 80.8%.