重新思考结构性异常检测:从决策边界到投影算子

arXiv cs.LG 论文

摘要

本文重新思考结构性异常检测,将重点从决策边界转向低维正常数据流形上的投影算子,证明投影对齐方法优于现有的基于边界和基于重建的方法。

arXiv:2606.15280v1 公告类型:新 摘要:大多数现有的异常检测方法依赖于估计概率密度或学习一个封闭的决策边界,隐含地假设正常数据在环境空间中占据一个非零体积的区域。相比之下,结构性异常检测考虑的是靠近低维流形的数据,这导致现有方法的归纳偏置与数据结构之间存在不匹配,常常导致性能下降。为了解决这种不匹配,我们引入了一种几何视角。具体来说,我们学习一个投影算子作用于正常样本的流形上,并定义一个样本如果被该投影改变则为异常。这一公式自然地整合了流形支持数据的归纳偏置,并将异常检测重新定义为投影残差,从而解决了由退化分布建模引起的问题。值得注意的是,它通过用投影质量解释重建方法的成功与失败,提供了对基于重建方法的统一解释。特别是,它将投影对齐模型强大的泛化能力解释为向流形收缩行为的结果。此外,通过将异常检测与概率建模解耦,它减少了将罕见但正常的样本误分类的倾向,这是现有方法被广泛认可的局限性。实验上,我们证明了投影对齐方法取得了强大的性能,优于基于边界的方法,并改进了现有的基于重建的方法。
查看原文
查看缓存全文

缓存时间: 2026/06/16 11:40

# 从决策边界到投影算子
来源:https://arxiv.org/html/2606.15280
## 重新思考结构异常检测:从决策边界到投影算子

Alexander Bauer1,2 1机器学习组,柏林工业大学 2BIFOLD,柏林,德国 alexander\.bauer@tu\-berlin\.de

###### 摘要

大多数现有的异常检测方法依赖于估计概率密度或学习一个封闭的决策边界,隐含地假设正常数据在环境空间中占据一个非零体积的区域。相比之下,结构异常检测考虑的是位于低维流形附近的数据,这与现有方法的归纳偏置和数据结构之间存在不一致,常常导致性能下降。为了解决这种不一致,我们引入了几何视角。具体来说,我们学习一个投影算子,将其投影到正常样本的流形上,如果一个样本在此投影下发生改变,则将其定义为异常。这种表述自然地整合了流形支撑数据的归纳偏置,并将异常检测重新表述为投影残差,从而解决了由建模退化分布引起的问题。值得注意的是,它为基于重建的方法提供了一个统一的解释,通过投影质量的角度解释了其成功与失败的原因。特别是,它解释了投影对齐模型强大的泛化能力,这是源于向流形收缩的行为。此外,通过将异常检测与概率建模解耦,它减少了将罕见但正常的样本误分类的倾向,这是现有方法一个广泛认可的局限性。实验上,我们证明了投影对齐方法实现了强大的性能,优于基于边界的方法,并改进了现有的基于重建的方法。

## 1 引言

从概念上讲,异常检测旨在识别偏离正常概念的观测值。在许多实际场景中,如工业检测或医学影像,异常表现为输入图像中的结构性偏差,包括表面缺陷、形状变形或其他破坏正常视觉模式的不规则性。

绝大多数现有的异常检测方法 (Schölkopf et al., 2001; Tax and Duin, 2004; Parzen, 1962; Kim et al., 2023; Ruff et al., 2018; Tack et al., 2020; Ruff et al., 2021) 要么通过概率密度,要么更一般地,通过一个包裹正常样本的决策边界来定义正常性。关键在于,这依赖于一个隐含假设:正常数据在环境空间中占据一个非零体积的区域。然而,这一假设与高维感知数据(如图像)根本不一致,因为正常样本集中在低维流形附近。由于嵌入流形相对于环境空间没有内部空间,任何包裹决策边界必然包含无支撑的区域,使其在概念上不成立。在此情况下使用基于边界的方法会导致基本的实践问题,包括不稳定的学习行为、对评分函数中噪声的敏感性,以及维度灾难的严重影响。图1以One-Class SVM为例,说明了基于边界方法的体积假设与流形支撑数据的低维本质之间的几何失配。当与各向同性径向核(如高斯核)结合时,相似性在数据流形的切向和法向方向同等传播。因此,核宽度引入了一个不可避免的权衡:大的宽度会允许更大的流形外区域,导致假阴性;小的宽度则需要密集采样以确保流形覆盖,否则会导致假阳性。尽管现实世界的数据通过测量误差和有限分辨率效应表现出非零体积,但这些仅会在底层流形周围引入一个薄邻域,并不改变其内在结构。

![参考图注](图1:RBF核的OC-SVM在流形支撑数据上的失效模式说明。虽然正常样本集中在低维流形(蓝色曲线)附近,但核在环境空间中引起的各向同性相似性产生了一个体积化的内点区域。该区域的有效半径由核宽度控制:减小它会减少对流形的覆盖,增加假阳性(左图),而增大它会扩展内点区域,增加假阴性(右图)。注意星形样本的分类变化。)

由于包裹决策边界的概念对流形支撑数据变得有问题,一个自然的替代方案是通过样本到流形的距离来衡量其异常程度。然而,这一想法立即面临根本性挑战:流形本身是未知的,必须从有限样本中推断,而计算距离需要求解一个非平凡的优化问题以确定流形上的最近点。在高维环境中,这两个方面在计算上和统计上都难以处理。相反,我们提出了一种不同的方法。关键观察是,对于自然图像,数据流形的全局形状是由像素间的强空间相关性诱导的,这极大地减少了有效自由度。具体来说,这些依赖性产生了一种形式的*索引诱导正则性*,使得一个像素的值在很大程度上可以从其局部邻域预测。这使得通过学习一个纠正偏离流形映射,从单个样本隐式地建模全局几何成为可能。当应用于异常数据时,该映射作为一个近似投影算子,将输入映射朝向流形,而无需显式几何表示。通过这种方式,全局几何与训练样本间共享的局部预测结构联系起来,支持投影映射的学习和泛化。而学习的投影进而诱导出数据流形的隐式刻画,将其作为重建泛函的零集。这提供了正常性的全局描述,无需显式几何估计或代价高昂的优化来识别流形上的最近点。

为此,我们重新解释并扩展了用于*结构异常检测*的基于纠正的方法家族,将其视为学习到的向正常数据流形投影的近似算子。给定输入,模型会产生一个纠正版本,投影向流形,而异常程度通过投影残差来量化。在像素层面,输入与投影之间的差异可以实现异常区域的定位。重要的是,这一视角为理解和改进现有方法提供了一个统一框架。首先,它使学习目标与数据的内在几何对齐,引入了一个与流形支撑分布一致的归纳偏置。其次,它为基于决策边界方法的局限性和基于重建方法的成功提供了一个原则性解释——从投影质量角度。第三,通过将异常检测与概率建模解耦,它减少了将罕见但正常样本误分类的倾向。第四,它通过向流形的收缩行为提供了泛化的几何解释,即多样化的扰动映射到一致的正常表示。总体而言,这些见解为改进算法设计提供了路线图。特别是,它们激发了几何感知的正则化(通过雅可比约束)、通过不动点动力学的迭代精炼,以及改进的损坏策略,以鼓励稳定的投影行为和更强的泛化能力。

本文的其余部分组织如下。第2节总结了用于近似投影算子的训练框架,包括预测时的推理过程。第3节对该框架进行了正式分析,强调了保守投影作为SAD的最优解,并讨论了如何通过训练来近似这种映射。我们进一步研究了基于投影的视角如何提供模型泛化的几何解释,并指出了未来算法改进的方向。第4节展示了在两个已建立的工业异常检测基准上的实验评估,并将提出的框架与最先进的方法进行了比较。最后,第5节对本文进行了总结。

## 2 方法

形式上,我们使用一个自编码器来近似非线性投影算子

f_θ: [0,1]^(h×w×3) → [0,1]^(h×w×3),

其中θ表示可学习参数。输入和输出都对应于分辨率为h×w的RGB图像。特别是,我们不做任何架构假设。具体来说,模型不需要包含瓶颈结构。术语"自编码器"是在一般意义上使用的,仅指具有相同输入和输出维度的映射。

### 2.1 训练

该模型以自监督方式进行训练,使用正常样本及其损坏版本的输入-输出对。设x ∈ [0,1]^(h×w×3) 表示一个正常(无异常)图像。通过改变随机选择的区域(由一个实值掩码 M ∈ [0,1]^(h×w×3) 指定)来获得损坏版本 x̂。其补集定义为M̄ := 1 - M,其中1表示全一张量。

我们使用先前工作中确立的损失公式,并相对于模型参数θ进行优化:

L(x̂, x, M; θ) := (1-λ)/||M̄||₁ * ||M̄ ⊙ (f_θ(x̂) - x)||₂² + λ/||M||₁ * ||M ⊙ (f_θ(x̂) - x)||₂²,   (1)

其中 ⊙ 表示逐元素张量乘法,||·||_p 表示 ℓ^p 范数,λ ∈ [0,1] 平衡损坏区域与未损坏区域的贡献。

有多种方法可以选择用于生成训练数据的损坏模式。一种高效且强大的增强技术是使用额外数据集(如DTD)的背景图像B,这些图像提供了正常数据中不出现的结构模式变化。给定一个正常图像 x ∈ M,一个损坏模式 y ∈ B,以及一个随机选择的平滑掩码 M,根据 x̂ = M⊙y + M̄⊙x 创建损坏版本。

### 2.2 测试时检测

训练后,通过将输入 x̂ 与其重建 f_θ(x̂) 进行比较来进行异常定位。为此,我们定义了一个逐像素差异函数

Δ: [0,1]^(h×w×3) × [0,1]^(h×w×3) → [0,1]^(h×w)。

文献中Δ有不同的选择,包括均方误差、结构相似性指数度量、梯度幅度相似性度量,每种都捕捉重建质量的不同方面。可以通过对异常评分的逐像素图进行阈值化来提取异常区域的二值分割掩码。无论Δ的具体选择如何,在阈值化之前应用空间平滑可以提高稳定性。

对于图像级检测,通过聚合异常图的值(通常通过求和)来获得全局异常分数。替代策略,如取最大值或将聚合限制在最大响应上,可以减少对异常空间范围的敏感性。整体推理流程如图2所示。

![参考图注](图2:我们的异常检测过程说明。给定一个输入 x̂,训练好的模型首先产生输出 f_θ(x̂),该输出保留正常区域并用局部一致的图案替换不规则区域。其次,我们在输入和输出之间计算逐像素差异图 Δ(x̂, f_θ(x̂)) ∈ [0,1]^(h×w) 来定位异常区域。)

本质上,这个概念简单且原则性的框架能够实现准确且高效的结构异常检测,如实验部分所示。

## 3 正式分析:归纳偏置、逼近与泛化

本节将基于投影的视角形式化为结构异常检测的一个原则性框架。我们首先展示它引入了流形支撑数据所缺失的归纳偏置,为检测和定位提供了基础。然后我们将保守投影确定为SAD的最优解,并讨论如何通过第2节中提出的训练框架来近似该解。基于此观点,我们通过向数据流形的收缩提供了模型泛化的几何解释,并讨论了未来算法发展的方向,包括通过不动点动力学的迭代精炼和几何感知的正则化。

### 3.1 通过投影实现几何归纳偏置

相似文章

面向关系数据的异常检测

arXiv cs.LG

本文介绍了RelAD,一个基于重构的框架,用于检测关系数据库中的异常,通过联合建模属性和关系边重构。在六个新基准上的大量实验表明,RelAD优于现有方法。

桥接分类与重建:协同时间序列异常检测

arXiv cs.LG

本文提出CoAD,一种新颖的框架,统一了异常暴露(分类)和掩码自编码器(重建)两种范式用于时间序列异常检测,解决了它们各自的局限性。大量实验表明,CoAD在轻量快速的同时,显著优于现有最先进方法。

基于可微D-vine Copula的局部异常检测

arXiv cs.AI

提出了一种新颖的D-vine copula估计框架,该框架利用基于梯度的最大似然估计和束搜索以获得更好的全局拟合,并给出了一种通过共形预测进行不确定性量化的局部异常检测方法。