重新思考边缘持续异常检测:在真实工业条件下的基准测试

arXiv cs.LG 论文

摘要

本文介绍了一个用于工业检测中持续异常检测的统一基准,解决了不现实的评估和边缘部署约束问题,并提出了DINOSaur,一种无需训练的方法,在边缘硬件上以零遗忘和低于100毫秒的推理速度优于现有方法。

arXiv:2605.24251v1 公告类型:新 摘要:持续异常检测(CAD)解决了工业检测系统适应不断变化的生产条件的需求,然而现有方法存在三个关键缺陷:评估不现实、没有系统性比较、以及未考虑边缘部署约束。我们引入了一个统一基准,结合了对结构异常和逻辑异常的离散任务评估、一种新颖的连续漂移协议、所有已发布CAD方法的首次正面比较,以及在边缘硬件上的计算效率分析。我们的结果表明,现有CAD方法并不总是优于采用简单经验回放的传统方法。受此启发,我们提出了DINOSaur,一种无需训练的方法,结合了冻结的DINOv3骨干网络、空间索引的coreset内存和邻域限制的异常评分。DINOSaur通过构造实现零遗忘,在所有五个协议上优于所有评估的方法,并在NVIDIA Jetson Orin Nano上以低于100毫秒的推理速度运行,设备上适应新任务的时间不到30秒。
查看原文
查看缓存全文

缓存时间: 2026/05/26 09:02

# 重新思考边缘场景下的持续异常检测:在真实工业条件下的基准测试
来源:https://arxiv.org/html/2605.24251
11institutetext:休斯顿大学

###### 摘要

持续异常检测(CAD)满足了工业检测系统适应不断变化的生产条件的需求,但现有方法存在三个关键缺陷:不切实际的评估、缺乏系统性比较以及未考虑边缘部署的限制。我们引入了一个统一的基准测试,包括对结构性和逻辑性异常的离散任务评估、一种新颖的连续漂移协议、所有已发表CAD方法的首次正面比较,以及在边缘硬件上的计算效率分析。我们的结果表明,现有的CAD方法并不始终优于采用简单经验回放的传统方法。受此启发,我们提出了DINOSaur,一种无需训练的方法,它结合了冻结的DINOv3骨干网络、空间索引的核心集记忆和邻域限制的异常评分。DINOSaur通过设计实现了零遗忘,在所有五种协议上均优于所有评估方法,并在NVIDIA Jetson Orin Nano上实现了低于100毫秒的推理,设备上适应新任务的时间不到30秒。

## 1 引言

工业4.0的兴起给制造业带来了更高的自动化程度,包括采用AI驱动的质量控制。在生产环境中,糟糕的质量控制可能代价极其高昂,漏检的缺陷可能导致保修索赔、产品召回和严重的声誉损害[dimitriou_automatic_2025]。异常检测(AD)主要使用正常样本训练模型来识别缺陷产品,已成为工业环境中自动视觉检测的自然选择[bergmann_mvtec_2019]。

然而,现实世界的制造过程绝非静态。环境条件波动,工具磨损和退化,材料批次变化,生产参数随时间漂移。这些因素导致正常产品外观的分布持续变化,给那些假设数据分布固定的AD训练系统带来了根本性挑战。当正常分布发生变化时,先前部署的AD模型可能会遗漏真正的缺陷,或将正常变化标记为异常,这两种情况都会带来重大的经济损失。持续学习(CL)提供了一个框架,使模型能够适应新数据,同时保留先前学习到的分布知识[wang_comprehensive_2024]。最近有几项工作提出了持续异常检测(CAD)方法,将AD架构与CL策略相结合,以在数据跨连续任务演化时保持性能[li_towards_2022, tang_incremental_2025, liu_unsupervised_2024]。

尽管取得了这些进展,但我们发现当前CAD文献中存在三个关键缺陷:

(1) **忽视了计算可行性**。工业AD系统通常在计算能力有限的边缘设备上运行,通常需要每秒多次推理才能跟上生产吞吐量。最近的CAD方法采用了基于视觉-语言模型(VLM)、扩散模型或大型视觉Transformer的大规模架构,但未分析这些模型是否能在受限环境中可行部署[wyatt_anoddpm_2022, li_one-for-more_2025, gu_anomalygpt_2024, zhou_anomalyclip_2023]。

(2) **不切实际且狭隘的评估**。现有的CAD基准测试将每个产品类别视为不同的任务,造成尖锐且离散的边界(例如,瓶子到电缆)。实际上,工业漂移是渐进的——同一产品因工艺变化而随时间改变外观。现有基准测试都没有捕捉到这种连续漂移的场景。此外,评估仅限于结构性异常(表面缺陷),忽略了逻辑性异常(缺失组件、排列错误)[bergmann_beyond_2022]——这是一个尚无CAD方法评估过的重大未解决挑战。

(3) **缺乏系统性比较**。已发表的三种CAD方法,即DNE[li_towards_2022]、IUF[tang_incremental_2025]和UCAD[liu_unsupervised_2024],各自针对不同基线和不同实验条件进行了独立评估。这三种方法从未相互进行过全面评估,因此无法理解它们相对的优缺点,更不用说在现实场景中的可行性了。

为了解决这些缺陷,本文做出了以下贡献:

- • 我们引入了**一个统一的CAD评估框架**,首次结合了所有已发表CAD方法的正面比较、一种新颖的**连续漂移协议**、**逻辑性异常**评估以及在边缘硬件上的计算效率分析。
- • 我们的评估揭示,**专门的CAD方法并不始终优于**具有简单经验回放的**传统基线**。受此发现启发,我们提出了**DINOSaur**,一种无需训练的方法,以极小的计算成本超越了所有评估方法,从而实现了实用的边缘部署。

## 2 相关工作

**工业环境中的异常检测**。工业异常检测(IAD)方法大致分为两类范式。**基于分布的方法**[roth_towards_2022, defard_padim_2021, reiss_panda_2021]对正常样本特征的分布进行建模,并将分布之外的测试样本标记为异常,使用的技术包括最近邻评分、多元高斯拟合或学习到的正常性分数。**基于重建的方法**[zavrtanik_draem_2021, you_unified_2022]在正常图像上训练编码器-解码器网络,并使用高重建误差作为异常信号。统一或多类别AD[you_unified_2022]同时处理多个类别,但假设一次性访问所有数据,这与CAD的顺序约束不同。

**用于异常检测的大规模模型**。最近的工作将大型基础模型应用于AD,包括基于LLM的推理[gu_anomalygpt_2024]、视觉-语言提示[zhou_anomalyclip_2023]、上下文学习[zhu_toward_2024]和扩散模型[wyatt_anoddpm_2022, li_one-for-more_2025]。虽然这些方法在基准测试上取得了强劲结果,但它们需要数十亿参数和GPU级硬件,推理延迟以每张图像数秒计——这从根本上与需要每秒处理数张图像吞吐量的边缘部署不兼容。此外,这些大型模型也无法避免灾难性遗忘:将CLIP等视觉-语言模型适应到顺序任务会导致零样本迁移能力显著下降[zheng_preventing_2023],而多模态LLM在微调后同样无法保留其预训练的视觉理解能力[zhai_investigating_2024]。这种双重挑战——**计算不可行**且**易于遗忘**——进一步激发了我们对用于边缘部署CAD的轻量级、无需训练方法的关注。

**持续学习**。CL解决了从任务序列\{D_1, D_2, ..., D_T\}学习的问题,受限于当训练任务t时,只能访问数据集D_t(D_1, ..., D_{t-1}的数据不可用)。每个任务都是一个独特的数据集,D_t = \{x_t, y_t\},t ∈ [1, 2, ..., T]。在CL框架下,我们旨在构建一个模型,能够持续学习新任务,同时最大程度地减少对先前任务知识的**灾难性遗忘**[wang_comprehensive_2024]。

现有的CL策略分为三大类。**基于正则化的方法**在损失函数中添加惩罚项,以限制权重更新,从而保留先前任务的重要知识。弹性权重巩固(EWC)[kirkpatrick_overcoming_2017]使用Fisher信息识别重要参数,突触智能(SI)[zenke_continual_2017]在线跟踪参数重要性,记忆感知突触(MAS)[ferrari_memory_2018]基于输出敏感性计算重要性。**基于架构的方法**为不同任务分配专用参数或子网络,如渐进式神经网络[rusu_progressive_2022]。**基于记忆的方法**存储先前任务的信息,并调整新任务的学习以利用这些信息,可进一步分为**基于回放的方法**和**基于梯度投影的方法**。前者存储先前任务的原始样本或特征表示,并在新任务训练期间重放它们,例如经验回放[rolnick_experience_2019]和黑暗经验回放[buzzega_dark_2020]。后者[saha2021gradient, lin2022trgp, lin_beyond_2022]在记忆中存储先前任务的梯度信息,并使用这些信息修改新任务的梯度方向。根据经验,基于记忆的方法在CL基准测试中始终表现最强[wang_comprehensive_2024],因为它们通过维持对过去信息的访问,最直接地解决了遗忘问题。

**持续异常检测**。迄今为止,已有三种已发表的方法专门解决了现实工业环境中的CAD问题。**DNE**[li_towards_2022]存储来自视觉Transformer(ViT)骨干网络的每个任务嵌入统计信息,并仅通过图像级别的马氏距离进行异常评分。**IUF**[tang_incremental_2025]使用具有正则化潜在空间分离和约束梯度更新的ViT编码器-解码器。**UCAD**[liu_unsupervised_2024]将对比学习与SAM[kirillov_segment_2023]结合用于纹理分解,并维护一个任务特定的知识库。每种方法的详细架构描述见附录~0.A (https://arxiv.org/html/2605.24251#Pt0.A1)。

最近出现了几个针对CAD的基准测试,但并未直接比较CAD方法。Bugarin*等人* [bugarin_unveiling_2024]在MVTec-AD上引入了一个像素级别的CAD基准测试,评估了包装有标准回放或记忆库策略的现成AD方法(PatchCore、CFA、STFPM、EfficientAD、FastFlow等)。Pezzè*等人* [pezze_continual_2025]同样在回放下对现有的AD方法进行了基准测试,并提出了一种压缩回放策略,通过超分辨率减少内存使用,但没有提出新的检测架构。Continual-MEGA[lee_continual-mega_2025]提供了一个大规模基准测试,并评估了零样本泛化能力;其评估的方法包括CAD方法和基于CLIP的VLM,尽管它提出了一个带有混合专家适配器的基于CLIP的基线,专门用于减轻大型模型中的遗忘。这三个基准测试的共同点是依赖通用的CL策略(主要是回放),应用于传统的AD骨干网络,而没有针对持续异常检测的具体约束(例如,非平稳的正常性、无监督或边缘部署)设计方法。我们的基准测试在以下几个进一步方面有所不同:我们是第一个包含**连续漂移**协议(而不仅仅是离散类别转移)的,第一个通过MVTec-LOCO评估逻辑性异常的CAD,以及第一个在**实际边缘硬件上分析计算效率**的。

## 3 持续异常检测的统一基准测试

### 3.1 动机

我们基准测试的核心动机在于当前CAD评估方式与实际工业AD系统运行方式之间的脱节。在真实的制造环境中,检测系统长期监控同一产品。随着环境条件变化(温度、湿度、光照)、工具退化、材料批次变化或生产工艺漂移,产品外观逐渐发生变化。这些变化导致正常数据分布的连续演化——而不是现有IAD数据集模拟的尖锐、类别性的转移。例如,一家检测磁瓦表面缺陷的工厂会经历传感器逐渐退化、季节性光照变化和材料批次变化——所有这些都改变了“正常”的外观,但系统必须持续检测真正的缺陷。这与一个必须突然从检测瓶子切换到检测电缆的系统有着根本的不同。

除了分布漂移问题,现有的CAD评估在范围上也过于狭窄。工业缺陷不仅限于表面层面的结构性异常;逻辑性异常,例如缺失组件和排列错误,同样普遍,并且需要根本不同的检测策略,然而还没有已发表的CAD方法对其进行过评估。

因此,我们的基准测试沿着与已识别缺陷相对应的三个轴评估CAD方法:(1) **评估的现实性和范围**,涵盖标准的离散任务协议和一种新颖的连续漂移协议,以及通过MVTec-LOCO进行的逻辑性异常评估;(2) **所有现有CAD方法之间以及与传统AD基线之间的系统性比较**;(3) **边缘部署可行性的计算效率分析**。

### 3.2 离散任务协议

对于我们的离散任务协议,我们使用了AD和CAD的标准数据集[xie_im-iad_2024]:

**MVTec-AD**。MVTec-AD[bergmann_mvtec_2019]包含15个涵盖纹理和物体的对象类别,每个类别作为一个独立的任务顺序学习。训练期间仅使用正常样本(无监督设置),反映了制造业中异常样本稀缺的实际现实。此协议作为我们与现有方法直接比较的基线。

**MVTec-LOCO**。MVTec-LOCO[bergmann_beyond_2022]包含5个类别,包括结构性和**逻辑性**异常——需要全局场景理解的缺陷。顺序协议与MVTec-AD类似,每个类别作为一个任务。

### 3.3 连续漂移协议

为了模拟真实的工业数据漂移,我们设计了一个基于磁瓦缺陷(MTD)数据集[huang_saliency_2020]的协议。MTD包含单一产品类别(磁瓦),具有多种缺陷类型(气孔、裂纹、破损、磨损、不均匀),非常适合研究产品内部分布漂移,而非产品间的类别变化。

##### 通过渐进式增强模拟漂移。

我们从MTD数据集构建了一个由T=10个任务组成的序列,通过应用强度逐渐增加的图像增强。令 A(x, α) 表示应用于图像 x 且强度为 α 的增强函数。对于任务 t ∈ {1, ..., T},每个后续任务的强度更大:

α_t > α_{t-1} ∀ t > 1. (1)

每个任务的数据为:

D_t = { A(x, α_t) | x ∈ D_MTD }, (2)

其中 D_MTD 是原始的MTD数据集。随着 t 增加,图像经历更严重的失真,模拟了渐进的环境或工艺漂移。

##### 增强类型。

我们运行三个独立的实验轨道,每个轨道模拟不同类别的现实世界漂移:

- **颜色失真**:通过渐进的色调、饱和度、亮度和对比度变化模拟光照变化和材料批次变化。
- **高斯模糊**:通过增加核大小和标准差模拟传感器退化和聚焦漂移。
- **几何失真**:

相似文章

面向关系数据的异常检测

arXiv cs.LG

本文介绍了RelAD,一个基于重构的框架,用于检测关系数据库中的异常,通过联合建模属性和关系边重构。在六个新基准上的大量实验表明,RelAD优于现有方法。

当规则违反罕见时:逻辑异常检测的奇美拉训练

arXiv cs.LG

本文介绍了奇美拉训练(Chimera Training),这是一种用于逻辑异常检测的方法,通过在特征层面进行反事实构建来训练神经规则评估器,无需真实的异常图像,从而在CLEVRER、OpenImages和VidOR等基准测试上提升了规则级异常检测性能。