面向原则性持续异常检测:一个系统框架与基准场景

arXiv cs.LG 论文

摘要

本文介绍了一个系统框架,用于从表格数据集设计可复现的持续异常检测基准,并提供了来自三个网络安全数据集的五个基准场景。

arXiv:2607.18289v1 公告类型:新 摘要:持续异常检测(CAD)研究模型如何适应不断演变的数据分布,同时保持对先前观察到的状态的性能。然而,CAD基准的关键取决于任务如何定义、过滤、排序和验证。在表格域中,任务边界很少给出,任意划分可能产生不可学习、冗余或过度可迁移的任务,从而掩盖真正的持续学习行为。为此,我们引入了一个系统框架,用于从现有的表格异常检测数据集设计可复现的基准场景。该框架发现候选任务,过滤不合适的任务,并推导出原则性的排序,以揭示多样的动态变化。该框架使我们能够从三个大规模网络安全异常检测数据集中提供五个基准就绪场景,产生单数据集和多数据集CAD设置。
查看原文
查看缓存全文

缓存时间: 2026/07/22 08:18

# 迈向有原则的持续异常检测:一个系统化框架与基准场景

来源:https://arxiv.org/html/2607.18289

**Kamil Faber**
AGH科技大学计算机科学学院
波兰克拉科夫
kfaber@agh\.edu\.pl
& **Mateusz Smendowski**
AGH科技大学计算机科学学院
波兰克拉科夫
smendowski@agh\.edu\.pl
**Roberto Corizzo**
美利坚大学计算机科学系
美国华盛顿特区
rcorizzo@american\.edu

###### 摘要

持续异常检测(CAD)研究模型如何适应不断演变的数据分布,同时保持对先前观察到的模式的性能。然而,CAD基准测试严重依赖于任务的定义、过滤、排序和验证方式。在表格域中,任务边界很少被明确给出,任意的划分可能会产生不可学习、冗余或过度可迁移的任务,从而掩盖真正的持续学习行为。为此,我们引入了一个系统化框架,用于从现有的表格异常检测数据集中设计可复现的基准场景。该框架发现候选任务,过滤不合适的任务,并推导出有原则的排序,以展现多样化的动态。该框架使我们能够从三个大规模的网络安全异常检测数据集中提供五个准备好用于基准测试的场景,涵盖单数据集和多数据集CAD设置。

## 1 引言

异常检测(AD)模型越来越多地被部署在非平稳环境中,其中正常性的概念本身会随时间变化(Lu等人,2023(https://arxiv.org/html/2607.18289#bib.bib29))。持续异常检测(CAD)研究这种设置,要求检测器适应新兴模式,同时保留关于先前观察到的模式的有用知识(Faber等人,2024a(https://arxiv.org/html/2607.18289#bib.bib12))。CAD继承了异常检测的特定挑战:它通常是单类、无监督或半监督的;异常是罕见的,而正常性本身独立于观察到的异常而发生漂移(Pang等人,2021(https://arxiv.org/html/2607.18289#bib.bib4))。一个需要考虑的关键方面是,传统的异常检测数据集并不自动产生强大的持续场景:当任务多样性较低时,诱导的任务序列可能表现出有限的分布分离,而高绩效可能部分反映一个简单或弱区分的场景,而非广泛解决的CAD问题(Dragoi等人,2022(https://arxiv.org/html/2607.18289#bib.bib2);Amalapuram等人,2024b(https://arxiv.org/html/2607.18289#bib.bib22))。与基于视觉的CAD不同,后者中对象类别可以提供语义上有意义的进展单元(Lee等人,2025(https://arxiv.org/html/2607.18289#bib.bib20)),表格异常检测数据集很少包含经过验证的任务边界。因此,CAD场景通常由时间窗口、元数据字段或手动划分构建而成。这些选择虽然方便,但未必有效,因为不同的时间段可能代表几乎相同的正常模式,而实质性的分布变化可能发生在单个时间段内。因此,由此产生的任务序列可能无法引发有意义的持续学习动态(Amalapuram等人,2024b(https://arxiv.org/html/2607.18289#bib.bib22);Chin and Corizzo,2024(https://arxiv.org/html/2607.18289#bib.bib26))。因此,表格CAD缺乏可靠、可复用的基准场景,也缺乏将现有异常检测数据集转化为经过验证的CAD场景的机制。

本文直接解决场景设计问题。我们不将任务序列视为一个次要的实验细节,而是将场景构建视为一个一流的基准设计问题。给定一个或多个现有的表格异常检测数据集,该框架发现候选任务,使用单任务专家评估其可学习性和迁移结构,过滤不合适的任务,并推导出有原则的排序,以展现不同的持续学习动态。本文并非提供一个详尽的CAD方法排行榜,而是聚焦于基准设计问题本身。我们引入了一个系统化框架来构建和验证CAD场景,并提供了五个单数据集和多数据集基准场景。每个场景都配备了基于课程、泛化和漂移水平的六种排序。该框架和发布的场景共同为未来的CAD基准测试提供了可复现的方法论基础。

我们的贡献如下:
- 我们形式化了一个**有原则的、可复现的基准设计框架**,通过候选任务发现、单任务专家分析、迭代任务过滤、场景排序、场景选择和验证,将现有的表格异常检测数据集转化为持续场景。
- 我们定义了**六种有原则的任务排序族**,它们从相同的保留任务集中展现出互补的持续学习动态。此外,我们为CAD场景定义了三个**场景质量属性**:可行性、非平凡性和遗忘性。
- 我们提供了**五个CAD基准场景**,来自网络安全领域的三个大规模表格异常检测数据集,涵盖了数据集内的模式转变和跨数据集的持续适应。我们提供了即用型的基准测试制品,包括任务划分、训练-测试划分和最终排序,为未来的CAD基准测试建立了可复现的基础。

## 2 相关工作

**异常检测基准测试:** 现有的异常检测基准测试通过标准化数据集、指标和评估协议提高了可复现性(Han等人,2022(https://arxiv.org/html/2607.18289#bib.bib1);Lu等人,2023(https://arxiv.org/html/2607.18289#bib.bib29);Arodi等人,2024(https://arxiv.org/html/2607.18289#bib.bib10))。然而,它们主要在静态、面向流或特定领域的协议下评估异常检测器。它们没有解决CAD特有的、关于持续适应与知识保留的问题。

**持续学习基准测试与任务:** 持续学习基准测试已经表明,基准设计和评估协议在很大程度上决定了哪些形式的遗忘、迁移和适应变得可观察(Lin等人,2021(https://arxiv.org/html/2607.18289#bib.bib7)),并论证了基准设计与关于终身学习系统的主张密不可分(Parisi等人,2019(https://arxiv.org/html/2607.18289#bib.bib18))。在图像分类和强化学习等领域,持续学习基准测试通常通过图像类别、游戏或机器人任务来定义进展,通常依赖自然边界或人工划分,例如将一组类别划分为顺序任务(Lin等人,2021(https://arxiv.org/html/2607.18289#bib.bib7);Parisi等人,2019(https://arxiv.org/html/2607.18289#bib.bib18);Wang等人,2024(https://arxiv.org/html/2607.18289#bib.bib3))。类似地,在面向视觉的CAD中,任务划分通常可以基于语义上有意义的单元,如对象类别或产品类型。然而,在表格CAD中,这种划分远非直接,从而为从现有数据集构建有意义的持续学习场景创造了一个核心挑战。

**持续异常检测与表格CAD场景:** 持续异常检测(CAD)已成为异常检测和持续学习交叉领域的一个独特研究方向(Faber等人,2024a(https://arxiv.org/html/2607.18289#bib.bib12))。现有工作同时关注面向视觉的CAD(通常构建在具有语义上有意义的对象、产品或缺陷结构的图像异常检测基准上(Hu等人,2025(https://arxiv.org/html/2607.18289#bib.bib19);Lee等人,2025(https://arxiv.org/html/2607.18289#bib.bib20)))和表格CAD(其中这种结构通常不那么明确)。最近的CAD方法研究了基于回放的保留、基于提示的适应、任务感知参数化以及面向网络安全的持续训练(Faber等人,2023(https://arxiv.org/html/2607.18289#bib.bib13);Amalapuram等人,2023(https://arxiv.org/html/2607.18289#bib.bib21);Liu等人,2024(https://arxiv.org/html/2607.18289#bib.bib14);Zhang等人,2025(https://arxiv.org/html/2607.18289#bib.bib15);Amalapuram等人,2024b(https://arxiv.org/html/2607.18289#bib.bib22),a(https://arxiv.org/html/2607.18289#bib.bib5))。然而,表格CAD的评估方面比方法论方面发展得不够成熟。许多广泛使用的表格异常检测数据集是为静态异常检测而不是持续学习评估而设计的。因此,它们不提供经过验证的任务边界、有原则的任务排序,也没有证据表明诱导的任务是可学习的、非冗余的,并且能够揭示遗忘或迁移。这就产生了一个特定的基准设计问题。在表格CAD中,一个时间窗口或数据源可能看似定义了一个自然任务,但这种划分不一定对应于有意义的变化。AnoShift(Dragoi等人,2022(https://arxiv.org/html/2607.18289#bib.bib2))是一个重要的正面例子,表明当时间结构足够丰富时,基于时间的划分可以产生有意义的持续场景(Amalapuram等人,2024b(https://arxiv.org/html/2607.18289#bib.bib22))。然而,许多常用的入侵检测数据集,如CICIDS2017或CICIDS2018,覆盖的收集周期更短,且不自动提供同样水平的经过验证的时间结构。这个问题由Amalapuram等人(2023(https://arxiv.org/html/2607.18289#bib.bib21),2024b(https://arxiv.org/html/2607.18289#bib.bib22))说明,他们观察到基于时间的划分可能表现出有限的任务多样性。Faber等人(2024a(https://arxiv.org/html/2607.18289#bib.bib12))提出了一种不同的方法,其中利用基于聚类的选项从最初非持续的数据中构建持续场景(Faber等人,2024a(https://arxiv.org/html/2607.18289#bib.bib12))。然而,这项工作没有提供对创建的任务的进一步验证以保证具有挑战性的场景。这些问题激发了对于更全面框架的需求,其中任务发现只是一个组成部分,还需要明确的过滤、排序和验证标准。为此,我们提出了一个框架,通过使场景构建成为CAD评估中有原则且可复现的一部分来弥补这一差距。此外,我们提供了五个来自三个大规模入侵检测数据集的CAD基准场景。

## 3 用于CAD场景基准设计的框架

我们提出了一个框架,用于将一个或多个现有的表格异常检测数据集转化为经过验证的持续异常检测(CAD)场景。该框架专为那些最初并非作为持续学习基准收集的数据集而设计,不仅仅是将数据集拆分为任意任务,而是构建任务在经验上有意义的CAD场景,这些任务适用于异常检测,并根据明确的评估原理进行组织。该框架支持单数据集和多数据集场景,实现了数据集内的模式转变以及跨数据集的持续适应。其输出不是任意的划分,而是一组可复用的CAD场景,具有经过经验验证的任务结构、有原则的排序、任务统计数据和验证结果。我们框架的图形概览如图1(https://arxiv.org/html/2607.18289#S3.F1)所示。为了便于读者理解,我们还在附录A(https://arxiv.org/html/2607.18289#A1)中提供了符号参考。我们的代码可在以下网址获取:https://github.com/lifelonglab/CAD-Benchmarks-Framework。基准场景可在以下网址获取:https://huggingface.co/collections/lifelonglab/tabular-cad-benchmarks。

1. 任务发现
   生成任务候选 T
   自然划分
   基于聚类的发现
   多数据集
2. 任务评估
   可学习性与异质性 M^f
   使用多个AD模型评估 T
   M^f_{i,j} – 在任务i上训练模型f,在任务j上测试
3. 任务选择
   过滤不合适任务 S
   FC1. 自学习性
   FC2, FC3. 迁移覆盖
   FC4, FC5. 冗余
4. 场景排序
   定义有原则的排序 Π
   基于漂移(平滑、突然)
   基于课程
   基于泛化
5. 场景选择
   最终场景和排序 S^*
   通过跨模型一致性进行场景选择
   通过Borda计数进行排序共识
6. 场景验证
   检查持续学习动态
   可行性
   非平凡性
   遗忘性
7. 输出
   准备好用于基准测试的CAD场景套件
   - CAD-CICIDS2017: 6个任务
   - CAD-CICIDS2018: 5个任务
   - CAD-CICUNSW: 5个任务
   - MCAD-CIC-3x1: 3个任务
   - MCAD-CIC-3xN: 13个任务
   每个场景
   - 最终任务集 T^*
   - 一组6个排序 Π
   - 统计数据和验证结果
   - 可在HuggingFace获取

图1:所提出框架的详细概述,用于将异常检测数据集转化为经过验证的持续异常检测场景。

### 3.1 任务发现

任务发现从一个或多个预处理后的表格异常检测数据集中生成候选任务集。令 D = {D^(1), ..., D^(R)} 表示可用的数据集,其中每个 D^(r) = {(x_i, y_i)}_{i=1}^{N_r} 且 y_i ∈ {0,1} 表示正常或异常样本。每个候选任务集 T_i = {τ_1, ..., τ_K} 建立在任务之上,这些任务由正常数据的一个模式以及测试子集中的异常样本组成:τ_k = (D^(norm)_{k,train}, D^(norm)_{k,test}, D^(anom)_{k,test})。关键要求是候选任务应对应于实质上不同的学习条件,而不是数据集的任意切片。附录B.2(https://arxiv.org/html/2607.18289#A2.SS2)提供了更多形式化细节和示例。我们考虑三种任务发现机制:
- **自然划分**,适用于数据集提供固有的时间、上下文或基于采集的结构时;例如,CICIDS2017可以按捕获日期进行划分。
- **基于聚类的划分**家族,其中任务结构从数据分布中推断出来。我们考虑三种变体:联合聚类正常和异常样本;仅聚类正常样本并将异常分配给最近诱导的聚类;仅聚类正常样本同时随机分布异常。我们在附录B.4(https://arxiv.org/html/2607.18289#A2.SS4)中提供了更多细节。
- **多数据集**选项,在多个数据集基础上构建场景,其中每个数据集可以视为一个单一任务或分解为多个任务。

### 3.2 任务评估与选择

任务发现产生候选任务集,但无论是自然边界还是基于聚类的划分都不能保证结果任务对持续异常检测有意义。因此,我们评估每个候选任务集,以确保任务是可学习的、足够不同且不冗余的。

**任务评估** 我们通过单任务专家(STE)来评估任务异质性。对于每个候选任务和每个模型 f ∈ F,我们在该任务上训练一个STE,并在所有候选任务上进行评估,得到一个跨任务性能矩阵 M^f,其中 M^f_{i,j} 表示在任务 i 上训练并在任务 j 上评估。这种经验视角揭示了可学习性、迁移和潜在的冗余。

相似文章

面向关系数据的异常检测

arXiv cs.LG

本文介绍了RelAD,一个基于重构的框架,用于检测关系数据库中的异常,通过联合建模属性和关系边重构。在六个新基准上的大量实验表明,RelAD优于现有方法。

多变量时间序列基准中的异常大多数是单变量的

arXiv cs.LG

本文介绍了一种用于多变量时间序列异常检测基准的诊断框架,发现标记的异常大多可以从单个通道检测到,这对跨通道建模的必要性提出了挑战。作者呼吁开发更多结构多样的评估数据集。

OpenClawBench:真实世界代理执行轨迹中过程侧异常的基准测试

arXiv cs.AI

本文介绍了OpenClawBench,这是一个大规模数据集,用于对真实世界AI代理执行轨迹中的过程侧异常进行基准测试。该数据集揭示了任务成功可能掩盖过程失败,9.33%通过oracle测试的执行仍包含异常,并通过一种新颖的分类法提供了结构化监督。