桥接分类与重建:协同时间序列异常检测
摘要
本文提出CoAD,一种新颖的框架,统一了异常暴露(分类)和掩码自编码器(重建)两种范式用于时间序列异常检测,解决了它们各自的局限性。大量实验表明,CoAD在轻量快速的同时,显著优于现有最先进方法。
arXiv:2605.26193v1 公告类型:新
摘要:时间序列异常检测(TSAD)因其广泛应用长期以来一直是数据挖掘领域的热点研究课题。近期研究对流行深度学习方法的有效性提出了挑战,指出它们在检测细微和持久异常方面的失败。异常暴露(OE)和掩码自编码器(MAE)作为两种有前景的范式(分类与重建)出现了,用于解决上述问题。然而,基于OE的方法受限于泛化能力差,而基于MAE的方法则受限于掩码不对齐问题。为了解决这些局限性,本文提出了一种新颖的框架CoAD,该框架统一了这两种范式,利用它们的互补优势,同时缓解各自的弱点。在该框架中,分类模块为重建模块生成概率引导的软掩码,这反过来又缓解了分类模块的泛化问题。这种协同设计使CoAD能够有效检测现有方法常常忽略的细微和复杂异常。此外,分类模块经过精心设计,以解决分类粒度不当和忽略频率信息的问题。在高质量基准数据集上、在严格评估协议下进行的大量实验表明,CoAD显著优于现有最先进的深度学习和传统数据挖掘方法,突显深度学习在TSAD中的潜力。此外,CoAD轻量且速度远快于现有最先进方法,展示了其在大规模实时应用中的实用价值。
查看缓存全文
缓存时间: 2026/05/27 09:05
# 弥合分类与重构:协同时间序列异常检测 来源:https://arxiv.org/html/2605.26193 \\setcctype by\\setcctypeby\-nc\-nd Qideng Tang tqd18907@nudt\.edu\.cn (https://arxiv.org/html/2605.26193v1/mailto:[email protected]) 浙江省空间信息感知与传输重点实验室,杭州电子科技大学,杭州,中国 Chaofan Dai cfdai@nudt\.edu\.cn (https://arxiv.org/html/2605.26193v1/mailto:[email protected]) 信息系统工程全国重点实验室,国防科技大学,长沙,湖南,中国 Wubin Ma wb ̇ma@nudt\.edu\.cn (https://arxiv.org/html/2605.26193v1/mailto:wb%CB%[email protected]) Yahui Wu wuyahui@nudt\.edu\.cn (https://arxiv.org/html/2605.26193v1/mailto:[email protected]) 信息系统工程全国重点实验室,国防科技大学,长沙,湖南,中国 Haohao Zhou haohaozhou@nudt\.edu\.cn (https://arxiv.org/html/2605.26193v1/mailto:[email protected]) 信息系统工程全国重点实验室,国防科技大学,长沙,湖南,中国 Tao Zhang zhangtao@nudt\.edu\.cn (https://arxiv.org/html/2605.26193v1/mailto:[email protected]) 系统工程学院,国防科技大学,长沙,湖南,中国 Huan Li lihuan\.cs@zju\.edu\.cn (https://arxiv.org/html/2605.26193v1/mailto:[email protected]) 浙江大学,杭州,中国 以及 Dalin Zhang zhangdalin@hdu\.edu\.cn (https://arxiv.org/html/2605.26193v1/mailto:[email protected]) 浙江省空间信息感知与传输重点实验室,杭州电子科技大学,杭州,中国 \(2009年6月5日\) ###### 摘要。时间序列异常检测(TSAD)因其广泛应用一直是数据挖掘领域的研究热点。近期的研究对流行的深度学习方法在TSAD中的有效性提出了质疑,认为它们在检测细微和持续性异常方面存在不足。异常暴露(OE)和掩码自编码器(MAE)被认为是解决上述问题的两种有前景的范式(分类和重构)。然而,基于OE的方法受限于泛化能力差,而基于MAE的方法则受限于掩码不对齐问题。为了解决这些局限性,本文提出了一种新颖的框架CoAD,它统一了这两种范式,以利用它们互补的优势,同时减轻各自的弱点。在该框架中,分类模块为重构模块生成概率信息驱动的软掩码,这反过来又缓解了分类模块的泛化问题。这种协同设计使CoAD能够有效检测现有方法经常忽略的细微和复杂异常。此外,分类模块经过精心设计,以解决分类粒度不当和忽视频率信息的问题。在高质量基准数据集上并采用严格评估协议进行的大量实验表明,CoAD显著优于最先进的深度学习和传统数据挖掘方法,凸显了深度学习在TSAD中的潜力。此外,CoAD轻量且速度明显快于现有SOTA方法,展示了其在大规模实时应用中的实用价值。 ††期刊年份:2026††版权:cc††会议:第32届ACM SIGKDD知识发现与数据挖掘会议 V.2;2026年8月9–13日,韩国济州岛††论文集:第32届ACM SIGKDD知识发现与数据挖掘会议 V.2 (KDD ’26),2026年8月9–13日,韩国济州岛††DOI:10.1145/3770855.3818108††ISBN:979-8-4007-2259-2/2026/08††期刊年份:2026††版权:cc††会议:第32届ACM SIGKDD知识发现与数据挖掘会议 V.2;2026年8月9–13日,韩国济州岛††论文集:第32届ACM SIGKDD知识发现与数据挖掘会议 V.2 (KDD 2026),2026年8月9–13日,韩国济州岛††ISBN:979-8-4007-2259-2/2026/08††DOI:10.1145/3770855.3818108††CCS:计算方法 → 异常检测††CCS:数学计算 → 时间序列分析††CCS:信息系统 → 数据流挖掘 ## 1. 引言 请参见插图,比较不同掩码策略:随机掩码、光栅掩码以及CoAD中提出的概率软掩码,以及对应的重构误差。 图1:我们的掩码策略(CoAD)与现有掩码策略的比较。上半部分可视化了掩码。随机掩码和光栅掩码是二值化策略,阴影区域作为掩码,而CoAD是一种概率策略,颜色越深表示掩码越强。 时间序列异常检测旨在识别时序数据中偏离预期行为的模式,并且在众多应用中至关重要(Blázquez-García et al., 2022; Kim et al., 2022; Gupta et al., 2014; Schmidl et al., 2022)。近年来,深度学习为时间序列异常检测(TSAD)带来了许多方法(Li and Jung, 2023; Zamanzadeh Darban et al., 2025; Choi et al., 2021)。然而,最新的研究(Schmidl et al., 2022; Lai et al., 2021; Rewicki et al., 2023; Liu and Paparrizos, 2024; Sarfraz et al., 2024; Mejri et al., 2024; Garg et al., 2022)表明,基于深度学习的方法可能不如经典的数据挖掘方法,特别是在检测细微和持续性异常方面(Lee et al., 2024; Sun et al., 2024)。作为回应,异常暴露(OE)(Hendrycks et al., 2019)和掩码自编码器(MAE)(He et al., 2022)已成为解决上述问题的突出范式(Jeong et al., 2023; Wang et al., 2024a; Xu et al., 2024a; Tang et al., 2025; Shentu et al., 2025; Goswami et al., 2024; Fang et al., 2024)。尽管如此,这两种范式都存在固有限制,可能阻碍其在复杂现实世界时间序列中的有效性。 基于OE(分类)方法的局限性: L1. 高度依赖先验知识:基于OE的方法假设存在共同的异常模式,并使用先验异常知识生成伪异常样本来训练分类器。当真实异常与预定义类型匹配时,这种方法有效,但无法泛化到未见过的或意外的异常。 L2. 分类粒度不当:当前基于OE的方法要么在“步骤级别”要么在“窗口级别”操作,各有缺点。步骤级别分类(Jeong et al., 2023)通过单次前向传递嵌入整个输入窗口,为每个时间步分配异常分数;然而,它在需要更长窗口以获取足够上下文时表现不佳(Tang et al., 2025)。相比之下,窗口级别分类(Wang et al., 2024a; Xu et al., 2024a)预测整个窗口的异常,并通过滑动窗口生成逐步分数。虽然这样能捕获更长的上下文,但细微异常可能被占主导的正常模式掩盖,导致漏检。 L3. 忽略频域信息:大多数基于OE的方法仅在时域中操作,忽略了某些异常可能更明显的频域。因此,在时域中细微或模糊的频率敏感异常可能会被漏检。 基于MAE(重构)方法的局限性: L4. 掩码与异常位置不对齐:基于MAE的方法通过从非掩码块重构掩码块来建模正常模式,并根据重构误差分配异常分数。理想情况下,掩码应针对潜在异常区域,同时保持正常块不掩码,使模型能够依赖周围的正常模式进行重构。然而,如图1所示,现有方法通常采用随机掩码(Tang et al., 2025; Shentu et al., 2025)或光栅掩码(Chen et al., 2023),而不考虑块语义,不加区分地掩码正常和异常区域。因此,模型可能会重现异常模式,导致正常区域的误报(Tang et al., 2025)(图1(a)中较大的重构误差),或者通过准确重构异常区域而漏检异常(Yao et al., 2023)(图1(b))。 为了克服这些局限性,我们提出CoAD,一种协同异常检测框架,统一了基于分类和基于重构方法的优势。CoAD的核心是一种引导软掩码机制,它利用基于OE的分类来指导基于MAE的重构的掩码。与传统的随机或均匀掩码不同,CoAD应用概率信息驱动的软掩码,其中所有块都被掩码,但更可能是异常的块被更强烈地掩码(见图1)。这抑制了重构过程中的异常相关线索,产生更准确的异常分数,从而有效解决了L4。由于基于MAE的重构可以恢复异常区域内的正常模式,它反过来为基于OE的分类提供了“准正常参考”。这一洞察促使我们设计了基于残差的分类模块,该模块利用原始块与重构块在特征空间中的差异作为可泛化的异常判别表示,从而促进新异常的检测。此外,基于MAE的重构受到OE的约束,只学习正常数据分布,因此无法重构未见过的异常。在推理过程中,分类和重构模块协同工作以检测异常。这种整体协同机制使CoAD能够识别之前未见过的异常,从而解决了L1。为了支持这种协同策略,CoAD引入了块级、双分支时频分类模块。输入序列被划分为不重叠的块,每个块基于从时域和频域提取的特征进行分类。这种设计有两个优点:它通过块内和块间相关性捕获长短期上下文信息(解决了L2),并整合了现有方法经常忽视的频域模式(解决了L3)。 鉴于最近对许多现有研究实验可靠性的担忧(Liu and Paparrizos, 2024; Wu and Keogh, 2021a; Keogh, 2021; Wu and Keogh, 2024b),我们使用最高质量的数据集和最稳健的指标进行严格评估。实验结果表明,CoAD在314个数据集上始终优于24种SOTA方法,取得了显著优越的性能。此外,定性分析证实,CoAD能有效检测现有方法经常忽略的细微和具有挑战性的异常,包括即使人类专家也难以识别的案例。此外,CoAD的运行速度比现有方法快数个数量级,突显了其卓越的效率和可扩展性。 ## 2. 相关工作 ### 2.1. 数据挖掘与深度学习 最近的研究(Rewicki et al., 2023; Liu and Paparrizos, 2024; Mejri et al., 2024)挑战了流行的基于深度学习的TSAD方法的有效性,表明经典的数据挖掘方法,如基于不一致的方法(例如,Matrix Profile (Nakamura et al., 2020) 和 DAMP (Lu et al., 2023))以及基于聚类的方法(例如,SAND (Boniol et al., 2021) 和 KShapeAD (Liu and Paparrizos, 2024)),优于深度学习方法。这些研究(Liu and Paparrizos, 2024; Sun et al., 2024; Tang et al., 2025)特别指出,深度学习方法由于无法在正常样本和细微异常样本之间学习清晰的判别边界,因此无法检测细微和持续性异常(Wang et al., 2024a; Xu et al., 2024a)。 ### 2.2. 基于OE的方法 基于OE的方法假设时间序列中存在共同的异常模式,并旨在基于生成的伪异常训练二分类器。通过将先验异常知识显式注入模型,这些方法能够在正常和异常样本之间学习更清晰的决策边界。AnomalyBERT (Jeong et al., 2023)是一项开创性工作,它假设时间序列中的四种代表性异常类型,并采用类似BERT的结构提取特征并进行异常分类。尽管取得了有希望的性能,但它严重依赖预先假设的异常模式,并且通常泛化到未见过的异常类型方面表现不佳。后续研究试图通过将子序列替换为从其他位置剪切的随机片段作为预先假设的异常(Wang et al., 2024a),或者采用单类分类器额外测量到正常模式的距离(Xu et al., 2024a)来解决这个问题。尽管这些技术看似有前途,但它们的进展并未带来实质性的改进(见表4.3)。泛化仍
相似文章
检测不可检测之异常:通过主动学习增强无监督时间序列异常检测
提出一种新框架,结合主动学习、掩码重构与极小极大策略,以改进无监督时间序列异常检测。在28个测试案例中,相较于基线模型,AUC提升12.39%。
TPA-AD:一种用于轴承时间序列异常检测的两阶段伪异常引导方法
TPA-AD 是一种用于轴承时间序列异常检测的两阶段伪异常引导方法,利用重建模型和对比学习在正常边界附近生成伪异常窗口,再通过 KNN 对异常进行评分——训练过程中无需真实异常样本。该方法在轴承故障和退化数据集上进行了评估,包括高速列车轴箱轴承数据。
CALAD: 通道感知对比学习用于多变量时间序列异常检测
提出了CALAD,一个用于多变量时间序列异常检测的通道感知对比学习框架,该框架利用估计的通道相关性构建对比样本,实现了最先进的性能。
面向关系数据的异常检测
本文介绍了RelAD,一个基于重构的框架,用于检测关系数据库中的异常,通过联合建模属性和关系边重构。在六个新基准上的大量实验表明,RelAD优于现有方法。
面向物联网系统多变量时间序列异常检测的联邦低秩Koopman学习
提出FedKAD,一种面向物联网系统中多变量时间序列的联邦Koopman异常检测框架,采用轻量级滑动窗口Koopman表示和Stiefel-ADMM算法实现高效通信和推理。