D2H-AD:一种利用超维计算的高级异常检测混合模型

arXiv cs.LG 论文

摘要

D2H-AD是一种新颖的异常检测框架,采用超维计算(HDC),结合了基于距离和密度感知的编码。它在多个基准测试中优于五种基线方法,为边缘AI和物联网提供轻量级、可解释且高效的性能。

arXiv:2606.13754v1 公告类型:新 摘要:异常检测是智能系统的基本组成部分,应用于医疗、网络安全、智能电网和物联网环境。尽管传统的机器学习和深度学习方法在识别异常方面表现出有效性,但它们通常依赖于大规模标注数据集、计算成本高,并且在边缘和高维场景中面临可扩展性挑战。本文提出了 D2H-AD,一种基于超维计算(HDC)的新型异常检测框架,HDC 是一种受大脑启发的范式,利用高维分布式向量表示信息。与现有的基于 HDC 的方法不同,D2H-AD 在统一框架内集成了基于距离的相似性和密度感知编码,提升了异常表示和检测性能。消融研究表明,与直接在原始特征空间中应用相同的密度-距离评分相比,仅使用超维编码即可使 ROC-AUC 提高高达 5.4%。此外,D2H-AD 在所有评估数据集上始终优于五种既定基线方法,即 HDAD、ODHD、一类支持向量机(One-Class SVM)、孤立森林(Isolation Forest)和自编码器(Autoencoders)。该框架轻量、可解释且计算高效,适用于资源受限和实时应用。我们在五个基准数据集上验证了 D2H-AD,展示了其优异的 F1 分数和 ROC-AUC 性能,以及对类别不平衡、噪声和数据复杂性的鲁棒性。除了提高准确性外,D2H-AD 还通过二进制计算和紧凑设计实现了可扩展性、小内存占用和低延迟操作。这些特性使其特别适用于 TinyML 和边缘 AI 部署。所提出的框架凸显了 HDC 在动态环境中进行准确、可解释且节能的异常检测的潜力。
查看原文
查看缓存全文

缓存时间: 2026/06/15 09:07

# D2H-AD:一种利用超维计算进行高级异常检测的混合模型 来源:https://arxiv.org/html/2606.13754 埃拉赫·加贾里²[![[未附图注图像]](https://arxiv.org/html/2606.13754v1/x2.png)](https://orcid.org/0009-0009-4263-5112) 阿舒托什·吉米尔¹[![[未附图注图像]](https://arxiv.org/html/2606.13754v1/x3.png)](https://orcid.org/0000-0001-6210-1219) 赛义德·阿塔埃³[![[未附图注图像]](https://arxiv.org/html/2606.13754v1/x4.png)](https://orcid.org/0009-0004-0326-2249) 法里斯·阿尔苏拉米⁴[![[未附图注图像]](https://arxiv.org/html/2606.13754v1/x5.png)](https://orcid.org/0000-0002-0868-3905) 法西·阿姆萨德¹[![[未附图注图像]](https://arxiv.org/html/2606.13754v1/x6.png)](https://orcid.org/0000-0002-7582-8326) 莱特州立大学,代顿,俄亥俄州 45435,美国(电子邮箱:[ghajari.2, ashutosh.ghimire, fathi.amsaad]@wright.edu) 阿扎德大学,阿瓦士 6887561349,伊朗(电子邮箱:[email protected]) 史蒂文斯理工学院,霍博肯,新泽西州 07030,美国(电子邮箱:[email protected]) 吉达大学,吉达 23890,沙特阿拉伯(电子邮箱:[email protected]) ###### 摘要 异常检测是现代智能系统的基石,在医疗保健、网络安全、智能电网和物联网环境中具有关键应用。尽管传统的机器学习和深度学习模型在识别异常值方面显示出潜力,但它们常常面临挑战,例如依赖大型标注数据集、高计算成本以及对边缘设备或高维数据流的可扩展性有限。本研究引入了D2H-AD,一种基于超维计算(HDC)的新型异常检测框架,HDC是一种受大脑启发的范式,使用高维分布式向量对信息进行编码。与以往基于HDC的方法不同,D2H-AD在混合设计中融合了基于距离的相似性和密度感知编码,显著改善了异常表征和检测精度。消融实验证实,与在原始欧几里得特征空间中应用相同的密度-距离评分相比,仅超维编码本身就能使ROC-AUC提高多达5.4%,并且D2H-AD在所有评估数据集上持续优于所有五个已发表的基线方法(HDAD、ODHD、一类支持向量机、孤立森林和自编码器)。该方法设计为轻量级、可解释且计算高效,表明其非常适合在资源受限和实时环境中部署。为了验证其有效性,我们在五个不同的基准数据集上评估了D2H-AD,并将其性能与五种领先技术(HDAD、ODHD、一类SVM、孤立森林和自编码器)进行了比较。我们的结果表明,D2H-AD持续获得优越的F1分数和ROC-AUC指标,表现出对类别不平衡、噪声和数据复杂性的鲁棒性。除了准确性,D2H-AD还具有实用优势,包括可扩展性、最小内存占用以及由其二进制运算和轻量级设计带来的预期低延迟特性。这些特性对于TinyML和边缘AI应用至关重要。这项工作凸显了HDC在高性能异常检测中的未开发潜力,并为在物联网、嵌入式系统等动态环境中实现安全、可解释且节能的AI解决方案开辟了新途径。此外,D2H-AD通过超向量解码提供特征级别的可解释性,从而为安全关键型应用提供透明的解释。 ###### 索引术语:超维计算、异常检测、基于密度的评分、一类分类、物联网安全 ## I. 引言 异常检测,也称为离群点检测,是数据分析和机器学习中的一个关键过程,涉及识别数据流中与预期显著偏差的不寻常模式或行为。这些异常或离群点通常是突然的、不常见的现象,以前未曾遇到过,使得它们难以预测和管理[agrawal2015survey]。虽然一些异常可能是良性的,但其他异常可能是危险的,可能指示系统故障、安全漏洞或其他关键问题。识别这些异常模式至关重要,因为它可以在各个领域提供有价值的见解并启用及时的干预措施[ramchandran2018unsupervised]。异常检测在包括医疗保健、网络安全、欺诈检测、物联网、工业系统和关键基础设施在内的不同领域发挥着关键作用。在临床和生物医学背景下,考虑类别不平衡的联邦影像分析[khaniki2025class]、安全心脏监测[ahmadi2025multiheart]、帕金森患者步态异常检测[alazeb2024effective]、医院网络EHR分析[niu2025anomaly]以及无线体域网安全[islam2025securing]凸显了对可解释和隐私保护解决方案的需求。在工业和计算领域,基于AI的电力系统故障检测[behnam2024decentralized]、实时异常检测[abibulaiev2026context]、TinyML驱动的物联网监控[katib2025safeguarding]以及工业异常检测的进化方法[zeng2025evolutionary]强调了在分布式边缘环境中可扩展且资源高效方法的重要性。随着数据挖掘的兴起,对稳健异常检测机制的需求变得更加迫切。传统的工具,如入侵检测系统(IDS)、恶意软件扫描器和网络监控软件,通常采用基于规则的检测方法,将传入的数据流量与预定义的模式或规则进行比较,以识别潜在威胁[zhong2022bidirectional]。虽然这些方法对已知问题有效,但随着数据模式演变并变得越来越复杂,它们可能变得过时且效率降低,因此需要探索更具适应性和智能的检测策略。在内存和延迟至关重要的资源受限设备中,这些挑战被放大。为了应对这些挑战,现代异常检测方法越来越多地依赖数据挖掘技术。这些技术涉及分析大型数据集以发现可能指示异常的模式和关联。一些常见的方法包括聚类(将数据分组)和分类(基于预标注的训练数据将数据划分到类别中)。虽然基于聚类的异常检测通过将数据分割成更小的子集有助于识别不熟悉的攻击,但分类方法通常更精确,但由于可扩展性问题可能难以处理高数据量[hu2021real]。异常检测领域随着高级数据挖掘技术(如时间挖掘、离群点检测和关联规则挖掘)的集成而显著发展。这些方法协同工作,以提高在动态和高容量环境中检测异常的精度和速度。例如,在网络安全中,实时网络异常检测系统对于分析流量模式和识别可疑活动(如未经授权的访问或数据泄露)至关重要[goswami2024ai]。在医疗保健中,高级异常检测技术用于分析医学影像数据,例如检测MRI或CT扫描中可能指示早期疾病的细微异常[ghajari2024hybrid]。此外,视频异常检测系统越来越多地部署在安全和监控领域,用于在公共交通枢纽、机场和其他敏感位置实时识别异常行为[zhong2022cascade, verma2024real, rezaee2024survey]。尽管异常检测取得了进展,但仍存在若干挑战。开发能够适应不同场景并实时处理大量数据的通用算法是一个重大障碍。传统的基于规则的算法通常缺乏适应新的或变化的数据模式的灵活性,使它们在动态环境中效率低下。相比之下,非参数学习算法提供了更多的适应性,允许它们通过学习先前的实例来响应不断发展的数据。监督分类学习是机器学习中一种流行的技术,因其在异常检测中的有效性而备受关注。诸如决策树、模糊逻辑系统和支持向量机之类的算法已被广泛使用,其中人工神经网络因其建模数据中复杂关系的能力而显示出特别的希望[purarjomandlangrudi2014data]。然而,神经网络中的泛化能力差、局部收敛问题和结构困难等挑战仍需解决。为了克服这些限制,正在探索结合监督和非监督技术的混合方法[shon2007hybrid]。这些方法旨在降低误报率并提高检测精度,尽管它们也有自己的挑战,包括算法设计的复杂性、需要多样化的训练样本以及确保可扩展性的困难。随着该领域研究的不断发展,异常检测存在进一步发展的巨大潜力,特别是在提高检测模型的可扩展性、实时处理能力和可解释性方面。这些发展对于增强异常检测在各种应用中的有效性以及确保在日益复杂和数据丰富的环境中系统的可靠性至关重要。这些方法可能资源密集型,需要大量的计算能力和大量的标注数据。此外,它们在高维度、噪声和实时分析需求的环境中也常常遇到困难。这正是超维计算(HDC)发挥作用的地方。HDC,也称为向量符号架构,是一种受人类大脑处理信息方式启发的新型计算范式。与依赖精确数值表示的传统计算方法不同,HDC使用高维二进制向量(也称为超向量)来表示数据。这些超向量可以以对噪声鲁棒且计算高效的方式编码复杂模式[kanerva2009hyperdimensional, ge2020classification]。HDC的主要优势之一是能够对这些向量执行模仿认知过程(如联想记忆和推理)的操作,从而实现快速学习和推理。HDC在异常检测背景下的重要性不言而喻。传统的异常检测方法通常需要大量训练,并且对数据中的噪声和变异性敏感。相比之下,HDC使用高维空间可以自然分离正常模式和异常模式,即使在存在噪声的情况下也是如此。这使得HDC特别适合资源受限的环境,如物联网设备和嵌入式系统,其中计算效率和鲁棒性至关重要[wang2023hyperdetect]。此外,HDC从有限数据中泛化的能力使其在标注异常稀缺的场景中成为一个有吸引力的选择。使用HDC进行异常检测的应用跨越多个领域。在网络安全中,HDC可用于检测网络流量中的异常模式,可能实时识别安全漏洞[wang2023hyperdetect, wang2023late, ma2023robust]。在工业环境中,HDC可以监控来自机械设备的传感器数据,识别设备故障的早期迹象,从而防止代价高昂的停机[mitrokhin2019learning, gungor2022res]。在医疗保健中,HDC可以协助监控患者数据以寻找可能指示医疗状况发作的不规则迹象[pale2023hyperdimensional, pale2022hyperdimensional]。尽管有这些优势,HDC在异常检测中的应用并非没有限制。一个挑战是需要仔细设计数据到超向量的编码,因为不良的编码会导致次优性能。此外,虽然HDC本质上对噪声具有鲁棒性,但它可能仍然难以处理非常细微且接近正常数据分布的异常[wilson2023hyperdimensional]。异常检测与HDC之间的关系是共生的,彼此增强对方的能力。异常检测受益于HDC有效处理高维数据的能力及其对噪声的鲁棒性,而HDC提供了一个框架,可以在其中有效地建模和分析复杂的数据模式。最近的工作已展示了HDC在网络安全推理中的符号和可解释性质[zakeri2025enabling],突显了受大脑启发的计算范式的更广泛适用性。我们的工作引入了D2H-AD,它在HDC编码框架内整合了基于距离的相似性和密度感知评分。通过结合这些互补的度量,所提出的方法旨在更好地表征不平衡和高维数据集中的异常模式。对基准数据集的实证评估证明了这种混合方法在不同异常检测场景中的有效性。本文报告了以下研究贡献。

1. 我们引入了D2H-AD,一种无监督的异常检测方法,以其核心组件命名:密度(Density)、距离度量(Distance metrics)和超维计算(Hyperdimensional Computing),结合起来进行异常检测。这种方法与监督方法相比具有竞争力,同时消除了大量训练时间的需求。通过超维计算(HDC)将数据表示为高维二进制向量的能力,无需传统机器学习模型通常需要的迭代优化过程,即可直接计算密度和距离度量,从而消除了冗长的训练。通过利用这些预编码的超向量,D2H-AD无需依赖大规模标注数据集或耗时的模型训练即可有效计算异常分数。
2. 我们提出了一种新颖的异常检测方法,将密度和距离度量结合在超维计算(HDC)框架内。创新之处在于将数据集编码为高维二进制向量,这些向量本质上捕捉数据关系和模式。异常检测过程然后由两步方法驱动:首先,编码后的超向量无需传统的计算开销即可高效计算密度和距离度量;其次,基于这些度量计算异常分数,利用高维空间自然分离正常和异常模式。这种简化而有效的过程提高了检测精度,同时暗示了计算效率,即使在高维和噪声数据集中也是如此。
3. 我们在五个不同的数据集[rayana2016outlier]上评估了所提出的D2H-AD模型的性能,并将其与几种成熟的和最新的方法进行了比较。使用F1分数和ROC-AUC指标评估的结果一致表明,我们的模型在所有情况下都优于基线技术。这证明了我们的方法在处理各种异常检测任务中的有效性和鲁棒性,相比现有方法提供了显著的改进。[shul2023noise, sato2024high, li2016anomaly, liu2008isolation, he2020exploring, tang2015outlier, amrouch2023beyond, wang2021brief, wang2022odhd, ghajari2025network, ghajari2025intrusion, xu2025ifodhd, xu2024]

相似文章

面向关系数据的异常检测

arXiv cs.LG

本文介绍了RelAD,一个基于重构的框架,用于检测关系数据库中的异常,通过联合建模属性和关系边重构。在六个新基准上的大量实验表明,RelAD优于现有方法。