用于网络异常检测的混合潜变量-结构融合(HLSF)

arXiv cs.LG 论文

摘要

提出混合潜变量-结构融合(HLSF),一种加权异常融合框架,结合CP-APR结构异常分数与来自归一化流的隐空间密度分数,在真实受损用户凭证数据上提升了网络异常检测性能。

arXiv:2607.18479v1 Announce Type: new 摘要:恶意异常活动检测是网络安全系统的基础挑战。基于统计框架的张量分解(采用CANDECOMP-PARAFAC交替泊松回归,CP-APR)和归一化流已被证明是强大的无监督机器学习方法,能够对多维数据建模,并捕捉网络安全应用中行为特征的复杂多面细节。在本研究中,我们提出混合潜变量-结构融合(HLSF),一种加权异常融合框架,将CP-APR结构异常分数与从归一化流导出的隐空间密度分数相结合。我们的实验表明,与单独使用CP-APR或归一化流相比,HLSF框架在来自洛斯阿拉莫斯国家实验室(LANL)大型企业网络的红队演练中收集的真实受损用户凭据数据集上提升了异常检测性能。
查看原文
查看缓存全文

缓存时间: 2026/07/22 08:21

# 混合潜在结构融合(HLSF)的网络安全异常检测
来源:https://arxiv.org/html/2607.18479
Dorianis Mercedes Perez¹¹¹目前地址:计算研究中心,桑迪亚国家实验室,阿尔伯克基,NM 87185Maksim Ekin Erenmaksim@lanl\.gov (https://arxiv.org/html/2607.18479v1/mailto:[email protected])Bryan Edward Kaiserbkaiser@lanl\.gov (https://arxiv.org/html/2607.18479v1/mailto:[email protected])

###### 摘要

恶意异常活动检测是网络安全系统面临的一个基本挑战。在统计框架下使用CANDECOMP-PARAFAC交替泊松回归(CP-APR)的张量分解和归一化流都已被证明是强大的无监督机器学习方法,能够对多维数据建模,并捕获网络安全应用中行为特征的复杂和多面细节。在本研究中,我们提出混合潜在结构融合(HLSF),一个加权异常融合框架,将CP-APR结构异常得分与来自归一化流的潜在空间密度得分相结合。在我们的实验中,我们表明,与单独使用CP-APR或归一化流相比,HLSF框架在从洛斯阿拉莫斯国家实验室(LANL)大型企业网络在红队演习期间收集的真实世界被泄露用户凭证数据集上提高了异常检测性能。

###### 关键词:

网络异常检测,非负张量分解,无监督学习,归一化流

\\csdef

WGMwgm\\xspace\\csdefQEqe\\xspace

\\affiliation

\[1\]organization=十计算物理分部,地址线=洛斯阿拉莫斯国家实验室,城市=洛斯阿拉莫斯,邮编=87545,州=NM,国家=美国

\\affiliation

\[2\]organization=分析、情报与技术分部,地址线=洛斯阿拉莫斯国家实验室,城市=洛斯阿拉莫斯,邮编=87545,州=NM,国家=美国

## 1 引言

自计算机出现以来,数字信息一直容易受到攻击。网络系统首次出现于20世纪60年代和70年代,早期的恶意软件和网络入侵也随之而来[29 (https://arxiv.org/html/2607.18479#bib.bib33)]。Anderson在1980年的报告中引入了这样一种观点:可以通过检查安全审计跟踪来发现对系统的未授权访问[4 (https://arxiv.org/html/2607.18479#bib.bib48)]。基于异常方法的入侵检测则于1987年正式确立,当时Denning通过监控系统行为并与正常使用的统计特征进行对比,正式提出了基于异常检测的概念[13 (https://arxiv.org/html/2607.18479#bib.bib34)]。如今,对网络异常(如被入侵账户、内部威胁、恶意软件流量和网络钓鱼)的检测仍然是网络防御者面临的重大挑战[20 (https://arxiv.org/html/2607.18479#bib.bib8)]。这些挑战凸显了对能够在大规模复杂网络环境中自动识别微小的正常行为偏离的方法的需求。

最近的工作表明,基于降维的潜在因子模型(最初为协同过滤推荐系统而开发)为网络行为建模提供了一个强大的框架[21 (https://arxiv.org/html/2607.18479#bib.bib2)]。矩阵分解可以识别用户和设备的“对等组”,从而能够基于数据驱动预测用户未来的行为[12 (https://arxiv.org/html/2607.18479#bib.bib11),46 (https://arxiv.org/html/2607.18479#bib.bib13),36 (https://arxiv.org/html/2607.18479#bib.bib12)]。最近,张量分解方法将这些思想扩展到网络数据的高阶降维,同时捕获用户、设备、资源和时间之间的交互。Eren等人表明,在统计框架内扩展张量分解方法能够在广泛的网络安全应用中实现最先进的无监督异常检测[20 (https://arxiv.org/html/2607.18479#bib.bib8)]。他们的方法使用了最初由[11 (https://arxiv.org/html/2607.18479#bib.bib35)]引入的CANDECOMP-PARAFAC交替泊松回归(CP-APR)算法的实现,并在涉及垃圾邮件流量、异常信用卡交易、僵尸网络流量和检测凭证被入侵用户的任务上,取得了比统计矩阵分解以及其他监督和无监督方法更强的异常检测性能。

与此同时,归一化流已成为现实世界应用中分布外(OOD)检测的一种方法,应用领域涵盖自动驾驶、医疗诊断和安全系统[51 (https://arxiv.org/html/2607.18479#bib.bib18),48 (https://arxiv.org/html/2607.18479#bib.bib27),6 (https://arxiv.org/html/2607.18479#bib.bib28),24 (https://arxiv.org/html/2607.18479#bib.bib29),9 (https://arxiv.org/html/2607.18479#bib.bib30),7 (https://arxiv.org/html/2607.18479#bib.bib31),49 (https://arxiv.org/html/2607.18479#bib.bib32)]。在整个深度学习社区中,归一化流被认为是一个强大的工具,因为它能够对复杂的概率分布进行建模并执行精确的似然估计[51 (https://arxiv.org/html/2607.18479#bib.bib18),14 (https://arxiv.org/html/2607.18479#bib.bib19),15 (https://arxiv.org/html/2607.18479#bib.bib20),35 (https://arxiv.org/html/2607.18479#bib.bib21),27 (https://arxiv.org/html/2607.18479#bib.bib65)]。归一化流通过从数据空间到潜在空间的双射映射来学习精确、灵活的密度模型[35 (https://arxiv.org/html/2607.18479#bib.bib21),51 (https://arxiv.org/html/2607.18479#bib.bib18)]。这使得它们能够有效地从分布内(ID)数据中提取特征,具体方法是通过最大化似然在ID数据的高级特征上进行训练,然后使用低似然作为OOD检测的得分函数[51 (https://arxiv.org/html/2607.18479#bib.bib18),32 (https://arxiv.org/html/2607.18479#bib.bib22),41 (https://arxiv.org/html/2607.18479#bib.bib23),26 (https://arxiv.org/html/2607.18479#bib.bib24),50 (https://arxiv.org/html/2607.18479#bib.bib25),2 (https://arxiv.org/html/2607.18479#bib.bib26)]。正因为如此,归一化流已成为许多应用中无监督异常检测的流行且成功的方法[53 (https://arxiv.org/html/2607.18479#bib.bib50),25 (https://arxiv.org/html/2607.18479#bib.bib49),22 (https://arxiv.org/html/2607.18479#bib.bib51),39 (https://arxiv.org/html/2607.18479#bib.bib52)]。

在本研究中,我们提出使用一种混合方法,称为混合潜在结构融合(HLSF),其中CP-APR通过潜在因子提供张量化稀疏数据的结构化表示,而归一化流(通过实值非体积保持(RealNVP))则帮助我们对潜在行为的密度进行建模[15 (https://arxiv.org/html/2607.18479#bib.bib20)]。这使得归一化流能够检测训练期间未见过的潜在组合,而这正是网络异常信号。CP-APR学习存在哪些模式,而归一化流则学习特定模式配置的可能性有多大。将两者结合,通过同时捕获结构和分布,提高了异常检测性能。我们的结果有力地证明了这种方法可以超越任何一种单独使用的方法。我们从公开的统一主机和网络数据集中构建稀疏张量,该数据集包含了在洛斯阿拉莫斯国家实验室(LANL)真实大型网络在红队演习期间记录的涉及凭证被入侵用户的异常。我们使用CP-APR算法通过泊松张量分解(CP-APR)[45 (https://arxiv.org/html/2607.18479#bib.bib14)]来分解一个指定秩的张量。然后利用得到的潜在因子,通过拟合模型中的p值对异常进行评分。第二种方法使用归一化流学习将数据变换为潜在分布,并通过负对数似然(NLL)生成异常得分。混合方法通过加权求和的方式对异常进行评分。然后对这些方法进行比较,我们发现,在某些矩阵和张量配置中,当我们选择不同的变量来表示张量的维度时,归一化流以及后续的混合方法往往在所有数据集上都优于基于CP-APR的异常得分。通过对CP-APR潜在因子(而非原始张量)进行建模,流在结构化的连续表示上进行操作,其中的简单性反映了有意义的模式而非稀疏性。这防止了退化或随机输入获得人为的高似然性,从而减轻了归一化流已知的向低复杂度数据倾斜的偏差[51 (https://arxiv.org/html/2607.18479#bib.bib18),38 (https://arxiv.org/html/2607.18479#bib.bib40),32 (https://arxiv.org/html/2607.18479#bib.bib22),41 (https://arxiv.org/html/2607.18479#bib.bib23),34 (https://arxiv.org/html/2607.18479#bib.bib41)]。总而言之,我们的贡献如下:

1.  利用归一化流检测网络流数据中的网络异常,重点关注真实网络数据集中凭证被入侵的用户。
2.  比较了归一化流与使用CP-APR的张量分解在异常检测性能上的表现。
3.  引入了一个名为HLSF的混合框架,该框架融合了来自张量分解和归一化流的异常得分,以提高检测性能。

论文的其余部分组织如下:第2节描述了异常检测方法的相关工作以及选择这些特定方法的动机;第3节描述了我们的方法论,并给出了每种方法的数学公式;第4节介绍了实验设置和结果;第5节以关键发现总结全文。

## 2 相关工作

网络异常检测的最新进展越来越侧重于能够捕获大规模安全数据中潜在行为结构的潜在因子模型[31 (https://arxiv.org/html/2607.18479#bib.bib53),28 (https://arxiv.org/html/2607.18479#bib.bib54),8 (https://arxiv.org/html/2607.18479#bib.bib55),47 (https://arxiv.org/html/2607.18479#bib.bib56)]。早期工作使用泊松矩阵分解(PMF)对用户、主机和资源之间的交互进行建模,同时通过基于泊松分布的异常得分识别统计上不太可能的事件[46 (https://arxiv.org/html/2607.18479#bib.bib13),37 (https://arxiv.org/html/2607.18479#bib.bib15),36 (https://arxiv.org/html/2607.18479#bib.bib12)]。这些方法表明,推荐系统方法论可以有效且无监督地(无需标签)发现对等组和行为模式,而这些模式很难使用基于规则或基于签名的方法来识别。

张量分解方法将潜在因子建模从成对关系扩展到了高阶关系。网络事件本质上是多关系的,同时涉及用户、设备、目的地、应用程序和包括周期平稳过程在内的时间属性。张量表示通过降维对高阶关系进行建模,以揭示跨维度的潜在行为结构。Eren等人引入了一种通用版本的张量分解方法,用于无监督异常检测,该方法在一系列具有挑战性和多样化的网络应用领域中超越了最先进的监督和半监督学习基线(Eren等人)[20 (https://arxiv.org/html/2607.18479#bib.bib8)]。他们使用二元张量来表示用户、源和目的地的关系,例如图1 (https://arxiv.org/html/2607.18479#S2.F1),并通过规范多元分解(CPD)执行张量分解,以获得秩为1的张量的加权和。他们基于张量分析的方法对一组多样化属性上的异常活动很敏感。他们开发并公开可用的`pyCP_APR` Python库允许使用图形处理单元(GPU)进行张量分解,并将分解与异常评分和预测接口相结合[20 (https://arxiv.org/html/2607.18479#bib.bib8),18 (https://arxiv.org/html/2607.18479#bib.bib46),19 (https://arxiv.org/html/2607.18479#bib.bib47)]。在本工作中,我们使用Python库`pyCP_APR`进行张量分解。

CP-APR的一个关键能力是通过泊松似然公式对稀疏计数和二元网络数据进行建模。异常得分来源于与重建张量表示之间的偏差,而重建张量表示可能无法完全捕获潜在因子之间复杂的非线性依赖关系。因此,我们探索了互补的密度估计方法,这些方法能够学习潜在行为表示上更丰富的概率分布。

见图注图1:来自Eren等人(Eren等人)[20 (https://arxiv.org/html/2607.18479#bib.bib8)]的具有用户-源-目的地维度的二元张量,显示背景流量为灰色,异常为红色。深度生成模型已成为一类强大的无监督异常检测方法,因为它们直接从观测数据中学习概率分布。变分自编码器(VAE)、生成对抗网络(GAN)和归一化流已被应用于一系列网络安全问题,包括入侵检测、恶意软件分析和网络流量监控[5 (https://arxiv.org/html/2607.18479#bib.bib57),42 (https://arxiv.org/html/2607.18479#bib.bib58),44 (https://arxiv.org/html/2607.18479#bib.bib61),17 (https://arxiv.org/html/2607.18479#bib.bib62),40 (https://arxiv.org/html/2607.18479#bib.bib63),33 (https://arxiv.org/html/2607.18479#bib.bib64),1 (https://arxiv.org/html/2607.18479#bib.bib59),16 (https://arxiv.org/html/2607.18479#bib.bib60),43 (https://arxiv.org/html/2607.18479#bib.bib43),3 (https://arxiv.org/html/2607.18479#bib.bib42),23 (https://arxiv.org/html/2607.18479#bib.bib38)]。归一化流特别有吸引力,因为它们通过观测数据与易于处理的潜在分布之间的可逆映射提供精确的似然估计。

最近的研究已经证明了使用归一化流进行网络异常检测的成功。Stepashkina和Hushchyn [43 (https://arxiv.org/html/2607.18479#bib.bib43)] 使用了一种基于Transformer的自编码器架构,通过过渡到变分自编码器(VAE)并结合归一化流,增强了其检测多变量时间序列异常的能力。Guo等人[23 (https://arxiv.org/html/2607.18479#bib.bib38)] 使用了一个半监督学习框架,结合归一化流对标记和未标记数据的分布进行建模,同时引入灵敏度阈值管理以提高检测性能。Ammar和Al Bassam [3 (https://arxiv.org/html/2607.18479#bib.bib42)] 使用了一个仅使用良性流量数据训练的RealNVP架构,成功检测到了包括拒绝服务(DoS)、分布式拒绝服务(DDoS)、端口扫描、渗透和僵尸网络活动在内的异常。

虽然这些研究表明归一化流可以有效地对复杂的网络数据分布进行建模,但现有的方法主要操作于网络流特征、数据包统计或时间传感器测量。据我们所知,这是首次将基于流的密度估计应用于从张量分解方法导出的潜在行为表示。

## 3 方法

在本节中,我们描述了本研究中比较的三种方法:CP-APR张量分解、RealNVP归一化流,以及提出的混合潜在结构融合(HLSF)。

相似文章

联邦哈希投影潜在因子学习

arXiv cs.LG

本文提出了一种联邦哈希投影潜在因子(FHPLF)模型,该模型将哈希学习集成到联邦学习中,以降低通信成本并增强隐私保护,通过使用二值类梯度矩阵和投影汉明距离来提高准确性和效率。