面向移动核心网业务影响故障检测的自适应两阶段在线学习

arXiv cs.LG 论文

摘要

本文提出一种两阶段在线学习框架,通过对正常流量动态进行建模并分析残差,检测移动核心网中影响业务的故障,相比静态阈值取得了更优的精确率-召回率权衡。

arXiv:2607.18522v1 公告类型:新 摘要:移动网络运营商监控聚合流量以评估核心网络基础设施的运行健康状态。由于强时间结构、非平稳性、测量伪影和极端类别不平衡,可靠的故障检测具有挑战性,这些因素限制了基于静态阈值的监测。本文提出一种基于流量的移动核心网故障检测的两阶段在线学习框架。第一阶段使用轻量级回归和时序感知特征逐步建模正常流量动态。第二阶段分析预测残差并结合上下文指标,检测真实的业务影响性网络故障。该框架在事前评估协议下完全在线运行,能以较低计算开销实现持续自适应。在线性和非线性模型中,所提两阶段架构实现了最佳精确率-召回率权衡,在可接受的假阳性率下获得了最高的召回率、F1分数和AUC。这些结果证明了显式残差分解对于流式移动核心网数据中可靠故障检测的重要性。
查看原文
查看缓存全文

缓存时间: 2026/07/22 08:21

# 自适应两阶段在线学习用于移动核心网络的服务影响故障检测
来源: https://arxiv.org/html/2607.18522

###### 摘要

移动网络运营商监测聚合流量量以评估核心网络基础设施的运行健康状况。由于强烈的时间结构、非平稳性、测量伪影以及极端的类别不平衡,可靠的故障检测具有挑战性,这限制了基于静态阈值的监控方法。

本文提出了一种用于移动核心网络中基于流量的故障检测的两阶段在线学习框架。第一阶段使用带有时间感知特征的轻量级回归增量建模正常流量动态。第二阶段分析预测残差以及上下文指标,以检测真实的服务影响性网络故障。该框架在预序评估协议下完全在线运行,能够以较低的计算开销实现持续自适应。

在线性和非线性模型中,所提出的两阶段架构实现了最佳的精确率-召回率权衡,在可接受的假阳率下获得了最高的召回率、F1分数和AUC。这些结果证明了显式残差分解对于流式移动核心网络数据中可靠故障检测的重要性。

## I. 引言

移动网络运营商(MNO)依赖对聚合流量量的持续监测来评估其核心网络的健康状况。移动核心网络(MCN)包括分组交换的控制面和用户面基础设施,负责会话管理、移动性、认证、策略执行以及用户流量在无线接入网络(RAN)与外部数据网络之间的路由。来自多种无线接入技术、接入点名称(APN)和核心网元的数据按地理区域以固定间隔聚合,提供了一种可扩展且技术无关的系统行为视图。

尽管聚合流量因人类活动而表现出强烈的昼夜和周周期结构[16 (https://arxiv.org/html/2607.18522#bib.bib9)],但其本质上具有非平稳性,并且容易受到测量伪影的影响,例如计数器溢出、部分捕获和延迟报告。这些影响并不一定普遍存在于所有MNO或部署中。然而,核心网络设备通常依赖具有有限位宽的增量流量计数器,在持续高负载下可能会饱和或失效。服务连续性通常通过冗余或备份处理路径来维持,这些路径对用户透明,但计数器信息会丢失或损坏。这导致出现类似于真实网络故障的突发的明显流量下降,从而削弱了基于静态阈值的监控,导致高告警率。

传统的基于阈值的系统因其简单性而仍被广泛使用,但它们假设准平稳行为,并且需要持续的手动调优。可预测的上下文效应(如周末、节假日和资费变化)经常触发假告警,削弱了对自动化决策系统的信任[8 (https://arxiv.org/html/2607.18522#bib.bib1),4 (https://arxiv.org/html/2607.18522#bib.bib2)]。随着网络规模和负载的增长,这些限制越来越制约其操作实用性。

先前的研究已探索了统计和基于学习的方法用于流量异常检测,包括残差分析、变点检测和深度学习模型[2 (https://arxiv.org/html/2607.18522#bib.bib3),9 (https://arxiv.org/html/2607.18522#bib.bib6),10 (https://arxiv.org/html/2607.18522#bib.bib7),12 (https://arxiv.org/html/2607.18522#bib.bib8)]。然而,大多数方法是离线训练的,并将所有偏差视为单一异常类别,从而将服务影响的故障与良性的测量伪影混为一谈。这限制了鲁棒性、可解释性以及MCN环境中的操作信任度。

网络监控数据本质上是作为数据流生成的,这促使了能够增量适应不断变化的流量模式的在线学习方法[14 (https://arxiv.org/html/2607.18522#bib.bib4),6 (https://arxiv.org/html/2607.18522#bib.bib5)]。尽管最近的研究探索了面向网络化系统的在线异常检测[3 (https://arxiv.org/html/2607.18522#bib.bib14),13 (https://arxiv.org/html/2607.18522#bib.bib13)],但大多数方法仍然是端到端的,并没有明确地将基线流量动态与故障检测分离。

相反,本工作提出了一种两阶段在线学习架构,将自监督的流量基线建模与罕见事件故障检测解耦。通过在分类之前隔离可预测的流量动态,该框架在严重的类别不平衡、延迟标签和测量伪影下提高了鲁棒性,同时保持计算轻量且与操作对齐。

所提出的方法旨在补充而非替代现有的核心网络故障检测系统。某些故障模式可能不会在聚合流量中明显显现,因此更适合由更细粒度的监控工具捕获。相反,起源于移动核心网络外部的问题,例如外部服务平台故障,仍可能在聚合流量中体现出来,并可以通过所提出的方法检测到。重要的是,聚合流量是MNO的主要创收KPI,任何在此信号中可见的服务影响性中断都会产生直接的商业影响。因此,即使是检测延迟的适度降低,也能转化为有意义的运营和收入效益。

本文的主要贡献如下:

- • 一种将基线建模与故障检测分离的两阶段在线架构。
- • 在流式约束下评估时间感知特征编码。
- • 在真实运维MCN数据上,使用轻量级在线模型展示了强大的性能和稳定性。

本工作是与Vodacom Group Limited合作开展的,是MCN性能管理领域持续改进计划的一部分。

## II. 问题定义

### II-A 流量异常的操作解释

在聚合MCN监控中,与预期流量量的偏差可能源于根本不同的原因。在本工作中,我们区分两种主要的异常行为来源:真实的网络故障和测量伪影。

*网络故障*对应于移动网络无法提供正常服务性能的任何情况。此类事件可能由硬件或软件故障、传输故障、资源过载或计划内和计划外维护引起,并与用户实际经历的服务影响相关联[15 (https://arxiv.org/html/2607.18522#bib.bib11)]。

相反,*测量伪影*是指由流量计数器的采集、传输或聚合错误引起的虚假偏差。常见来源包括计数器翻转、部分或延迟报告以及瞬态监控故障。尽管底层网络可能正常运行,但此类伪影可能产生与真实故障非常相似的流量下降,使其成为基于流量监控系统中误报的主要来源。

区分这些现象至关重要,因为它们在聚合流量数据中产生相似的信号,但需要不同的操作响应。因此,所提出的框架旨在检测与预期流量动态的偏差,同时促进真实故障与良性测量伪影的分离。

令 \(y_t \in \mathbb{R}_{\geq 0}\) 表示某区域在第 \(t\) 个15分钟间隔内的下行链路观测流量量,\(x_t\) 表示相关的时态和上下文特征向量。观测按序到达,形成时间顺序的数据流 \(\{(x_t, y_t)\}_{t=1}^{\infty}\)。

目标是学习一个模型来估计预期的或“正常”的流量动态 \(\hat{y}_t = f(x_t)\),并识别那些偏差与正常操作不一致的观测。此类偏差可能源于真实的网络故障、良性的测量伪影或瞬态的上下文效应。

与批量学习不同,数据生成过程本质上是顺序的:测量值必须按到达顺序处理,未来观测在训练时不可用。因此,模型使用在线学习技术增量训练和更新,这比离线训练后进行静态评估更能准确反映操作部署条件[14 (https://arxiv.org/html/2607.18522#bib.bib4),6 (https://arxiv.org/html/2607.18522#bib.bib5)]。

一个重要的实际考虑因素是数据质量。缺失、无效或损坏的测量值可能使学习的基线产生偏差,并降低检测性能。因此,所提出的框架支持选择性学习,其中模型更新仅限于那些质量可以可靠评估的观测。

### II-B 基于阈值监控的局限性

由于简单性和低计算成本,基于阈值的监控在运营网络中仍被广泛使用[8 (https://arxiv.org/html/2607.18522#bib.bib1),4 (https://arxiv.org/html/2607.18522#bib.bib2)]。当观测流量超过预定义边界时触发告警,这些边界通常使用历史平均值或专家知识配置。

此类方法隐含地假设可接受的流量范围是静态或缓慢变化的,这一假设在实践中经常被违反。移动流量表现出强烈的昼夜和周周期、日历效应以及长期增长,导致固定阈值在可预测的低使用期间产生误报,同时在高峰需求期间漏掉真实异常。此外,维护基于阈值的系统需要持续的人工调优,这在跨区域、技术和聚合级别上难以扩展。

### II-C 基于学习的基线建模

本工作提出的方法用学习的、时间自适应的基线替代了静态阈值。异常不是相对于固定界限进行评估,而是相对于随时间演进的模型期望 \(\hat{y}_t\) 进行评估,使系统能够适应非平稳性、长期趋势和重复的时间模式,无需手动重新配置。

异常检测被表述为一个流式预测问题,其中 \(y_t\) 与 \(\hat{y}_t\) 之间的偏差定义了异常分数。持续的增量学习使系统能够自动适应变化的流量条件,并减少对启发式规则的依赖,这与非平稳时间序列分析的现代方法一致[9 (https://arxiv.org/html/2607.18522#bib.bib6),12 (https://arxiv.org/html/2607.18522#bib.bib8)]。

一个核心挑战是极端的类别不平衡:正常操作和测量伪影频繁发生,而确认的网络故障很少见,且标签通常延迟。所提出的两阶段架构通过将自监督的基线流量建模与故障分类解耦来明确解决这一问题。正常的动态从丰富的流数据中学习,而故障检测则以成本敏感、半监督的方式对残差和辅助指标进行操作。这种设计减轻了类别不平衡,减少了对稀缺标签的依赖,并使学习过程与运营网络工作流对齐。

## III. 数据集描述

### III-A 概述

图1 (https://arxiv.org/html/2607.18522#S3.F1) 展示了用户流量通过移动蜂窝网络的基本流程以及监控数据的采集点。用户流量源自用户设备(UE),穿过无线接入网络(RAN),并经过多个核心网元路由,然后到达外部互联网协议(IP)网络。上行和下行流量均沿此路径方向相反流动。

对于运营监控,流量计数器在单个核心网元处收集,并按地理区域以固定15分钟间隔聚合。因此,某个区域的总观测流量量代表该间隔内该区域所有报告网元路由的聚合流量。

流量可能会根据路由穿过区域内的多个核心网元,并且由于设备故障、重新配置或测量伪影,报告网元集可能随时间变化。因此,聚合流量既反映了底层用户需求,也反映了报告基础设施的可用性。这种耦合促使采用基于学习的监控方法,在解释流量偏差时明确考虑基础设施动态。

图 1:MCN中的聚合流量流。流量计数器在每个核心网元 \(E\) 处收集,并按地理区域 \(R\) 以固定15分钟间隔聚合。

本研究中使用的数据¹是在常规网络性能监控期间收集的,并作为Vodacom Group Limited核心网络性能管理职能持续改进计划的一部分进行分析。该数据集由聚合的下行链路流量量测量值组成,每个观测对应一个区域和时间间隔。

¹ 为保护商业敏感信息,数据集已匿名化并按比例缩放,以保持相对趋势和时间行为,但防止恢复绝对流量值。

令 \(y_{r,t}\) 表示区域 \(r\) 在时间 \(t\) 的观测下行链路流量量。流量通过对所有在间隔内成功报告的网络元素 \(e \in E\) 的计数器进行聚合获得:

\[
y_{r,t} = \sum_{e=1}^{E_{r,t}} y_{e,r,t},
\]

其中 \(E_{r,t}\) 表示区域 \(r\) 在时间 \(t\) 的报告元素数量。由于不完全报告或监控故障导致 \(E_{r,t}\) 的变化,即使网络正常运行,也可能引起明显的流量下降。

数据集结构为时间有序的数据流,与测量值连续生成并近实时处理的操作环境一致,使其适用于评估在线学习方法。

真实网络故障标签来自MCN团队维护的运营事件和故障管理记录。当记录到一起经确认的影响服务交付的事件,并且该事件在时间上与相应的流量测量窗口对齐时,即为某个区域和间隔分配故障标签。确认通常由网络工程师进行手动调查和根因分析后进行。

因此,标签受到实际限制,包括延迟、部分可观测性以及事件日志与流量聚合间隔之间的轻微时间错位。所提出的框架通过将自监督的基线学习与故障分类解耦,并支持异步整合确认标签,明确考虑了这种不确定性。

### III-B 特征

对于每个15分钟间隔,以下特征可用:

- • 下行链路流量量(bytesDL):间隔内观测到的总下行流量;主要目标变量。
- • 网络元素数量(noElements):间隔内贡献计数器的核心元素数量。
- • 接入点名称数量(noAPNs):间隔内观测到的接入点名称数量。

相似文章

AgentForesight:多智能体系统中用于早期故障预测的在线审计

arXiv cs.CL

本文介绍了 AgentForesight,这是一个用于基于大语言模型(LLM)的多智能体系统的在线审计和早期故障预测框架。文章提出了一个新数据集 AFTraj-22K,以及一个专用模型 AgentForesight-7B,该模型在检测轨迹执行过程中的决定性错误方面优于领先的专有模型。

当证据稀疏时:对话与LLM-Agent轨迹中的弱监督早期故障预警

arXiv cs.CL

本文提出了一种两阶段方法,用于对话和LLM-Agent轨迹中的早期故障预警。该方法通过从轨迹标签中学习逐轮故障证据来解决证据稀疏的挑战,并使用基于注意力的预测器与偏好条件停止策略(α-STOP),以实现可控的准确率-及时性权衡。

机制驱动的LLM训练不稳定性预判监测器

arXiv cs.CL

提出了一种基于机制驱动的监测器,用于预判检测LLM训练不稳定性,通过从低精度闪光注意力(flash attention)和MoE路由器中提取内部信号,使得能在损失发散前数千步进行检测。