NEST: 通过面向机制的混合专家模型应对数据集级分布偏移

arXiv cs.LG 论文

摘要

本文介绍了NEST,一个使用面向机制的混合专家模型来处理时间序列预测中数据集级分布偏移的框架,在多个基准测试上达到了最先进的性能。

arXiv:2607.06607v1 公告类型:新 摘要:复杂系统中的准确长期预测常常受到数据集级分布偏移的影响,其中多样化的潜在行为模式和不断演化的系统状态驱动着动态多元时间序列。现有方法主要关注局部时间偏移,未能明确建模数据集由不同运行机制组成这一全局结构挑战。本文提出NEST,一个专门设计的框架,通过两阶段密集MoE架构来建模和重组这些演化结构。NEST首先通过在有原则的矩熵空间中进行无监督聚类,将数据集划分为不同的运行机制,从而实现结构专业化。我们引入了一种面向机制的路由器机制,根据时间内容生成初始专家权重,随后通过几何调制对机制质心进行细化。关键的是,各个专家并非作为单一的预测器,而是作为专门的核函数,通过演化独特的变量注意力模式来捕捉机制特定的动态。在包括异构网络流量和物理现象在内的多个基准上的广泛评估表明,NEST持续实现了最先进的性能。我们的代码和数据集可在 https://github.com/Aaralshin/NEST 获取。
查看原文
查看缓存全文

缓存时间: 2026/07/09 07:41

# NEST:通过面向状态的混合专家模型应对数据集级分布偏移
来源:https://arxiv.org/html/2607.06607
谢秉枢¹  孙立军¹  薛鑫¹  周浩一¹¹¹通讯作者  李建欣¹  
北京航空航天大学  {lilanhao, xiebingshu, sunlijun1, xuexin0102, haoyi, lijx}@buaa.edu.cn

###### 摘要

复杂系统中的精确长期预测常受数据集级分布偏移影响——不同的底层行为模式与演化的系统状态驱动着动态多元时间序列。现有方法主要关注局部时间偏移,未能显式建模数据集由不同运行状态组成的全局结构挑战。本文提出NEST,一种通过两阶段稠密混合专家架构建模并重组这些演化结构的专用框架。NEST首先通过无监督聚类实现结构专业化:在基于矩熵的语义空间中将数据集划分为不同运行状态。我们引入一种面向状态的路由机制,基于时间内容生成初始专家权重,随后通过几何调制将其向状态质心精炼。关键的是,单个专家并非作为整体预测器,而是作为捕获状态特定动态的专用核,通过演化独特的变量注意力模式来实现。在包括异构网络流量和物理现象在内的多样化基准上的广泛评估表明,NEST持续达到最先进性能。我们的代码和数据集发布于 https://github.com/Aaralshin/NEST。

## 1 引言

图1:数据集级分布偏移的概念示意图。以网络流量为例,IP流量的体积随时间波动,受不同底层行为模式驱动。

时间序列预测是理解和管理复杂系统的基石,应用范围从全球网络基础设施(Basu等,1996)和电网(Boehme等,2007)到空间天气动力学等复杂物理现象(Pulkkinen,2007)。在这些领域,提供精确的长期预测对于主动资源分配、异常检测和保证系统稳定性至关重要。然而,现实世界的数据流因其高度非平稳性和跨数据集的显著分布偏移而难以建模。

这种分布偏移并非随机,而是不同底层行为模式和演化的系统状态的体现,并且可能在长时间段内重复出现。例如,如图1所示,这种异质性由不同的底层行为模式驱动,每种模式生成具有不同统计特征的流量模式。图标(a)表示低流量基线流量,可能由自动系统签到或后台进程生成;图标(b)表示标准的每日峰值,可能对应个体用户进行典型交互会话;图标(c)表示最高流量激增,通常反映协调的大规模活动,例如重大事件期间众多用户同时访问热门服务。一个单一的预测模型在包含这种混合行为的数据上训练时,被迫学习一个“平均化”的表示,无法准确捕获任何单个模式的特定动态,导致性能不佳。

尽管这种数据集级偏移普遍存在,但现有方法很少解决它。主要关注点仍集中在缓解历史回顾窗口与未来预测窗口之间的局部时间偏移。这一范式虽然有价值,但主要在小时间邻域内修正演化的非平稳性;它没有显式建模全局结构挑战:数据集本身是由不同运行状态组成的复合体。

为解决这一根本问题,我们主张采取一种基于识别不同运行状态的系统性方法。我们假设数据集内的多样动态行为可以通过矩熵指标有效区分。具体来说,我们使用低阶统计矩(均值和方差)捕获分布强度,同时使用奇异值分解熵量化结构复杂度。通过将数据切片映射到这个矩熵空间,我们应用无监督聚类自动将数据集划分为功能不同的类别。这种分类确保可以训练专用专家掌握每种状态固有的特定模式,有效捕获当系统在不同类型行为之间转换时发生的变量间依赖关系的动态重组。

为此,我们提出NEST:通过面向状态的混合专家模型应对数据集级分布偏移。NEST是一个两阶段MoE框架,通过显式建模底层系统状态之间的转换来解决数据集级分布偏移。该过程始于无监督状态发现:我们在矩熵空间通过聚类识别不同的运行模式。基于这些发现的状态,我们执行结构化的两阶段训练协议以培养异质专家池。在阶段1中,我们促进异质专家池内的结构专业化;这里的单个专家通过演化独特的变量注意力模式来建模状态特定的序列动态,捕获每种状态的耦合逻辑。在阶段2中,路由基于时间内容生成初始权重,然后通过静态拓扑调制进行精炼,利用几何接近度到状态质心锚定决策。通过动态重组这些专用核,NEST有效地将分布偏移的挑战转化为可管理的状态识别和依赖重新配置过程。

我们的主要贡献如下:

- •**结构性状态建模:** 我们提出NEST,一个两阶段MoE框架,通过动态重组变量间依赖关系来建模复杂系统状态的演化。通过将演化动态解耦为专用核,NEST有效捕获推动数据集级分布偏移的运行模式之间的结构转换。
- •**有原则的发现与路由:** 我们引入一个使用矩熵指标的无监督发现模块,为状态划分提供数学基础。作为补充,我们设计了一个面向状态的路由器,通过将专家权重初始化与距离感知几何调制相融合,实现精确的专家编排。
- •**实证验证与可解释性:** NEST在包括异构网络流量和多年物理现象在内的多样化基准上达到最先进性能。对注意力多态性和权重排列的广泛分析进一步验证了其在变量依赖结构重组方面的独特能力。

## 2 相关工作

### 2.1 时间序列预测的深度学习方法

早期工作利用RNN如LSTM(Siami-Namini等,2018)和GRU(Weerakody等,2021)进行时间门控,但序列约束阻碍了长范围效率。向Transformer(Wu等,2020)的转变引入了全局依赖,但二次复杂度促使了稀疏或层次变体,如Informer(Zhou等,2021)和Pyraformer(Liu等,2021)。随后的创新聚焦于领域专用核:Autoformer(Wu等,2021)利用自相关,而FEDformer(Zhou等,2022)通过傅里叶/小波变换应用频域注意力(Torrence和Compo,1998;Cleveland等,1990)。最近的范式强调结构重塑:PatchTST(Nie等,2022)处理子序列块以获取局部语义,而iTransformer(Liu等,2023a)反转架构,通过将整个变量视为token来建模多元相关性。同时,DLinear(Zeng等,2023)证明了基于简单MLP分解的有效性。最近,统一主干如UniTS(Gao等,2024)已作为基础模型出现,在多样预测任务中实现稳健的零样本泛化。

### 2.2 处理分布偏移

近期研究通过在*实例*或*窗口*级别调整归一化或学习策略来应对时间序列的非平稳性。代表性方法包括实例级(Ogasawara等,2010)可学习输入归一化(Passalis等,2019)以及可逆实例归一化(RevIN,Kim等,2021),后者在训练期间移除非平稳成分并在推理期间恢复。Dish-TS(Fan等,2023)提出一种通用神经范式,通过采用双重框架分别建模输入和输出空间的分布来缓解分布偏移。FAN(Ye等,2024)利用频域信息进行归一化。后续工作通过基于切片的归一化扩展了这些想法,例如SAN(Liu等,2023b),其中每个切片定义在回顾窗口和预测范围内。然而,由于这些方法专注于建模回顾窗口与预测窗口之间的分布偏移,它们对短期波动表现出较强适应性,但在长期或数据集内状态转换下泛化能力有限,因为忽略了训练实例间变异引起的差异。

## 3 预备知识

### 3.1 问题定义

本文涉及的主要任务是长期多元时间序列预测。给定一个历史多元时间序列,目标是学习一个预测函数f(·),基于一段历史观测窗口准确预测未来值序列。

形式上,设输入为一个长度为L的回顾窗口,记为x = (x₁, x₂, ..., xₗ),其中每个多元观测xₜ ∈ ℝᵈ是时间步t上的d维向量。模型必须学习函数f,将输入窗口映射到后续H个时间步,其中H是预测范围:

ŷ = f(x)  (1)

这里,ŷ = (ŷ₁, ŷ₂, ..., ŷ_H),每个ŷₜ ∈ ℝᵈ,是预测序列。目标是最小化预测ŷ与真实未来序列y = (y₁, y₂, ..., y_H)之间的差异。

我们解决的根本挑战是数据集级分布偏移(DDS),即一个长期时间序列由多个异质的运行状态组成。与局部非平稳性不同,DDS反映了系统在长时间范围内的结构演化。例如,在电离层总电子含量(TEC)数据中,十年尺度的太阳周期引入持续数年的信号特征深刻变化;类似地,在网络流量中,从后台维护到协调的用户激增的转换代表了系统行为的根本变化。数学上,单一函数f在此场景中面临困难,因为历史与未来之间的映射不是不变的。相反,当系统在不同状态之间转换时,底层变量间依赖关系被动态重组。当一个单一模型被迫在这一混合的、截然不同的行为中最小化全局目标时,它不可避免地学习到一个“平均化”的表示。这种平均效应模糊了单个状态的特定耦合逻辑,导致捕获稳健长期预测所需精确动态的保真度损失。为解决这一问题,有必要识别这些状态并通过专用核掌握它们独特的模式。

图2:提出的NEST框架及其关键组件概述。(a) NEST流程:展示完整的两阶段流程。阶段1进行状态发现和专家训练。阶段2冻结专家,训练面向状态的路由器自适应组合其输出以进行最终预测。(b) 时间窗口化:说明从原始时间序列创建长度为SL的数据切片的过程。(c) 状态发现:状态发现过程的概念可视化,数据切片在其统计和复杂度特征定义的特征空间中被聚类。(d) 状态专家:每个状态专家包含一个变量注意力机制,以对变量间关系进行建模。(e) 几何上下文调制:在权重初始化后,基于输入样本到预计算状态质心的特征空间距离调制专家权重。

## 4 方法论

### 4.1 整体框架

为应对数据集级分布偏移的挑战,我们提出NEST:通过面向状态的混合专家模型应对数据集级分布偏移。该框架建立在状态特定结构建模的原则上,首先识别长期时间序列内的异质运行模式,然后由专用专家池精妙地捕获这些模式。NEST不是学习单一的平

相似文章

面向数据稀缺时间序列的统一生成模型:结合领域专家

arXiv cs.LG

介绍TimeMoDE,这是一个将扩散Transformer与混合专家模型相结合的框架,用于在数据稀缺条件下生成逼真的时间序列。该框架通过在多个领域的数据集上进行预训练,并利用领域提示来处理领域特定特征,同时结合扩散时间步信号实现自适应去噪。

分布漂移下的时序知识图谱预测:一项合成评估

arXiv cs.LG

本文研究了在受控分布漂移下的时序知识图谱预测,使用了一个编码重复性、同质性和周期性的合成生成器。在七种架构上的实验揭示了信号依赖的鲁棒性以及模型对结构断裂适应性方面的局限性。