FreSH:面向多元时间序列分类的频率分段层次化多专家框架
摘要
介绍了FreSH,一种用于多元时间序列分类的频率分段层次化多专家框架,在UEA基准测试中实现了最先进的准确率,同时减小了模型规模和计算成本。
arXiv:2608.08207v1 公告类型:新
摘要:多元时间序列分类(MTSC)需要能够在多个尺度上有效捕获复杂时间模式,同时保持计算效率的模型。然而,现有方法通常难以兼顾细粒度表示学习,尤其是在类别不平衡和现实约束下。本文提出了FreSH,一种频率分段层次化多专家框架,旨在解决这些挑战。FreSH通过实现对时间信号的自适应多尺度分析,为MTSC提供了新的视角,使数据的不同方面能够以互补和协调的方式建模。通过将局部专业化与整体上下文建模相结合,FreSH在不产生过高计算开销的情况下实现了强大的表示能力。自适应融合策略进一步增强了灵活性,使模型能够动态强调输入中最具信息量的组成部分。此外,我们引入了更稳健的优化目标,提高了在不同样本难度和类别分布下的学习稳定性。在30个UEA基准数据集和真实振动数据上的广泛评估表明,FreSH在分类准确率上持续优于最先进的方法,同时显著减小了模型规模并提高了效率。
查看缓存全文
缓存时间: 2026/08/11 08:10
# 面向多变量时间序列分类的频率分段层次多专家框架
来源:https://arxiv.org/html/2608.08207
刘平平1,王牧野1,张子健1,∗,张同顺1,苗浩2,谢国瑞3,李庆亮4,周求湛11吉林大学 2香港理工大学 3鹏城实验室 4长春师范大学 liupp@jlu\.edu\.cn, wangmy24@mails\.jlu\.edu\.cn, zhangzijian@jlu\.edu\.cn, tszhang23@mails\.jlu\.edu\.cn, hao\.miao@polyu\.edu\.hk, xiegrr@gmail\.com, liqingliang@ccsfu\.edu\.cn, zhouqz@jlu\.edu\.cn
###### 摘要
多变量时间序列分类(MTSC)要求模型能够有效捕获跨多个尺度的复杂时间模式,同时保持计算效率。然而,现有方法通常难以协调细粒度表示学习,尤其是在类别不平衡和现实约束下。本文提出了FreSH,一种频率分段层次多专家框架,旨在解决这些挑战。FreSH通过实现时间信号的自适应多尺度分析,为MTSC提供了新视角,允许数据的不同方面以互补且协调的方式进行建模。通过将局部专业化与整体上下文建模相结合,FreSH在不过度增加计算开销的情况下实现了强大的表示能力。自适应融合策略进一步增强了灵活性,使模型能够动态强调输入中最有信息量的组成部分。此外,我们引入了更稳健的优化目标,提高了在不同样本难度和类别分布下的学习稳定性。在30个UEA基准数据集和真实振动数据上的大量实验表明,FreSH在分类准确率上持续优于最先进方法,同时大幅减小了模型尺寸并提高了效率。实现代码公开于https://github.com/Wangmy2120/FreSH00。
## 1 引言
参见图1图注:MTSC中的一些模型无法适应不同数据集的多样时间模式,导致在不同数据集和不同类别之间存在性能差异。多变量时间序列分类因其在医疗健康Anet al.\(2023 (https://arxiv.org/html/2608.08207#bib.bib10)\)、工业设备故障诊断Farahaniet al.\(2023 (https://arxiv.org/html/2608.08207#bib.bib7)\)和人体动作识别Liet al.\(2023 (https://arxiv.org/html/2608.08207#bib.bib8)\)中的广泛应用而受到极大关注。准确的时间序列分类为决策者提供了关键支持和洞见。然而,时间序列数据的固有属性,如复杂动态、噪声和类别不平衡,使得MTSC成为一项特别具有挑战性的任务Ismail Fawazet al.\(2019 (https://arxiv.org/html/2608.08207#bib.bib9)\)。
传统MTSC算法,如DTWWanget al.\(2017 (https://arxiv.org/html/2608.08207#bib.bib3)\),主要依赖特征统计或信号处理技术。随着数据集变得日益复杂,这些方法难以扩展到现代高维时间序列,也无法在不同应用场景中良好泛化Ruizet al.\(2021 (https://arxiv.org/html/2608.08207#bib.bib11)\)。近年来,深度学习已成为MTSC的主导范式。基于CNN的方法,如OS-CNNTanget al.\(2020 (https://arxiv.org/html/2608.08207#bib.bib44)\),擅长通过卷积滤波器学习空间层次特征,但在全面建模全局特征方面存在局限,通常需要额外设计来弥补这一不足。基于RNNKarimet al.\(2017 (https://arxiv.org/html/2608.08207#bib.bib12)\)的方法由于梯度消失而难以捕获长期依赖。基于Transformer的模型Wenet al.\(2022 (https://arxiv.org/html/2608.08207#bib.bib13)\); Zuoet al.\(2023 (https://arxiv.org/html/2608.08207#bib.bib14)\)提出通过自注意力机制处理长程依赖,但在提取相邻时间点的局部模式特征方面有所欠缺。
尽管现有方法在时间序列分类上取得了可喜进展,但几个关键局限性阻碍了其性能和实用性。首先,现有模型通常难以有效捕获时间序列数据复杂的多尺度特性。它们通常直接处理时域数据Heet al.\(2015 (https://arxiv.org/html/2608.08207#bib.bib23)\)或整体频域Yiet al.\(2023 (https://arxiv.org/html/2608.08207#bib.bib15)\),因而无法区分和分析不同频带所携带的独特信息。MTSC数据集的多样性使现有模型在平衡数据集之间和类别之间的差异时面临挑战。如图1 (https://arxiv.org/html/2608.08207#S1.F1)所示,不同模型在不同类型的UEA数据集上表现出显著性能差异,且其准确率明显受到不同类别样本数量的影响,性能提升往往伴随着可观的开销。此外,近期复杂模型,尤其是利用全局自注意力机制的模型Zhouet al.\(2021 (https://arxiv.org/html/2608.08207#bib.bib27)\),存在计算成本高和可扩展性差的问题,使其不适合实时应用或大规模数据集。同时,这些模型缺乏根据数据局部特征进行专业化处理的自适应能力。最后,MTSC中常用的损失函数,如交叉熵Wuet al.\(2022a (https://arxiv.org/html/2608.08207#bib.bib19)\)和Focal LossLinet al.\(2017 (https://arxiv.org/html/2608.08207#bib.bib2)\),存在两难困境:前者通常被多数类主导,而后者可能对困难样本过度矫正。这使得它们在处理类别不平衡和样本难度不均的共同挑战时表现欠佳,而这些挑战在现实时间序列数据中十分常见。
受这些挑战的启发,我们提出了一种用于时间序列分类的频率分段层次多专家框架,*即*,FreSH。我们的主要目标是超越单视图方法,利用频域并提出一种分段策略,从而能够专门分析不同的频率成分。为了解决现有模型灵活性不足和成本高的问题,我们设计了一个高效且自适应的层次多专家系统。该架构使用专用的局部专家处理特定数据段,同时由全局专家提供整体上下文,且整体采用轻量级框架,避免全局注意力等复杂缓慢的机制。自适应门控机制融合这些输出,动态加权局部频带和全局频谱。我们还追求更优的优化策略,引入多项式损失作为标准损失函数的替代,我们认为这能够在优化易样本和难样本、多数类和少数类之间取得更好的平衡。我们的主要贡献总结如下:
- •我们提出了一种频率感知建模范式,自适应捕获多变量时间序列的多尺度、多频带特性,为时间序列分类提供了相对于单视图时域或频域方法的原理性替代方案。
- •我们设计了FreSH,一种轻量级频率分段层次多专家框架,通过整合局部和全局专家实现跨频率成分的自适应专业化,以较低计算开销实现有效的多尺度表示。
- •在30个UEA基准数据集上的大量实验验证了我们FreSH的有效性和泛化能力。我们的方法在超越多种最先进基线的同时实现了先进的效率。
## 2 方法
### 2.1 问题定义
设 X={Xi}1n\\mathcal\{X\}=\\\{\\mathbf\{X\}\_\{i\}\\\}\_\{1\}^\{n\} 表示一个多变量时间序列数据集,其中每个样本 Xi∈Rd×l\\mathbf\{X\}\_\{i\}\\in\\mathbb\{R\}^\{d\\times l\} 表示 dd 个变量在 ll 个时间步上的观测值。多变量时间序列分类的目标是学习一个分类器 fθf\_\{\\theta\} 以准确预测对应标签,*即*, Xi∈Rd×l→fθY^i∈Rc\\mathbf\{X\}\_\{i\}\\in\\mathbb\{R\}^\{d\\times l\}\\xrightarrow\{f\_\{\\theta\}\}\\hat\{\\mathcal\{Y\}\}\_\{i\}\\in\\mathbb\{R\}^\{c\}。
### 2.2 框架概述
我们提出了FreSH,一种用于多变量时间序列分类的频域专家框架,它在混合专家网络中整合了局部和全局建模。工作流程如图2 (https://arxiv.org/html/2608.08207#S2.F2)(a)所示。我们首先对不同样本进行mixup以丰富数据多样性,然后将数据转换到频域,并由层次频率信息MoE(HiFiMoE)模块处理,如图2 (https://arxiv.org/html/2608.08207#S2.F2)(b)所示。输出被送入预测层进行分类。
参见图2图注:FreSH的框架概览。将时间序列转换到频域后,多段专家模块学习分段模式,全局专家模块捕获全频谱依赖,自适应门控机制自适应融合它们以进行预测。
### 2.3 数据预处理
给定一个输入多变量时间序列样本 Xi∈Rd×l\\mathbf\{X\}\_\{i\}\\in\\mathbb\{R\}^\{d\\times l\},其中 dd 是变量数,ll 是序列长度,我们首先进行mixupZhanget al.\(2017 (https://arxiv.org/html/2608.08207#bib.bib25)\)以丰富数据多样性。我们使用快速傅里叶变换将其转换到频域:
F=FFT\(Xi\)∈Cd×s,\\mathbf\{F\}=\\mathrm\{FFT\}\(\\mathbf\{X\}\_\{i\}\)\\in\\mathbb\{C\}^\{d\\times s\}, (1) 其中 s=⌊l2⌋+1s=\\left\\lfloor\\frac\{l\}\{2\}\\right\\rfloor\+1。这种频域表示使模型能够利用在时域难以捕获的周期模式和频率特定信息。随后将得到的信号 F\\mathbf\{F\} 零填充到固定长度 spaddeds\_\{\\text\{padded\}\},以确保样本间的可整除性和一致性。
### 2.4 频率分段划分
为了捕获频域中分布不均匀的信息,我们将频谱划分为多个段。这种分段允许专门的专家聚焦于特定频带,实现更有针对性的特征学习,并为后续的自适应融合做准备。具体来说,我们将整个频谱划分为 KK 个等长段:
F=\[F\(1\),F\(2\),...,F\(K\)\],\\mathbf\{F\}=\[\\mathbf\{F\}^\{\(1\)\},\\mathbf\{F\}^\{\(2\)\},\\dots,\\mathbf\{F\}^\{\(K\)\}\], (2) 其中每个段 F\(k\)∈Cd×lk\\mathbf\{F\}^\{\(k\)\}\\in\\mathbb\{C\}^\{d\\times l\_\{k\}\} 对应一个特定频带,且 lk×K=spaddedl\_\{k\}\\times K=s\_\{padded\}。这种分段划分操作为单独利用可能携带与时间序列分类相关的独特模式的各个频率成分提供了机会。
### 2.5 层次频率信息MoE
#### 2.5.1 多段专家模块
对于每个频率段 F\(k\)\\mathbf\{F\}^\{\(k\)\},我们设计了一个专用的多段专家模块,由 MM 个并行局部专家 \{Em\(k\)\(⋅\)\}m=1M\\mathbf\{\\\{E\}\_\{m\}^\{\(k\)\}\(\\cdot\)\\\}\_\{m=1\}^\{M\} 组成,每个专家由轻量级MLP实现。这些专家旨在捕获段内特征的多样化、潜在互补的表示。具体来说,第 mm 个专家和第 kk 个频率段生成的隐藏表示 Hm\(k\)\\mathbf\{H\}^\{\(k\)\}\_\{m\} 为:
Hm\(k\)=Em\(k\)\(F\(k\)\)。\\mathbf\{H\}^\{\(k\)\}\_\{m\}=\\mathbf\{E\}\_\{m\}^\{\(k\)\}\\bigl\(\\mathbf\{F\}^\{\(k\)\}\\bigr\)。 (3)
当 M=1M=1 时,直接使用单个专家的输出。当 M\>1M\>1 时,所有专家的输出取平均以得到第 kk 个频率段的表示 H\(k\)\\mathbf\{H\}^\{\(k\)\}:
H\(k\)=1M∑m=1MHm\(k\)。\\mathbf\{H\}^\{\(k\)\}=\\frac\{1\}\{M\}\\sum\_\{m=1\}^\{M\}\\mathbf\{H\}^\{\(k\)\}\_\{m\}。 (4)
H\(k\)\\mathbf\{H\}^\{\(k\)\} 处理单个频带 F\(k\)\\mathbf\{F\}^\{\(k\)\},并通过平均集成 MM 个专家网络的输出结果,从而充分利用多个专家网络的协同优势,显著提升整体性能。这种设计能够平衡表达能力和计算效率,避免段内门控,同时仍允许专家之间的集成效应。
#### 2.5.2 全局专家模块
尽管分段专家聚焦于局部频带,建模跨越整个频谱的全局依赖同样重要。为此,我们引入了 NN 个全局专家 \{Ui\(⋅\)\}i=1N\\\{\\mathbf\{U\}\_\{i\}\(\\cdot\)\\\}\_\{i=1\}^\{N\},每个专家处理完整的频谱信号 F∈Cd×spadded\\mathbf\{F\}\\in\\mathbb\{C\}^\{d\\times s\_\{\\text\{padded\}\}\} 以提取整体表示:
Hglobali=Ui\(F\)。\\mathbf\{H\}^\{i\}\_\{\\text\{global\}\}=\\mathbf\{U\}\_\{i\}\(\\mathbf\{F\}\)。 (5)
为了根据输入自适应加权不同全局专家的贡献,我们引入了一个全局门 σglobal\(⋅\)\\sigma\_\{\\text\{global\}\}\(\\cdot\),它由一个简单线性层后接softmax实现:
λ=σglobal\(F\)∈RN,\\lambda\\ =\\sigma\_\{\\text\{global\}\}\\left\(\\mathbf\{F\}\\right\)\\in\\mathbb\{R\}^\{N\}, (6) 其中 F\\mathbf\{F\} 是输入的全频谱频率表示,λ\\lambda 为所有 NN 个全局专家提供归一化权重。最终全局表示 Hglobal\\mathbf\{H\}\_\{\\text\{global\}\} 随后计算为所有专家的加权和:
Hglobal=∑i=1Nλi⋅Hglobal,i\\mathbf\{H\}\_\{\\text\{global\}\}=\\sum\_\{i=1\}^\{N\}\\lambda\_\{i\}\\cdot\\mathbf\{H\}^\{\\text\{i\}\}\_\{\\text\{global\},\} (7)
其中 Hglobal∈Cd×spadded\\mathbf\{H\}\_\{\\text\{global\}\}\\in\\mathbb\{C\}^\{d\\times s\_\{\\text\{padded\}\}\}。该机制允许模型动态调整对哪些全局专家给予更多关注,从而提供适应不同信号特征的灵活性。
#### 2.5.3 自适应门控机制
除了全局专家融合之外,我们还引入了一种段级门控机制,以自适应地组合分段表示。原始全频域信息 F\\mathbf\{F\} 被馈送到段门 σsegment\(⋅\)\\sigma\_\{\\text\{segment\}\}\(\\cdot\),直接为每个段产生归一化权重 β\\beta:
β=σsegment\(F\)∈RK。\\beta=\\sigma\_\{\\text\{segment\}\}\\left\(\\mathbf\{F\}\\right\)\\in\\mathbb\{R\}^\{K\}。 (8)
局部表示随后计算为段输出的加权组合:
Hlocal=Concat\(β1⋅H\(1\),...,βK⋅H\(K\)\),\\mathbf\{H\}\_\{\\text\{local\}\}=\\text\{Concat\}\\left\(\\beta\_\{1\}\\cdot\\mathbf\{H\}^\{\(1\)\},\\dots,\\beta\_\{K\}\\cdot\\mathbf\{H\}^\{\(K\)\}\\right\), (9)
其中 Hlocal∈Cd×spadded\\mathbf\{H\}\_\{\\text\{local\}\}\\in\\mathbb\{C\}^\{d\\times s\_\{\\text\{padded\}\}\},且 βk\\beta\_\{k\} 为段 kk 提供softmax归一化的重要性权重,使模型能够动态平衡来自不同频带的贡献。
我们已经获得了全局频谱表示 Hglobal\\mathbf\{H\}\_\{\\text\{global\}\} 以及来自各个频率段的融合表示 Hlocal\\mathbf\{H\}\_\{\\text\{local\}\}。然后,我们相似文章
FM-LLM: A frequency-enhanced mixture-of-experts framework for adapting LLMs to time series forecasting
FM-LLM propose a frequency-enhanced mixture-of-experts framework that adapts frozen LLMs to time series forecasting without textual prompts, achieving state-of-the-art results by injecting spectral representations and separating periodic/non-periodic decoding.
FRAME: 使用分数阶傅里叶专家混合体学习适应域
提出FRAME,一种使用可学习分数阶傅里叶阶数在空间域和频谱域之间插值的专家混合适配器,提升了LLMs在多个基准上的参数高效微调性能。
基于Fisher路由的专家混合模型用于联邦类增量学习
本文提出FedFMX,一种基于Fisher路由的专家混合框架,用于联邦类增量学习,通过自适应专家特化解决容量冲突、灾难性遗忘和数据异质性。
嵌套时空时间序列预测
本文提出一种嵌套时空预测框架,利用谱聚类构建语义一致的宏观区域,为细粒度的微观预测提供自上而下的指导。在高维数据集上的实验表明,该方法始终优于最先进的基线模型。
RAVEN:一种面向金融时间序列预测的体制感知变上下文专家网络
本文提出了RAVEN,这是一种混合专家框架,能够自适应地为每个输入样本确定时间上下文窗口,以处理非平稳金融时间序列。该方法在金融和交通基准上取得了最先进的性能。