基于语义结构化分区的多元时间序列预测的重新思考

arXiv cs.AI 论文

摘要

本文提出了SCPaT,一个基于Transformer的多元时间序列预测框架,它使用语义结构化分区来解决现有基于块方法的局限性,并在真实数据集上展示了有效性。

arXiv:2608.19966v1 Announce Type: new 摘要:多元时间序列预测 (MTSF) 是许多现实世界应用中的一个基本任务。现有的基于块的预测方法通常分为三类:固定分区、多尺度分区和可扩展分区。固定分区常常破坏有意义的时间边界,多尺度分区可能在尺度间引入冗余表示,而可扩展分区提高了灵活性但仍缺乏组织语义结构和建模异质时间模式之间交互的明确机制。为了解决这些局限性,我们提出了SCPaT,一个基于语义结构化分区的Transformer框架。SCPaT首先通过自适应语义单元生成将输入序列分解为语义一致的单元,然后构建动态语义图来建模这些单元之间的有向依赖并将它们组织成高阶语义块。基于这些结构化表示,一个重要性感知路由机制自适应地将不同的语义块分派给不同的专家进行定制化建模。在12个真实数据集上的大量实验展示了SCPaT的有效性。
查看原文
查看缓存全文

缓存时间: 2026/08/21 10:12

# 基于语义结构化分割的多元时间序列预测方法再思考
来源:https://arxiv.org/html/2608.19966  
作者:王嘉哲 ([email protected]),河南科技大学软件学院,洛阳,河南,中国;河南科技大学信息工程学院,洛阳,河南,中国;薛琳静 ([email protected]);刘明 ([email protected]);李美文 ([email protected]);郑瑞娟 ([email protected])

###### 摘要

多元时间序列预测(MTSF)是许多实际应用中的基础任务。现有的基于片段的预测方法通常可分为三类:固定分割、多尺度分割和可扩展分割。固定分割常常破坏有意义的时间边界,多尺度分割可能在不同尺度上引入冗余表示,而可扩展分割虽提高了灵活性,但仍然缺乏组织语义结构和建模异构时间模式之间交互作用的显式机制。为了解决这些局限性,我们提出了SCPaT,一个基于语义结构化分割构建的Transformer框架。SCPaT首先通过自适应语义单元生成将输入序列分解为语义一致的单元,然后构建一个动态语义图来建模这些单元之间的有向依赖关系,并将它们组织成高阶语义块。基于这些结构化表示,一个重要性感知路由机制自适应地将不同的语义块分派给不同的专家进行定制化建模。在12个真实世界数据集上的广泛实验证明了SCPaT的有效性。

###### 关键词

多元时间序列预测,语义结构化分割,转移熵图,重要性感知路由

††通讯作者:通讯作者††这些作者对本工作贡献相同。## 1引言

多元时间序列预测(MTSF)在许多领域(20 (https://arxiv.org/html/2608.19966#bib.bib3))扮演着重要角色,包括电力负荷预测(4 (https://arxiv.org/html/2608.19966#bib.bib29))、天气预测(10 (https://arxiv.org/html/2608.19966#bib.bib1))和交通流预测(12 (https://arxiv.org/html/2608.19966#bib.bib25))。深度学习的最新进展为MTSF带来了广泛的预测架构(8 (https://arxiv.org/html/2608.19966#bib.bib8))。其中,基于片段的建模已成为捕捉复杂时间依赖关系的有效范式(2 (https://arxiv.org/html/2608.19966#bib.bib9))。通过将长序列划分为时间片段,这些方法在保留细粒度局部模式的同时降低了建模复杂度(31 (https://arxiv.org/html/2608.19966#bib.bib30))。然而,这些模型的有效性关键取决于输入序列如何被分割——正如我们将展示的,这一设计选择对语义保持具有深远影响。因此,片段分割策略的设计已成为基于片段的多元时间序列预测中的一个关键考量。

现有的片段分割策略大致可分为三类:固定分割(17 (https://arxiv.org/html/2608.19966#bib.bib26))、多尺度分割(24 (https://arxiv.org/html/2608.19966#bib.bib24))和可扩展分割(7 (https://arxiv.org/html/2608.19966#bib.bib23))。在这些策略中,固定分割在基于片段的预测中采用最为广泛。它将时间序列划分为等长的片段,并将每个片段视为输入单元,从而降低有效序列长度并简化建模过程。如图1 (https://arxiv.org/html/2608.19966#S1.F1)(a)所示,这种设计计算效率高,在具有规律和可预测模式的时间序列上表现良好。然而,由于它依赖于均匀分割,固定分割通常无法与非平稳序列中有意义的时间边界对齐,尤其是在存在趋势突变或突发事件(11 (https://arxiv.org/html/2608.19966#bib.bib22))时。这一限制了它表征复杂时间动态的能力,并推动了更灵活分割策略的发展。

图 1:四种基于片段方案的比较:固定分割、多尺度分割、可扩展分割和所提出的语义结构化分割。为了克服固定分割灵活性有限的问题,研究人员提出了多尺度分割。这种策略在多个粒度级别上划分时间序列,以便可以分别建模特定尺度的表示,然后进行整合。如图1 (https://arxiv.org/html/2608.19966#S1.F1)(b)所示,该策略通过捕捉局部短期波动和全局长期趋势(28 (https://arxiv.org/html/2608.19966#bib.bib33)),提供了对时间动态更丰富的描述。然而,当在多个粒度上捕捉到类似的时间模式时,相应的表示可能在不同尺度上大量重叠,从而在跨尺度整合中引入冗余(6 (https://arxiv.org/html/2608.19966#bib.bib21);16 (https://arxiv.org/html/2608.19966#bib.bib34))。这种冗余反过来可能促使模型学习多余的特征。这个问题在具有复杂和重叠依赖关系的数据集中变得更为突出,因为异构动态模式更难分离。这些限制推动了更具适应性的分割机制的发展。

可扩展分割通过允许每个时间片段的长度根据数据特征变化(29 (https://arxiv.org/html/2608.19966#bib.bib19);13 (https://arxiv.org/html/2608.19966#bib.bib17)),进一步增加了灵活性。通过使片段粒度适应局部动态,这种策略能更好地保留时间边界信息并捕捉局部语义模式。如图1 (https://arxiv.org/html/2608.19966#S1.F1)(c)所示,这种自适应分割为建模时间变化的多样性和复杂性提供了更大的灵活性。然而,现有的可扩展分割方法通常使用启发式规则来确定分割粒度,这限制了它们处理复杂高阶依赖关系的能力。在具有强非线性依赖或多种共存时间模式的场景中,这些方法常常难以建模异构模式之间的相互作用,从而导致次优的预测性能。这些观察表明,仅提高分割灵活性不足以建模复杂时间动态背后的语义结构。

尽管现有方法取得了进展,但一个关键的研究空白仍然未被根本解决:当前的分割策略均未明确考虑时间片段的内在语义一致性,也未建模异构时间模式之间的高阶结构交互。本质上,所有这些方法都将片段生成视为几何预处理步骤,而不是一个完整的语义建模任务。这种缺陷在趋势、周期性和突发波动共存于同一时间序列时尤其有害,因为模型缺乏一个原则性且可行的机制来分离这些不同的成分并建立它们之间的结构化关系。因此,我们认为基于片段预测的核心挑战不在于追求更高的分割灵活性,而在于构建一个嵌入语义结构的表示系统。

基于以上分析,我们提出了SCPaT,一个基于Transformer的MTSF框架,它通过语义结构化分割来建模动态语义结构。具体而言,SCPaT从原始时间序列中提取基本的时间成分,并将它们组织成分层的语义块,为预测提供多层次的语义抽象。然后,这些语义块通过一个重要的性感知路由模块被纳入注意力机制,这使得模型能够强调信息丰富的表示,并捕捉不同类型语义之间的依赖关系。在多个基准测试上的广泛实验表明,SCPaT在长期和短期预测任务中都达到了最先进的结果。这项工作的主要贡献总结如下:

- •系统分析。我们对时间序列预测的三种代表性片段分割策略进行了系统分析,并表明它们的局限性反映了一个明确的语义结构化分割机制的缺失。
- •创新框架。我们提出了SCPaT,一个将分层语义块和重要性感知路由机制集成到注意力机制中的Transformer框架,能够更有效地建模MTSF中的关键依赖关系。
- •广泛评估。在长期和短期预测基准上的广泛实验表明,SCPaT在广泛的数据集上实现了最先进的性能。

## 2相关工作

### 2.1基于Transformer的时间序列预测

基于Transformer的模型因其强大的并行建模能力和捕捉长期依赖关系的能力(22 (https://arxiv.org/html/2608.19966#bib.bib4);15 (https://arxiv.org/html/2608.19966#bib.bib15))而在MTSF中得到广泛应用。代表性方法从不同角度提高了预测性能。例如,iTransformer(14 (https://arxiv.org/html/2608.19966#bib.bib27))通过沿变量维度重组令牌来增强跨变量依赖建模。Pathformer(3 (https://arxiv.org/html/2608.19966#bib.bib16))使用具有自适应路径策略的多尺度片段分割来捕捉局部和全局时间上下文。Fredformer(19 (https://arxiv.org/html/2608.19966#bib.bib18))通过频率去偏减轻高频偏差。然而,这些方法在明确表征片段内的异构动态以及捕捉不同时间模式间的交互作用方面仍然有限(27 (https://arxiv.org/html/2608.19966#bib.bib5))。当趋势、周期性和突发波动共存于同一时间序列时,这种限制变得尤为明显。此类场景需要能够区分局部语义差异并更有效地建模复杂依赖关系的机制。

### 2.2基于片段的时间序列预测

基于片段的方法已成为时间序列预测的一个重要方向,早期研究主要依赖固定分割策略(26 (https://arxiv.org/html/2608.19966#bib.bib6);3 (https://arxiv.org/html/2608.19966#bib.bib16))。例如,PatchTST(17 (https://arxiv.org/html/2608.19966#bib.bib26))将时间序列分割成等长的片段以提高表示效率。然而,固定分割通常无法保留有意义的时间边界,可能导致显著局部模式的丢失和片段内语义不一致。为了解决这个问题,后续研究探索了多尺度分割策略。例如,TimesNet(24 (https://arxiv.org/html/2608.19966#bib.bib24))跨不同尺度建模时间模式,而FEDformer(34 (https://arxiv.org/html/2608.19966#bib.bib14))在频域分解框架下整合局部和全局趋势。可扩展分割进一步成为一种灵活的替代方案,HDMixer(7 (https://arxiv.org/html/2608.19966#bib.bib23))引入了长度自适应片段,动态调整片段边界,提高了语义完整性和建模灵活性。尽管取得了这些进展,现有基于片段的方法在明确捕捉细粒度语义变化和高阶时间依赖关系方面仍然有限。它们都将片段生成表述为一个几何分割问题,而我们的SCPaT从语义结构的角度重新定义了它。

图 2:SCPaT架构包括:(a) 语义向量编码器,将时间序列编码为语义单元;(b) 转移熵图构建器,量化有向依赖关系并构建动态语义图;以及(c) 重要性感知路由,为不同的语义块分配定制化处理策略以进行有效建模。

## 3所提方法

### 3.1预备知识

在多元时间序列预测中,输入表示为X=\{x1,x2,...,xC\}∈RC×L\\mathbf\{X\}=\\\{\\mathbf\{x\}\_\{1\},\\mathbf\{x\}\_\{2\},\\dots,\\mathbf\{x\}\_\{C\}\\\}\\in\\mathbb\{R\}^\{C\\times L\},其中C是变量数,L是历史回溯窗口长度。这里,xc∈RL\\mathbf\{x\}\_\{c\}\\in\\mathbb\{R\}^\{L\}表示第c个变量的历史观测值。目标是学习一个预测函数fΘ(⋅)f\_\{\\Theta\}(\\cdot),将历史序列映射到未来值Y^∈RC×H\\hat\{\\mathbf\{Y\}\}\\in\\mathbb\{R\}^\{C\\times H\},其中H是预测长度。形式上,Y^=fΘ(X)\.\\hat\{\\mathbf\{Y\}\}=f\_\{\\Theta\}(\\mathbf\{X\})\。我们将每个变量的历史序列划分为N=⌊L/s⌋N=\\lfloor L/s\\rfloor个不重叠的时间片段,其中s表示片段大小。然后将这些片段嵌入到维度为dhd\_\{h\}的隐藏空间中,得到片段级表示。基于这些表示,我们进一步构建语义单元、语义图和块级路由专家,以建模结构化的依赖关系用于预测。

### 3.2语义向量编码器

语义向量编码器将输入序列X∈RC×L\\mathbf\{X\}\\in\\mathbb\{R\}^\{C\\times L\}映射到一组局部语义表示。它提取多尺度的时间模式,自适应地融合生成的特征,并将融合后的序列组织成语义单元。

#### 3.2.1多尺度时间卷积

为了捕捉不同分辨率下的局部时间变化,我们对投影后的特征序列应用多尺度时间卷积。对于第c个变量,令hc=\{hc,t\}t=1L\\mathbf\{h\}\_\{c\}=\\\{\\mathbf\{h\}\_\{c,t\}\\\}\_\{t=1\}^\{L\}表示其投影后的特征序列,其中hc,t∈Rdh\\mathbf\{h\}\_\{c,t\}\\in\\mathbb\{R\}^\{d\_\{h\}\}是时间步t的隐藏表示。对于一个具有核大小k和膨胀因子d的时间分支,在时间步t的输出定义为:

zc,t(k,d)=∑j=0k−1wj(k,d)hc,t−jd,\\mathbf\{z\}\_\{c,t\}^\{\(k,d\)\}=\\sum\_\{j=0\}^\{k\-1\}w\_\{j\}^\{\(k,d\)\}\\,\\mathbf\{h\}\_\{c,t\-jd\},(1)其中zc,t(k,d)∈Rdh\\mathbf\{z\}\_\{c,t\}^\{\(k,d\)\}\\in\\mathbb\{R\}^\{d\_\{h\}\}表示在尺度(k,d)\(k,d\)下提取的特征,wj(k,d)w\_\{j\}^\{\(k,d\)\}是第j个核系数,当t−jd<1t\-jd<1时应用零填充。

该分支输出的紧凑形式为:

Zc(k,d)=W(k,d)∗Hc,\\mathbf\{Z\}\_\{c\}^\{\(k,d\)\}=\\mathbf\{W\}^\{\(k,d\)\}\*\\mathbf\{H\}\_\{c\},(2)其中∗\*表示时间卷积,Hc=[hc,1,...,hc,L]\\mathbf\{H\}\_\{c\}=[\\mathbf\{h\}\_\{c,1\},\\dots,\\mathbf\{h\}\_\{c,L\}],W(k,d)\\mathbf\{W\}^\{\(k,d\)\}是与尺度(k,d)\(k,d\)相关联的卷积核。该分支的有效感受野定义为r(k,d)=1+(k−1)d,r^\{\(k,d\)\}=1+\(k\-1\)d,它由核大小k和膨胀因子d决定。

为

相似文章

自适应分块在时间序列预测中比看起来更难实现

arXiv cs.LG

本文从理论和实验两个角度对时间序列 Transformer 的自适应分块方法进行了深入研究,推导出内容自适应分词应优于调优后的均匀分块的条件。在标准基准上的受控实验表明,经过良好调优的均匀基线与动态分块方法具有相当的竞争力,这对自适应方法所假设的优势提出了质疑。

嵌套时空时间序列预测

arXiv cs.LG

本文提出一种嵌套时空预测框架,利用谱聚类构建语义一致的宏观区域,为细粒度的微观预测提供自上而下的指导。在高维数据集上的实验表明,该方法始终优于最先进的基线模型。