CARNet:面向多元时间序列预测的周期条件核心聚合与再分配

arXiv cs.LG 论文

摘要

CARNet将全局循环周期信息整合到高效的核心交互建模中,用于多元时间序列预测,实现了线性复杂度,并在实际基准测试中优于强大的Transformer基线模型。

arXiv:2607.21681v1 公告类型: 新 摘要:准确建模变量间依赖关系仍是多元时间序列预测中的关键挑战,尤其是在存在强周期模式的情况下。许多现有方法依赖于注意力机制,该机制具有二次复杂度,且随着变量数量的增加扩展性较差。近期无注意力聚合模型通过线性复杂度的核心交互解决了这一问题,但并未明确利用数据中的全局周期结构。为克服这一局限,我们提出CARNet,一个周期条件核心聚合与再分配框架,通过多头核心聚合将全局循环周期信息整合到高效的核心交互建模中。在多个实际多元预测基准上的大量实验表明,CARNet在保持变量间依赖关系线性复杂度建模的同时,在不同预测范围内持续优于强Transformer和非注意力基线模型。
查看原文
查看缓存全文

缓存时间: 2026/07/27 07:41

# CARNet:用于多变量时间序列预测的周期条件化核心聚合与再分配框架
来源:https://arxiv.org/html/2607.21681
Awsaf Tausif Adib, Md\. Shahria Sarker Shuvo, Md\. Estehaar Ahmed Emon, Mustafa Kamal, Fuad Rahman, Shafin Rahman, Nabeel Mohammed

11机构:Apurba\-NSU R&D Lab,电气与计算机工程系,南北大学22机构:Apurba Technologies,加利福尼亚,美国
22邮箱:\{awsaf\.tasusif, shahria\.shuvo, estehaar\.emon, mustafa\.kamal, shafin\.rahman, nabeel\.mohammed\}@northsouth\.edu
22邮箱:fuad@apurbatech\.comMd\. Shahria Sarker ShuvoMd\. Estehaar Ahmed EmonMustafa KamalFuad RahmanShafin RahmanNabeel Mohammed

###### 摘要

准确建模跨变量依赖关系仍然是多变量时间序列预测中的一个关键挑战,尤其是在存在强周期模式的情况下。许多现有方法依赖于注意力机制,这些机制具有二次复杂度,并且随着变量数量的增加而扩展性差。最近的无注意力聚合模型通过线性复杂度的基于核心的交互来解决这个问题,但它们没有显式利用数据中存在的全局周期结构。为了克服这一局限性,我们提出了CARNet,一个周期条件化的核心聚合与再分配框架,通过多头核心聚合将全局循环周期信息整合到高效的核心交互建模中。在多个真实世界多变量预测基准上的大量实验表明,CARNet在多种预测范围上始终优于强Transformer和无注意力基线,同时保持了跨变量依赖建模的线性复杂度。

## 1 引言

准确建模跨变量依赖关系对于多变量时间序列预测(MTSF)至关重要,它支撑着广泛的实际应用,包括能源规划、医学预测、气候分析和交通监控\[27 (https://arxiv.org/html/2607.21681#bib.bib27),28 (https://arxiv.org/html/2607.21681#bib.bib28),29 (https://arxiv.org/html/2607.21681#bib.bib29),30 (https://arxiv.org/html/2607.21681#bib.bib30)\]。最近基于Transformer的模型显式捕获变量间交互,例如iTransformer\[2 (https://arxiv.org/html/2607.21681#bib.bib2)\],已显示出相对于通道独立方法(如PatchTST\[1 (https://arxiv.org/html/2607.21681#bib.bib1)\])的明显优势。然而,注意力的二次复杂度促进了高效注意力变体\[6 (https://arxiv.org/html/2607.21681#bib.bib6),5 (https://arxiv.org/html/2607.21681#bib.bib5),31 (https://arxiv.org/html/2607.21681#bib.bib31)\]以及基于状态空间模型、图方法、MLP风格架构和相关方法的无注意力替代方案\[7 (https://arxiv.org/html/2607.21681#bib.bib7),8 (https://arxiv.org/html/2607.21681#bib.bib8),9 (https://arxiv.org/html/2607.21681#bib.bib9),30 (https://arxiv.org/html/2607.21681#bib.bib30),12 (https://arxiv.org/html/2607.21681#bib.bib12),14 (https://arxiv.org/html/2607.21681#bib.bib14)\]的发展。

虽然多数现有通道依赖模型在可扩展性方面有效,但它们直接对通常呈现强周期或季节性模式的原始输入序列进行操作。先前工作表明,主导的重复结构可能掩盖其他信息丰富的动态,从而激励显式分解策略或周期感知建模方法\[10 (https://arxiv.org/html/2607.21681#bib.bib10),11 (https://arxiv.org/html/2607.21681#bib.bib11)\]。CycleNet通过残差周期预测(RCF)解决了这个问题,它学习循环周期并将其从输入中移除,以更好地建模残差时间动态\[16 (https://arxiv.org/html/2607.21681#bib.bib16)\]。然而,CycleNet主要关注时间周期性,并未显式建模多变量设置中的跨变量依赖关系。TQNet\[17 (https://arxiv.org/html/2607.21681#bib.bib17)\]通过将循环周期作为全局相关表示并通过交叉注意力调节变量间交互来解决这一局限,实现了周期结构与样本特定依赖之间的对齐。虽然有效,但这种设计依赖于注意力机制来调节循环周期与变量嵌入之间的交互。相比之下,像SOFTS\[13 (https://arxiv.org/html/2607.21681#bib.bib13)\]和TSMixer\[12 (https://arxiv.org/html/2607.21681#bib.bib12)\]这样的高效无注意力架构为通道交互提供了可扩展的替代方案,但它们没有显式利用全局循环周期信息。因此,将周期条件化的交互建模集成到无注意力架构中仍然是一个难题。

为了弥合这一差距,我们提出CARNet,一个用于多变量时间序列预测的周期条件化架构,它将可学习的循环周期作为全局条件信号集成到一个统一的核心聚合与再分配框架中。CARNet采用星形聚合机制\[13 (https://arxiv.org/html/2607.21681#bib.bib13)\],并引入了一种有效方法将全局周期信息纳入跨变量依赖建模。此外,为了提高聚合表示的表达能力,我们引入了多头核心聚合(MHCA)机制,它将变量表示划分为多个交互子空间,并通过单独的头变换提取紧凑的子空间特定表示。这些子空间表示被组合成统一的变量级表示,随后跨变量池化以获得全局的周期条件化核心。通过周期条件化核心再分配,此全局表示被反馈到变量嵌入中,实现结构化的跨变量交互建模,同时保持线性复杂度和无注意力计算。

总之,本文的贡献如下:

- 1\. 我们提出了CARNet,一个用于多变量时间序列预测的周期条件化架构,它将可学习的循环周期作为全局条件信号集成到一个统一的核心聚合与再分配框架中。
- 2\. 我们引入了*多头核心聚合(MHCA)*机制,通过从分区的变量特征中提取和组合多个核心表示来增强跨变量交互。
- 3\. 我们在12个真实世界多变量时间序列基准上进行了广泛实验,证明CARNet在多个预测范围内始终实现强劲性能,并具有有利的效率。

11脚注:

官方实现:https://github.com/adib3552/carnet

## 2 相关工作

### 2\.1 聚合模型

基于聚合的预测模型旨在通过将多个变量的信息压缩到共享的潜在表示中,然后将聚合的信息再分配用于预测来捕获跨变量依赖关系。与基于注意力的方法相比,这些模型通常通过避免所有变量之间的显式成对交互,为多变量预测提供了更高效的替代方案。早期的轻量级架构如TSMixer\[12 (https://arxiv.org/html/2607.21681#bib.bib12)\]和TiDE\[24 (https://arxiv.org/html/2607.21681#bib.bib24)\]通过混合和基于MLP的设计探索了高效通道交互,证明了即使不依赖完整的注意力机制也能实现强劲的预测性能。

最近,SOFTS\[13 (https://arxiv.org/html/2607.21681#bib.bib13)\]引入了一种专门的核心聚合机制,将多变量信息总结成一个紧凑的共享核心并重新分配给每个变量,以线性复杂度实现了强劲性能。如图1所示,我们的工作建立了这种聚合范式之上,超越了单核心聚合,引入了多头核心聚合,捕获了更丰富和更多样化的跨变量交互。这种设计使CARNet能够保持基于聚合建模的效率优势,同时增强其表示灵活性。

参考图说明图1:核心聚合策略比较。(a) 传统方法将所有变量聚合到一个共享核心表示中。(b) 我们的多头核心聚合首先将变量划分为多个交互子空间,提取特定头的核心,然后将它们组合成一个共享核心,实现更丰富和更多样化的跨变量交互建模。
### 2\.2 周期模型

周期模型通过引入对季节性、周期和频域结构的归纳偏置,显式捕获重复的时间模式。Autoformer\[10 (https://arxiv.org/html/2607.21681#bib.bib10)\]通过将输入序列分解为周期(季节性)和非周期(趋势)组件,推广了这一范式,使模型能够专注于结构化的时间规律。类似地,FEDformer\[11 (https://arxiv.org/html/2607.21681#bib.bib11)\]利用频域表示结合注意力机制,为长时域预测建模全局周期依赖关系。

几个轻量级架构通过高效的时间建模进一步利用周期结构。TimeMixer\[19 (https://arxiv.org/html/2607.21681#bib.bib19)\]通过跨不同时间分辨率的多尺度混合捕获周期模式,而SparseTSF\[15 (https://arxiv.org/html/2607.21681#bib.bib15)\]引入稀疏时间交互来选择性地建模主导周期依赖。TQNet\[17 (https://arxiv.org/html/2607.21681#bib.bib17)\]使用量化时间表示建模周期性,能够在多个时间尺度上高效学习重复模式。这些方法共同表明,显式建模周期结构可以简化时间动态并提高预测性能。

### 2\.3 通道依赖建模

建模跨变量依赖关系是多变量时间序列预测的核心,因为变量之间的相关性通常可以提高预测准确性。基于Transformer的方法通过显式的通道感知表示来解决这个问题。例如,iTransformer\[2 (https://arxiv.org/html/2607.21681#bib.bib2)\]将变量视为令牌,通过自注意力建模跨变量关系,而TimeXer\[4 (https://arxiv.org/html/2607.21681#bib.bib4)\]引入全局可学习令牌来总结通道特定的时间信息并支持通道间交互。TimesNet\[20 (https://arxiv.org/html/2607.21681#bib.bib20)\]也通过共享表示捕获跨变量依赖关系,同时强调结构化时间模式提取。

除了基于注意力的架构,几种轻量级方法为通道交互建模提供了高效替代方案。TSMixer\[12 (https://arxiv.org/html/2607.21681#bib.bib12)\]在基于MLP的框架中使用交替的时间混合和通道混合层,而SOFTS\[13 (https://arxiv.org/html/2607.21681#bib.bib13)\]引入了一种核心聚合机制,将变量间的信息总结成共享潜在表示并重新分配给每个通道。这些方法共同反映了在多变量预测中建模跨变量依赖关系的多样化策略。

## 3 方法论

多变量时间序列预测旨在根据历史输入序列X=\[x1,x2,...,xT\]∈RC×T\\mathbf\{X\}=\[\\mathbf\{x\}\_\{1\},\\mathbf\{x\}\_\{2\},\\ldots,\\mathbf\{x\}\_\{T\}\]\\in\\mathbb\{R\}^\{C\\times T\}预测未来序列Y=\[yT\+1,yT\+2,...,yT\+H\]∈RC×H\\mathbf\{Y\}=\[\\mathbf\{y\}\_\{T\+1\},\\mathbf\{y\}\_\{T\+2\},\\ldots,\\mathbf\{y\}\_\{T\+H\}\]\\in\\mathbb\{R\}^\{C\\times H\},其中CC表示变量数量(通道),TT是回溯窗口长度,HH是预测范围。形式上,目标是学习一个参数化的预测模型fφ\(⋅\)f\{\\boldsymbol\{\\phi\}\}\(\\cdot\),具有可学习参数φ\\boldsymbol\{\\phi\},将过去窗口映射到未来窗口,即Y=fφ\(X\)\\mathbf\{Y\}=f\{\\boldsymbol\{\\phi\}\}\(\\mathbf\{X\}\),其中fφ:RC×T→RC×Hf\{\\boldsymbol\{\\phi\}\}:\\mathbb\{R\}^\{C\\times T\}\\rightarrow\\mathbb\{R\}^\{C\\times H\}。预测函数旨在捕获跨变量依赖关系,同时考虑跨变量共享的重复时间模式。在许多真实场景中,这种依赖关系受到底层周期结构的影响,这激励我们将全局周期信息纳入变量交互建模。

### 3\.1 CARNet 概述

参考图说明图2:CARNet框架概述。(a) 在周期条件化核心聚合模块中,变量嵌入和周期投影融合得到周期条件化变量嵌入。(b) 多头核心聚合模块从周期条件化变量嵌入中提取紧凑的核心表示。(c) 在周期条件化核心再分配模块中,共享核心连同周期投影一起被重新分配给变量嵌入。如图2所示,CARNet遵循一个周期条件化核心聚合与再分配流程用于多变量时间序列预测。给定输入多变量时间序列X∈RC×T\\mathbf\{X\}\\in\\mathbb\{R\}^\{C\\times T\},其中CC表示变量数量,TT表示回溯长度,CARNet首先构建一个可学习的循环周期表示Z∈RC×T\\mathbf\{Z\}\\in\\mathbb\{R\}^\{C\\times T\}来编码跨变量共享的主导周期模式。该周期表示与输入序列相位对齐,并作为全局条件信号。由于CARNet明确是通道依赖的,原始输入序列通过线性嵌入层被转换成变量级嵌入X′∈RC×d\\mathbf\{X\}^\{\\prime\}\\in\\mathbb\{R\}^\{C\\times d\}。同时,周期表示被投影到相同的嵌入空间,得到Z′∈RC×d\\mathbf\{Z\}^\{\\prime\}\\in\\mathbb\{R\}^\{C\\times d\}。两个表示沿特征维度拼接形成V∈RC×2d\\mathbf\{V\}\\in\\mathbb\{R\}^\{C\\times 2d\},并线性投影得到周期条件化变量表示V′∈RC×d\\mathbf\{V\}^\{\\prime\}\\in\\mathbb\{R\}^\{C\\times d\}。为了建模跨变量交互,周期条件化变量嵌入V′\\mathbf\{V\}^\{\\prime\}被传递到多头核心聚合(MHCA)模块,以提取紧凑的变量级核心表示。如图2所示,MHCA将嵌入维度划分为hh个头,并从每个子空间提取一个紧凑表示。得到的头级表示被组合形成统一的多头表示θ∈RC×d′\\boldsymbol\{\\theta\}\\in\\mathbb\{R\}^\{C\\times d^\{\\prime\}\}。最后,通过跨变量维度的随机池化获得核心θP∈Rd′\\boldsymbol\{\\theta\}\_\{\\mathcal\{P\}\}\\in\\mathbb\{R\}^\{d^\{\\prime\}\}。然后,周期条件化核心被广播到每个通道得到θ′∈RC×d′\\boldsymbol\{\\theta\}^\{\\prime\}\\in\\mathbb\{R\}^\{C\\times d^\{\\prime\}\},并连同周期投影一起通过MLP融合重新分配到变量嵌入,以产生精炼表示G∈RC×d\\mathbf\{G\}\\in\\mathbb\{R\}^\{C\\times d\},使重新分

相似文章

一个102M参数的Transformer如何预测多元时间序列?

Reddit r/artificial

本文通过可视化方式介绍了t0-alpha——一个1.016亿参数的基础模型,用于多元时间序列预测。该模型将时间注意力与跨变量组注意力分离,在GIFT-Eval上取得了具有竞争力的CRPS分数,与TimesFM 2.5和Chronos-2等更大模型相当。

Nexus:面向时间序列预测的智能体框架

Hugging Face Daily Papers

Nexus 提出了一种多智能体框架,将时间序列预测分解为多个专门阶段,利用大语言模型整合数值模式与上下文信息,在基准测试上取得了最先进的结果。

基于自回归序列模型的条件属性估计

arXiv cs.AI

本文介绍了条件属性变换器(Conditional Attribute Transformers),一种联合估计条件概率和属性值的方法,能够在单次前向传播中实现信用分配、反事实分析和可引导生成。

STKAN:用于时空预测的Kolmogorov-Arnold Networks

arXiv cs.LG

本文介绍了STKAN,一种集成泰勒多项式Kolmogorov-Arnold网络模块以实现空间和时间令牌混合的时空预测架构。在五个交通基准上的实验显示出竞争性表现,表明非线性函数逼近器可以补充架构设计。