Unicorn:通过通用相关性建模实现高维时间序列预测的规模化

arXiv cs.LG 论文

摘要

本文介绍了Unicorn,一个用于对高维时间序列进行可扩展的多数据集预训练的框架,它通过潜在原型码本将相关性建模与特定通道身份解耦,从而实现了领域迁移和少样本预测。

arXiv:2605.30376v1 Announce Type: new Abstract: 现代时间序列架构面临一个基本权衡:通道独立模型随着数据量增加可扩展性好,但忽略了关键的通道间依赖关系;而通道依赖模型表达能力虽强,但受限于“维度受限”,难以在异构数据集上泛化。为了弥合这一差距,我们提出了Unicorn(通用相关网络),一个用于高维时间序列的可扩展多数据集预训练框架。Unicorn的核心是一个潜在原型码本,它将相关性建模与特定通道身份解耦。通过将异构通道投影到一个共享的潜在空间,UniCorN学习到与身份无关的、可复用的交互模式,这些模式能够在不同维度和语义的领域之间迁移。大量实验表明,Unicorn显著优于最先进的预测架构,尤其在少样本迁移场景中,为多变量时间序列基础模型提供了一条可扩展的路径。
查看原文
查看缓存全文

缓存时间: 2026/06/01 09:22

# Unicorn:通过通用相关性建模实现高维时间序列预测的规模化

来源:https://arxiv.org/html/2605.30376

Haochen Yuan·Yichen Song·Yunbo Wang·Xiaokang Yang  
教育部人工智能重点实验室,人工智能研究所,计算机科学学院  
上海交通大学  
\{yuanhaochen, syc\.x\_x, yunbow, xkyang\}@sjtu\.edu\.cn

###### 摘要

现代时间序列架构面临一个根本性的权衡:通道独立模型虽能随数据量增加良好扩展,但忽略了关键的通道间依赖关系;而通道依赖模型表达能力虽强,却始终"受维度制约",难以在异构数据集上泛化。为弥合这一差距,我们提出Unicorn(通用相关网络),一个面向高维时间序列的可扩展多数据集预训练框架。Unicorn的核心是一个**潜在原型码本**,它将相关性建模与特定通道身份解耦。通过将异构通道投影到共享的潜在空间,Unicorn学习**身份无关、可复用的交互模式**,这些模式能跨维度、跨语义的领域迁移。大量实验表明,Unicorn显著优于最先进的预测架构,尤其在少样本迁移场景中,为迈向多变量时间序列基础模型提供了一条可扩展的路径。

参阅图注 图1:在包含587支股票的A股数据集上的性能。雷达图在四个关键维度上对模型性能进行基准测试:效率、泛化能力、可扩展性和少样本适应性。可扩展性通过在微调和推理过程中全通道配置与25%通道配置之间的性能差异来评估。少样本性能通过在有限(25%)训练数据子集上进行微调来衡量。

## 1 引言

高维时间序列预测是许多实际应用的核心,涵盖金融市场分析、大规模能源系统管理到气候建模等领域。在这些领域中,系统必须联合推理数百甚至数千个相关变量(即输入通道)。尽管时间序列基础模型近期取得了进展,但将现代架构扩展到如此高维的设置仍然具有挑战性。这一挑战源于**领域可扩展性**与**相关性建模**之间的根本冲突:一方面,通道独立(CI)模型[Shi等人,2026 (https://arxiv.org/html/2605.30376#bib.bib5);Das等人,2024 (https://arxiv.org/html/2605.30376#bib.bib4)] 通过共享参数独立处理每个变量,这能很好地跨异构数据集扩展,但丢弃了通道间的交互信息。另一方面,通道依赖(CD)模型[Liu等人,2025a (https://arxiv.org/html/2605.30376#bib.bib1);Zhou等人,2022 (https://arxiv.org/html/2605.30376#bib.bib13)] 显式地捕捉变量间的交互,通常通过多头注意力机制实现,这些机制本质上与特定的通道身份和固定维度绑定。尽管忽略了通道间依赖,但最近的实证研究表明,CI模型在多变量预测任务中常常优于CD模型[Shi等人,2026 (https://arxiv.org/html/2605.30376#bib.bib5)]。这一看似矛盾的结果揭示了现有CD方法的一个关键局限性:通过将相关性建模紧密耦合到固定通道身份,它们学习了数据集特定的、无法泛化的依赖关系。这个问题在高维环境下尤为突出,因为相关性稀疏且观察不均,导致CD模型容易过拟合。例如,在金融市场中,当序列数量小于资产数量(MIC > I)时,这些模型会遭受参数爆炸和严重过拟合。其次,在大规模预训练中,通道数C在不同的数据集间变化(C∈{C₁, C₂, ...})。固定维度的交互矩阵(ℝ^{C×C})无法与异构通道集上的联合训练兼容。

## 3 相关工作

多变量时间序列预测通常围绕**通道独立**(CI)和**通道依赖**(CD)两种范式组织。CI方法分别对每个变量建模,这在异构的短期动态下通常能提升鲁棒性和可扩展性[Rangapuram等人,2018 (https://arxiv.org/html/2605.30376#bib.bib36);Park等人,2022 (https://arxiv.org/html/2605.30376#bib.bib35);Sagheer和Kotb,2019 (https://arxiv.org/html/2605.30376#bib.bib34);Li等人,2019 (https://arxiv.org/html/2605.30376#bib.bib27);Zhou等人,2021 (https://arxiv.org/html/2605.30376#bib.bib11)]。代表性的CI模型包括TiDE[Das等人,2023 (https://arxiv.org/html/2605.30376#bib.bib8)]、非平稳变换器[Liu等人,2022 (https://arxiv.org/html/2605.30376#bib.bib44)]、TEMPO[Cao等人,2024 (https://arxiv.org/html/2605.30376#bib.bib29)]、PDF[Tao等人,2024 (https://arxiv.org/html/2605.30376#bib.bib9)]和SparseTSF[Shengsheng等人,2024 (https://arxiv.org/html/2605.30376#bib.bib10)]。而CD方法显式利用通道间依赖,但直接的耦合常常会损害泛化能力[Wang等人,2019 (https://arxiv.org/html/2605.30376#bib.bib37),2022 (https://arxiv.org/html/2605.30376#bib.bib32);Zhou等人,2023 (https://arxiv.org/html/2605.30376#bib.bib40);Yi等人,2024 (https://arxiv.org/html/2605.30376#bib.bib30);Wang等人,2024a (https://arxiv.org/html/2605.30376#bib.bib42)]。现有的CD研究大致可以分为三个主要方向。首先,序列和概率模型,如DeepAR[Flunkert等人,2017 (https://arxiv.org/html/2605.30376#bib.bib38)]、GRU-D[Che等人,2018 (https://arxiv.org/html/2605.30376#bib.bib33)]和TimeGrad[Rasul等人,2021 (https://arxiv.org/html/2605.30376#bib.bib39)],通过共享全局时间动态来捕捉相关性。其次,基于图的方法,例如MTGNN[Wu等人,2020 (https://arxiv.org/html/2605.30376#bib.bib25)],显式建模关系结构以促进跨通道的信息传播。最后,基于注意力或混合的架构直接聚合变量级表示,包括iTransformer[Liu等人,2024a (https://arxiv.org/html/2605.30376#bib.bib16)]、Crossformer[Zhang和Yan,2023 (https://arxiv.org/html/2605.30376#bib.bib15)]、TimeMixer[Wang等人,2024b (https://arxiv.org/html/2605.30376#bib.bib43)]以及一系列相关方法[Zhou等人,2024 (https://arxiv.org/html/2605.30376#bib.bib41);Nie等人,2023 (https://arxiv.org/html/2605.30376#bib.bib6);Wu等人,2021 (https://arxiv.org/html/2605.30376#bib.bib12);Zhou等人,2022 (https://arxiv.org/html/2605.30376#bib.bib13);Wu等人,2023 (https://arxiv.org/html/2605.30376#bib.bib14)]。更近期的模型,如TimeBridge[Liu等人,2025a (https://arxiv.org/html/2605.30376#bib.bib1)],进一步引入了协整感知注意力来建模长期依赖,而SOFTS[Han等人,2024 (https://arxiv.org/html/2605.30376#bib.bib2)]则引入了一种高效的聚合-再分配机制用于可扩展的跨变量建模。

时间序列基础模型旨在通过在大量时间序列数据上进行大规模预训练,实现跨领域的强大零样本和少样本性能。典型的架构包括仅解码器[Das等人,2024 (https://arxiv.org/html/2605.30376#bib.bib4);Zhou等人,2023 (https://arxiv.org/html/2605.30376#bib.bib40);Liu等人,2024b (https://arxiv.org/html/2605.30376#bib.bib17);Xiaoming等人,2025 (https://arxiv.org/html/2605.30376#bib.bib18);Liu等人,2025b (https://arxiv.org/html/2605.30376#bib.bib19);Ansari等人,2024 (https://arxiv.org/html/2605.30376#bib.bib24)]、仅编码器[Goswami等人,2024 (https://arxiv.org/html/2605.30376#bib.bib20);Woo等人,2024 (https://arxiv.org/html/2605.30376#bib.bib21)]和编码-解码器模型[Garza等人,2023 (https://arxiv.org/html/2605.30376#bib.bib22)]。TimesFM[Das等人,2024 (https://arxiv.org/html/2605.30376#bib.bib4)]和Kronos[Shi等人,2026 (https://arxiv.org/html/2605.30376#bib.bib5)]采用CI架构设计,处理多变量输入但不显式建模通道间依赖。虽然它们可以处理具有不同通道维度的数据集,但在预训练过程中不区分通道,仅关注时间依赖。与TimesFM和Kronos不同,我们的方法通过域不变原型交互克服了这一局限性,能够同时实现通道依赖建模和多数据集预训练,使其特别适合高维预测任务。

## 4 方法

为了实现领域可扩展性,Unicorn基于一个指导原则:**通道间依赖应在共享的潜在交互空间中建模,而不是通过显式的通道到通道参数化。**核心思想是将异构的高维通道投影到一个紧凑的、包含K个可学习原型(K≪C)的集合中,形成一个通用的相关性词汇表,该词汇表可扩展到任意维度,并能跨不同领域泛化。具体来说,Unicorn包含三个组成部分:(i) 一个通道级编码器,用于提取单变量时间表示(第4.1节 (https://arxiv.org/html/2605.30376#S4.SS1));(ii) 一个频率感知的全局特征模块,注入频谱线索以指导表示学习(第4.2节 (https://arxiv.org/html/2605.30376#S4.SS2));(iii) 一个潜在交互模块,在潜在空间中建模通道到原型的依赖关系(第4.3节 (https://arxiv.org/html/2605.30376#S4.SS3))。我们将在第4.4节 (https://arxiv.org/html/2605.30376#S4.SS4)进一步详述训练流程,并在第4.5节 (https://arxiv.org/html/2605.30376#S4.SS5)分析计算复杂度。

参阅图注 图2:Unicorn架构。  
**时间提取(左)**:通过共享的补丁嵌入实现可扩展的单变量建模。  
**频率引导(中)**:一个傅里叶分析网络生成频谱特征(ḡ_m)以引导通道对齐。  
**原型交互(右)**:通道-原型交叉注意力(U,P)产生身份解耦的通道间特征(Ũ)。

### 4.1 时间建模

给定 X ∈ ℝ^{C×I},我们将每个通道划分为长度为 S 的非重叠补丁,得到 N = ⌈I/S⌉ 个补丁。每个时间补丁线性投影为一个 D 维令牌,得到补丁令牌 P ∈ ℝ^{C×N×D}。Unicorn采用TimeBridge[Liu等人,2025a (https://arxiv.org/html/2605.30376#bib.bib1)]作为通道独立建模的时间骨干,并对**每个通道内**的补丁应用集成注意力,以捕捉通道内的时间依赖,同时缓解短期的非平稳性。为了建模长期依赖,补丁令牌沿时间维度从 N 个下采样到 M 个令牌(M≪N),产生长期令牌 H ∈ ℝ^{C×M×D},其中 M≪I。每个切片 H_{:,m} 对应于索引 m 处的一个粗略时间抽象,并作为后续通道间模块的输入。到目前为止,所有操作都是通道独立的,这支持在具有异构通道集的数据集上进行预训练。

### 4.2 频谱全局引导

领域可复用的通道建模需要稳定的交互线索,这些线索通常表现为跨领域重复出现的周期性模式。我们通过一个频率引导模块来解决这个问题,利用频谱信息构建一个领域可迁移的通道间上下文。

#### 频谱特征提取。
为了显式捕捉周期结构,我们采用傅里叶分析网络(FAN)[Dong等人,2025 (https://arxiv.org/html/2605.30376#bib.bib3)]作为共享的频率提取器。给定来自通道级编码器的 H ∈ ℝ^{C×M×D},FAN在频域中操作,通过滤除非周期性的时间变化来提取与周期性相关的表示。具体来说,对于每个通道和长期索引,FAN产生一个频谱描述符 f_{c,m},编码主要的周期性签名:

f_{c,m} = FAN(H_{c,m,:}) ∈ ℝ^{d_f},   (1)

其中FAN的参数在所有通道和数据集上共享,以确保一个通用的特征空间。与在时域中混合通道的传统方法不同,我们的设计认识到局部时间动态已经由共享骨干充分捕捉。通过在频域中进行交互,我们专注于稳定的、全局的特征,这些特征作为跨数据集对齐的可靠锚点。

#### 聚合-再分配机制。
基于这些频谱描述符,我们通过一个聚合-再分配机制合成一个全局的通道间上下文,而不引入数据集特定的模型参数。对于每个补丁索引 m,我们根据其频率特征计算归一化的通道重要性分数 a_{c,m}:

s_{c,m} = w⊤ f_{c,m},   a_{c,m} = exp(s_{c,m}) / ∑_{j=1}^{C} exp(s_{j,m}),   (2)

其中 w ∈ ℝ^{d_f} 是可学习的,且对于每个 m,∑_{c=1}^{C} a_{c,m} = 1。这些分数决定了每个通道对每个索引 m 处的共享全局表示的相对贡献:

g_m = ∑_{c=1}^{C} a_{c,m} H_{c,m,:} ∈ ℝ^{D}.   (3)

聚合后的全局令牌 g_m 通过一个按维度操作的 MLP(记为 φ(·))进行精炼,得到精炼后的上下文 ḡ_m = φ(g_m) ∈ ℝ^{D}。该上下文随后通过残差融合过程重新分配给各个通道:

G_{c,m,:} = H_{c,m,:} + ψ( [H_{c,m,:}; ḡ_m] ) ∈ ℝ^{D},   (4)

其中 [·;·] 表示沿特征维度的拼接,ψ(·) 是一个跨通道共享的 MLP。这一阶段通过将频谱感知的全局上下文充实到原始的 CI 特征中结束。对于每个 m,我们构建增强后的表示:

U_{:,m,:} = [H_{:,m,:}; G_{:,m,:}] ∈ ℝ^{C×2D}.   (5)

通过保留单变量时间特征,同时用域稳定的周期线索进行增强,这个拼接后的表示 U 成为后续**原型中介交互**的最优输入,促进了异构通道的对齐。

### 4.3 通道-原型交互

为了学习可迁移的通道间依赖,Unicorn引入了一个潜在原型码本,并在一个领域可复用的潜在空间中建模交互。该架构将身份特定的 C×C 交互替换为 (i) 一组潜在通道交互原型,以及 (ii) 一个数据集自适应的通道-原型聚合与再分配机制。

#### 潜在原型码本。
给定频谱-时间表示 U_{:,m,:} ∈ ℝ^{C×2D},...

相似文章

时间序列即语言:面向通用时间序列基础模型的通用分词器

arXiv cs.LG

本文提出UniTok,一种将连续时间序列转化为离散标记的通用分词器,以及UniTok-FM,一个基于下一标记预测预训练的基础模型。该模型支持零样本和提示增强预测,以及通过无需训练的上下文推理实现少样本生成和分类——这是以往工作未能实现的能力。

统一零样本时间序列预测:Darts基础

arXiv cs.LG

Darts,一个广受欢迎的开源Python时间序列分析库,引入了一个统一的FoundationModel类集合,该集合整合了多种时间序列基础模型(Chronos-2、TimesFM 2.5、TiRex、PatchTST-FM),通过标准化接口和最小依赖实现零样本和微调预测。

Chronicle:用于联合语言和时间序列理解的多模态基础模型

arXiv cs.LG

Chronicle 是一个 324M 参数的纯解码器 Transformer,从零开始在自然语言和时间序列上预训练,在 NLU 和时间序列分类任务上取得了有竞争力的性能,并在 UCR/UEA 数据集上的冻结嵌入时间序列分类中创造了新的最先进水平。