基于多分块令牌对齐和混合掩码的尺度感知时间序列基础模型预训练

arXiv cs.LG 论文

摘要

本文介绍了SATS,一种用于时间序列基础模型的新颖预训练方法,它使用尺度感知的令牌对齐和混合掩码,以在异构数据集上实现最先进的预测性能并提高效率。

arXiv:2608.20005v1 公告类型:新 摘要:在异构数据集上预训练时间序列基础模型需要有效处理不同的采样频率。当前的方法要么使用特定于数据集的分块大小和独立的FFN,导致表示碎片化,要么强制使用固定的分块大小,忽略了固有的时间变化。为了解决这个问题,我们提出了SATS,它具有尺度感知的令牌对齐机制,将分块大小视为尺度的显式概念。通过引入受对比学习启发的对齐正则化器,SATS在跨尺度对齐表示空间的同时保留了不同的建模能力。此外,引入了一种结合随机和连续掩码的混合掩码策略,以捕获多尺度时间结构。在LSTF基准上的实验结果表明,与竞争基线相比,SATS在MSE上实现了9.2%的改进,在GIFT-Eval MASE上获得了8.3%的提升。值得注意的是,SATS在提供最先进的性能的同时,实现了比先进基线模型效率提高65.6%,突出了其在时间序列预训练中的有效性和可扩展性。
查看原文
查看缓存全文

缓存时间: 2026/08/21 10:31

# 通过多Patch Token对齐与混合掩码的尺度感知时间序列基础模型预训练
来源: https://arxiv.org/html/2608.20005

## 通过多Patch Token对齐与混合掩码的尺度感知时间序列基础模型预训练\*通讯作者:崔立振 \(clz@sdu\.edu\.cn\)。

陈太华1,2,马翔1,张一心3,詹泰霖1,孙满宇1,崔立振1,2,\*单位:1山东大学软件学院,中国济南 250101 2山东大学-南洋理工大学人工智能联合研究中心 (C-FAIR),山东大学,中国济南 250101 3南洋理工大学,新加坡 [email protected],[email protected],[email protected], [email protected],[email protected],[email protected]

###### 摘要

在异构数据集上预训练时间序列基础模型需要有效处理不同的采样频率。现有方法要么采用数据集特定的patch大小和独立的前馈网络,导致表示碎片化;要么强制使用固定的patch大小,忽略了时间序列固有的时序变化。为解决此问题,我们提出SATS模型,其采用一种尺度感知的token对齐机制,将patch大小视为一种显式的尺度概念。通过引入受对比学习启发的对齐正则化,SATS在跨尺度对齐表示空间的同时,保留了各自的建模能力。此外,我们提出一种结合随机掩码与连续掩码的混合掩码策略,以捕获多尺度的时间结构。在LSTF基准测试上的实验结果表明,与具有竞争力的基线模型相比,SATS在MSE指标上提升了9.2%,在GIFT-Eval MASE指标上提升了8.3%。值得注意的是,SATS在持续提供先进水平性能的同时,模型效率相比先进基线模型提高了65.6%,凸显了其在时间序列预训练中的有效性和可扩展性。

###### 索引词:

时间序列基础模型,时间序列预测,异构时间序列,零样本预测。

## I引言

基础模型的最新出现显著推动了自然语言处理\[1 (https://arxiv.org/html/2608.20005#bib.bib1),2 (https://arxiv.org/html/2608.20005#bib.bib2)\]、计算机视觉\[3 (https://arxiv.org/html/2608.20005#bib.bib3),4 (https://arxiv.org/html/2608.20005#bib.bib4)\]和语音理解\[5 (https://arxiv.org/html/2608.20005#bib.bib5),6 (https://arxiv.org/html/2608.20005#bib.bib6)\]等多个领域的发展。受其成功的启发,越来越多的研究致力于为时间序列开发基础模型,旨在生成可跨多种下游任务迁移的通用表示。早期的一类工作将预训练的语言模型适配到时间序列任务,利用其序列建模能力以期实现强大的泛化性\[7 (https://arxiv.org/html/2608.20005#bib.bib7),8 (https://arxiv.org/html/2608.20005#bib.bib8),9 (https://arxiv.org/html/2608.20005#bib.bib9)\]。然而,模态差距常常阻碍其在时间结构化数据上的性能,导致在不同时间序列任务上的泛化效果欠佳。此外,其黑箱性质进一步加剧了这一问题,引发了可解释性方面的担忧,且与时间序列内在的时间特性缺乏对齐\[10 (https://arxiv.org/html/2608.20005#bib.bib10)\]。为应对这些挑战,第二类工作应运而生,它们在大规模、异构的时间序列数据集上从头训练基础模型\[11 (https://arxiv.org/html/2608.20005#bib.bib11),12 (https://arxiv.org/html/2608.20005#bib.bib12),13 (https://arxiv.org/html/2608.20005#bib.bib13)\]。这些模型旨在以数据驱动和领域自适应的方式捕获通用的时序动态,从而增强对分布偏移的鲁棒性,并提高跨不同采样率、模态和序列长度领域(例如金融、医疗、气象、物联网)的迁移能力。

尽管后一种方向前景广阔,但它带来了独特的挑战——特别是在跨数据集预训练中,如何有效分割和词化连续信号。与语言中离散的词单位自然地作为稳定token\[14 (https://arxiv.org/html/2608.20005#bib.bib14)\],或视觉中由于空间分辨率和语义鲁棒性一致而适用的均匀patch大小\[15 (https://arxiv.org/html/2608.20005#bib.bib15),16 (https://arxiv.org/html/2608.20005#bib.bib16)\]不同,时间序列数据表现出不规则采样和可变的序列长度,使得固定大小的降采样无效。这些特性要求使用小的、自适应的patch大小以保留细粒度的时间模式。

如图1 (https://arxiv.org/html/2608.20005#S1.F1)所示,近期研究探索了时间序列词化的两种主要策略,每种策略都有其固有的局限性。(1)数据集特定的分块采用针对局部采样率定制的可变patch大小,并结合独立的前馈网络进行token投影\[17 (https://arxiv.org/html/2608.20005#bib.bib17),12 (https://arxiv.org/html/2608.20005#bib.bib12)\]。虽然这种设计与每个数据集的粒度高度契合,但它导致了碎片化的token空间,阻碍了可泛化时间模式的学习,并损害了训练稳定性\[18 (https://arxiv.org/html/2608.20005#bib.bib18)\]。(2)统一分块强制所有数据集使用全局小的patch大小,以促进表示的一致性\[19 (https://arxiv.org/html/2608.20005#bib.bib19),20 (https://arxiv.org/html/2608.20005#bib.bib20)\]。然而,这种策略引入了信息瓶颈,且常常错位局部动态,因为它无法适应不同数据集固有的多样时序结构\[21 (https://arxiv.org/html/2608.20005#bib.bib21)\]。因此,这两种策略都面临着数据集适应性与表示通用性之间的权衡,限制了它们在可扩展预训练中的有效性。

参见标题

图 1:(a) 针对不同采样率的数据集特定patch大小和独立FFN导致碎片化的token空间。(b) 使用统一的patch大小和FFN存在信息瓶颈和局部动态错位的风险。(c) SATS采用数据集特定的patch大小,并在FFN投影空间中强制执行尺度感知对齐,从而产生语义丰富且一致的表示。为了弥合自适应分块引入的碎片化token空间与固定分割的表示僵化之间的差距,我们提出一种面向时间序列预训练的尺度感知token对齐机制。通过将patch大小视为显式的尺度概念,我们的方法对齐了由特定尺度FFN诱导的表示空间。这是通过最小化跨尺度平均token嵌入之间的距离以鼓励语义对齐,同时最大化其最大嵌入之间的距离以保留特定尺度的建模能力来实现的。由此产生的token空间为下游任务提供了一个统一且富有表现力的基础。

基于这种对齐的表示空间,一个仍然存在的挑战是不同数据集固有的多样时序结构。即使嵌入已对齐,根据底层序列的动态特性,时间变化可能表现在单个token内或跨越多个token。为了捕获这种可变性,我们引入了一种混合掩码策略,以增强掩码重建过程中的多尺度时间建模。该策略结合了促进细粒度推理的随机掩码,以及便于建模长程依赖的连续掩码。通过联合优化这些互补模式,模型学习在不同分辨率上恢复时间结构,提高了其鲁棒性和泛化能力。

我们的主要贡献总结如下:
- •我们提出了SATS,一个面向时间序列的尺度感知基础模型,它在异构时间序列数据集上实现了卓越的泛化能力。
- •我们引入了一种基于特定尺度FFN的尺度感知对齐机制,在保留特定尺度表达能力的同时,统一了跨patch尺度的token空间。
- •我们设计了一种混合掩码策略,使模型能够跨多个分辨率捕获细粒度和长程时间依赖关系。
- •广泛的实验证明了SATS在零样本和分布内预测设置中的有效性,确立了其作为时间序列基础模型强大预训练范式的潜力。

## II相关工作

### II-A时间序列基础模型

传统预测模型通常针对特定的数据集、预测范围和采样分辨率进行优化,因此其尺度处理通常通过架构或超参数选择来编码。多尺度模型如Pathformer\[22 (https://arxiv.org/html/2608.20005#bib.bib22)\]和TimeMixer\[23 (https://arxiv.org/html/2608.20005#bib.bib23)\]通过在多个分辨率上建模时间模式来加强这一方向,使用特定尺度的路径、分解、池化、分块或膨胀。虽然这些方法捕获了单个数据集内的多分辨率模式,但基础模型预训练混合了具有不同采样频率和patch尺度的数据集,使得跨频率的表示兼容性对于可迁移的时间表示变得必要。因此,时间序列基础模型越来越受到关注。为满足预测的特定需求,仅解码器模型如Timer\[24 (https://arxiv.org/html/2608.20005#bib.bib24)\]和Lag-Llama\[25 (https://arxiv.org/html/2608.20005#bib.bib25)\]采用因果架构,而稀疏的混合专家变体如Time-MoE\[11 (https://arxiv.org/html/2608.20005#bib.bib11)\]和Moirai-MoE\[20 (https://arxiv.org/html/2608.20005#bib.bib20)\]则提高了可扩展性。编码器-解码器模型如LightGTS\[19 (https://arxiv.org/html/2608.20005#bib.bib19)\]和Chronos\[13 (https://arxiv.org/html/2608.20005#bib.bib13)\]使用并行解码或离散化目标。仅编码器架构在时间序列基础模型中探索较少,尽管最近的实验分析\[26 (https://arxiv.org/html/2608.20005#bib.bib26)\]表明在有限计算资源下具有更强的表示能力,这激励了对其架构和预训练策略的进一步研究\[12 (https://arxiv.org/html/2608.20005#bib.bib12),27 (https://arxiv.org/html/2608.20005#bib.bib27)\]。SATS遵循这种仅编码器预训练方向,解决了异构patch大小所引起的特定尺度token空间对齐这一被忽视的需求。

### II-B预训练中的对比学习

对比学习已成为跨多个领域大规模预训练的强大范式。在自然语言处理中,SimCSE\[28 (https://arxiv.org/html/2608.20005#bib.bib28)\]等方法利用对比目标来学习语义上有意义的句子嵌入,而无需监督。在计算机视觉中,CLIP\[4 (https://arxiv.org/html/2608.20005#bib.bib4)\]和ALIGN\[29 (https://arxiv.org/html/2608.20005#bib.bib29)\]通过最大化配对模态的相似性并对比非配对模态来联合嵌入图像和文本,实现了令人印象深刻的零样本性能。尽管时间序列中的对比学习相对未被充分探索,但像TS-TCC\[30 (https://arxiv.org/html/2608.20005#bib.bib30)\]和CoST\[31 (https://arxiv.org/html/2608.20005#bib.bib31)\]这样的近期工作展示了通过时间数据增强视图的对齐来学习可迁移表示的潜力。这些方法通常寻求在对齐语义相关表示与在嵌入空间中保持足够分散性之间的平衡。这种吸引-排斥结构不仅提高了特征的区分性,而且有助于防止表示坍缩到无信息的状态。对比学习的一个关键优势在于其保持嵌入多样性的能力——通过拉近语义相似的实例并推远不相似的实例,它以一种判别性和鲁棒性的方式构建了潜在空间。受对比学习结构化发散性的启发,我们采用一个受InfoNCE启发的目标来增强多尺度特征的独特性——而无需显式的负样本——从而继承了其正则化益处。

## III方法论

### III-A问题定义

设$\mathcal{S}=\{(\mathbf{X}^{(i)},\mathbf{C}^{(i)})\}_{i=1}^{N}$表示一个多变量时间序列数据集,其中$\mathbf{X}^{(i)}\in\mathbb{R}^{d_{x}\times T_{i}}$是目标序列,$\mathbf{C}^{(i)}\in\mathbb{R}^{d_{c}\times T_{i}}$是相关的协变量。给定未掩码的观测值$\mathbf{X}_{\text{obs}}$和相应的协变量$\mathbf{C}$,目标是学习模型参数$\theta$,使得模型$f_{\theta}$预测目标序列中被掩码子集$\mathbf{X}_{\mathcal{M}}$的分布参数$\hat{\boldsymbol{\psi}}$。

这导致以下优化问题:
$\displaystyle\min_{\theta}\mathbb{E}_{(\mathbf{X},\mathbf{C})\sim p(\mathcal{S})}\mathbb{E}_{\mathcal{M}\sim p(\mathcal{T}\mid\mathcal{S})}\left[\mathcal{L}_{\text{nll}}\left(\mathbf{X}_{\mathcal{M}},\hat{\boldsymbol{\psi}}\right)\right]$
 (1)
$\displaystyle\text{s.t.}\ \ \hat{\boldsymbol{\psi}}=f_{\theta}(\mathbf{X}_{\text{obs}},\mathbf{C})$
其中,$\mathcal{L}_{\text{nll}}$表示负对数似然损失:
$\mathcal{L}_{\text{nll}}(\mathbf{X}_{\mathcal{M}},\hat{\boldsymbol{\psi}})=-\log p(\mathbf{X}_{\mathcal{M}}\mid\hat{\boldsymbol{\psi}})$
 (2)
这里$p(\mathcal{S})$是时间序列实例$(\mathbf{X},\mathbf{C})$上的数据生成分布,而$p(\mathcal{T}\mid\mathcal{S})$定义了任务采样分布,该分布决定了用于预测的掩码位置$\mathcal{M}\subset\{1,\dots,T\}$的选择。经典预测对应于掩码区域$\mathcal{M}$位于序列末尾的特殊情况。

参见标题

图 2:SATS框架概览。来自多个patch大小的token通过单独的FFN进行投影。SATS采用尺度感知对齐机制,促进每个尺度内平均池化表示的接近性,同时强制跨尺度最大池化表示的分离——在保持一致性和特定尺度表达能力之间取得平衡。进一步应用混合掩码策略,整合随机掩码和连续掩码,以捕获细粒度和长程时间依赖关系。
### III-B模型架构

如图2 (https://arxiv.org/html/2608.20005#S3.F2)所示,SATS采用了非重叠的、基于patch的、仅编码器的Transformer架构\[32 (https://arxiv.org/html/2608.20005#bib.bib32)\]。多变量时间序列首先被展平,并根据数据集,按照Moirai\[12 (https://arxiv.org/html/2608.20005#bib.bib12)\]的方式映射成不同大小的patch。为提高效率,我们采用打包作为默认设置\[33 (https://arxiv.org/html/2608.20005#bib.bib33),2 (https://arxiv.org/ht

相似文章

自适应分块在时间序列预测中比看起来更难实现

arXiv cs.LG

本文从理论和实验两个角度对时间序列 Transformer 的自适应分块方法进行了深入研究,推导出内容自适应分词应优于调优后的均匀分块的条件。在标准基准上的受控实验表明,经过良好调优的均匀基线与动态分块方法具有相当的竞争力,这对自适应方法所假设的优势提出了质疑。

扩展时间点语言模型

arXiv cs.CL

本文证明,扩展时间点语言模型(仅基于每个日历日期之前可用的文本进行训练)可以显著缩小与无限制模型之间的性能差距,从而在金融和社会科学中实现有效的回测和因果推断。作者训练了多达40亿参数的仅解码器Transformer,使用1万亿按时间顺序过滤的token,并发布了完整流程。