CLaST:上下文感知对比变分自编码器的概率时间序列预测
摘要
CLaST 提出了一种用于概率多变量时间序列预测的上下文感知对比变分自编码器框架,并在多个基准测试中展示了相对于基线方法的显著性能提升。
arXiv:2608.20025v1 公告类型:新
摘要:概率预测模型广泛应用于能源系统、金融、医疗和交通等领域的时间序列预测。近年来,深度生成模型在概率预测方面表现出色,但许多传统方法难以捕获内部时间依赖关系,导致潜在表示的表达能力有限。为了解决这一局限性,我们提出了\textit{CLaST},一种用于概率多变量时间序列预测的变分自编码器框架。与现有生成模型不同,CLaST 通过我们的对比损失函数学习保留观测值之间上下文相似性的嵌入表示。在九个广泛采用的基准测试上的实验表明,CLaST 始终优于强基线方法。在短期预测任务中,我们的方法在 CRPS 和 NMAE 上分别实现了高达 $16.4\%$ 和 $14.4\%$ 的改进,相对于第二佳方法。此外,在长期预测中,CLaST 获得了卓越的整体性能,在 CRPS 和 NMAE 上分别超过了第二佳方法高达 $48.6\%$ 和 $25.1\%$。
查看缓存全文
缓存时间: 2026/08/21 10:31
# CLaST:用于概率时间序列预测的上下文感知对比变分自编码器
来源:https://arxiv.org/html/2608.20025
第一作者:Alexander Marusov 附属机构:应用人工智能研究所,莫斯科,俄罗斯
第四作者:Aleksandr Yugay 附属机构:应用人工智能研究所,莫斯科,俄罗斯
第二作者:Dmitry Anikin 附属机构:应用人工智能研究所,莫斯科,俄罗斯
第五作者:Petr Sokerin 附属机构:应用人工智能研究所,莫斯科,俄罗斯
第七作者:Alexey Zaytsev 附属机构:应用人工智能研究所,莫斯科,俄罗斯
第三作者:Vitaliy Pozdnyakov 附属机构:应用人工智能研究所,莫斯科,俄罗斯
第六作者:Ilya Kuleshov 附属机构:应用人工智能研究所,莫斯科,俄罗斯
###### 摘要
概率预测模型广泛应用于能源系统、金融、医学和交通运输等领域的时间序列预测。近年来,深度生成模型在概率预测方面展现出强劲性能,但许多传统方法在捕捉内部时间依赖性方面存在困难,导致潜在表示的表达能力有限。为解决这一局限性,我们提出了**CLaST**——一种用于概率多元时间序列预测的变分自编码器框架。与现有生成模型不同,CLaST通过我们的对比损失函数学习能够保持观测值间上下文相似性的嵌入表示。在九个广泛采用的基准数据集上的实验表明,CLaST持续超越了强大的基线方法。在短期预测任务中,我们的方法在CRPS和NMAE指标上分别比次优方法最高提升了16.4%和14.4%。此外,在长期预测中,CLaST取得了卓越的整体性能,在CRPS和NMAE指标上分别超越次优方法最高达48.6%和25.1%。
###### 索引术语:
概率时间序列预测,相似性学习,生成模型,对比学习
## I 引言
时间序列分析面临着一系列独特的挑战:时间依赖性、非平稳性、多模态性、数据缺失以及量化预测不确定性的需求。该领域的一个核心任务是时间序列预测,即模型需要从不完美且通常波动的历史数据中推断未来动态。在广泛的应用中,利用深度生成模型始终如一地提高了预测性能。循环神经网络(如DeepAR\[26\])、基于注意力的模型(如PatchTST\[23\])、扩散模型(如TSDiff-Cond\[19\])以及基于流的方法(如TFM\[38\])都展现出强大的预测性能。基于VAE的方法,如K^2VAE\[34\]和LaST\[30\],则进一步利用动力系统或趋势/季节分解来结构化潜在表示。
然而,学习信息丰富的潜在表示仍然是一个重大挑战。虽然估计输入观测值与其表示之间的互信息(MI)是增强嵌入信息性的有前景的方法,但现有的神经互信息估计器——如MINE\[3\]、CLUB\[9\]和STUB\[30\]——计算强度大、方差高,且在高维环境中收敛缓慢\[28, 12, 7\]。这种不稳定性损害了优化过程,并最终限制了所学表示的质量。
此外,当前方法通常无法捕捉嵌入在序列数据上下文结构中的潜在时间依赖性。这里的**上下文相似性**反映了两个观测值在语义上的接近程度。例如,7月1日和7月2日的温度读数共享夏季炎热的上下文状态,而7月1日和1月1日则属于不同的季节状态。关键的是,这个概念与传统的统计相关性不同:变量可能由于共同的混杂因素而协变,但在上下文中仍然不同。例如,电力需求和冰淇淋销量在夏季经常同时达到峰值,但它们描述的是根本不同的物理过程,因此属于不同的上下文领域。
为解决这些局限性,我们提出了**CLaST**——一种用于概率时间序列预测的变分自编码器框架,它显式地保留上下文结构。为充分捕捉上下文相似性,我们考虑一类时间序列,其中观测值之间的协方差仅取决于时间滞后δ(即cov(x_t, x_{t+δ}) = f(δ)),而时变均值保持整体的非平稳性。尽管经典统计文献已隐式地处理过此类过程,但据我们所知,它们缺乏统一的命名法。因此我们引入术语**滞后不变非平稳时间序列(LINTS)过程**。与严格限制其对现实数据适用性的平稳性假设不同,LINTS公式通过其演变的均值保留了真实的动态时间特性,同时仅对依赖结构施加了一个可解释的单一约束。在LINTS过程下,我们的方法利用相似性矩阵——对比自监督学习的基石\[2\]——来建模时间上观测值之间的接近程度。具体来说,我们约束潜在的相似性矩阵以反映输入序列中固有的结构模式。扩展LaST架构,我们用基于对比的惩罚项替代了容易产生不稳定性的传统互信息(MI)估计器,该惩罚项保留了对象间的上下文相似性。这种形式在增强训练稳定性的同时,促进了对底层相似性依赖关系的更稳健捕捉。
本工作的主要贡献如下:
- • **CLaST:用于概率时间序列预测的上下文感知对比变分自编码器**:为提升概率预测性能,我们引入了一个基于新颖目标函数的变分自编码器框架,该函数显式地考虑了样本间的上下文相似性。我们的方法确保学习到的嵌入表示在保留有意义的序列依赖性的同时,有效捕捉内在的时间关系。
- • **损失函数的理论性质**:我们在LINTS过程下对提出的目标函数进行了分析推导。值得注意的是,定理III.3确立了我们的损失函数在指定相似性矩阵类别内的理论最优性。通过在优化目标中形式化滞后结构先验,损失函数将结构知识注入学习流程。在编码器容量足够高的情况下,这种形式迫使模型提取能够保留输入时间序列滞后感知信息的表示。
- • **实证验证**:在涵盖电力、ETT和天气等不同领域的九个既有数据集上进行的广泛短期和长期预测实验表明,CLaST能有效泛化到异构的时间序列模态。在短期设置中,它持续优于强大的基线方法,在CRPS上实现了高达16.4%的相对改进,在NMAE上实现了14.4%。对于长期预测,我们的方法在CRPS和NMAE指标上分别超越次优结果高达48.6%和25.1%。我们提供了所提方法的代码实现:https://anonymous.4open.science/r/CLaST-3407/README.md。
## II 相关工作
##### 经典与深度学习方法
经典方法(ARIMA\[5\],VAR\[4\],SVR\[6\],指数平滑\[32\])在处理高维非线性动态时表现挣扎\[16\]。深度学习模型解决了这个问题:如LSTM\[15\]等RNN实现了概率预测(例如DeepAR\[26\]),而像PatchTST\[23\]等Transformer通过基于块的注意力捕捉长期依赖关系。相反,像DLinear\[36\]这样的线性模型通过将序列分解为趋势和季节性成分,仍然是强大的基线。
##### 变分自编码器
VAE\[18\]提供概率预测,但通常产生无结构的潜在表示。结构化变体解决了这个问题:LaST\[30\]将潜在变量分解为趋势/季节性成分并使用互信息正则化,而K^2VAE\[34\]结合了VAE与Koopman算子和卡尔曼滤波,以显式建模时间动态并提高长期预测的准确性。
##### 常微分方程
连续时间模型(Neural ODE\[8\],Latent ODE\[25\],GRU-ODE\[10\])自然地处理不规则采样,但计算成本高且缺乏潜在正则化。基于流的替代方法,如轨迹流匹配(TFM)\[38\],通过连续归一化流有效地学习条件轨迹导数,无需随机模拟。DeNOTS\[20\]引入了负反馈机制来稳定向量场,从而能够建模长期依赖关系。
##### 扩散模型
扩散模型\[14\]通过逆转以过去观测为条件的噪声过程来生成概率预测。虽然在多步预测\[24\]和插补\[29\]方面有效,但它们计算强度大且缺乏潜在可解释性。TSDiff-Cond\[19\]通过在基于SSSD的架构中整合S4层与卷积通道混合,提高了可扩展性。
在文献综述之后,我们选择了LaST\[30\]、K^2VAE\[34\]、DeNOTS\[20\]、DeepAR\[26\]、TFM\[38\]、TSDiff\[19\]和PatchTST\[23\]作为基线模型,因为它们在各自类别中报告了强劲的性能。
## III 方法
为介绍我们提出的方法,我们首先从问题陈述开始。然后概述CLaST方法的整体流程,接着详细描述其关键组成部分。符号在需要时贯穿全文以清晰说明。有关本文中使用的符号完整列表,请参阅我们GitHub仓库(https://anonymous.4open.science/r/CLaST-3407/docs/notations.png)上的在线文档。
### III-A 问题陈述
我们研究多元时间序列的概率预测。令x_t ∈ R^F表示在时间t处F个变量的观测值。给定长度为N的历史窗口x_{t-N+1:t},任务是在预测范围L内预测未来序列x_{t+1:t+L}。在概率设置中,模型输出预测分布p(x_{t+1:t+L} | x_{t-N+1:t}),该分布同时捕捉未来值及其不确定性。
### III-B CLaST
我们现在介绍**CLaST(对比LaST)**,一种用于概率时间序列生成的对比模型。CLaST建立在LaST架构\[30\]之上,同时从根本上修改了其潜在正则化策略。
为解决数据非平稳性,LaST采用了专门的趋势和季节性编码器及解码器,为每个成分提供信息丰富的表示。因此,LaST分别为趋势Z^t和季节性Z^s生成潜在表示,以及一个使用离散傅里叶变换(DFT)进行季节性预测的预测模块。
LaST的一个核心组件是其损失函数。证据下界(ELBO)项L_ELBO确保学习到的趋势和季节性嵌入包含足够信息,既能重构输入时间序列,又能实现准确预测。作者采用了一个略微修改的基于MINE的互信息估计器,以最大化原始输入X在趋势和季节性表示Z^t和Z^s中保留的信息量。相应的目标分别记为I_MINE(X, Z^t)和I_MINE(X, Z^s)。同时,项I_STUB(Z^s, Z^t)促进了趋势和季节性表示之间的解耦,鼓励它们捕捉互补的、不重叠的信息。LaST的最终损失函数定义在公式(1)中:
L_LaST = L_ELBO + I_MINE(X, Z^s) + I_MINE(X, Z^t) - I_STUB(Z^s, Z^t). (1)
然而,如前所述,互信息估计在实践中可能不稳定。我们用上下文相似性对齐损失替代了基于互信息的目标,该损失鼓励潜在表示保留输入时间序列的上下文结构。核心思想是使估计的相似性矩阵Ĝ(Z)与由数据诱导的相似性矩阵G = G(X)对齐,后者被称为**真实相似性矩阵**。这里,Ĝ(Z)是从趋势和季节性表示Z^t和Z^s计算得到的,而G作为相似性矩阵。
尽管从趋势嵌入估计的相似性Ĝ(Z^t)和从季节性嵌入估计的相似性Ĝ(Z^s)都逼近相同的真实矩阵G,但相应的表示在嵌入空间中仍然是可分离的,如我们的实验111https://anonymous.4open.science/r/CLaST-3407/figs/trend_seasonal.png所示。这种分离是因为……相似文章
CALAD: 通道感知对比学习用于多变量时间序列异常检测
提出了CALAD,一个用于多变量时间序列异常检测的通道感知对比学习框架,该框架利用估计的通道相关性构建对比样本,实现了最先进的性能。
基于生成式机器学习的季节性预报概率偏差订正:以北极海冰预测为例
本文提出了一种基于条件变分自编码器(cVAE)的概率后处理框架,用于对北极海冰的季节性预报进行偏差订正,相比标准方法,在校准性、锐度及谱功率方面均有提升。
SAGE:变量级语义增强的视觉-语言时间序列预测
SAGE引入了一个基于CLIP的时间序列预测框架,该框架结合了时间、文本和视觉语义信息以提高准确性,在长期基准测试中实现了最先进的性能。
ConceptTS: LLM引导的概念瓶颈用于可解释的多元时间序列预测
ConceptTS 引入了一个可解释的预测框架,该框架使用大语言模型为多元时间序列预测提出人类可读的概念,通过概念瓶颈在保持透明度的同时实现了具有竞争力的准确性。
AR-VLA: 面向视觉-语言-动作模型的真正自回归动作专家
提出了AR-VLA,一个自回归动作专家,它通过长期记忆生成连续的、具有上下文感知能力的机器人策略训练的动作序列,相比反应式VLA模型,提高了轨迹平滑度和任务成功率。