SAGE:变量级语义增强的视觉-语言时间序列预测

arXiv cs.LG 论文

摘要

SAGE引入了一个基于CLIP的时间序列预测框架,该框架结合了时间、文本和视觉语义信息以提高准确性,在长期基准测试中实现了最先进的性能。

arXiv:2608.26829v1 Announce Type: new Abstract: 时间序列预测模型基于原始数值序列运行,缺乏领域专家隐式利用的语义知识,例如每个变量的物理意义、统计行为和时域动态。近年来,弥合这一差距的努力分为两类。有些依赖于在推理时使用大型语言模型,这计算成本高昂。另一些在数据集级别应用统一的文本提示,忽略了各个变量之间的异构语义。我们提出了SAGE(基于接地编码的感知与增强),这是一个端到端的CLIP框架,联合建模时间、跨变量、文本和视觉信息。CLIP文本编码器处理频率增强的片段和变量令牌,而门控残差路径注入变量特定的描述和统计描述符。与此同时,冻结的CLIP视觉编码器通过仅训练的对比目标将渲染的序列与时间表示对齐。CLIP的这种双重使用增加了互补的语义和视觉监督,而无需在预测循环中放置LLM。在八个长期基准测试和M4上,SAGE实现了最先进的准确性。消融研究证实了来自多模态对齐和变量级知识的互补增益。
查看原文
查看缓存全文

缓存时间: 2026/08/28 09:44

# 面向视觉-语言时间序列预测的变量级语义增强
来源:https://arxiv.org/html/2608.26829

###### 摘要

时间序列预测模型处理原始数值序列,缺乏领域专家隐式利用的语义知识,例如每个变量的物理含义、统计行为和时间动态。弥合这一鸿沟的近期努力分为两个阵营。有些依赖推理时的大语言模型,计算成本高昂。另一些在数据集级别应用统一的文本提示,忽略了各变量间异质的语义信息。我们提出SAGE(基于扎根编码的感知与增强),这是一个端到端的、基于CLIP的框架,能联合建模时间、跨变量、文本和视觉信息。CLIP文本编码器处理频率增强的片段和变量令牌,而门控残差路径注入特定于变量的描述和统计描述符。与此同时,冻结的CLIP视觉编码器通过仅训练时的对比目标,将渲染的序列与时间表示对齐。这种对CLIP的双重使用,添加了互补的语义和视觉监督,而无需将大语言模型(LLM)置于预测循环中。在八个长期预测基准和M4数据集上,SAGE取得了最先进的预测精度。消融实验证实了多模态对齐和变量级知识的互补性增益。

上海交通大学

中国上海

[email protected][email protected]

## 1 引言

时间序列预测是数据挖掘和机器学习中的一项基础任务,在能源管理、交通规划、天气预测和金融分析等领域有着广泛应用(Zhou et al. 2020;Wu et al. 2021)。基于Transformer架构的出现带来了显著进步(Zhou et al. 2022;Liu et al. 2024),而一个引人深思的发现是,简单的线性模型可以匹配甚至超越许多Transformer变体(Zeng et al. 2023),这促使社区重新思考哪些归纳偏置对时间序列建模真正重要。

图1:在Weather、Electricity和ETTm1上的代表性96步预测。SAGE通过结合数值历史与多模态知识,更好地捕捉了机制变化。每个小图报告了SAGE和图中显示的最强基线的窗口级MSE。

最近,两个并行趋势重塑了这一格局。第一个是**大规模预训练**:基础模型如TimesFM(Das et al. 2024)、Chronos(Ansari et al. 2024)和Time-MoE(Shi et al. 2025)表明,在数十亿时间点上进行预训练能产生强大的零样本和少样本预测能力。第二个是**跨模态知识迁移**:方法如GPT4TS(Zhou et al. 2023)、Time-LLM(Jin et al. 2024)和TEST(Sun et al. 2024)将预训练的语言模型重新用于时间序列任务,利用其丰富的语义和序列知识。然而,这些方法中的许多LLM组件可以被简单的注意力层替代而不降低性能(Tan et al. 2024),这引发了关于语言模型是否真正贡献了时序理解,抑或只是充当通用特征提取器的质疑。

与此同时,探索**视觉-语言模型(VLMs)** 用于时间序列的研究工作正在兴起。一篇最近的综述(Ni et al. 2025)强调了二维视觉表示与多尺度时间模式之间的自然兼容性,这一洞见此前已被TimesNet(Wu et al. 2022)所证实。Time-VLM(Zhong et al. 2025)融合了检索、视觉和文本模态进行预测;Aurora(Wu et al. 2025)构建了首个多模态时间序列基础模型;OccamVTS(Lyu et al. 2026)表明,将视觉模型的知识蒸馏到其参数的1%,即可匹配全模型的预测性能。CiK基准(Williams et al. 2024)进一步证实,在许多现实场景中,文本上下文对于准确预测至关重要。

尽管取得了这些进展,但一个根本性的差距仍然存在:现有的多模态方法通常将语言模型用作冻结的特征提取器或辅助的提示生成器,而没有充分利用视觉-语言模型的**双重结构**。在CLIP(Radford et al. 2021)中,文本和视觉编码器经过联合训练,以在共享嵌入空间中产生对齐的表示。这种双重结构天然适合时间序列。文本编码器可作为序列骨干网络,而视觉编码器则通过渲染的时间序列图像提供互补的监督。此外,现有的知识注入方案(Jin et al. 2024;Pan et al. 2024)可能需要昂贵的LLM推理,或将数值序列简化为有限的文本表示。图1预示了弥合这一差距的收益:跨越来自三个不同数据集的真实测试窗口,SAGE追踪了周期性和方向性动态,而强大的Transformer预测器则会坍缩到近期均值附近。

在本文中,我们提出SAGE,一个用于时间序列预测的多模态语义对齐框架,通过三个关键贡献解决了这些局限性:

1.  **端到端CLIP预测**:我们将CLIP作为预测架构的一部分,而非外部的特征服务。其文本编码器被改造为时间骨干网络,其冻结的视觉编码器在训练期间提供双向对比监督。这种设计以一个紧凑的可训练骨干网络实现了更高的预测精度,而非在预测循环中依赖数十亿参数的模型。
2.  **基于模板的知识注入与变量级门控**:一个轻量级的离线流程从元数据和训练集统计信息中构建语义、行为和关联描述。LLM可以协助这个准备步骤,但不在训练或预测内部调用。门控交叉注意力为每个变量独立控制知识注入,而一个单独的门控统计旁路保留了硬的数值线索。
3.  **跨时间、变量和模态的扎根**:频率增强的片段嵌入结合了时域和频谱证据。跨变量注意力纳入了变量间的依赖关系,而视觉-语言对比对齐则规范化了时间表示。总之,这些组件在一个预测模型中整合了互补的时间、关联、文本和视觉信号。

## 2 相关工作

### 2.1 多模态与知识增强的时间序列预测

早期工作表明,预训练的语言模型可以作为有效的时间序列骨干:GPT4TS(Zhou et al. 2023)仅微调冻结GPT-2的层归一化和位置嵌入;而LLMTime(Gruver et al. 2023)将数值序列编码为文本字符串以进行零样本预测。后续方法引入了显式的跨模态对齐:Time-LLM(Jin et al. 2024)将输入片段重编程为由声明式提示引导的文本原型;TEST(Sun et al. 2024)通过对比损失将时间序列嵌入与可解释的文本原型对齐。一个反复出现的局限是,语言组件通常充当通用的特征提取器,而非真正的时序知识源(Tan et al. 2024)。

最近,社区转向真正的多模态融合。Time-VLM(Zhong et al. 2025)将检索、视觉和文本增强的学习器与冻结的VLMs耦合;Aurora(Wu et al. 2025)通过模态引导注意力和流匹配注入文本和图像知识,用于零样本生成式预测;VLM4TS(He et al. 2026)将VLMs应用于零样本异常检测,通过视觉筛选和多模态验证。尽管取得了这些进展,大多数现有方法仍将语言模型视为冻结的特征提取器或辅助的提示生成器,而没有在统一的训练框架中充分利用视觉-语言模型的两个分支。

### 2.2 时间序列预训练模型

在监督学习范式下,Autoformer(Wu et al. 2021)开创了具有自相关机制的深度分解;PatchTST(Nie et al. 2022)建立了一个强大的基于片段的、通道独立的基线;iTransformer(Liu et al. 2024)将每个变量视为一个令牌以捕捉多变量相关性;TimesNet(Wu et al. 2022)将一维序列转换为二维张量,使视觉骨干可用于时间建模。更新的架构继续精进这条路线:FredFormer(Piao et al. 2024)去偏频域表示;DUET(Qiu et al. 2025)联合聚类时间和通道依赖;Amplifier(Fei et al. 2025)放大能量稀疏的成分;SRSNet(Wu et al. 2026)学习选择性表示空间;这些都是近期与SAGE进行基准比较的强基线。在基础模型范式下,TimesFM(Das et al. 2024)在1000亿真实世界时间点上训练一个仅解码器的Transformer;Chronos(Ansari et al. 2024)将数值分词化为离散词表,用于T5系列模型;MOMENT(Goswami et al. 2024)在时间序列堆(Time-series Pile)上通过掩码重建进行预训练;Moirai(Woo et al. 2024)引入在270亿观测值上训练的任意变量注意力机制;Time-MoE(Shi et al. 2025)通过稀疏混合专家扩展到24亿参数。这些努力证明了规模化效果,但它们需要策划海量的时间序列语料库。另一个方向,以OccamVTS(Lyu et al. 2026)为例,表明预训练的视觉-语言表示已经包含可迁移的时序知识,无需数十亿规模的预训练即可加以利用。

### 2.3 时间序列的对比学习

对比学习已被证明对于学习可迁移的时间序列表示是有效的:TS-TCC(Eldele et al. 2021)在增强视图上结合时序和上下文对比;TS2Vec(Yue et al. 2022)在实例和时序层面进行分层对比学习;CoST(Woo et al. 2022)通过时域和频域损失解耦季节和趋势成分;TF-C(Zhang et al. 2022)在联合嵌入空间中强制时频一致性;Soft-CL(Lee et al. 2024)通过软分配减轻假阴性样本;FACL(Wang and Zhang 2026)设计了尊重频谱结构的频率感知增强。所有这些都操作在时间序列模态内,从同一数据的增强视图构建正样本对。一个自然的扩展是跨模态对比学习,其中正样本对将时序表示与其视觉渲染耦合,提供了超越模态内增强的互补监督信号。

## 3 方法

我们提出一个用于多元时间序列预测的多模态框架。给定输入多元时间序列 **X**∈**R**^(T×N),其中T为时间步数,N为变量数,模型输出一个跨越H步预测范围的预测 **ŷ**∈**R**^(H×N)。如图2所示,归一化输入由两个协作的流处理,它们共享一个预训练的CLIP文本编码器。**数值流**将每个序列转换为片段令牌和变量令牌,并将它们通过CLIP文本编码器,产生时间及跨变量表示,这些表示进一步用频率信息和来自离线文本知识库的每个变量自然语言先验进行丰富。**视觉流**仅对低维数据集激活,将每个序列渲染为图像,用冻结的CLIP视觉编码器进行编码,并在训练期间通过对比学习将其与时间表示对齐。然后,一个预测头融合这些表示并反归一化以生成预测。具体来说,该框架包含五个组成部分,我们依次描述:频率增强语言模块、跨变量依赖模块、多视图文本语义融合模块、视觉-语言对比对齐模块和预测生成器。

### 3.1 频率增强语言模块

该模块将时间序列片段视为预训练CLIP文本Transformer的令牌。

我们首先应用可逆实例归一化以缓解分布偏移。对于变量i,RevIN存储其均值μ^(i)和标准差σ^(i)用于输出反归一化。为清晰起见,我们在每个变量的方程中省略批次索引。归一化后的序列 **x**^(i)∈**R**^T被分为L_p个长度为P、步幅为S的重叠片段。令 **p**_j^(i)∈**R**^P表示片段j。一个可学习的分词器 **W**_tok将其映射到共享的嵌入宽度D:

**z**_j^(i) = **W**_tok **p**_j^(i)

相似文章

语义增强的检索增强时间序列预测

arXiv cs.AI

提出SERAF,一种用于时间序列预测的多模态检索增强框架,该框架同时利用数值相似性和自生成的文本描述来检索历史模式,从而改善非平稳条件下的预测。在七个真实世界数据集上的实验表明,其效果优于最先进的基线模型。