用于时间序列预测的上下文内图像修复

arXiv cs.AI 论文

摘要

ICI-Time 是一个新颖的框架,它将时间序列预测重新定义为视觉修复任务,利用大型视觉模型实现无需微调或架构更改的适应性预测。

arXiv:2608.23855v1 公告类型:新 摘要:我们提出 ICI-Time,一个新颖的框架,将时间序列预测重新定义为视觉修复任务,利用大型视觉模型 (LVMs) 的泛化能力。与需要专门的时间架构和大量领域特定训练的方法不同,ICI-Time 将时间序列转换为结构化的视觉表示(面积图),并应用视觉上下文内学习,将预测重新表述为网格结构提示中的模式补全,预训练的视觉变换器可以在无需微调或架构修改的情况下解决。时间依赖通过空间布局表示,并在数值域和视觉域之间具有一致的、可逆的映射。在流行病学、气象学和电力系统中进行的广泛实验表明,ICI-Time 与深度学习基线相比表现具有竞争力,并在有限数据设置下显示出有前景的适应性,引入了一个桥接时间域和视觉域的新范式。
查看原文
查看缓存全文

缓存时间: 2026/08/26 09:14

# ICI-Time:基于上下文修复的自适应时间序列预测框架
来源:https://arxiv.org/html/2608.23855  
作者:Dung Nguyen, Romero Morais, Truyen Tran  
所属机构:迪肯大学应用人工智能倡议组,澳大利亚维多利亚州吉朗市3216  
邮箱:[email protected]

## 摘要

我们提出ICI-Time,一种创新性框架,通过将时间序列预测重构为视觉修复任务,充分发挥大型视觉模型(LVMs)的泛化能力。与需要专用时序架构和大规模领域特定训练的方法不同,ICI-Time将时间序列转化为结构化视觉表征(面积图),并运用视觉上下文学习,将预测任务重构为网格结构提示中的模式补全——预训练视觉Transformer无需微调或架构修改即可解决此类问题。时间依赖性通过空间布局呈现,并建立了数值域与视觉域之间一致且可逆的映射关系。在流行病学、气象学和电力系统领域的广泛实验表明,ICI-Time与深度学习基线模型相比表现具有竞争力,并在小数据场景下展现出良好的适应性,为时域与视觉领域的桥接开辟了新范式。

## 关键词
时间序列预测 视觉提示 修复 上下文学习

## 1 引言

时间序列预测是机器学习的基石问题,支撑着金融、流行病学、电力系统和气候建模等领域的应用。尽管历经数十年发展,但由于复杂的时间依赖性、多尺度变异性、非平稳性以及众多现实场景中标注数据的稀缺性,预测任务始终具有固有挑战性。深度学习方法已取得当前最优成果[13, 35],但它们通常需要领域特定架构,并在适应新领域或任务时需要大量训练或微调。这种对任务特定工程的依赖限制了其可扩展性,尤其在数据有限的场景下阻碍了泛化能力。

相比之下,语言[3, 27]和视觉[2]领域的基础模型通过上下文学习(ICL)展现了前所未有的泛化能力——仅在推理时通过示例接触即可解决新任务,无需参数更新。近期研究尝试利用大型语言模型(LLMs)[36]或时序模型[14]实现时间数据的ICL,但利用大型视觉模型(LVMs)进行时间序列预测仍是开放挑战,主要原因在于时序信号本质上非视觉化。

**图1**:基于图像上下文学习的时间序列预测视觉提示。输入序列被转换为图像并排列成网格:第一行包含上下文输入-输出示例对,第二行包含待预测的查询序列(灰色区域)。预训练大型视觉模型对缺失区域进行修复,预测结果(红色)通过逆图像化过程提取。

本文引入ICI-Time(基于上下文修复的时间序列预测),这一创新框架将时间序列预测重新定义为可提示的视觉修复任务。ICI-Time:(i)将时间序列转化为视觉表征(面积图),(ii)将输入-输出示例对与查询实例组装成网格状视觉提示,(iii)通过预训练LVM修复图像缺失区域实现预测——类似模式补全过程,(iv)将生成图表逆转换回数值时间序列。如图1所示,LVM从上下文示例对(x₁,y₁)推断任务,并为查询x_q预测修复(红色区域),全程无需任务特定微调。关键是LVM作为即用型模型,无需任何修改。该范式因此(i)消除了训练领域特定模型的需求,(ii)通过灵活的视觉提示支持新预测任务的快速适应,(iii)利用LVM丰富的模式识别能力而无需架构变更或额外监督。

我们的贡献具有四重性:
- *跨模态预测框架*:连接时域与视觉域,实现基于即用型视觉Transformer的快速适应。
- *时间序列视觉上下文学习新范式*:将ICL从自然语言处理延伸至通过视觉提示和修复解决时序预测的新领域。
- *精心设计的双向映射机制*:通过空间布局表示时间依赖性,实现可逆转换,确保预测保真度在转换过程中无损。
- *强有力的实证验证*:在流行病学(ILI)、气象学(Weather)和电力系统(ETT)领域,ICI-Time无需训练即可匹配基于Transformer的强基线模型,在小数据场景下鲁棒性显著更优。

研究发现表明,配备适当表征的视觉推理模型可泛化至时序任务,为利用跨模态迁移进行时序分析开辟了新研究方向。

## 2 相关工作

### 视觉上下文学习
上下文学习(ICL)使模型能在推理时基于上下文输入-输出示例进行条件生成,无需参数更新即可为新输入产生输出,为AI适应性提供了捷径[5]。尽管基于文本的ICL起源于自回归语言模型,*视觉上下文学习*(VICL)训练深度网络填补网格状图像的补丁[2]。Painter[25]和SegGPT[26]等开创性工作表明,通用视觉模型可通过将任务视为基于视觉示例的修复,执行从深度估计到语义分割的多样任务。在时域领域,WeatherGFM[33]将此范式应用于基于网格提示的多模态气象数据。然而,使用简单折线图进行单变量时间序列预测的通用VICL仍待探索,且语义任务中研究的示例选择等关键因素[32]尚未涉及时序动态。我们的工作通过设计无需参数更新即可激活LVM预测能力的视觉提示方案,填补了这一空白。

### 基础模型与时序预测
基础模型为时间序列预测提供了新解决方案[31, 24, 30]。早期工作适配LLMs:Chronos[1]和Time-LLM[8]通过量化或文本编码标记化时序数据,但此类方法常因连续数值数据与离散文本标记间的"模态鸿沟"而受限[16]。近期涌现新一代"视觉优先"模型:VisionTS[4]证明在ImageNet上预训练的视觉掩码自编码器可通过重建掩码时序图像实现零样本预测,但需要与预测对齐的预训练任务;ViTime[29]在二值图像度量空间中训练基础模型以实现鲁棒概率预测。此视觉优先趋势加速发展:VisionTS++[22]在大规模时序语料库上持续预训练视觉骨干以缩小模态鸿沟,DMMV[20]融合基于分解的多模态视图与LVMs实现长期预测,OccamVTS[15]和SVTime[21]将LVM预测器的先验知识蒸馏至轻量级网络。这些结果强化了视觉先验迁移至时序数据的证据,但仍各自依赖持续预训练、微调或蒸馏。与这些需要任务对齐预训练、架构适配或知识迁移至新权重的方法不同,我们研究使用标准折线图、预训练通用模型和上下文视觉条件作用的"免费午餐"假设[4]——无需任务对齐预训练。

### 时序预测的图像表征
将时间序列转化为图像可绕过数值序列建模的限制;近期综述[16]将此类转换分为折线图、热力图和频谱图像。VisionTS[4]和TimesNet[28]使用基于周期性的热力图捕捉长期依赖,但丢失了数据的"形状",而折线图保留了视觉模式识别所需的连续性和拓扑特征。ViTST[11]将不规则采样序列转换为折线图用于分类,Time-VLM[34]和VLM-TSC[18]将折线图输入视觉-语言模型,表明显式连接性提示优于散点图或文本描述;DePlot[12]和ChartLlama[7]进一步证明LVMs可从图表中提取精确数值语义。最新TimeOmni-VL[6]在统一视觉-语言模型中实现时序理解与生成,并指出低损失双向图像-序列转换是数值忠实生成的前提——独立印证了我们框架的核心设计原则——但通过在专用语料库上的大规模多任务训练实现。然而大多数现有图像预测器[19, 10, 23]从头训练解码器或微调视觉骨干,Time-VLM仅使用视觉-语言模型增强预测,TimeOmni-VL等统一模型仍需高强度训练。相反,我们将预测完全重构为视觉推理:直接使用预训练视觉提示模型[2]——无微调、无外部模块——并设计提示方案,利用其内在ICL能力直接从折线图网格进行预测。

## 3 基础知识

### 3.1 时间序列预测
令 **X** ∈ ℝ^{C×L} 表示多元时间序列,其中 L 为总长度,C 为通道数。将 **X** 划分为历史序列 **X_I** ∈ ℝ^{C×T_I} 和未来序列 **X_P** ∈ ℝ^{C×T_P},其中 L = T_I + T_P。**X_t^j** 表示第 t 个时间步、第 j 个通道的序列值。

目标是开发预测器 f: ℝ^{C×L_I} → ℝ^{C×L_P},将长度为 L_I 的回溯窗口映射为长度为 L_P 的预测范围。其中 T_I 和 T_P 分别代表用于训练和评估的总可用数据,L_I 和 L_P 定义模型的固定输入输出维度,且 T_I ≫ (L_I + L_P)。

### 3.2 上下文学习
上下文学习(ICL)使模型无需任务特定训练或微调即可回答查询:模型接收查询 x_q 前一系列“相似”输入-输出对 {(x_i, y_i)}_{i=1}^H,直接生成输出 ŷ_q。这与标准监督学习形成对比,后者使用输入-输出对训练或微调模型。

## 4 方法

时间序列预测传统上需要针对时序数据定制的专用架构和训练流程。我们通过利用大型视觉模型(LVMs)的*上下文学习*能力挑战这一范式:时间序列转化为视觉表征,LVM通过修复实现预测,消除了领域特定架构和模型训练/调优的需求,即使在数据有限时也能快速适应新领域。我们称此为时间序列预测的*上下文修复*方法。

我们的框架(图2)包含四个组件:(1)基于历史数据的视觉案例选择,(2)将时间序列转换为信息密集图像,(3)即用型LVM执行上下文修复,(4)将图像逆转换回原始时间序列的机制。

**图2**:ICI-Time框架:(1)从历史数据选择示例(左上);(2)时间序列到图像转换(左下);(3)使用预训练LVM[2]的上下文视觉提示进行修复(右上);(4)含去噪和曲线提取的图像到时间序列转换(右下)。最右侧图像中黑色为原始序列,红色为预测值。

### 4.1 视觉案例预测
任务示例使LVM能够进行*上下文学习*,因此选择与查询相关的示例至关重要。这类似于案例推理——通过回忆并适配相似历史案例及其解决方案解决新问题——LVM在图像空间中充当非线性案例插值器。

为此,我们通过滑动窗口将历史序列划分为重叠窗口构建可搜索数据库 **X_I**,每个窗口包含长度为 L_I 的回溯组件和长度为 L_P 的预测组件。对于每个有效起始位置 s ∈ {1, ..., T_I - (L_I + L_P) + 1}:

W_s = {x_s, y_s} = {**X_I**[:, s:s+L_I], **X_I**[:, s+L_I:s+L_I+L_P]} (1)

该数据库 𝒟_hist = {W_s}_{s=1}^S 支持预测时的模式匹配:给定查询窗口 W_q,我们计算欧氏距离

相似文章

基于时间冗余掩蔽和潜在修补的自适应令牌化 [R]

Reddit r/MachineLearning

本文提出了一种自适应视频令牌化方法,利用潜在空间中的时间冗余动态分配令牌,实现高效压缩,无需辅助网络。所提出的潜在修补变压器(Latent Inpainting Transformer)重建被丢弃的位置,相比ElasticTok-CV实现31倍加速,相比InfoTok实现2倍加速。