重新思考多模态时间序列预测评估

arXiv cs.LG 论文

摘要

介绍了TimesX,这是一个新的多模态时间序列预测基准,包含多样化的真实世界数据和文本上下文,解决了泛化、数据泄露和上下文多样性问题。

arXiv:2607.06973v1 公告类型: 新 摘要:我们引入了一个新的上下文增强的多模态时间序列预测基准TimesX。TimesX包含了通过自动化数据生成管道获得的高质量真实世界时间序列,涵盖多个领域和文本上下文,这有助于解决现有模态预测基准的三个主要问题:(1) 由于基准数据规模小且为合成数据,导致泛化能力差;(2) 基准中文本上下文类型非常有限;(3) 无法在评估中减轻数据泄露问题。我们对TimesX上的零样本多模态预测方法进行了彻底的实证研究。结果表明,许多在现有基准上表现良好的方法可能在TimesX上失败。相比之下,利用时间序列伴随的丰富文本上下文的简单集成方法可以在TimesX上超越强基线。
查看原文
查看缓存全文

缓存时间: 2026/07/09 07:46

# 重新思考多模态时间序列预测评估

来源: https://arxiv.org/html/2607.06973  
\pdftrailerid redacted  
\correspondingauthorHaoxin Liu[](https://arxiv.org/html/2607.06973v1/mailto:[email protected])\. 本工作完成于Haoxin Liu在Google Research担任学生研究员期间。本工作被国际机器学习大会(ICML) 2026接收。  
Yichen Zhou  
Google Research  
Rajat Sen  
Google Research  
B\. Aditya Prakash  
Georgia Institute of Technology  
Abhimanyu Das  
Google Research  

###### 摘要

我们引入了一个新的、上下文丰富的多模态时间序列预测基准,TimesX。TimesX包含从自动化数据生成流水线获得的大量高质量真实世界时间序列,涵盖多样化的领域和文本上下文,有助于解决现有多模态预测基准的三个主要问题:(1) 由于基准数据规模小且为合成数据导致泛化能力差;(2) 基准中文本上下文的类型非常有限;(3) 无法在评估中缓解数据泄露问题。我们在TimesX上对零样本多模态预测方法进行了彻底的实证研究。结果表明,许多在现有基准上表现良好的方法可能在TimesX上失败。相比之下,利用伴随时间序列的丰富文本上下文的简单集成方法可以在TimesX上超越强基线。

## 1 引言

时间序列预测(TSF)是众多领域中普遍存在的任务,对于明智决策至关重要。受NLP成功的启发,近年来在用于预测的时间序列基础模型(TFM)方面有大量工作,范围包括将LLM直接重新用于预测(gruver2023large;tan2024)、在时间序列数据上微调预训练LLM(zhou2023one;chang2023llm4ts),以及从头开始预训练时间序列基础模型(das2023decoder;goswami2024moment;woo2024unified;ansari2024chronos;kamarthi2024lptm)。这些模型展示了有前景的零样本TSF能力,通常在推理时仅使用时间序列的历史上下文就超越传统的统计和监督方法。

尽管历史数值数据为预测提供了基础,但它们通常缺乏可靠和准确预测所需的完整上下文。人类预测者经常整合额外信息,如背景知识、事件和约束,这些通常可以通过自然语言捕获(Liu_et_al_2024a_LSTPrompt)——我们称之为*文本上下文*。提高时间序列基础模型有效利用和整合多样化文本上下文的能力仍然是一个持续的挑战。这突显了对高质量和全面的多模态数据集和基准的迫切需求,以推动该领域的研究。

与此同时,现有的上下文丰富的多模态TSF评估基准及其构建技术在将其用于预训练模型基准测试时存在几个局限性。第一个局限性是基准测试指标与真实世界性能之间未知的泛化差距。这通常是由于基准要么局限于小规模且领域选择狭窄,要么是完全合成的。现有基准的第二个重大挑战是数据泄露。预训练的TFM和LLM可能已经吸收了评估数据,导致未知的数据污染和方法之间的不公平比较。基准本身的有效期很短,因为预训练模型会不断更新其预训练数据集,导致其知识截止日期变得比基准数据更新。第三个局限性来自我们的观察:先前基准中文本上下文的类型和粒度通常有限且差异很大。从真实数据派生的文本上下文包括关于时间序列的元数据信息、时间戳相关信息(如重要日期和节假日)、与时间序列相关的文本事件数据,以及捕获与目标时间序列相关的外生变量统计数据和趋势的文本数据。多模态模型处理这些不同类型上下文的能力,以及这些不同上下文在数据集中的可用性和质量,对模型的基准性能有显著影响。当多模态模型在现有基准上表现不佳时,很难断定这种不足是由于方法未能有效利用所提供的信息,还是因为基准中提供的上下文是特定类型、过于模糊或缺乏相关细节。

为了解决这些根本局限性并建立一个用于上下文丰富的时间序列预测的无偏基准,我们引入了TimesX,一个新颖的多模态基准,旨在专注于:(1) 真实、大规模、跨领域的数据;(2) 提供持续缓解数据泄露的数据集生成流水线;(3) 收集全面、细粒度的文本上下文。我们进一步介绍了几个有前景的基线方法,它们结合TFM和LLM,在我们的基准上实现了非平凡的多模态、上下文丰富的预测性能。本文的主要贡献有三个:

1. TimesX,据我们所知,是第一个真实世界、大规模、跨领域的上下文丰富的时间序列预测基准。它涵盖19个不同领域,共190个变量,覆盖多样化的全球地理区域,包括日频率和周频率。它还将每个目标数值序列关联到多种形式的详细文本上下文。与现有的多模态时间序列基准不同,TimesX中的所有时间序列和文本数据均来自真实世界观测。
2. 我们在TimesX的数据集生成流水线中提出了两种新机制,以帮助防止数据泄露并保证文本上下文的有效性。第一种是自动化数据收集流水线,在其每一步都采用严格的时间戳对齐和隔离。第二种是用于事实核查和丰富文本上下文的假设者-验证者-丰富者框架。这些机制结合确保TimesX是可验证的、无泄露的,并且可以在未来更新,用于对具有新预训练截止日期的模型进行基准测试。
3. 我们通过实验验证了TimesX解决了现有基准的缺陷。此外,我们在TimesX上对当前的(零样本)多模态TSF方法进行了彻底的实证比较,涉及超过312,000次独立LLM推理,揭示了现有基准未发现的新观察结果。特别是,我们发现像Williams_2024这样的早期基准(虽然是预测中指令跟随的绝佳测试)往往严重高估了LLM相对于TSF模型的性能。同时,像Liu_et_al_2024b_TimeMMD这样的基准低估了文本上下文信息在预测准确性中的重要性。局限性和未来工作在附录A (https://arxiv.org/html/2607.06973#A1)中详述。

## 2 相关工作

除了之前提到的时间序列基础模型,最近的工作jin2023time;Liu_et_al_2024a_LSTPrompt;wang2025chattime已经开始调整预训练LLM以在文本上下文可用时执行预测,通常通过对齐时间序列和自然语言的模态。这些模型的发展伴随着旨在评估它们的新基准的出现。例如,ChatTS(ChatTS)生成成对的合成时间序列和详细属性描述,以训练多模态LLM进行理解和推理任务。类似地,Time-MQA框架(Kong_2025)引入了TSQA数据集,其中包含带有基于模板的元信息的真实世界时间序列,并将时间序列预测转换为问答格式。诸如CiK(Williams_2024)中引用的基准包含真实世界时间序列和手动制作的、对预测至关重要的文本上下文。Time-MMD(Liu_et_al_2024b_TimeMMD)提供了一个通过基于关键词的Web搜索构建的上下文丰富基准,涵盖九个领域,每个领域一个变量。MTBench(Chen_2025)将股票价格与金融新闻对齐,将天气预报与温度记录对齐,策划需要推理它们的任务。MoTime(Zhou_2025)数据集套件提供了一系列多模态数据集,将时间序列与诸如文本和图像等静态模态配对。值得注意的是,这些早期工作通常受到高质量、大规模、真实世界数据集稀缺的限制,导致一些工作依赖合成数据和特定形式的文本上下文。我们在表1 (https://arxiv.org/html/2607.06973#S2.T1)中总结了几个代表性基准,并与我们提出的TimesX进行比较。

表 1: 多模态TSF基准的比较。Leakage-Free表示该基准是否能保证对最新预训练模型无数据泄露,详述于第3.1.2节 (https://arxiv.org/html/2607.06973#S3.SS1.SSS2)。

## 3 TimesX 基准

### 3.1 TimesX 的设计原则

我们将首先介绍TimesX区别于其他多模态预测基准的核心原则:(i) 真实世界数据,(ii) 缓解泄露,(iii) 全面、高质量的上下文,以及 (iv) 大规模评估。注意,我们进一步提供实证证据,证明这些原则的重要性以及其他基准可能存在的不足。

#### 3.1.1 真实世界数据

原则描述:TSF由于现实世界的动态性、复杂过程和多样化领域而高度复杂。另一方面,许多现有基准使用合成时间序列、合成文本上下文或两者兼有,而未证明合成数据上的结论如何能迁移到真实世界场景(Williams_2024;tan2024)。TimesX通过使用真实世界数据(包括时间序列和文本上下文)来区分自己与其他基准。

为什么它很重要:为了测试合成数据上的结论是否能迁移到真实数据,我们在一个合成上下文数据集(CiK)和我们的真实数据集(TimesX)上评估了三种方法。我们报告了三种方法的聚合MASE(平均绝对标度误差):(i) TimesFM-2.5 (一个TFM),仅使用时间序列;(ii) Gemini-2.0-Flash (一个LLM),同时使用时间序列和文本上下文;以及 (iii) CodeRev,Gemini-2.0-Flash编写并执行代码以基于上下文修正TimesFM-2.5的输出。更多细节见附录N (https://arxiv.org/html/2607.06973#A14)。如图1 (https://arxiv.org/html/2607.06973#S3.F1)所示,三种方法在CiK(合成)和我们的真实数据上的排序完全不同。在CiK上,直接将时间序列连同相关文本上下文输入Gemini,远远领先于TimesFM-2.5。此外,让Gemini通过代码编辑TimesFM-2.5的输出效果更好,显著优于其他两种方法。另一方面,在TimesX上,我们看到所有方法的结果更加接近,TimesFM-2.5实际上比Gemini更好。进一步地,CodeRev降低了同时使用TimesFM-2.5和Gemini的性能。这表明CiK存在强烈偏见,使其结论模糊不清:在CiK中,文本上下文既是合成的又极其具体——然后使用这些特定的上下文编写代码来修改输入时间序列并生成最终的预测任务。因此,这类任务可以很容易地被指令跟随语言模型解决,甚至可以通过生成代码来完成简单修改任务的语言模型更好地解决。然而,这些结论并不能推广到真实世界的任务,因为真实任务的上下文不那么具体,并且不通过编码路径与预测任务相关联。

参见标题 图 1: 在相同设置下,合成 (CiK) 与真实世界 (TimesX) 性能对比(MASE越低越好)。TimesFM-2.5、Gemini-2.0-Flash和CodeRev的排序在两个数据集之间颠倒,表明合成生成可能将排序偏向指令跟随LLM和编码。我们在此展示CiK的Future子集上的结果。表15 (https://arxiv.org/html/2607.06973#A18.T15)进一步报告了所有子集的平均性能,结论相同。

#### 3.1.2 缓解数据泄露

原则描述:一个公平的基准数据集应能减轻基准任务泄露到被评估模型的预训练数据中的任何潜在风险。鉴于许多预训练模型不发布其预训练数据集,声称使用来自未使用来源(数据隔离)的数据进行评估的现有基准存在三个缺点:(1) 潜在不可识别的数据污染。(2) 可用于基准测试多种方法的干净任务数量有限。(3) 有效性短暂,即所考虑模型的未来版本可能无意中将基准泄露到其预训练数据中。相比之下,TimesX采用严格的时间隔离来防止数据污染:我们对TimesX进行彻底的时间戳标记,并建议严格使用发生在目标模型知识截止日期之后的基准任务。此外,TimesX流水线被设计为可随时间重新更新,即数据收集、验证、对齐和模型评估都可以自动化。据我们所知,TimesX是第一个能够自动刷新以评估未来预训练方法的基准。

表 2: 在搜索趋势子集(120个变量)上,两个LLM的知识截止日期(2024年6月)前后的性能对比。MASE越低越好。设置详见附录B (https://arxiv.org/html/2607.06973#A2)。

为什么它很重要:为了研究数据污染如何影响评估结果,我们评估了TimesX的搜索趋势(见第3.2节 (https://arxiv.org/html/2607.06973#S3.SS2))子集中的120个变量。我们保持数值序列、窗口化和提示固定,并根据Gemini-2.0-Flash和DeepSeek-V3的公开知识截止日期(2024年6月)划分测试期。我们在表2 (https://arxiv.org/html/2607.06973#S3.T2)中报告了通过几何平均聚合的MASE。两个TFM的预训练数据描述排除了两个时间段内的任何时间序列数据泄露,并且两个TFM报告了稳定的结果,变化小于2%。相比之下,两个LLM在其知识截止日期后误差增加了约13%。

#### 3.1.3 全面且高质量的上下文

原则描述:大多数多模态预测基准的文本上下文集非常有限——要么局限于静态元数据(Zhou_2025)、日期和天气派生特征(wang2025chattime),要么是合成生成的上下文(Williams_2024)。相比之下,TimesX不仅使用所有常见上下文类型的并集,还提供了更高质量的文本事件描述以及这些上下文的相应对齐。特别是,我们将各种上下文分类为:(1) 元数据:所预测变量的描述性高级摘要;(2) 日历派生特征,如节假日;(3) 协变量,涵盖关于其他相关时间序列的文本信息;(4) 带时间戳的事件:与所考虑变量时间窗口对齐的相关事件的文本描述。第3.2.2节 (https://arxiv.org/html/2607.06973#S3.SS2.SSS2)包含有关我们如何生成这些上下文的更多细节。W

相似文章

时间序列预测的不合理难度

Hacker News Top

本文探讨了时间序列预测相比其他机器学习任务为何更具挑战性,展示了基准测试结果,表明简单的统计模型和零样本基础模型在许多序列上往往优于复杂的深度学习模型。

面向数据稀缺时间序列的统一生成模型:结合领域专家

arXiv cs.LG

介绍TimeMoDE,这是一个将扩散Transformer与混合专家模型相结合的框架,用于在数据稀缺条件下生成逼真的时间序列。该框架通过在多个领域的数据集上进行预训练,并利用领域提示来处理领域特定特征,同时结合扩散时间步信号实现自适应去噪。