RMISC:用于时间序列基础模型的大规模真实世界多变量语料库
摘要
介绍RMISC,一个包含约200个数据集和1420亿个时间点的大规模真实世界多变量时间序列语料库,并证明在真实世界多变量数据上预训练时间序列基础模型相比合成数据能提升零样本泛化能力。
arXiv:2607.06504v1 公告类型:新
摘要:近年来,使用时间序列基础模型(TSFM)进行多变量建模取得了进展,实现了先进的零样本泛化。现代多变量TSFM主要在多变量合成数据上进行预训练,这虽然易于扩展,但可能无法捕捉真实世界时间序列中存在的复杂时间动态和跨变量关系。这引出了一个关键问题:使用真实世界语料库训练的领先TSFM是否以及在多大程度上优于使用合成数据训练的模型?为回答这个问题,我们构建了RMISC语料库,这是一个相当大规模、高质量、开放获取、真实世界且多变量的时间序列档案,包含约200个数据集和来自不同领域的1420亿个时间点。此外,我们在单变量、合成多变量和真实世界多变量数据上预训练了四个先进的TSFM,并在标准分布内和分布外基准上评估了它们的零样本泛化能力。实验结果表明,纳入真实世界多变量数据主要提升了单变量和多变量TSFM的泛化性能。这些结果让我们更深入理解真实世界多变量数据如何有助于开发更强的TSFM。
查看缓存全文
缓存时间: 2026/07/08 04:40
# RMISC:面向时间序列基础模型的大规模真实世界多变量语料库 来源:https://arxiv.org/html/2607.06504 钱孙1,2,4,\* 田永明1,2,4,\* 黄嘉伟1,2,4 程峰3,4 张少群1,2,4, 🖂 1南京大学计算机软件新技术国家重点实验室,中国南京 2南京大学智能科学与技术学院,中国苏州 3西门子数据与人工智能研究院,中国北京 4南京大学-西门子工业人工智能联合研究中心,中国苏州 ###### 摘要 近年来,基于时间序列基础模型(TSFMs)的多变量建模取得了显著进展,实现了先进的零样本泛化能力。现代多变量TSFM主要基于多变量合成数据进行预训练,这种数据易于扩展,但可能无法捕捉真实世界时间序列中存在的复杂时间动态和跨变量关系。这引出一个关键问题:使用真实世界语料库训练的领先TSFM是否以及在多大程度上优于使用合成数据训练的模型?为回答此问题,我们构建了RMISC语料库,这是一个大规模、高质量、开放获取、真实世界的多变量时间序列存档,包含约200个数据集和1420亿个时间点,覆盖多个领域。此外,我们在单变量、合成多变量和真实世界多变量数据上预训练了四个先进的TSFM,并在标准分布内和分布外基准上评估其零样本泛化能力。实验结果表明,引入真实世界多变量数据主要提升了单变量和多变量TSFM的泛化性能。这些结果更深入地揭示了真实世界多变量数据如何助力开发更强TSFM。 ###### 关键词: 多变量时间序列预测\sep时间序列基础模型\sep真实世界时间序列语料库\sep协变量\sep分布外泛化 ## 1 引言 近期时间序列基础模型(TSFMs)的进展显著重塑了时间序列分析的范式(Liang et al., 2024 (https://arxiv.org/html/2607.06504#bib.bib36))。通过输入大规模异构时间序列语料库,TSFM能够直接兼容各种预测任务、频率分布和数据模态(Montet et al., 2025 (https://arxiv.org/html/2607.06504#bib.bib11)),展现出卓越的零样本泛化能力,从而超越了传统统计方法(Hyndman and Athanasopoulos, 2018 (https://arxiv.org/html/2607.06504#bib.bib2); Box and Jenkins, 1968 (https://arxiv.org/html/2607.06504#bib.bib20))和需要为单个时间序列反复训练特定任务模型的深度学习模型(Hochreiter and Schmidhuber, 1997 (https://arxiv.org/html/2607.06504#bib.bib21); Chung et al., 2014 (https://arxiv.org/html/2607.06504#bib.bib23); Sen et al., 2019 (https://arxiv.org/html/2607.06504#bib.bib24))(Challu et al., 2023 (https://arxiv.org/html/2607.06504#bib.bib37); Lim et al., 2021 (https://arxiv.org/html/2607.06504#bib.bib10))。近年来,开发者已将TSFM广泛应用于工业传感(Hector and Panjanathan, 2024 (https://arxiv.org/html/2607.06504#bib.bib5))、金融评估(Sezer et al., 2020 (https://arxiv.org/html/2607.06504#bib.bib6))、医疗监测(Morid et al., 2023 (https://arxiv.org/html/2607.06504#bib.bib7))、气候建模(Mudelsee, 2010 (https://arxiv.org/html/2607.06504#bib.bib1))、能源管理(Hong and Fan, 2016 (https://arxiv.org/html/2607.06504#bib.bib8))和交通预测(Li et al., 2018 (https://arxiv.org/html/2607.06504#bib.bib33))等多个领域。 参见图注 图 1:单变量和多变量时间序列基础模型在语料库上的建模工作流程。 捕捉跨变量信息是TSFM发展的基本课题之一(Ansari et al., 2025 (https://arxiv.org/html/2607.06504#bib.bib12); Liu et al., 2025b (https://arxiv.org/html/2607.06504#bib.bib38)),其建模工作流程如图1 (https://arxiv.org/html/2607.06504#S1.F1) 所示。直观上,真实世界时间序列很少孤立出现;一个目标变量通常伴随多个相关协变量,其时间动态往往受复杂的跨变量依赖关系影响(Zhang and Yan, 2023 (https://arxiv.org/html/2607.06504#bib.bib39))。例如,天气预报中的温度变化受降雨量和风速影响。因此,多变量TSFM中的协变量建模有助于更准确的预测,因为辅助协变量和跨变量依赖关系提供了超越目标历史本身的互补信号(Lim et al., 2021 (https://arxiv.org/html/2607.06504#bib.bib10); Zhang and Yan, 2023 (https://arxiv.org/html/2607.06504#bib.bib39); Liu et al., 2024b (https://arxiv.org/html/2607.06504#bib.bib40))。然而,当前多变量TSFM主要基于多变量合成数据进行预训练(Ansari et al., 2025 (https://arxiv.org/html/2607.06504#bib.bib12); Liu et al., 2025a (https://arxiv.org/html/2607.06504#bib.bib19));尽管易于使用且可扩展,但在捕捉复杂时间动态和跨变量关系方面,合成数据与真实世界时间序列之间仍存在差距(Liu et al., 2025a (https://arxiv.org/html/2607.06504#bib.bib19); Li et al., 2025 (https://arxiv.org/html/2607.06504#bib.bib28))。这引出一个关键问题:使用真实世界语料库训练的领先TSFM是否以及在多大程度上优于使用合成数据训练的模型? ### 1.1 相关工作 由于缺乏协变量建模,单变量TSFM的泛化能力仍然有限。近期TSFM已开始显式纳入多变量建模,包括Chronos-2(Ansari et al., 2025 (https://arxiv.org/html/2607.06504#bib.bib12))、COSMIC(Auer et al., 2025 (https://arxiv.org/html/2607.06504#bib.bib16))、Toto(Cohen et al., 2026 (https://arxiv.org/html/2607.06504#bib.bib45))、GTT(Feng et al., 2024 (https://arxiv.org/html/2607.06504#bib.bib18))、TabPFN-TS(Hoo et al., 2025 (https://arxiv.org/html/2607.06504#bib.bib17))和Moirai-1(Woo et al., 2024 (https://arxiv.org/html/2607.06504#bib.bib44))。其中,Chronos-2基于数亿多变量时间序列数据预训练,相比单变量TSFM取得了显著改进(Ansari et al., 2025 (https://arxiv.org/html/2607.06504#bib.bib12); Woo et al., 2024 (https://arxiv.org/html/2607.06504#bib.bib44))。然而,现有真实世界多变量时间序列数据集在数量和质量上仍显不足,给大规模多变量TSFM的训练和评估带来挑战(Liu et al., 2025a (https://arxiv.org/html/2607.06504#bib.bib19))。作为替代方案,合成时间序列数据被越来越多地探索,并主要用于训练多变量TSFM(Ansari et al., 2025 (https://arxiv.org/html/2607.06504#bib.bib12)),这类数据更易于大规模获取。目前已探索了多种合成时间序列生成方法,从经典统计模型和基于模拟的方法,到生成对抗网络(GANs)、变分自编码器(VAEs)和扩散模型等深度生成模型(Brophy et al., 2023 (https://arxiv.org/html/2607.06504#bib.bib22); Desai et al., 2021 (https://arxiv.org/html/2607.06504#bib.bib25); Yuan and Qiao, 2024 (https://arxiv.org/html/2607.06504#bib.bib26))。例如,Chronos系列使用了由AR和ETS模型、TSI和KernelSynth生成的合成时间序列(Ansari et al., 2024 (https://arxiv.org/html/2607.06504#bib.bib15); Box et al., 2015 (https://arxiv.org/html/2607.06504#bib.bib3); Hyndman et al., 2008 (https://arxiv.org/html/2607.06504#bib.bib4); Bahrpeyma et al., 2021 (https://arxiv.org/html/2607.06504#bib.bib27))。尽管合成时间序列数据具有可扩展性和灵活性,但它常受限于生成过程的假设,可能无法忠实保留真实世界的复杂模式和复杂的跨变量依赖关系(Liu et al., 2025a (https://arxiv.org/html/2607.06504#bib.bib19))。近期证据进一步表明,基于合成多变量数据集预训练且在标准基准上表现良好的TSFM,仍可能在真实世界时间动态方面遇到困难(Li et al., 2025 (https://arxiv.org/html/2607.06504#bib.bib28))。 近期TSFM已将真实世界时间序列纳入模型开发(Woo et al., 2024 (https://arxiv.org/html/2607.06504#bib.bib44); Cohen et al., 2026 (https://arxiv.org/html/2607.06504#bib.bib45)),同时引入了专门基准来评估模型在真实多变量预测场景下的性能(Shchur et al., 2025 (https://arxiv.org/html/2607.06504#bib.bib13); Aksu et al., 2024 (https://arxiv.org/html/2607.06504#bib.bib30); Godahewa et al., 2021g (https://arxiv.org/html/2607.06504#bib.bib29));然而,现有真实世界多变量时间序列数据集在数量和质量上仍然有限,不足以完全支持大规模多变量TSFM的预训练(Goswami et al., 2024 (https://arxiv.org/html/2607.06504#bib.bib43))。此外,还需要从多变量真实世界时间序列数据构建测试平台,用于全面评估多变量TSFM的预训练和下游性能(Shchur et al., 2025 (https://arxiv.org/html/2607.06504#bib.bib13))。 ### 1.2 我们的贡献 本文全面研究了使用合成数据和真实时间序列数据训练的多变量TSFM的效果。我们构建了真实世界多变量时间序列语料库(RMISC),这是一个大规模、高质量、开放获取、真实世界的多变量时间序列存档,如表LABEL:tab:rmisc_datasets所示。RMISC语料库包含约200个数据集和1420亿时间点,均收集自真实世界场景,具有开放合法许可,支持多变量TSFM的预训练和基准测试。此外,我们实证比较了四种先进TSFM在单变量、合成多变量和对应我们提出的RMISC语料库的真实世界多变量数据上预训练后的收敛性和泛化能力。具体来说,涉及的TSFM包括Chronos-2(Ansari et al., 2025 (https://arxiv.org/html/2607.06504#bib.bib12))、GTT(Feng et al., 2024 (https://arxiv.org/html/2607.06504#bib.bib18))、Moirai-2.0(Woo et al., 2024 (https://arxiv.org/html/2607.06504#bib.bib44))和TimesFM-2.5(Das et al., 2024 (https://arxiv.org/html/2607.06504#bib.bib41)),其中前两者为多变量TSFM,后两者为单变量TSFM。分布内性能在分布内测试集上衡量,而零样本泛化能力在由GIFT-Eval(Aksu et al., 2024 (https://arxiv.org/html/2607.06504#bib.bib30))和fev-bench(Shchur et al., 2025 (https://arxiv.org/html/2607.06504#bib.bib13))组成的标准分布外基准上衡量。结果表明,加入真实世界多变量数据始终带来更强健的分布外泛化性能。具体而言,我们从实验中得出以下结论:(1)使用多变量时间序列预训练的TSFM性能始终优于单变量数据,凸显了建模跨变量依赖关系的重要性;(2)用真实世界多变量数据替换合成多变量数据在分布内和分布外泛化方面均带来改进,这可能得益于更真实的动态和更丰富的跨变量依赖关系;(3)使用真实世界单变量数据、合成多变量数据和真实世界多变量数据的平衡组合预训练的TSFM取得了最佳整体性能,我们将其作为最终推荐的预训练方案。 本文其余部分组织如下。第2节 (https://arxiv.org/html/2607.06504#S2) 介绍所提出的RMISC语料库及其关键特性。第3节 (https://arxiv.org/html/2607.06504#S3) 通过实验研究真实世界多变量数据如何影响预训练TSFM的性能。第4节 (https://arxiv.org/html/2607.06504#S4) 总结本文工作。 表 1:RMISC数据集的紧凑总结,其中“观测数”指时间点的总数。 ## 2 RMISC语料库 本节正式介绍用于多变量TSFM预训练和基准测试的RMISC语料库。RMISC语料库收集自真实世界场景,具有开放合法许可,并保留带有显式目标-协变量注释的丰富多变量信息。因此,该语料库能够支持在预测目标、辅助协变量和复杂跨变量依赖关系被共同考虑的真实预测场景下,进行多变量TSFM的预训练和评估。表1 (https://arxiv.org/html/2607.06504#S1.T1) 总结了RMISC语料库的数据集名称、领域和观测总数,更详细的信息可查阅附录A.1 (https://arxiv.org/html/2607.06504#A1.SS1)。 参见图注 图 2:RMISC语料库的整体构建流程。 构建RMISC语料库需要大量超出简单聚合的数据整理和工程工作。图2 (https://arxiv.org/html/2607.06504#S2.F2) 展示了RMISC语料库的整体构建流程,涉及五个关键阶段,即数据来源、数据处理、模式统一、元数据构建和数据集精炼。 阶段 1: 数据来源。我们首先从多样化的来源和领域收集大量真实世界多变量时间序列数据。具体而言,最终的RMISC语料库包含约200个子数据集、200万个时间序列文件、160亿个时间步和1420亿个时间点,覆盖包括能源、金融、环境、工业、交通等主要真实世界领域。 阶段 2: 数据处理。真实世界时间序列数据通常带有噪声且跨来源信息不完整(Hyndman and Athanasopoulos, 2018 (https://arxiv.org/html/2607.06504#bib.bib2); Box et al., 2015 (https://arxiv.org/html/2607.06504#bib.bib3))。此步骤采用系统化的数据处理方法,包括处理缺失值和异常值、连接来自多个文件的相关时间序列,以及将原始输入转换为一致的时间序列表示,以提高所收集数据的质量。 阶段 3: 模式统一。为便于大规模TSFM预训练和评估,我们以层次结构组织RMISC语料库,每个子数据集存储在独立文件夹中。在每个子数据集内,时间序列数据按顺序分区为有序的Parquet文件,具有一致的索引。 阶段 4: 元数据构建。为确保数据可追溯性并促进可重复研究,我们设计了标准化的元数据和来源系统。每个子数据集关联一个元数据文件,记录预测目标、协变量、领域、时间频率及其他数据集级统计信息。由于RMISC完全开源,并源自公开可用的真实世界多变量时间序列数据集,元数据还额外记录了每个子数据集的原始数据来源和许可信息。此外,在可用正式引用时提供BibTeX引用文件。 阶段 5: 数据集精炼。此步骤执行整体精炼和验证,以进一步提高整体可靠性。
相似文章
混合而非挑选:为何合成语料组合对时间序列基础模型预训练至关重要
本文系统评估了11种用于基础模型预训练的合成时间序列生成器,发现生成器的排名在不同架构下不稳定,但所有生成器的等权重混合结果与最佳单个生成器相当或更优。将这种混合与真实数据融合可得到最强的预训练语料,从而将合成预训练重新定义为语料组合问题而非生成器选择问题。
ReTAMamba:用于不规则临床时间序列预测的可靠性感知时间聚合与Mamba方法
提出ReTAMamba,一种使用基于Mamba的可靠性感知时间聚合进行不规则临床时间序列预测的方法,在MIMIC-IV、eICU和PhysioNet 2012上取得了显著的AUPRC提升。
一个102M参数的Transformer如何预测多元时间序列?
本文通过可视化方式介绍了t0-alpha——一个1.016亿参数的基础模型,用于多元时间序列预测。该模型将时间注意力与跨变量组注意力分离,在GIFT-Eval上取得了具有竞争力的CRPS分数,与TimesFM 2.5和Chronos-2等更大模型相当。
Unicorn:通过通用相关性建模实现高维时间序列预测的规模化
本文介绍了Unicorn,一个用于对高维时间序列进行可扩展的多数据集预训练的框架,它通过潜在原型码本将相关性建模与特定通道身份解耦,从而实现了领域迁移和少样本预测。
Chronicle:用于联合语言和时间序列理解的多模态基础模型
Chronicle 是一个 324M 参数的纯解码器 Transformer,从零开始在自然语言和时间序列上预训练,在 NLU 和时间序列分类任务上取得了有竞争力的性能,并在 UCR/UEA 数据集上的冻结嵌入时间序列分类中创造了新的最先进水平。