时间序列基础模型的因果分析
摘要
本文提出了一种因果分析框架,用于识别时间序列基础模型中的偏差,并应用于 Chronos-2 和 TimesFM-2.5,揭示了特定的失败模式,如对持续性的过度估计以及对 regime switch 模式的失败。
arXiv:2608.24303v1 Announce Type: new
摘要:从定制的时间序列模型向时间序列基础模型的转变,将模型与应用的关系从一对一变为一对多。这种转变引入了集中风险,因为许多潜在的高风险预测应用暴露在单个时间序列基础模型的相同偏差和失败模式之下。同时,这种集中化允许在模型开发和验证中实现规模经济。本研究调查了如何在部署前识别时间序列基础模型的偏差和失败模式。我们提出了一种因果分析框架,用于研究时间序列基础模型保留时间序列模式的能力。为此,我们在参数化合成时间序列生成器上进行干预,并在 ceteris paribus 条件下测量模型输出的相应变化。我们将因果分析框架应用于 Chronos-2 和 TimesFM-2.5,并测试了六种不同的时间序列模式。我们发现趋势和谐波振荡模式是安全配置。结果还表明,两个模型都倾向于过度估计持续性,对 regime switch 模式存在突然失败,且 TimesFM-2.5 对 energy-release 模式失败。我们对两个模型原始作品的审查表明,这些发现可能由预训练数据解释。最后,我们提出了进一步模型开发的建议、针对特定应用模型选择的推荐,并讨论了局限性和未来研究方向。
查看缓存全文
缓存时间: 2026/08/26 09:36
# 时间序列基础模型的因果分析 来源: https://arxiv.org/html/2608.24303 Mathis Jander https://orcid.org/0009-0004-9321-862X 单位:行为、管理与社会科学学院,特文特大学,恩斯赫德,荷兰 单位:欧洲中央银行,法兰克福,德国 单位:通讯作者:[mathis\.jander@utwente\.nl](mailto:[email protected]) Wouter van Heeswijk https://orcid.org/0000-0002-5413-9660 单位:行为、管理与社会科学学院,特文特大学,恩斯赫德,荷兰 Martijn Mes https://orcid.org/0000-0001-9676-5259 单位:行为、管理与社会科学学院,特文特大学,恩斯赫德,荷兰 2026年8月25日 ###### 摘要 从定制的时间序列模型转向时间序列基础模型,改变了模型与应用之间一对多的关系。这一转变带来了集中风险,因为许多潜在的、高风险的预测应用都暴露在同一个时间序列基础模型的相同偏见和故障模式之下。与此同时,这种集中化也带来了模型开发和验证的规模经济。本研究探讨如何在部署前识别时间序列基础模型的偏见和故障模式。我们提出了一个因果分析框架,用于研究时间序列基础模型保持时间序列模式的能力。为此,我们在参数化的合成时间序列生成器上进行干预,并在其他条件不变的情况下测量模型输出的相应变化。我们将因果分析框架应用于Chronos-2和TimesFM-2.5,并在六种不同的时间序列模式上进行测试。我们找到了适用于趋势和谐波振荡模式的安全配置。结果还表明,两个模型都存在高估持续性的偏见,在体制转换模式上均出现突然故障,且TimesFM-2.5在能量释放模式上出现失败。我们对两个模型原始工作的回顾表明,这些发现可能与用于预训练的数据有关。我们最后提出进一步模型开发的建议、针对特定应用的模型选择建议,以及局限性和未来研究方向的讨论。 ## 1 引言 预测被广泛用于指导金融、能源和政策等关键领域的决策。与此同时,我们用来生成这些预测的时间序列模型,随着数据集大小和可训练参数数量的增加,变得越来越不可解释。传统上,每个预测应用都使用专门的数据集来训练一个定制的模型,模型开发和部署都在同一个团队或组织内进行。随着大型、预训练的时间序列基础模型的创建,例如Chronos-2(Ansari et al., 2025)和TimesFM-2.5(Das et al., 2024),时间序列模型的开发和使用进一步分离。这些基础模型由组织(如Amazon Science或Google Research)开发,然后授权给更广泛的开发者社区用于许多不同的下游应用。虽然从为每个应用定制模型转向基础模型有望在训练和应用方面创造规模经济(Ansari et al., 2025; Das et al., 2024; Woo et al., 2024),但它也带来了两个问题。首先,它减少了部署组织对模型开发的了解,因此也无法了解其可能存在的偏见和故障模式。其次,由于一个基础模型旨在用于多个下游应用,这就引入了系统性风险,因为模型的偏见和故障模式可能影响许多应用,而不是像定制模型那样局限在一个应用内。考虑到规模经济和由此产生的风险状况,我们认为这种向少数广泛使用的基础模型集中的趋势,意味着需要比定制模型更深入地审视时间序列基础模型。因此,我们将关注如何在部署任何特定预测应用之前识别时间序列基础模型的偏见和故障模式。 本研究对当前关于时间序列基础模型的知识体系做出四项贡献。首先,我们定义并应用了一个时间序列基础模型因果分析的框架。其次,我们展示了Chronos-2和TimesFM-2.5在六种不同时间序列模式上的剂量-反应关系,表明它们存在高估持续性的偏见,并识别出几种故障模式。第三,通过我们的分析,我们发现了两个模型都存在高估持续性的偏见,并展示了在体制转换和能量释放生成器上的突然失败。第四,基于我们的实证发现,我们能够为下游应用提供模型选择建议,并为未来时间序列基础模型的开发提供参考。 本研究的其余部分结构如下。我们首先在第2节回顾现有文献,寻找我们研究问题的答案。然后在第3节定义时间序列基础模型的因果分析框架,并用我们的实验设置将其具体化。我们在第4节分析结果,并在第5节将我们的发现与先前研究进行比较。在第6节,我们总结研究发现,承认局限性,并概述进一步研究的方向,从而结束本研究。 ## 2 文献综述 在定义我们的因果分析框架之前,我们先回顾与我们研究问题相关的现有文献。为了理解我们在识别和潜在缓解时间序列基础模型偏见及故障模式方面是否存在方法论空白,我们首先回顾了其他工程学科如何处理具有类似风险状况的技术的案例。有了这些案例作为参考,我们可以将时间序列基础模型的文献与这些标准进行比较。在此,我们首先介绍引入Chronos-2和TimesFM-2.5模型的原始研究。然后,我们将范围扩大到关于时间序列基础模型因果分析的其他研究。最后,我们将回顾关于可解释性和鲁棒性的相关工作,以进一步明确文献中的空白范围。 虽然基础模型在机器学习领域带来了新的挑战,但其他工程学科已经制定了评估将在许多潜在高风险环境中使用的技术的实践。在药物开发中,新化合物在上市前需要经过三个阶段的流程(Food and Drug Administration, 2020; European Medicines Agency, 2009)。在第一阶段,新化合物在其他条件不变的情况下进行体外测试,以确保高度的因果控制。该阶段的目标是分离化合物的因果效应。第二阶段,在动物身上进行临床前试验,允许对化合物的毒性及其他对生物体的影响进行体内测试。第三阶段则在人体上进行体内测试,以验证预期的治疗效果。上市后,药物会持续监测罕见的不良反应,这些反应可能在前几个阶段未被发现。在汽车制造领域,汽车开发遵循类似的过程(International Organization for Standardization, 2018; Peter, 2022; Zollino et al., 2025)。在第一阶段,部件和子系统在专门的测试台上进行测试,该测试台可以模拟温度、磨损以及其他随时间损害其完整性的因素。这些测试台允许在其他条件不变的情况下隔离温度等因素,并观察其对部件的影响。在第二阶段,整车在受控条件下进行测试,以验证所有子系统的正确集成。这包括测试空气动力学、燃油效率和碰撞行为。汽车上市后,定期检查和缺陷调查(可能导致召回)在不同司法管辖区都很常见。在这两个例子中,新技术首先在其他条件不变的条件下进行测试以隔离因果效应,然后在更真实但也更混杂的条件下验证其预期行为。 在分别介绍Chronos-2(Ansari et al., 2025)和TimesFM-2.5(Das et al., 2024)的研究中,这两个时间序列基础模型通过在基准数据集上测试其预测准确性来与其他模型进行比较。例如,TimesFM-2.5在Monash基准测试中表现优于所有其他模型,而llmtime则排在倒数第二。另一方面,在Darts基准测试中,llmtime排名第一,TimesFM-2.5排名第三。我们无法确信地判断这些性能差异是训练数据、模型架构还是其他任何因素的结果。我们也无法判断这些发现是否会持续适用于相同数据生成过程的未来观察结果。这类似于药物体内测试或汽车试驾,仅仅进行基准测试并不能让我们理解导致观察到性能结果的原因。 据我们所知,目前尚无文献将因果分析应用于研究时间序列基础模型。虽然先前的研究探索了从时间序列数据中进行因果推断,例如Granger因果关系(Granger, 1969)或Pearl的结构因果模型(Pearl, 2010)来揭示因果关系,但这些研究旨在从时间序列数据中推断变量之间的因果关系,而并不使用时间序列数据来评估模型。因此,对数据生成过程进行干预以研究时间序列基础模型行为仍未被探索。 除了关注时间序列基础模型的文献之外,在更广泛的机器学习领域还有几个相关的研究方向追求类似的目标。可解释性人工智能(Explainable AI)研究产生了多种技术,用于量化机器学习模型输入与输出之间的关系。著名的技术包括SHAP(Lundberg and Lee, 2017)、LIME(Ribeiro et al., 2016)和部分依赖图(Partial Dependence Plots)(Friedman, 2001),这些技术是为表格数据开发的。前两者基于特有的公理和假设,为给定样本的每个输入特征分配重要性分数。而部分依赖图则改变特征值并观察其对模型输出的影响。对一组样本重复此过程,可以估计干预的平均处理效应。在多个干预值上进行扫描,可以创建剂量-反应曲线,映射输入特征与模型输出之间的预期交互作用。虽然对实现的样本进行干预对于大多数表格数据应用来说很直观,但对于时间序列则不然。相反,我们希望干预数据生成过程本身的模式,例如趋势、季节性或自相关。 鲁棒性文献关注的是理解输入修改如何降低机器学习模型的性能。该研究方向可以大致区分为两个不同的子类别(Braiek and Khomh, 2025)。首先是对输入样本损坏的鲁棒性,无论是来自噪声(Hendrycks and Dietterich, 2019)还是有意的对抗性操纵(Goodfellow et al., 2015)。其次是对数据分布变化的鲁棒性(Recht et al., 2019; Koh et al., 2021)。当我们考虑针对我们研究问题的鲁棒性分析时,我们面临三个问题。首先,由于这些方法修改的是观测值,而不是控制底层数据生成过程,我们面临与可解释性人工智能文献中相同的时间序列干预意义问题。其次,鲁棒性分析揭示了在输入损坏下模型性能下降的程度,但如果我们干预底层数据生成过程的属性,它并不能揭示时间序列基础模型的偏见和故障模式。虽然允许我们分析由于输入损坏导致的故障模式,但鲁棒性分析不允许我们识别未损坏样本上的偏见和故障模式。第三,当我们将其应用于时间序列基础模型时,数据分布变化的鲁棒性概念变得模糊不清。考虑到时间序列基础模型所训练的数据量大且多样(Ansari et al., 2025; Das et al., 2024),定义训练数据分布是什么以及什么构成分布变化并不明确。 总之,其他工程学科已经建立了分阶段的流程来测试高风险技术,如药理学和汽车。该流程始于在其他条件不变的条件下进行体外因果分析,以权衡真实性来识别因果机制。在第二阶段,技术在更真实的条件下进行体内测试。这个两阶段的流程允许我们在隔离状态下识别因果机制并映射剂量-反应关系,然后在更真实的条件下进行验证。回顾时间序列基础模型的文献表明,当前的验证工作集中在第二阶段,即通过对未受控数据生成过程的实现观测进行性能基准测试实验。我们还发现,相关研究工作,即可解释性人工智能和鲁棒性分析,未提供分析时间序列基础模型偏见和故障模式的因果分析方法。这些发现共同勾勒出了我们试图在本研究剩余部分解决的方法论空白。 ## 3 方法论 在本节中,我们首先在第3.1节提出我们的时间序列基础模型因果分析框架。然后在第3.2节描述本研究的实验配置。 ### 3.1 因果分析框架 为了形式化我们的时间序列基础模型因果分析框架,我们为数据生成过程、时间序列基础模型以及我们的因果推断逻辑定义了数学符号。 设 t ∈ ℕ
相似文章
时间序列基础模型基准测试是否隐藏了依赖状态的失败?来自交通速度预测的证据
本文提出了面向时间序列基础模型的状态分层评估方法,揭示出聚合指标会掩盖交通状态转换期间的严重失败,并提出了双峰混合增强方法,在保持整体准确性的同时改善覆盖范围。
迈向连续时间因果基础模型
提出了一个连续性准则,用于将离散时间因果先验数据拟合网络扩展到连续时间,利用随机微分方程(SDE)。引入了分类体系和细网格积分方法,在不规则观测时间表上优于朴素积分方法。
基于边际影响的归因方法对全局时间序列解释的失效
本文证明了现有基于边际影响的归因方法从根本上无法捕捉时间序列模型的条件依赖结构,并提出了DAG忠实性作为忠实解释的新标准。
评估基础模型在时间序列预测中的运行可行性
本文对基础模型在时间序列预测中的应用进行了评估,与四种操作领域中的监督学习方法进行了比较,并提出了一种复杂性路由器,用于选择性地将序列分配给最优模型类别,以平衡准确性和推理成本。
使用零样本时间序列基础模型进行功能MRI和合成信号的预测与因果关系分析
本文介绍了一种零样本时间序列基础模型,应用于功能MRI与合成信号的预测和因果关系分析。