评估基础模型在时间序列预测中的运行可行性

arXiv cs.LG 论文

摘要

本文对基础模型在时间序列预测中的应用进行了评估,与四种操作领域中的监督学习方法进行了比较,并提出了一种复杂性路由器,用于选择性地将序列分配给最优模型类别,以平衡准确性和推理成本。

arXiv:2605.24381v1 公告类型:新 摘要:时间序列预测驱动着金融、交通和能源等领域的运营决策。虽然监督学习方法取得了强劲的性能,但它们需要特定领域的训练、特征工程和持续的维护。大规模基础模型最近作为零样本替代方案出现,避免了像LLM那样的任务特定训练。在这项工作中,我们将基础模型与标准监督方法进行了评估。我们不仅仅关注总体准确性,而是分析了四种操作机制下的性能:周期性以人为中心的系统、物理约束过程、随机金融市场和异质性需求预测。 我们的结果描述了最佳部署区域。基础模型在具有可转移周期性结构的领域中表现良好,并且对于冷启动或长尾场景效率较高。相反,监督专家在受严格物理约束的系统中保持更高的精度。在金融领域,较新的基础模型正在迅速缩小与监督专家的性能差距。我们进一步量化了推理延迟、数据漂移适应性和部署约束方面的权衡。最后,我们提出了一种复杂性路由器,利用经验特征将每个序列分配给最优模型类别。我们证明,与部署通用基础模型相比,这种选择性路由实现了更高的准确性和显著更低的推理成本,为平衡泛化性和效率提供了实用框架。
查看原文
查看缓存全文

缓存时间: 2026/05/26 09:05

# 评估时间序列预测中基础模型的操作可行性
来源:https://arxiv.org/html/2605.24381
Debanshu DasGoogle, USA \{kavinsoni, debanshu, vamshigud\}@google\.comVamshi GuduguntlaGoogle, USA \{kavinsoni, debanshu, vamshigud\}@google\.com

###### 摘要

时间序列预测仍然是金融规划、交通运输和能源系统等领域运营决策的核心。虽然梯度提升树和循环神经网络等监督学习方法取得了强劲的实证表现,但它们需要特定领域的训练流程、特征工程和持续维护。最近,大规模基础模型作为一种潜在的替代方案出现,能够在无需任务特定训练的情况下实现零样本预测,概念上类似于大型语言模型(LLM)。在这项工作中,我们呈现了基础模型与行业标准监督方法相比的应用评估。我们并非仅仅关注总体准确率,而是分析了四个运营场景下的性能:周期性的以人为本系统(交通)、物理受限过程(能源)、随机金融市场以及异构需求预测(M4)。我们的结果刻画了最佳部署场景:基础模型在具有可迁移周期结构的领域中表现出竞争性性能,并在冷启动或长尾场景中提供了运营效率。相反,监督专家模型在受严格物理约束的系统中保持了更高的精度。在高熵金融领域,较新基础模型架构正在迅速缩小与监督专家模型的差距。此外,我们量化了推理延迟、对数据漂移的适应性以及部署约束之间的权衡。这些发现为从业者确定基础模型与任务特定监督流程之间的最佳平衡提供了一个框架。基于这些发现,我们提出了一种复杂度路由器,它使用经验导出的特征将每个序列分配给最优模型类别。我们证明了选择性路由比通用基础模型部署在显著降低推理成本的同时实现了更高的准确率,为从业者提供了一个平衡泛化性与效率的原则性框架。

## 1 引言

基于历史时间数据准确预测未来值的能力是现代运营和战略决策的核心。从管理能源系统的电网稳定性、优化城市网络中的交通流量,到对冲波动的金融市场中的风险,稳健的预测支撑着效率、规划和风险管理。随着高频传感器数据和经济指标变得无处不在,对可扩展和自动化预测解决方案的需求持续增长。

历史上,这一挑战主要通过两种范式来解决。首先,经典统计方法,如季节性朴素(SNAIVE)[8] 和自回归积分滑动平均(ARIMA)[3],提供了稳健且可解释的基线,但往往难以捕捉高维数据中复杂的非线性依赖关系。其次,监督机器学习方法,特别是梯度提升树(例如 XGBoost)和循环神经网络(例如 LSTM),通过学习复杂的时间模式展示了强劲的实证表现。然而,这些专家模型本质上需要大量资源,并且需要针对每个任务或领域定制数据流程、广泛的特征工程和反复的再训练。

最近,基础模型作为时间序列预测的第三种范式出现。受自然语言处理进展的启发,这些模型旨在通过利用对不同时间序列数据的大规模预训练来实现推理。原则上,此类模型可以针对先前未见过的序列生成预测,而无需任务特定的训练,与传统预测流程相比,有可能降低工程开销和部署时间。

本文对这一通才与专才的权衡进行了专注且独立的评估。我们将基础模型在仅推理设置(无梯度更新)中的性能与常用监督方法(XGBoost、LSTM、PatchTST、DLinear)进行比较。我们并非进行广泛调查,而是分析了四个不同场景中的模型行为:具有强周期性的交通预测、受物理约束的能源系统、以高波动性为特征的汇率以及来自 M4 数据集的异构需求预测。

从应用角度来看,我们在四个不同的运营环境中呈现了基于场景的分析:周期性交通、热力学能源系统、随机金融市场和异构需求。我们证明模型的主导地位并非随机,而是由底层数据生成过程决定。基于这些实证发现,我们提出了复杂度路由器,这是一种部署架构,它使用从 5,089 个序列分析中导出的特征将预测任务分配给最优模型类别。通过将基础模型和监督基线视为单个系统内的互补组件,而非竞争性替代方案,我们确定了一种帕累托最优配置,可以在大规模预测系统中同时优化准确性和运营成本。

## 2 相关工作

### 2.1 统计和监督基线

几十年来,Makridakis 竞赛(M3、M4、M5)[12, 13, 14] 一直作为预测进展的标准基准。纯统计方法,如 ARIMA 和指数平滑(ETS),一直占据主导地位,直到 M4 竞赛成为一个转折点,混合方法(例如 ES-RNN)开始超越纯统计方法[17]。M5 竞赛(专注于零售销售)进一步巩固了机器学习,特别是梯度提升树(LightGBM)和深度学习,在有足够数据时的优越性。然而,这些“专家”模型从根本上受到其需要任务特定训练和广泛特征工程的限制。

### 2.2 深度学习

在基础模型之前,深度学习架构不断发展以解决统计模型的扩展限制。像 N-BEATS[16] 和 PatchTST[15] 这样的架构引入了有效捕捉长期依赖关系的机制。然而,该领域关于 Transformer 对时间序列有效性的争论一直很激烈。Zeng 等人(2023)曾著名地论证简单的线性模型(DLinear)可以胜过复杂的 Transformer[20],质疑了注意力机制在低语义密度数据中的效用。我们的工作重新评估了预训练 Transformer 时代的这一假设,探究大规模是否克服了早期研究提出的架构怀疑。

### 2.3 基础模型与近期基准测试

向仅推理能力的转变代表了当前的前沿。TimesFM[6] 采用仅在超过 1000 亿个真实世界时间点上训练的仅解码器架构,与 Chronos[2] 形成对比,后者将序列量化为离散标记以利用基于 T5 的 LLM 架构,以及 Moirai[18],它专注于任意变量注意力以处理不同频率。

最近的基准测试工作试图评估这一格局。GIFT-Eval (2024) 和 FoundTS (2025)[1, 22] 提供了这些基础模型的首次大规模比较。然而,这些基准测试主要侧重于对基础模型进行相互排名(例如,“Chronos 是否击败了 TimesFM?”)。我们的工作通过关注通才类与专才类之间的结构性权衡来区分自己。我们不是简单地宣布一个赢家,而是分析那些决定实践者何时应放弃基础模型范式而转向经典特征工程的场景(物理与周期性)和运营约束(延迟、隐私)。

## 3 方法论

### 3.1 问题描述

给定一个历史时间序列 X_hist = [x_1, x_2, ..., x_T],目标是预测未来水平 H,表示为 X_pred = [x_{T+1}, ..., x_{T+H}]。对于标准的监督基线(例如 XGBoost),在 X 的训练分割上训练一个模型,以最小化损失函数 L(X_true, f_θ(X_hist))。在基础模型范式中,我们在仅推理模式下使用预训练模型 F_pre。预测严格生成为 F_pre(X_hist),无需在目标数据集 X 上执行任何任务特定的梯度更新或微调。

### 3.2 数据集与领域多样性

为了严格评估“通才与专才”的权衡,我们选择了四个代表不同统计场景的基准数据集,范围从严格周期性的物理系统到高熵金融市场(见表 1)。

表 1:数据集特征。我们涵盖了从周期性(交通)到随机(金融)的不同场景。MASE 的计算:交通和能源使用 m=24,汇率和 M4 使用 m=7。1. 1. 交通流量(交通/小时级):我们使用了加州交通部(PeMS)的交通数据集,记录了旧金山湾区 862 个传感器的小时级车道占用率。该数据集的显著特征是强烈的时间规律性,表现出明显的日高峰期和清晰的周周期性(S=168)。它作为模型捕捉复杂但确定性季节性能力的基准。[4, 11]。
2. 2. 电力变压器温度(能源/小时级):ETTh1 数据集跟踪电力变压器油温,分辨率为小时级。与交通流量不同,该数据代表一个受热力学约束和负载因素影响的连续物理过程。它表现出平滑的局部波动而非突发性尖峰,测试了模型建模连续动态和短期均值回复的能力。[23]。
3. 3. 汇率(金融/日级):我们包含了一个包含 8 种日度汇率(例如美元、欧元、日元、英镑)跨越 26 年的数据集。金融时间序列以其随机游走行为和高波动性而闻名,难以预测。该数据集测试了模型对低信噪比和变化趋势的鲁棒性,其中传统季节性很弱或不存在。尽管汇率数据集包含的序列数量有限,但它广泛应用于预测基准测试,并且专门设计用于捕捉高熵金融动态。[11]。
4. 4. M4 竞赛(通用/日级):为了测试广泛的泛化能力,我们使用了 M4 竞赛的日度子集,包含来自宏观经济、微观工业和人口统计学的 4,227 个多样化序列。这个异构集合要求模型处理不同的尺度、趋势和噪声水平,而不会过拟合到单个领域的物理特性。[13]。

##### 预训练重叠。

我们明确承认,诸如 M4、交通和 ETTh1 等标准基准频繁包含在大规模时间序列模型的预训练语料库中[6]。因此,我们在这些数据集上的评估评估了模型通过上下文学习回忆和适应典型操作模式的能力,而非纯粹的分布外泛化。

### 3.3 待评估的基础模型

我们评估两个架构不同的基础模型家族。TimesFM[6] 采用基于补丁的连续表示的仅解码器架构,可提供 TimesFM 2.0(5 亿参数)和 TimesFM 2.5(2 亿参数,16K 上下文长度)两种版本。Chronos[2] 采用基于 T5 的编码器-解码器架构,将连续值量化为离散标记。这两个家族代表了通才预测问题的根本不同方法,并在零样本仅推理模式下进行评估,不进行微调。

#### 3.3.1 理论框架:通过上下文学习的基础模型

与传统的时间序列 Transformer(例如 Informer[23]、Autoformer[19])依赖于编码器-解码器结构并需要在目标数据上进行监督训练不同,TimesFM 采用概念上类似于大型语言模型(LLM)的仅解码器架构。TimesFM 的核心创新是从基于梯度的适应转向上下文学习。与监督模型不同(监督模型中知识静态存储在数据集特定的权重中),TimesFM 保持参数冻结。这促进了真正的基础模型推理,其中模型通过动态关注历史上下文窗口(X_hist)来适应局部季节性和趋势(例如,特定交通传感器),而无需一次梯度更新。

#### 3.3.2 背景:基础模型格局

为了正确评估 TimesFM 的可行性,我们必须将其置于更广泛的基础模型架构环境中,每种架构都通过不同的机制解决连续数据问题:

参考图标题 图 1:时间序列基础模型的架构差异。(A) TimesFM 将连续时间点聚合成密集向量(‘补丁’),保留局部数值语义。(B) Chronos 将值量化为离散区间。(C) Moirai 利用‘任意变量’注意力来处理可变数量的输入序列。Chronos(通过 LLM 进行量化):[2] Chronos 采用基于词汇表的方法,将连续时间序列值量化为固定的离散标记(区间),以训练标准的 T5 语言模型。虽然这允许它将预测视为分类任务并利用现有的 LLM 基础设施,但它引入了分辨率损失,在科学或能源领域至关重要的细微变化如果落在相同的量化区间内可能会被掩盖。

Moirai(任意变量注意力):[18] Moirai 使用任意变量注意力来针对时间序列的异构性(不同频率和变量数量)。与以单变量为中心的模型不同,Moirai 将多变量序列展平为单个序列,采用多个补丁大小的投影层。

相似文章

TimeRouter:高效自适应的时间序列基础模型路由

arXiv cs.LG

TimeRouter 提出了一种高效的时间序列基础模型路由框架,利用轻量级判别路由和选择性门控,无需大型语言模型(LLM)开销即可自适应选择最佳专家模型,在 GIFT-EVAL 排行榜上达到了最先进水平。

TS-Fault:针对结构性故障的时间序列预测器基准测试

arXiv cs.LG

本文介绍了TS-Fault,这是一个用于评估时间序列预测模型在结构化故障场景(如依赖关系断裂和机制变化)下的基准测试。研究发现,干净数据上的准确性通常与鲁棒性呈负相关,且基础模型特别脆弱。