使用结构化时间融合提升层次时间序列预测中的一致性
摘要
提出层次时间融合(HTF),它是时间融合Transformer的扩展,整合了感知一致性的损失函数,确保预测在层次结构各层级之间保持一致,在基准数据集上实现了更高的准确性和一致性。
arXiv:2606.28553v1 公告类型:新
摘要:在许多实际应用中,如零售销售、能源使用和供应链规划,预测是在层次结构上进行的。这些结构通常表示聚合(例如,从产品到类别到区域),其中预测不仅必须准确,还必须保持一致,即低层预测正确求和得到高层预测。传统的统计方法,如自底向上和MinT,通过后处理强制一致性,但未能建模复杂的非线性时间依赖关系和协变量交互。
我们提出层次时间融合(HTF),这是时间融合Transformer(TFT)的一种新颖扩展,它将结构化层次嵌入与感知一致性的损失函数相结合,以确保层次结构中所有层级的预测一致。HTF不是在预测后应用协调,而是将一致性直接嵌入训练目标中。在训练期间,一致性损失惩罚聚合子预测与其对应父预测之间的差异,使模型能够同时学习时间动态和结构一致性。
我们在两个公开可用的基准数据集上评估HTF:M5 Walmart预测数据集和一个公开可用的层次能源消耗数据集。结果表明,与经典的协调方法和深度学习基线相比,HTF显著降低了预测不一致性,同时提高了预测准确性。此外,注意力可视化和嵌入分析揭示了时间和结构信息如何对层次预测性能做出贡献。
查看缓存全文
缓存时间: 2026/06/30 05:28
# 使用结构化时间融合改进分层时间序列预测中的一致性
来源:https://arxiv.org/html/2606.28553
## I摘要
在许多现实世界的应用中,例如零售销售、能源使用和供应链规划,预测是在分层结构上进行的。这些结构通常代表聚合(例如,产品→类别→区域),其中预测不仅必须准确,还必须具有一致性,这意味着较低层级的预测正确求和到较高层级的预测。传统的统计方法(例如,自底向上、MinT)通过后处理强制执行一致性,但它们无法对复杂的非线性时间依赖性和协变量交互进行建模。
我们提出了分层时间融合(HTF),这是时间融合变换器(TFT)的一个新颖扩展,它集成了结构化分层嵌入和一致性感知损失函数,以确保层级结构中所有层级的一致性预测。我们不是事后应用协调,而是将一致性作为训练目标中的第一类约束嵌入。我们的一致性损失在训练过程中惩罚子预测的聚合与父预测之间差异的L2范数,使模型能够同时学习时间动态和结构一致性。
我们在两个公开可用的基准数据集上评估了HTF:M5沃尔玛预测数据集和一个公开可用的分层能源消耗数据集。
1. 1.沃尔玛M5竞赛数据集,具有丰富的层级结构,物品按类别和商店随时间分组
2. 2.一个多级能源数据集,捕获变电站、城市和区域的小时电力消耗。
我们的结果表明,与基线模型和经典协调技术相比,HTF显著减少不一致性,同时提高预测准确性。通过注意力可视化和嵌入投影等可解释工具,我们深入了解了在分层预测场景中时间和结构特征如何交互。
## II关键词
时间序列预测、分层预测、一致性损失、时间融合变换器、结构化嵌入、深度学习
## III引言
预测是跨领域战略决策的核心,例如供应链优化、能源电网管理、零售规划和公共政策。在许多这些设置中,数据本质上是分层的:销售按SKU记录并向上汇总到类别和区域;电力使用在变电站追踪并在城市和国家层面聚合。这种结构对预测系统引入了一个关键要求:预测必须在各层级上既准确又一致。
一致性预测指的是较低层级预测在聚合时应与较高层级预测匹配的性质。传统的分层时间序列(HTS)预测方法,如自底向上、自顶向下和MinT(最小迹协调),试图通过后处理来满足一致性:它们独立地为每个节点生成预测,并在事后协调不一致性。然而,这些方法忽略了时间动态、非线性依赖关系和外部变量,而这些在现实世界数据中通常起着关键作用。
随着深度学习在时间序列预测中的出现,像时间融合变换器(TFT)这样的模型通过结合门控循环单元、注意力机制和静态/动态协变量嵌入,取得了最先进的性能。然而,TFT是为平面、非结构化时间序列设计的,并未考虑分层数据集中存在的结构关系。
在本文中,我们提出了分层时间融合(HTF),这是TFT的一个原则性扩展,包含:
1. 1.结构化分层嵌入,其中每个时间序列在层级结构中的标识和位置被编码为可学习向量。
2. 2.一致性感知损失函数,通过直接最小化每个时间步上父预测与其子预测之和之间的差异来确保一致性。
3. 3.可扩展架构,保留TFT的可解释性,并能建模外部特征、变量重要性和基于注意力的依赖关系。
设:
- • \(y_t^{(p)}\) 为父节点 p 在时间 t 的预测值
- • \(\{y_t^{(c_1)},y_t^{(c_2)},\ldots,y_t^{(c_n)}\}\) 为其 n 个子节点在同一时间步的预测值
则一致性损失定义为:
\[
\mathcal{L}_{\text{coherence}} = \sum_{t=1}^T \sum_{p \in \mathcal{P}} \left(y_t^{(p)} - \sum_{c \in \text{children}(p)} y_t^{(c)}\right)^2 \quad (1)
\]
将其添加到标准预测损失中,得到总损失:
\[
\mathcal{L}_{\text{total}} = \mathcal{L}_{\text{forecast}} + \lambda \cdot \mathcal{L}_{\text{coherence}} \quad (2)
\]
其中 \(\lambda\) 是控制准确性与一致性之间权衡的超参数。
### III-A 研究贡献
本工作的主要贡献总结如下:
1. 1.我们提出了**分层时间融合(HTF)**,这是时间融合变换器(TFT)的一个新颖扩展,专门为分层时间序列预测设计。
2. 2.我们引入了**一致性感知训练目标**,将分层一致性直接纳入模型优化,消除了事后协调的需要。
3. 3.我们开发了**结构化分层嵌入**,对节点标识和分层位置进行编码,使模型能够学习跨聚合级别的结构关系。
4. 4.我们在两个现实世界的分层预测数据集上评估了HTF,涵盖零售需求预测和能源消耗预测。
5. 5.实验结果表明,与经典协调方法和深度学习基线相比,在预测准确性和分层一致性方面均有改进。
## IV相关工作
### IV-A 分层时间序列预测(HTS)
预测分层结构化时间序列一直是计量经济学和运筹学中的一个重要问题。目标不仅是在层级的每个级别生成准确的预测,还要确保一致性——即子节点的预测应求和到其父节点的预测。
传统方法包括:
- •**自底向上**:仅在最低(叶子)级别生成预测,然后向上聚合。它很简单,但忽略了较高级别可用的有用信息。
- •**自顶向下**:从层级顶部开始预测,然后使用历史比例将预测向下分解到树中。这容易导致误差传播。
- •**中间向外**:在中间级别进行预测,然后向上和向下协调层级。
- •**MinT(最小迹协调)**:由 Hyndman 等人 [2011] 提出,MinT 是一种统计协调方法,它在所有级别独立生成基础预测,然后使用线性变换调整它们以最小化总预测方差:\(\hat{\mathbf{y}}^{\text{reconciled}} = \mathbf{S} \mathbf{G} \hat{\mathbf{y}}\),其中:
- \(\hat{\mathbf{y}}\) 是基础预测向量
- \(\mathbf{S}\) 是编码层级的求和矩阵
- \(\mathbf{G}\) 是协调矩阵,通常使用预测误差的协方差矩阵推导
虽然有效,但这些技术假设线性关系,忽略时间动态、多变量协变量和上下文信息。
### IV-B 与现有方法的比较
表I (https://arxiv.org/html/2606.28553#S4.T1) 总结了HTF与现有分层预测方法之间的关键差异。
**表 I:分层预测方法的比较**
与现有方法不同,HTF将分层结构直接纳入表示学习中,同时在优化过程中强制执行一致性,而不是依赖后处理协调。
### IV-C 用于时间序列预测的深度学习
诸如RNN、LSTM、GRU以及最近的Transformer等深度学习方法通过学习非线性时间依赖关系并实现多变量建模,彻底改变了时间序列预测。这些模型在非结构化场景中表现出色,但在分层组织设置中则显不足,除非进行显式修改。
由Google Cloud AI [Lim et al., 2021] 提出的时间融合变换器(TFT)是该领域最具表达力和可解释性的架构之一。它集成了:
- •用于处理静态和时间协变量的门控残差网络(GRN)
- •用于捕捉长期依赖关系的多头注意力
- •用于特征级可解释性的变量选择网络
- •用于概率预测的分位数损失
尽管取得了成功,TFT在平面时间序列上运行,当应用于分层数据时无法强制实施一致性等结构约束。
### IV-D 分层时间序列的深度学习:差距与挑战
只有有限的尝试将分层建模与深度学习联系起来。一些努力包括:
- •使用LSTM或CNN独立建模每个节点(无一致性强制)
- •使用GNN在节点关系之间传播时间信息
- •使用MinT或自顶向下调整事后协调深度学习预测
这些方法中没有一个将一致性嵌入到学习过程中,也没有将时间建模与可学习的结构意识相结合。
我们的工作扩展了TFT,通过:
- •引入结构化分层嵌入,对节点标识及其在树结构中的位置进行编码。
- •设计一致性感知损失函数,在训练过程中惩罚不一致的预测。
- •保留TFT的可解释性,同时使其能够建模分层、多变量数据。
这使得我们的方法完全端到端、可解释且可扩展,适用于实际的分层时间序列应用。
## V方法学:分层时间融合变换器(HTF)
### V-A 问题定义
设层级结构由一组节点 \(\mathcal{N}\) 表示,其中每个节点 \(i \in \mathcal{N}\) 对应一个时间序列。层级结构形成一棵树,具有从子节点到父节点的有向边。
每个节点 i 具有:
1. 1.观测值 \(y_t^{(i)}\),时间戳 \(t=1,2,\ldots,T\)
2. 2.外部协变量 \(\mathbf{x}_t^{(i)}\)
3. 3.父节点 \(\text{parent}(i)\)(如果适用)
目标是预测未来值 \(\hat{y}_{T+1:T+H}^{(i)}\),预测期 H,使得:
- •预测准确
- •预测一致,即对于每个非叶子节点:\(\hat{y}_t^{(p)} \approx \sum_{c \in \text{children}(p)} \hat{y}_t^{(c)} \quad \forall t \in [T+1,T+H]\) (3)
### V-B 模型架构
所提出的分层时间融合(HTF)扩展了时间融合变换器(TFT)[Lim et al., 2021],以处理具有显式一致性约束的结构化时间序列层级结构。
如图2(HTF模型架构)所示,模型由四个主要阶段组成:
1. 1.数据源和特征嵌入,
2. 2.用于时间推理的TFT核心,
3. 3.一致性感知损失模块,
4. 4.所有层级级别的最终一致预测。
这种端到端设计确保了时间动态和层级一致性在训练过程中联合优化。
请参考标题
图1:分层融合变换器概述
请参考标题
图2:HTF模型架构
### V-C 结构化分层嵌入
每个节点 \(i \in \mathcal{N}\) 接收一个可学习嵌入向量 \(\mathbf{e}^{(i)}\),表示其标识、级别和祖先关系。这些嵌入与静态协变量连接,并传入TFT的静态编码器。可学习嵌入向量表示为:
\[
\mathbf{e}^{(i)} = \mathbf{e}^{\text{node}}(i) + \mathbf{e}^{\text{level}}(\text{Level}(i)), \quad (4)
\]
其中 \(\mathbf{e}^{\text{node}}(i)\) 对节点 i 的身份进行编码,\(\mathbf{e}^{\text{level}}(\cdot)\) 捕捉其层级级别(例如,SKU、类别、商店、区域)。
附加输入处理如下:
- •静态元数据(\(\mathbf{s}^{(i)}\),例如产品类别、位置)→ 静态嵌入。
- •动态协变量(\(\mathbf{x}_t^{(i)}\),例如价格、天气、节假日)→ 时间嵌入。
- •目标序列(\(y_t^{(i)}\))→ 直接作为数值序列传递。
所有嵌入连接成一个组合特征表示:
\[
\mathbf{z}_t^{(i)} = [\mathbf{e}^{(i)}; \mathbf{s}^{(i)}; \mathbf{x}_t^{(i)}; y_{t-1}^{(i)}], \quad (5)
\]
作为TFT核心的输入。
这允许模型:
- •区分节点
- •学习结构相似节点之间的关系(例如,同一类别中的产品)
### V-D 时间融合变换器核心
TFT核心对短期和长期依赖关系进行建模,同时保留可解释性。它包括:
1. 1.变量选择网络:动态选择每个时间步最相关的协变量。
2. 2.局部序列编码器(LSTM):捕捉短期记忆,\(\mathbf{h}_t^{(i)} = \text{LSTM}(\mathbf{z}_{1:t}^{(i)})\)
3. 3.多头注意力:学习跨历史窗口的长期依赖关系。
4. 4.分位数解码器:在分位数 \(q \in \{0.1, 0.5, 0.9\}\) 输出概率预测:\(\hat{y}_{t,q}^{(i)} = f_{\text{decoder}}(\mathbf{h}_t^{(i)})\)
因此,TFT核心为每个节点生成每个预测期的预测。
### V-E 一致性感知损失
虽然时间融合变换器(TFT)核心捕捉时间依赖关系并为每个节点独立生成预测,但分层结构需要一个额外约束:父节点的预测必须与其子节点之和一致。如果不这样做,模型可能在叶子级别取得良好精度,但会产生不一致的聚合(例如,商店级别销售额与区域总销售额不匹配)。
为了解决这个问题,我们引入了一个一致性感知损失项,明确惩罚层级结构中的不一致性。
\[
\hat{y}_t^{(p)} \approx \sum_{c \in \mathcal{C}(p)} \hat{y}_t^{(c)} \quad (6)
\]
设:
- • \(\hat{y}_t^{(p)}\):父节点 p 在时间 t 的预测值。
- • \(\hat{y}_t^{(c_1)}, \hat{y}_t^{(c_2)}, \ldots, \hat{y}_t^{(c_n)}\):子节点 c_1,...,c_n 的预测值
- • \(\mathcal{P}\):层级结构中父节点的集合。
一致性约束要求:
\[
\hat{y}_t^{(p)} \approx \sum_{c \in \text{children}(p)} \hat{y}_t^{(c)} \quad (7)
\]
我们在训练过程中通过一个一致性惩罚项来强制执行这一要求:
\[
\mathcal{L}_{\text{coherence}} = \sum_{t=T+1}^{T+H} \sum_{p \in \mathcal{P}} \left(\hat{y}_t^{(p)} - \sum_{c \in \text{children}(p)} \hat{y}_t^{(c)}\right)^2
\]相似文章
CoRe:多元时间序列预测中的连贯性与关系对齐
CoRe 提出了一种模型无关的学习目标,用于多元时间序列预测,该目标使用频率连贯性和关系图损失来提高预测精度,优于标准方法。
嵌套时空时间序列预测
本文提出一种嵌套时空预测框架,利用谱聚类构建语义一致的宏观区域,为细粒度的微观预测提供自上而下的指导。在高维数据集上的实验表明,该方法始终优于最先进的基线模型。
THGFM:双分支时序异构图融合模型
THGFM 是一种双分支时序异构图融合模型,结合了共享空间注意力、关系类型分区注意力与旋转时序注意力,在学术图基准测试上优于基线模型。
HARN:用于事件驱动多时间框架预测的分层关联共振网络
本文介绍了HARN,一个用于金融时间序列事件驱动多时间框架预测的分层关联共振网络,通过多个资产的评估,显示出与基线相比具有竞争力的结果。
使用混合摊销推理加速层次化稀疏预测编码
本文提出了一种混合摊销推理方法,通过结合快速初始估计和校正优化步骤,加速了层次化稀疏预测编码,比纯迭代或摊销方法更高效。