多变量时间序列预测需要跨变量损失
摘要
本文识别了多变量时间序列直接预测中的目标差距,并提出CvLoss,一种即插即用的结构正则化器,它在跨变量图上约束预测残差,以提高同步和异步交互之间的一致性。实验表明,相对于有竞争力的预测模型,它带来了一致的改进。
arXiv:2608.05742v1 公告类型:新
摘要:多变量时间序列预测带来了独特的挑战,因为未来变量通常在共享系统动态下共同演化。虽然现有研究主要关注历史观测中的跨变量依赖性,但未来值之间的依赖性却很少被探索。具体而言,现代预测模型大多遵循直接预测(DF)范式,使用逐点目标生成多步预测,而这些目标并未显式约束跨变量结构。在这项工作中,我们表明在存在跨变量和滞后依赖的情况下,DF目标是不匹配的,从而揭示了一个目标差距。为了解决这个问题,我们提出了 \textbf{C}ross-\textbf{V}ariable \textbf{L}oss(CvLoss),一种即插即用的结构正则化器,它在跨变量图上约束预测残差。CvLoss惩罚预测块上不一致的逐边残差差异,鼓励同步和异步交互之间的一致性。我们的实验表明,CvLoss持续改进了有竞争力的预测模型,优于代表性的学习目标,并且与多种预测骨干兼容。
查看缓存全文
缓存时间: 2026/08/07 07:51
# 多变量时间序列预测需要跨变量损失 来源: https://arxiv.org/html/2608.05742 Kuiye Ding1, Yifan Hu2, Hanchen Wang1, Hao Xue3 1悉尼科技大学, 2清华大学, 3香港科技大学(广州) [email protected], [email protected] [email protected], [email protected] ###### 摘要 多变量时间序列预测面临独特挑战,因为未来变量通常在共享系统动态下协同演化。尽管现有研究主要关注历史观测中的跨变量依赖,但未来值之间的依赖关系却鲜有探索。具体而言,现代预测模型大多遵循直接预测(DF)范式,通过逐点目标函数生成多步预测,而这些目标并未显式约束跨变量结构。在本工作中,我们表明在存在跨变量和滞后依赖的情况下,DF目标存在失配,揭示了目标差距。为解决这一问题,我们提出了跨变量损失(CvLoss),一种即插即用的结构正则化器,在跨变量图上约束预测残差。CvLoss惩罚预测块上不一致的边级残差差异,鼓励同步和异步交互之间的一致性。实验表明,CvLoss持续改进具有竞争力的预测模型,优于代表性的学习目标,并与多种预测骨干架构兼容。 ## 1 引言 多变量时间序列预测(MTSF)是跨多个领域的基础任务,其核心挑战在于准确捕捉变量之间复杂的协同关系。为建模这些时间动态,近期开创性工作(Liu等人,2024 (https://arxiv.org/html/2608.05742#bib.bib1);Zhao和Shen,2024 (https://arxiv.org/html/2608.05742#bib.bib2);Qiu等人,2025a (https://arxiv.org/html/2608.05742#bib.bib3);Hu等人,2025a (https://arxiv.org/html/2608.05742#bib.bib4);Ding等人,2025 (https://arxiv.org/html/2608.05742#bib.bib5))主要致力于从历史输入特征中提取表示,这一范式称为输入侧通道依赖建模。与之形成鲜明对比的是,输出侧未来预测之间的内在相关性在很大程度上被忽视了。当前主流的直接预测(DF)范式(Wang等人,2025a (https://arxiv.org/html/2608.05742#bib.bib6))通常强制解耦多变量输出,将统一的历史嵌入独立投影到未来时间步,从而将MTSF退化为一系列孤立的标量预测问题。这种不对称性严重偏向输入而忽视输出。因此,它不仅割裂了未来变量之间的物理协同演化,还引入了严重的结构错误。 一方面,盲目解耦预测目标直接违背了多变量系统的内在物理和运行规律。在现实世界中,时间序列很少独立生成;相反,它们受共享系统动态支配,表现出强烈的协同演化特征。例如,在量化金融市场中(Hu等人,2025b (https://arxiv.org/html/2608.05742#bib.bib7)),当受到宏观经济冲击时(Hu等人,2025c (https://arxiv.org/html/2608.05742#bib.bib8)),相关资产的收益往往表现出高度同步的暴涨、暴跌或对冲效应。类似地,在交通流预测中,城市网络内数百个传感器记录的交通流量受共享气象条件(如突然的暴雨导致大范围拥堵)和同步的日常通勤模式驱动。这导致未来交通动态的深刻协同演化,如图5 (https://arxiv.org/html/2608.05742#A2.F5)所示。如果模型在输出阶段隔离这些变量,单个变量的预测曲线可能在数值上表现良好。然而,当它们组合成联合的多变量预测时,常常产生矛盾的结果,违反真实的物理约束和市场规律。 此外,忽视这些协同关系会在优化层面引入关键的结构错误。现代MTSF模型严重依赖逐点损失函数(如均方误差(MSE))(Wang等人,2024 (https://arxiv.org/html/2608.05742#bib.bib9);Qiu等人,2026 (https://arxiv.org/html/2608.05742#bib.bib10))进行优化。从概率推断的角度看,这种逐点优化从根本上基于一个高度受限的假设:所有变量和时间步上的预测残差遵循完全独立且各向同性的高斯分布(即具有对角协方差矩阵)。然而,鉴于上述协同演化现象,残差的真实时空协方差矩阵必然包含大量非零的非对角元素。这在现有标准损失函数与数据的真实联合时空分布之间造成了不可逾越的理论鸿沟,称为目标差距。因此,即使两个模型取得了非常相似的逐点MSE,它们的跨变量协方差结构也可能存在巨大差异,完全无法捕捉原始数据的联合几何拓扑。 为克服这些物理和数学上的双重缺陷,优化目标必须超越对绝对逐点精度的单一追求,显式约束变量之间的相对结构一致性。这意味着我们不仅要捕捉同一时间步上变量之间的并发交互(同步效应),还要捕捉系统扰动随时间演化的滞后传播(异步效应)。为优雅地统一这两种现象,我们引入图结构的视角,因为图天然适合描绘多变量数据中复杂的非均匀成对交互。 具体而言,我们提出一种新颖的基于图的结构正则化方案,称为跨变量损失(CvLoss)。通过构建跨变量图,CvLoss连接相同时间步上的不同变量以捕捉同步并发交互,同时连接不同时间步上的变量以建模异步滞后效应。本质上,CvLoss在预测残差场上施加ℓ₁范数图总变差(Graph TV)正则化,促使模型在最小化绝对误差的同时严格遵守潜在的相对结构一致性。 此外,作为即插即用的正则化器,CvLoss可无缝集成到各种主流预测架构中。我们引入的边采样机制显著降低了训练期间的计算复杂度,并且关键在于,该正则化器在推理期间零开销,确保测试速度完全不受影响,同时保持极高的预测精度。 我们的主要贡献总结如下: - • 我们揭示了当前MTSF范式中的关键局限性,证明标准的逐点学习目标忽略了未来预测中固有的通道间误差依赖。 - • 我们提出了一种新颖的跨变量损失作为结构正则化器,通过残差一致性公式显式约束预测值的通道间关系。 - • 大量实验表明,我们提出的目标持续改进各种最先进模型,以可承受的计算开销实现优越的预测性能。 ## 2 预备知识与相关工作 ### 2.1 问题定义 本文关注MTSF问题。全文使用斜体大写字母表示矩阵(如\(X\)、\(Y\)、\(Z\)、\(E\)),粗体小写字母表示向量(如\(\mathbf{e}\)),花体大写字母表示集合(如\(\mathcal{E}\)),小写字母表示标量和索引(如\(t\)、\(d\)、\(\alpha\));维度常量\(H\)、\(T\)、\(D\)、\(P\)、\(L\)和\(N\)按惯例用大写字母表示。 给定一个具有\(D\)个变量的多变量时间序列数据集,输入历史序列定义为\(X\in\mathbb{R}^{H\times D}\),真实标签序列定义为\(Y\in\mathbb{R}^{T\times D}\),其中\(H\)是回溯窗口长度,\(T\)是预测水平。现代时间序列预测模型主要在多任务学习方式下训练,称为直接预测(DF)范式。因此,目标是学习一个多输出预测器\(f_{\theta}:\mathbb{R}^{H\times D}\rightarrow\mathbb{R}^{T\times D}\),由预测骨干的可训练权重\(\theta\)参数化,同时为所有\(D\)个变量直接产生\(T\)步预测,得到预测值\(\hat{Y}=f_{\theta}(X)\)。与当前将多变量输出解耦为孤立标量预测的范式不同,我们的公式显式保持联合结构以捕捉跨通道依赖和共享时间动态。 ### 2.2 时间序列预测中的学习目标 近期学习目标通过形状对齐(Liu等人,2021 (https://arxiv.org/html/2608.05742#bib.bib11);Le Guen和Thome,2019 (https://arxiv.org/html/2608.05742#bib.bib12);Cuturi和Blondel,2017 (https://arxiv.org/html/2608.05742#bib.bib13))、似然最大化(Wang等人,2026a (https://arxiv.org/html/2608.05742#bib.bib14),2025b (https://arxiv.org/html/2608.05742#bib.bib15);Lange等人,2021 (https://arxiv.org/html/2608.05742#bib.bib16);Wang等人,2025a (https://arxiv.org/html/2608.05742#bib.bib6))、分布平衡(Pan等人,2026 (https://arxiv.org/html/2608.05742#bib.bib17);Wang等人,2026b (https://arxiv.org/html/2608.05742#bib.bib18))以及通过分解(Qiu等人,2025b (https://arxiv.org/html/2608.05742#bib.bib19))或局部步对齐(Xiong等人,2025 (https://arxiv.org/html/2608.05742#bib.bib20);Kudrat等人,2025 (https://arxiv.org/html/2608.05742#bib.bib21))进行的序列内建模,扩展了逐点MSE以捕捉时间动态。尽管有这些进展,现有方法从根本上将多变量预测视为孤立标量预测的集合。通过专门优化通道内时间结构,它们完全忽略了对跨变量依赖的显式约束。因此,这些方法未能捕捉多变量输出的联合几何结构和相关扰动。 ### 2.3 时间序列预测中的跨变量依赖 有效建模跨变量依赖是MTSF的基础(Wang等人,2024 (https://arxiv.org/html/2608.05742#bib.bib9);Liang等人,2024 (https://arxiv.org/html/2608.05742#bib.bib22))。现有范式通常采用通道依赖(CD)策略来显式捕捉通道间相关性,如iTransformer(Liu等人,2024 (https://arxiv.org/html/2608.05742#bib.bib1))、TSMixer(Chen等人,2023 (https://arxiv.org/html/2608.05742#bib.bib23))、Crossformer(Zhang和Yan,2023 (https://arxiv.org/html/2608.05742#bib.bib24))和TimesNet(Wu等人,2023 (https://arxiv.org/html/2608.05742#bib.bib25))等代表性架构。然而,CD模型常常过拟合虚假相关性,并难以应对无关变量的噪声干扰。为解决这一问题,近期进展引入通道偏置(CP)以选择性过滤依赖。例如,DUET(Qiu等人,2025a (https://arxiv.org/html/2608.05742#bib.bib3))提出通道聚类模块,通过频域软聚类过滤噪声通道。类似地,TimeFilter(Hu等人,2025a (https://arxiv.org/html/2608.05742#bib.bib4))构建了具有动态路由的块特定时空图,以保留关键相关性同时丢弃无关噪声。其他方法如MTGNN(Wu等人,2020 (https://arxiv.org/html/2608.05742#bib.bib26))和MCformer(Han等人,2024a (https://arxiv.org/html/2608.05742#bib.bib27))也探索了稀疏交互以平衡精度和效率。 尽管有这些显著改进,当前模型主要专注于从历史观测中提取表示(Zhao等人,2024 (https://arxiv.org/html/2608.05742#bib.bib28);Wei等人,2026 (https://arxiv.org/html/2608.05742#bib.bib29))。未来预测中复杂的结构几何和协同演化的跨变量依赖仍从根本上未被充分探索。 参见说明(a) 真实结构。 参见说明(b) 基线结构。 参见说明(c) CvLoss的改进。 参见说明(d) ECL快照。 图1:ECL上的激励示例,输入长度\(H=96\),预测水平\(T=96\)。(a, b) 真实未来序列与普通iTransformer(Liu等人,2024 (https://arxiv.org/html/2608.05742#bib.bib1))预测序列的跨变量相关结构。(c) 使用CvLoss训练的相同骨干在结构误差上小于普通基线的条目,覆盖所有跨变量条目的\(84.83\%\)。(d) 代表性变量的预测快照。用于计算(a)–(c)的协议定义于附录B.3 (https://arxiv.org/html/2608.05742#A2.SS3)。 ## 3 方法 ### 3.1 动机 现代时间序列预测模型主要在多任务学习方式下训练,称为直接预测(DF)范式(Wang等人,2025a (https://arxiv.org/html/2608.05742#bib.bib6))。给定输入历史\(X\in\mathbb{R}^{H\times D}\),多输出预测器\(f_{\theta}:\mathbb{R}^{H\times D}\rightarrow\mathbb{R}^{T\times D}\)直接为\(D\)个变量产生\(T\)步预测:\(\hat{Y}=f_{\theta}(X)\)。标准训练目标是逐点MSE: \[\mathcal{L}_{\mathrm{df}}=\frac{1}{T}\sum_{t=1}^{T}\frac{1}{D}\|Y_{t,:}-\hat{Y}_{t,:}\|_{2}^{2}\quad(1)\] 该目标简单有效,但只惩罚单个时间-变量条目上的预测误差。尽管现代预测架构可能通过共享参数隐式捕捉跨变量交互,但此类依赖并未在式(1 (https://arxiv.org/html/2608.05742#S3.E1))的目标中显式体现,该式并未约束跨变量的*相对误差结构*。因此,具有相似逐点MSE的两个模型仍可能表现出截然不同的跨变量相关模式。 图1(a) (https://arxiv.org/html/2608.05742#S2.F1.sf1)在ECL上具体展示了这一点。面板(a)和(b)显示了真实未来窗口与使用MSE训练的普通iTransformer预测窗口的跨变量相关矩阵:预测矩阵明显更平坦,并且错置了大量非对角结构,尽管该模型的逐点误差具有竞争力。面板(c)标记了使用我们目标训练的相同骨干更准确地恢复相关性的条目,覆盖所有跨变量条目的\(84.83\%\),面板(d)显示了相应的预测快照。因此,未来窗口的相关结构是逐点目标在很大程度上未加约束的东西,也是可以在不改变...的情况下改进的东西。
相似文章
Exogenous Dropout: 一个简单且强大的基线方法,用于带有协变量的抗腐蚀时间序列预测
提出外生丢弃(exogenous dropout)——一种简单的训练干预方法,在训练期间随机将整个外生通道归零——以提高时间序列预测模型对协变量被破坏的鲁棒性。该方法在多种破坏类型和领域上匹配或超越更复杂的架构。
CARNet:面向多元时间序列预测的周期条件核心聚合与再分配
CARNet将全局循环周期信息整合到高效的核心交互建模中,用于多元时间序列预测,实现了线性复杂度,并在实际基准测试中优于强大的Transformer基线模型。
重新思考多模态时间序列预测评估
介绍了TimesX,这是一个新的多模态时间序列预测基准,包含多样化的真实世界数据和文本上下文,解决了泛化、数据泄露和上下文多样性问题。
超越整体模型:深度多元时间序列预测的系统组件级基准测试
本文介绍了TSCOMP,一个大规模基准测试,系统地将深度多元时间序列预测方法分解为细粒度组件,以实现自动化模型选择,性能优于复杂的整体架构。
交换关联泛函的导数信息学习
这篇ICML 2026论文介绍了Derivative Informed XC-Loss(DI-Loss),这是一种用于机器学习交换关联泛函的训练方法,它在密度矩阵的格拉斯曼流形上引入了一阶和二阶导数监督。在四种架构上,与仅使用能量和密度监督相比,DI-Loss将总能量平均绝对误差(MAE)降低了66%,并改善了TDDFT计算中的激发态预测。