CoRe:多元时间序列预测中的连贯性与关系对齐
摘要
CoRe 提出了一种模型无关的学习目标,用于多元时间序列预测,该目标使用频率连贯性和关系图损失来提高预测精度,优于标准方法。
arXiv:2609.19670v1 公告类型:新 \n摘要:直接预测已成为多元时间序列预测的标准范式,因为它在一次传递中预测整个未来时间范围。然而,其训练目标通常仍然分解为点级误差,如MSE。此类目标提供稳定的监督,但并未显式保持未来轨迹的结构:每个变量内的时间连贯性和变量间的关系一致性都可能被削弱。我们提出CoRe,一种用于直接多元预测的模型无关学习目标。CoRe 用两个输出空间约束替代了点级监督:一个频率连贯性损失,对齐预测和目标频谱;以及一个低秩关系图损失,匹配在目标派生的PCA子空间中采样的成对差异。由此产生的目标不引入可训练参数,仅通过更改损失即可应用于现有的预测骨干网络。在标准基准上的实验表明,CoRe 改进了强大的基线,与最近的预测目标相比表现良好,并且在不同的骨干网络、数据集和超参数设置中整体上保持一致的有效性。
查看缓存全文
缓存时间: 2026/09/18 09:02
# CoRe:多变量时间序列预测中的连贯性与关系对齐 来源:https://arxiv.org/html/2609.19670 作者:林晓宇、段慧然、刘一宁、吴志祥、林楚、陆琳 所属机构:纽约城市大学(美国)、加州大学伯克利分校(美国)、埃默里大学(美国)、三峡大学计算机与信息学院(中国) \*通讯作者\. 电子邮箱:[[email protected]](mailto:) ###### 摘要 直接预测因其单次推理即可预测完整未来时间范围,已成为多变量时间序列预测的标准范式。然而,其训练目标通常仍分解为点对点误差(如MSE)。这类目标虽提供稳定监督,却未显式保留未来轨迹的结构:每个变量内的时间连贯性与变量间的关系一致性均可能被削弱。本文提出CoRe——一种与模型无关的直接多变量预测学习目标。CoRe以两个输出空间约束替代点对点监督:频域连贯性损失(对齐预测与目标频谱)和低秩关系图损失(在目标主成分子空间中匹配采样点对差异)。该目标不引入可训练参数,仅通过替换损失函数即可应用于现有预测主干网络。标准基准实验表明,CoRe能提升强基线性能,与最新预测目标相比具有竞争力,且在不同主干网络、数据集和超参数设置下均保持有效性。 ###### 关键词: 多变量时间序列预测;关系对齐;频域学习 ## 1 引言 深度学习正在广泛变革研究领域[63,25,52,27,26,30,59,54,20]。多模态学习与高性能人工智能领域进展尤为迅速[29,28,19,7,8,12],这些突破为改进和拓展科学计算方法创造了新可能[21,23,56,53,55]。多变量时间序列预测是能源系统、交通网络、气象学和工业监测的核心问题。该任务旨在基于多个相关变量的历史观测,预测它们在目标时间范围内的未来演变。近期预测模型通过更强的时间编码器、通道交互模块和可扩展架构提升了预测精度[35,34,50,22]。在预测范式中,直接预测因其单次推理即可预测完整未来范围、避免迭代预测的误差累积并支持高效训练与推理,尤为引人关注。 尽管架构层面持续进步,训练直接预测模型的目标函数仍相对简单。标准损失函数(如MSE)将未来输出分解为点对点误差。虽然这种方法简便,但未显式匹配多变量未来的结构。在时间维度上,未来标签具有自相关性并常包含周期性或长程模式;在变量维度上,通道因共享潜在因子(如交通网络中相邻传感器或电力系统中的相关负载)而相互耦合。因此,模型虽能降低点对点误差,却可能产生时序轮廓扭曲或跨变量几何结构弱化的预测结果。 近期研究通过重新审视学习目标开始弥补这一缺陷。频域目标(如FreDF)和依赖感知目标(如Time-o1)表明,建模未来标签结构无需改变骨干网络即可提升直接预测性能。然而,这些目标主要关注每个变量内的时序依赖。对于多变量时间序列预测,预测的未来同时也是联合多变量对象,其跨变量结构通常由架构处理,而非在输出层面显式正则化。 我们提出CoRe——一种适用于直接多变量预测的模型无关目标。CoRe不独立监督每个未来值,而是通过两个互补的输出空间约束训练模型:频域连贯性损失沿未来范围对齐预测与目标频谱,以促进全局时间一致性;低秩关系图损失将预测和目标投影至目标导出的主成分子空间,并匹配采样点对的潜在成分差异,为跨变量几何结构提供可扩展的监督。CoRe是即插即用的目标函数:不引入可训练参数,通过替换原生损失即可应用于Transformer、MLP和CNN等代表性主干网络。 我们的贡献总结如下: - • 识别直接多变量预测中的输出层面目标缺口:点对点损失未显式保留直接预测输出中未来范围的连贯性或跨变量关系一致性。 - • 提出CoRe——一种结合频域连贯性损失与高效低秩关系图对齐的模型无关目标,无需增加可训练参数或修改骨干网络架构。 - • 在标准多变量预测基准上验证CoRe,证明其在多个数据集和预测范围下,对强基线、竞争性目标级方法及多种预测主干网络均有提升。 ## 2 相关工作 ### 2.1 多变量时间序列预测架构与跨变量依赖建模 多变量时间序列预测需同时建模时序动态和变量间依赖[37,5]。早期统计方法[49,1]已被深度架构大幅扩展,包括RNN[40]、CNN[50]、GNN[9]、MLP[61,48,47]和Transformer[22,24,4,58,18]等。这些模型的核心问题是如何表示跨变量依赖。通道依赖方法显式建模跨通道交互[62,34],而近期通道局部性方法则过滤噪声或冗余依赖(如DUET的频域聚类[39]和TimeFilter的特定片段路由图[10])。 这些方法主要改进了骨干网络从历史观测中提取依赖的方式。CoRe与此互补:它不修改骨干网络,而是正则化预测未来本身的结构。这一区别至关重要,因为模型可能学到有效历史依赖,同时在预测时生成的输出几何结构却偏离目标未来范围。 ### 2.2 直接预测目标 对于多步预测,迭代预测递归预测未来值并自然保留标签自回归性,但存在误差累积问题[14,41]。直接预测因其高效性和经验优势被广泛采用[32,35,34],但标准训练通常将未来范围分解为点对点目标,削弱了对未来标签依赖的显式监督。 近期学习目标从不同角度解决此限制:基于形状的目标对齐时序轨迹[33,2],分布感知目标改善概率或似然监督[44,42,36,45],局部目标对齐时间步或片段[57,13]。FreDF将直接预测监督转移至频域[43],Time-o1进一步研究未来时序依赖的目标级建模[42]。相关频谱模型(如Autoformer[51]、FedFormer[64]和FreTS[60])也证明频域表示能捕捉周期性和长程结构。与这些目标不同,CoRe在输出空间联合正则化未来范围连贯性和跨变量关系几何。 ## 3 提出的方法论 ### 3.1 问题表述与目标缺口 设X∈RB×L×D\\mathbf{X}\\in\\mathbb{R}^{B×L×D}表示历史观测批次,其中B为批大小,L为回溯长度,D为变量数。给定预测主干fθf_{θ},直接预测生成完整未来序列Y^=fθ(X)∈RB×T×D\\hat{\\mathbf{Y}}=f_{θ}(\\mathbf{X})\\in\\mathbb{R}^{B×T×D},对应目标Y∈RB×T×D\\mathbf{Y}\\in\\mathbb{R}^{B×T×D}。 大多数直接预测模型采用点对点损失(如MSE或MAE)训练。这些目标虽为有效标量准则,但未显式约束Y^\\hat{\\mathbf{Y}}的联合结构。我们聚焦两个缺失的输出层面约束:首先,未来范围具有时序结构,相邻及周期性标签存在相关性,匹配孤立时间步可能对全局轨迹约束不足;其次,多变量输出具有关系结构,变量应保留共享潜在因子诱导的相对模式。CoRe通过在输出空间用频域连贯性和低秩关系图对齐替代点对点监督来填补此目标缺口。 图1 (https://arxiv.org/html/2609.19670#S3.F1)展示了CoRe的整体框架。 参见图1:CoRe的整体框架,包括频域连贯性和低秩关系图对齐。 ### 3.2 频域连贯性损失 第一个组件通过沿时间维度对目标和预测轨迹应用一维实快速傅里叶变换,在序列层面对其预测和目标: Y~=F(Y),Y~^=F(Y^),\\tilde{\\mathbf{Y}}=\\mathcal{F}(\\mathbf{Y}),\\hskip 10.00002pt\\hat{\\tilde{\\mathbf{Y}}}=\\mathcal{F}(\\hat{\\mathbf{Y}}), (1) 其中Y~,Y~^∈CB×F×D\\tilde{\\mathbf{Y}},\\hat{\\tilde{\\mathbf{Y}}}\\in\\mathbb{C}^{B×F×D},F=⌊T/2⌋+1F=\\lfloor T/2\\rfloor+1。 频域连贯性损失在所有批次、频率和观测变量上平均复模距离: Lfreq=1BFD∑b=1B∑f=1F∑d=1D∥Y~^b,f,d−Y~b,f,d∥\\.\\mathcal{L}_{freq}=\\frac{1}{BFD}\\sum_{b=1}^{B}\\sum_{f=1}^{F}\\sum_{d=1}^{D}\\left\\|\\hat{\\tilde{\\mathbf{Y}}}_{b,f,d}-\\tilde{\\mathbf{Y}}_{b,f,d}\\right\\|. (2) 由于该损失比较频谱而非单个时间步,它约束了预测轨迹的振幅和相位信息。这促进了全局时间一致性(包括周期性和长程演变),同时独立于预测主干网络。 ### 3.3 低秩关系图对齐 第二个组件保留输出空间中的跨变量结构。直接匹配所有D个变量的点对关系成本为O(BTD2)\\mathcal{O}(BTD^{2}),且可能对高维噪声相关敏感。遵循近期显式保留跨变量关系结构的研究[6],我们在目标导出的低秩关系子空间中执行对齐。 对于每个训练批次,我们将目标序列沿批次和时间维度中心化。设Y ̄∈R1×1×D\\bar{\\mathbf{Y}}\\in\\mathbb{R}^{1×1×D}为目标均值,V∈RD×k\\mathbf{V}\\in\\mathbb{R}^{D×k}包含从目标侧变量协方差计算出的前k个标准正交主方向。我们用相同基投影预测和目标: Z=(Y−Y ̄)V,Z^=(Y^−Y ̄)V,\\mathbf{Z}=(\\mathbf{Y}-\\bar{\\mathbf{Y}})\\mathbf{V},\\hskip 10.00002pt\\hat{\\mathbf{Z}}=(\\hat{\\mathbf{Y}}-\\bar{\\mathbf{Y}})\\mathbf{V}, (3) 其中Z,Z^∈RB×T×k\\mathbf{Z},\\hat{\\mathbf{Z}}\\in\\mathbb{R}^{B×T×k}。共享目标导出的中心化和投影为两者提供了关系比较的通用坐标系。 接着我们采样无序潜在成分对E⊂{1,...,k}2\\mathcal{E}\\subset\\{1,\\ldots,k\\}^{2},并匹配每个采样对的一阶差: Lgraph=1BT|E|∑b=1B∑t=1T∑(i,j)∈E∥(Z^b,t,i−Z^b,t,j)−(Zb,t,i−Zb,t,j)∥\\.\\mathcal{L}_{graph}=\\frac{1}{BT|\\mathcal{E}|}\\sum_{b=1}^{B}\\sum_{t=1}^{T}\\sum_{(i,j)\\in\\mathcal{E}}\\left\\|\\left(\\hat{\\mathbf{Z}}_{b,t,i}-\\hat{\\mathbf{Z}}_{b,t,j}\\right)-\\left(\\mathbf{Z}_{b,t,i}-\\mathbf{Z}_{b,t,j}\\right)\\right\\|. (4) 该低秩差分损失惩罚相对潜在响应的偏差而非孤立通道值。投影后,随机边采样将点对比较成本从O(BTk2)\\mathcal{O}(BTk^{2})降至O(BT|E|)\\mathcal{O}(BT|\\mathcal{E}|),使关系
相似文章
多变量时间序列预测需要跨变量损失
本文识别了多变量时间序列直接预测中的目标差距,并提出CvLoss,一种即插即用的结构正则化器,它在跨变量图上约束预测残差,以提高同步和异步交互之间的一致性。实验表明,相对于有竞争力的预测模型,它带来了一致的改进。
使用结构化时间融合提升层次时间序列预测中的一致性
提出层次时间融合(HTF),它是时间融合Transformer的扩展,整合了感知一致性的损失函数,确保预测在层次结构各层级之间保持一致,在基准数据集上实现了更高的准确性和一致性。
CARNet:面向多元时间序列预测的周期条件核心聚合与再分配
CARNet将全局循环周期信息整合到高效的核心交互建模中,用于多元时间序列预测,实现了线性复杂度,并在实际基准测试中优于强大的Transformer基线模型。
SCoR:一种用于预测科学概念之间关系的层次框架
本文介绍了SCoR,一种用于预测科学概念之间关系的层次框架,其中包含一个基准和模型,通过预测类型化关系来改进研究方向的发现。
ReCoLoRA:面向连续大语言模型微调的频谱感知递归整合方法
ReCoLoRA 是一个频谱感知框架,用于大型语言模型的连续微调。它通过递归整合低秩适配器来防止灾难性遗忘,在多个骨干网络的连续 GLUE 任务上取得了更优的性能。