Exogenous Dropout: 一个简单且强大的基线方法,用于带有协变量的抗腐蚀时间序列预测

arXiv cs.LG 论文

摘要

提出外生丢弃(exogenous dropout)——一种简单的训练干预方法,在训练期间随机将整个外生通道归零——以提高时间序列预测模型对协变量被破坏的鲁棒性。该方法在多种破坏类型和领域上匹配或超越更复杂的架构。

arXiv:2607.05452v1 公告类型: 新 摘要: 使用外生协变量的时间序列预测器在实际部署中很脆弱:当这些协变量受到噪声污染、时间错位或缺失时,强化的外生融合和外生自适应模型的性能可能严重退化,甚至低于仅使用内生变量的基本水平。我们研究这种鲁棒性是否需要专门的架构,还是可以通过简单的训练干预获得。我们提出外生丢弃(exogenous dropout),一种与模型无关的方法,在训练期间随机将整个外生通道归零。在电价预测、水库水文学和气象学中,外生丢弃显著提升了模型在加性高斯噪声、时间错位和完全缺失通道情况下的鲁棒性,同时保持干净数据上的准确性。将其应用于双相关网络时,它在我们的实验中产生了最鲁棒的模型,超越了刻意设计的强架构基线 BoundEx,后者结合了可学习门控、回退到内生骨干的残差路径以及逐通道外生 FiLM 调制。架构-丢弃消融实验、门控行为诊断以及表示层面的界分析表明,显式的架构有界性对于这种鲁棒性并非必需:使用外生丢弃训练的无界模型在每个领域都比有界模型更鲁棒。我们发布一个破坏鲁棒性基准,并推荐外生丢弃作为未来协变量时间序列预测工作的简单且强大的基线。
查看原文
查看缓存全文

缓存时间: 2026/07/08 04:43

# 外生丢失:一种针对协变量损坏鲁棒时间序列预测的简单强基线
来源:https://arxiv.org/html/2607.05452
胡浩 1 ^1 艾学山 1,2, \*1 武汉大学水资源工程与调度全国重点实验室,武汉 430072,中国 2 湖北省海绵城市建设水系统科学重点实验室(武汉大学),武汉 430072,中国 \*通讯作者。

###### 摘要

整合外生协变量的时间序列预测器在部署中很脆弱:当这些协变量被损坏——添加噪声、时间错位或缺失——时,最先进的外生融合和自适应模型(TimeXer, DAG, iTransformer, CrossLinear)在电力价格预测上的性能下降幅度比仅使用内生变量的基线高出 32–62%。越来越多的研究工作通过越来越复杂的架构来应对,这些架构对外生路径进行限制、门控或掩码。我们表明,这些架构优势在很大程度上可以被一个单行、模型无关的训练干预所匹配或超越:**外生丢失**,即在训练期间随机将整个外生通道置零。它在几乎所有测试架构上都能恢复鲁棒性,且对清洁准确度的影响可以忽略不计;当应用于现有双相关网络(DAG)时,它产生了我们研究中最为鲁棒的模型——相对于基线,高斯损坏 ++3%,错位 −−8%,缺失通道 −−4%,同时保持了接近最佳的清洁准确度(MSE 0.259,而研究最佳为 0.255)。为了测试这种鲁棒性是否必然需要专门架构,我们构建了一个刻意强大的有界对照模型 **BoundEx**——一个可学习的门控、一个可证明回退到内生基线的后备残差,以及每个通道的外生 FiLM 调制——并发现它在清洁准确度以及所有三种损坏类型上都被使用相同丢失训练的 DAG 所超越。一个架构×丢失消融实验、一个门控行为诊断以及一个表示层界限(虽成立但经验上宽松)表明,架构的有界性对于这种鲁棒性并非必要:尽管该界限在某些领域内对 BoundEx 有帮助,但在每个领域中,使用相同丢失训练的无界模型都优于有界模型。该发现在三个领域(电力价格、水库水文和气象)和三种损坏类型(高斯噪声、时间错位和完全缺失通道)中得到了复制。我们发布了一个损坏鲁棒性基准,并建议将外生丢失作为一个简单而强大的基线,未来的架构提案应与之进行比较。

## 1 引言

电力价格预测、天气驱动的能源预测以及供应链需求估计具有共同的结构:预测器既观察到内生目标历史,也观察到一系列外生协变量——日前拍卖价格、温度预测、假日日历——这些变量在预测范围内是事先已知的。整合这些未来已知的协变量,原则上应能提高准确性。然而,目前主导的处理方式将外生变量视为不受约束的信息源,其对模型内部表示的影响没有架构上的上限。

这种无界性在部署中至关重要。现实世界的外生输入经常被损坏:日前价格在结算后修订、天气预报存在漂移、传感器读取出故障、管道错误引入虚假通道。在这种情况下,无界的外生融合成为一种负担:当协变量被损坏时,外生路径不仅无法帮助,反而会主动损害预测,并且没有任何架构机制可以阻止这种损害。

这种脆弱性并非理论上的,该领域已经注意到了。一个快速增长的系列工作——TimeXerWang et al. (2024 (https://arxiv.org/html/2607.05452#bib.bib20)), ExoTSTTayal et al. (2024 (https://arxiv.org/html/2607.05452#bib.bib19)), DAGQiu et al. (2025 (https://arxiv.org/html/2607.05452#bib.bib16)), CrossLinearZhou et al. (2025 (https://arxiv.org/html/2607.05452#bib.bib25)), CITRASYamaguchi et al. (2026 (https://arxiv.org/html/2607.05452#bib.bib22)), 和 FTimeXerLi et al. (2026 (https://arxiv.org/html/2607.05452#bib.bib8))——通过越来越复杂的融合机制(交叉注意、双时域-通道相关图、随机掩码、频域门控)来应对,其中几个明确以对不完美协变量的鲁棒性为动机。隐含的前提是,保护外生路径需要专门的**架构**机制。在本文中,我们质疑这一前提,并发现一个更简单的干预就足够了。

我们采取一个故意最小化的路径:我们研究一个单行、模型无关的训练干预——**外生丢失**——它在训练期间随机将整个外生通道置零(重新缩放幸存者),使模型暴露于不同的外生可用性,从而学会不过分依赖任何单一协变量。我们将其添加到五个代表性预测器中,并在一个受控损坏基准下测量鲁棒性。为了公平地测试架构假设,而不仅仅是驳回它,我们还构建了一个故意强大的有界架构——**BoundEx(有界外生调制)**——不是作为一个提案模型,而是作为一个受控**对比**:它通过 FiLM 风格的仿射调制 Perez et al. (2018 (https://arxiv.org/html/2607.05452#bib.bib15))——逐通道缩放 γ 和移位 β——注入外生信息,通过一个学习的标量 ḡ ∈ [0,1] 进行门控,并与内生表示通过一个后备残差结合:

h_out = (1− ḡ) ⊙ h_endog + ḡ ⊙ (γ ⊙ h_endog + β) (1)

当门关闭 (ḡ → 0) 时,表示可证明回退到内生骨干(我们在附录 A 中形式化这个界限),而未来已知的协变量(当可用时)仅通过这个相同的有界调制路径进入。我们的核心发现对于这条架构路径是负面的:一旦将外生丢失应用于基线,BoundEx——尽管有内置保证——在清洁准确度以及所有三种损坏类型上都被超越,最显著的是被使用相同丢失训练的现有双相关网络(DAG)。我们认为,这种有界设计所报告的鲁棒性来自数据增强,而非架构。

我们的贡献有四个方面:

1. 1. 我们引入了一个系统的**外生损坏鲁棒性基准**,涵盖三个领域(五个市场的电力价格、水库水文和气象)、四个测试时场景(清洁、高斯噪声、时间错位和缺失通道)、每种配置五个随机种子,并测量相对于仅内生基线的性能下降。
2. 2. 我们表明**外生丢失**,一种单行训练时增强,是一个强大且**模型无关**的鲁棒性基线:它在高斯噪声、错位和缺失通道下对所有测试架构都提高了鲁棒性(例如 DAG:++32% → ++3% 高斯,++25% → −−8% 错位,++24% → −−4% 缺失),且清洁准确度成本可忽略。
3. 3. 通过一个完整的**架构×丢失消融实验**,我们建立了架构有界性对于这种鲁棒性并非必要:带有外生丢失的 DAG 是我们研究中最为鲁棒的模型,同时保持了接近最佳的清洁准确度,并且在清洁准确度以及所有三种损坏类型上——在每个领域中——都优于我们专门构建的有界架构 BoundEx。
4. 4. 我们提供了一项机制分析——一个门控行为诊断显示学习到的门**在损坏下并不关闭**(在任何领域中),以及一个虽然成立但经验上宽松的表示层界限——支持架构有界性**并非**外生损坏鲁棒性所必需的结论(它确实在某些领域内帮助了 BoundEx,但在任何地方,使用相同丢失的无界模型都更鲁棒)。

## 2 相关工作

### 2.1 内生时间序列预测

过去五年中,深度学习在时间序列预测领域经历了快速演变。早期的基于 Transformer 的预测器将经典的编码器-解码器架构 et al. (2017 (https://arxiv.org/html/2607.05452#bib.bib5)) 应用于时序数据:InformerZhou et al. (2021 (https://arxiv.org/html/2607.05452#bib.bib24)) 引入了长序列的稀疏注意力,AutoformerWu et al. (2021 (https://arxiv.org/html/2607.05452#bib.bib21)) 利用自相关进行季节-趋势分解,FEDformerZhou et al. (2022 (https://arxiv.org/html/2607.05452#bib.bib26)) 在频域中运行。一个关键的转折点出现在观察发现简单架构通常能在标准基准上超越复杂 Transformer。DLinearZeng et al. (2023 (https://arxiv.org/html/2607.05452#bib.bib23)) 证明单线性层能超越许多 Transformer 变体,促使对架构复杂性进行重新审视。PatchTSTNie et al. (2022 (https://arxiv.org/html/2607.05452#bib.bib13)) 通过将时间序列分割成块并应用通道独立的注意力来解决这一问题,在保持 Transformer 表达能力的同时取得了强劲结果。更近期的工作探索了基于 MLP 的架构 Ekambaram et al. (2023 (https://arxiv.org/html/2607.05452#bib.bib4)); Das et al. (2023 (https://arxiv.org/html/2607.05452#bib.bib2)) 以及基础模型方法 Ansari et al. (2024 (https://arxiv.org/html/2607.05452#bib.bib1)); Liang et al. (2024 (https://arxiv.org/html/2607.05452#bib.bib9))。

这一文献建立了一个强大的仅历史基线。通过改进回望窗口内趋势、季节性、长期依赖性、通道结构以及分布偏移的表示,内生预测器表明,在没有外部协变量流的情况下,可以提取出显著的预测能力。这种强度定义了**内生基线**:忽略外生信息时可达到的准确度。外生方法应相对于该基线进行评判,即在提高清洁准确度的同时,当协变量有噪声、错位、缺失或以其他方式损坏时,不会显著低于该基线。

同时,内生预测留下了一个明确的问题未解决。许多实际任务提供了与目标历史不同的辅助信号:它们可能来自不同的系统,在预测范围内可用,或者与内生序列独立地损坏。因此,问题不仅在于如何构建更强的历史编码器,还在于如何整合这些协变量,以免当它们的可靠性下降时,它们主导预测。这推动了接下来回顾的外生变量预测文献。

### 2.2 时间序列预测中的外生变量

将外生变量整合到神经预测器中已引起越来越多的关注,这得益于能源市场、交通和医疗保健等领域的应用,其中未来已知的协变量是常规可用的。早期和通用的方法直接将协变量纳入预测模型。N-BEATSxOlivares et al. (2021 (https://arxiv.org/html/2607.05452#bib.bib14)) 将 N-BEATS 基展开架构扩展了外生堆栈,而 Temporal Fusion TransformerLim et al. (2021 (https://arxiv.org/html/2607.05452#bib.bib10)) 使用变量选择网络对协变量加权,然后再输入多头注意力编码器,iTransformerLiu et al. (2023 (https://arxiv.org/html/2607.05452#bib.bib11)) 则反转了注意力维度——在变量之间而不是时间步之间进行注意力——以便将辅助协变量作为多变量输入的一部分处理。这些方法虽然有效,但将外生和内生信息大致对称处理——没有提供针对损坏协变量的保护。

更近期的研究开发了用于外生融合的专门架构,进展迅速。TimeXerWang et al. (2024 (https://arxiv.org/html/2607.05452#bib.bib20)) 引入了一个双分支 Transformer,其中内生块和外生变量通过可学习全局令牌的交叉注意交换信息。ExoTSTTayal et al. (2024 (https://arxiv.org/html/2607.05452#bib.bib19)) 将过去和未来的外生变量作为不同的模态分离,并通过跨时间注意力融合它们。CATSLu et al. (2024 (https://arxiv.org/html/2607.05452#bib.bib12)) 从协变量中构建辅助时间序列作为即插即用的外生表示。DAGQiu et al. (2025 (https://arxiv.org/html/2607.05452#bib.bib16)) 构建了双时域和通道级相关图,以发现和注入外生依赖性,实现了强大的清洁数据准确度。CrossLinearZhou et al. (2025 (https://arxiv.org/html/2607.05452#bib.bib25)) 添加了一个轻量级的即插即用交叉相关嵌入。最近的两个条目,CITRASYamaguchi et al. (2026 (https://arxiv.org/html/2607.05452#bib.bib22)) 和 FTimeXerLi et al. (2026 (https://arxiv.org/html/2607.05452#bib.bib8)),分别提出了一个协变量通知的 Transformer,带有专门的外生嵌入和融合层,以及一个频域门控融合,结合了**随机外生掩码**和一致性正则化。

这一文献的两个属性值得强调。首先,据我们所知,这些方法中没有一个施加了**结构性**约束来限制外生路径对内生表示的扰动程度——它们的融合幅度在设计上是无界的,因此损坏的协变量原则上可以将预测任意远离仅内生预测。其次,即使处理了对不完美协变量的鲁棒性,也是**经验性**地处理而不是架构性地:最显著的是,这些模型中最新的一个,FTimeXer,其鲁棒性组件与**随机外生掩码**密切相关——这是我们在本文中隔离和研究的外生丢失的一个亲戚——而不是任何架构界限。这两个观察——缺乏架构界限,以及现有鲁棒性机制的经验性、掩码性质——激发了本文提出的两个问题:显式架构界限是否必要,以及一个简单的掩码风格训练增强单独能在多大程度上带来鲁棒性。

### 2.3 深度学习中的条件调制和门控

一个长期的研究方向是关于一个信号如何条件性地调制神经网络内的另一个信号。特征级线性调制(FiLM)Perez et al. (2018 (https://arxiv.org/html/2607.05452#bib.bib15)) 最初用于视觉问答,其中语言表示通过逐通道仿射参数条件性地缩放和移位视觉特征;此后它已被广泛应用于图像生成、风格迁移和语音处理,作为注入条件信息的轻量级方式,而无需重构骨干网络。门控机制同样有着悠久的历史:LSTMsHochreiter and Schmidhuber (1997 (https://arxiv.org/html/2607.05452#bib.bib6)) 使用遗忘门和输入门来调节信息随时间流动;Highway NetworksSrivastava et al. (2015 (https://arxiv.org/html/2607.05452#bib.bib18)) 通过门控跳跃连接路由信号,使非常深的网络能够保留恒等映射;而 Mixture-of-Experts 架构Shazeer et al. (2017 (https://arxiv.org/html/2607.05452#bib.bib17)) 采用学习到的门控

相似文章

多变量时间序列预测需要跨变量损失

arXiv cs.LG

本文识别了多变量时间序列直接预测中的目标差距,并提出CvLoss,一种即插即用的结构正则化器,它在跨变量图上约束预测残差,以提高同步和异步交互之间的一致性。实验表明,相对于有竞争力的预测模型,它带来了一致的改进。

Dropout的普适性:混沌边缘的缩放定律与最优调度

arXiv cs.LG

本文提出了一种平均场理论,将dropout视为神经网络混沌边缘的微扰,推导出相关性衰减的缩放定律,并为平滑激活函数和类ReLU激活函数建立了不同的普适类。此外,该理论还得到了最优的dropout调度,可在不增加计算成本的情况下降低测试损失。

时间序列基础模型中的预测坍缩

Hugging Face Daily Papers

该论文识别了时间序列基础模型在每小时股票收益预测中的预测坍缩现象,并引入了CalibRank来平衡校准和排名,显著提高了截面相关性。