时间序列预测器是否使用了正确的历史:时间延迟的可恢复性、恢复与功能使用

arXiv cs.LG 论文

摘要

本文研究时间序列预测器是否使用了正确的历史输入,区分了延迟的可恢复性、模型报告和功能使用。文章证明,即使预测准确且延迟报告正确,仍可能隐藏使用了错误滞后的情况,并在N-HiTS和TCN模型中实证展示了这一问题。

arXiv:2608.10433v1 公告类型:新 摘要:预测准确性并不能告诉我们哪些过去输入产生了预测。我们将具有已知延迟结构的时间序列模型的问题分为三个:能否从观测数据中恢复真实延迟,模型是否报告该延迟,以及预测是否实际使用了相同的历史?我们首先推导了基于输入的可恢复性度量,将内在模糊性与模型误差区分开来。然后我们证明,延迟报告可以变得任意可靠,同时预测风险接近oracle,即使预测器仍然使用错误的滞后。这一失败也出现在点延迟任务的有限样本中:在延迟报告正确且归一化超额风险在oracle的10%以内的预测中,报告的历史在我们的匹配掩蔽测试下在55.4%的N-HiTS案例和92.7%的TCN案例中未被功能使用。最后,我们表明,通过报告的历史路由预测可以消除报告外的旁路路径;硬独热控制可实现精确的固定报告对齐。主要结论很简单:好的预测,即使延迟报告正确,也不能说明模型使用了正确的历史。
查看原文
查看缓存全文

缓存时间: 2026/08/12 08:29

# 时间序列预测器是否使用了正确的历史:时间延迟的可恢复性、恢复与功能性使用

来源:https://arxiv.org/html/2608.10433

Qipeng Qian1,2  
Yuntao Qian2  
1Supcon Technology, Hangzhou, China  
2College of Artificial Intelligence, Zhejiang University, Hangzhou 310027, China  
[email protected]  
[email protected]

###### 摘要

预测准确度并不能告诉我们哪些过去的输入产生了预测。我们将时间序列模型在已知延迟结构下的三个问题分开:能否从观测数据中恢复真实延迟,模型是否会报告该延迟,以及预测是否实际上使用了相同的历史?我们首先推导了以输入为条件的可恢复性度量,将内在模糊性与模型误差分开。然后我们证明,延迟报告可以变得任意可靠,同时预测风险接近 oracle,即使预测器仍在使用错误的滞后。这种失败在点延迟任务的有限样本中也会出现:在具有正确延迟报告且归一化超额风险处于 oracle 的 10% 以内的预测中,报告的历史在 N-HiTS 案例的 55.4% 和 TCN 案例的 92.7% 中在我们匹配的掩码检验下是功能上未被使用的。最后,我们表明,通过报告的历史路由预测可以消除报告之外的旁路路径;硬 one-hot 控制实现了精确的固定报告对齐。主要结论很简单:一个好的预测,即使有正确的延迟报告,也不能说明模型使用了正确的历史。

## 1 引言

时间序列模型通常以预测误差来评判。当有用历史的位置很重要时,这还不够。自相关输入会使相邻滞后看起来很相似,输出记忆可能隐藏错误的输入延迟,而模型可能在使用与生成输出不同的过去信息的同时做出良好预测([Björklund and Ljung,2003](https://arxiv.org/html/2608.10433#bib.bib17); [Sadler and Kozick,2006](https://arxiv.org/html/2608.10433#bib.bib18); [Ljung,1999](https://arxiv.org/html/2608.10433#bib.bib10); [Seborg et al.,2016](https://arxiv.org/html/2608.10433#bib.bib11); [Kay,1993](https://arxiv.org/html/2608.10433#bib.bib7))。我们问一个直接的问题:*预测器是否使用了正确的历史?*

这需要三项独立的检查。**可恢复性**(recoverability)询问观测轨迹是否包含足够的信息,以将真实延迟与备选延迟区分开来。**恢复/报告**(recovery/reporting)询问拟合模型是否识别出该延迟或核。**功能性使用**(functional use)询问改变报告的历史是否实际上改变了数值预测。这些是不同的主张,我们按以下顺序进行审计(箭头表示审计顺序,而非逻辑蕴含):可恢复性 ⟶ 恢复/报告 ⟶ 功能性使用。数据无法区分的延迟,不应归咎于模型。反过来,正确的报告也不必影响预测。例如,模型可能输出“延迟 8”,但其数值预测主要在第 12 滞后被扰动时改变。仅凭预测误差无法揭示这种错配。因此中心问题是最后一环:即使延迟是可恢复的、被正确报告,并且与接近 oracle 的预测配对,那段历史是否真的被使用了?我们的贡献也遵循同样的顺序。

首先,我们在评判模型之前衡量延迟是否可恢复。点延迟和有限核设定允许以输入为条件的贝叶斯校准,而自回归设定使用剖面得分,允许错误滞后重新拟合其他动态参数。

其次,我们证明准确的报告和接近 oracle 的预测仍然可以与使用错误滞后共存。然后我们检验这个精确的联合事件,而不仅仅是比较预测排名和结构排名。

第三,我们通过对过去输入进行干预来直接衡量使用情况,并将路由(routing)作为一种受控修复加以研究。无旁路分解消除报告之外的历史路径,硬 one-hot 控制精确实现点延迟保证。

*DelayBench-TS* 只是使这些问题可测量的受控测试平台;主要结果是可恢复性、报告和实际使用之间的分离。非平凡之处不仅在于模型解释可能不忠实。而在于这种错配可以在时间结构统计上可恢复、模型正确报告该结构、且数值预测已接近 oracle 之后仍然存在。这个联合条件排除了三种较容易的解释——数据模糊、报告不正确和预测器性能差——然后才询问报告的历史是否实际参与了预测。

## 2 相关工作

#### 延迟估计与可恢复性。

经典系统辨识和较新的时间序列方法直接估计延迟、领先–滞后结构或时间边([Björklund and Ljung,2003](https://arxiv.org/html/2608.10433#bib.bib17); [Sadler and Kozick,2006](https://arxiv.org/html/2608.10433#bib.bib18); [Ljung,1999](https://arxiv.org/html/2608.10433#bib.bib10); [Ma and Huang,2023](https://arxiv.org/html/2608.10433#bib.bib35); [Cattaldo et al.,2024](https://arxiv.org/html/2608.10433#bib.bib36); [Heyse et al.,2021](https://arxiv.org/html/2608.10433#bib.bib19); [Zhao and Shen,2024](https://arxiv.org/html/2608.10433#bib.bib44); [Runge et al.,2019a](https://arxiv.org/html/2608.10433#bib.bib20), [b](https://arxiv.org/html/2608.10433#bib.bib21); [Runge,2020](https://arxiv.org/html/2608.10433#bib.bib22))。相关工作也询问时间序列结构是否可从观测数据中识别([Kuskova et al.,2026b](https://arxiv.org/html/2608.10433#bib.bib45); [Tan and others,2025](https://arxiv.org/html/2608.10433#bib.bib37))。我们对显式有限延迟或核决策使用相同的可恢复性原则。当候选似然是完备的时,我们为结构决策本身计算以输入为条件的贝叶斯极限。当自回归记忆引入干扰补偿时,我们使用剖面分离诊断,而不是称其为贝叶斯 oracle。其目标是实用的:在解释模型的结构误差之前,先判断该轨迹是否确实使延迟可区分。

#### 报告、解释与实际使用。

可读的解释不一定匹配产生预测的计算([Jain and Wallace,2019](https://arxiv.org/html/2608.10433#bib.bib41); [Jacovi and Goldberg,2020](https://arxiv.org/html/2608.10433#bib.bib42); [Ross et al.,2017](https://arxiv.org/html/2608.10433#bib.bib43))。时间序列工作检验扰动、上下文窗口和预测掩码([Ozyegen et al.,2022](https://arxiv.org/html/2608.10433#bib.bib46); [Liu et al.,2024c](https://arxiv.org/html/2608.10433#bib.bib51), [b](https://arxiv.org/html/2608.10433#bib.bib52); [Kim et al.,2026](https://arxiv.org/html/2608.10433#bib.bib53); [Zhang et al.,2025](https://arxiv.org/html/2608.10433#bib.bib47); [Koh et al.,2020](https://arxiv.org/html/2608.10433#bib.bib49); [Zheng et al.,2026](https://arxiv.org/html/2608.10433#bib.bib48)),而自相关可能混淆朴素的时间归因([Tunyi,2026](https://arxiv.org/html/2608.10433#bib.bib50))。预测必要性检验通过边消融询问报告的关系是否为预测所必需([Kuskova et al.,2026a](https://arxiv.org/html/2608.10433#bib.bib54))。我们的审计增加了实例级可恢复性和一个外部指定的结构目标:在延迟可恢复、被正确报告并与接近 oracle 的预测配对之后,该位置是否真的被使用?我们将报告与干预敏感性进行比较,并且仅在受控预测器敏感性意义上使用“功能性使用”,而不是真实世界因果识别。

#### 受控基准。

合成和因果基准提供受控结构和留出机制([Tan and others,2025](https://arxiv.org/html/2608.10433#bib.bib37); [Cheng et al.,2024](https://arxiv.org/html/2608.10433#bib.bib23); [Mogensen et al.,2024](https://arxiv.org/html/2608.10433#bib.bib24); [Stein et al.,2025](https://arxiv.org/html/2608.10433#bib.bib25); [Herdean et al.,2025](https://arxiv.org/html/2608.10433#bib.bib26); [Yi et al.,2026](https://arxiv.org/html/2608.10433#bib.bib27); [Zhao et al.,2026](https://arxiv.org/html/2608.10433#bib.bib38))。我们仅使用该设定来回答上述有序问题:轨迹能揭示什么、模型报告了什么、预测使用了什么历史?这使受控生成器处于辅助角色,而不是把基准广度作为主要主张。

## 3 问题设定

一个实例包含输入 $U_{1:T}$、输出 $Y_{1:T}$ 和一个有限候选集。设 $L$ 为最大候选滞后,$\mathcal{I}_{L}=\{L+1,\dots,T\}$,$n_{\mathrm{eff}}=T-L$,以及 $S_{d}u=(u_{t-d})_{t\in\mathcal{I}_{L}}$。模型和 oracle 仅在它们使用相同的观测信息和相同的有效窗口时才进行比较。这一点对自回归模型最为重要,因为第一个被评分的输出可能依赖前一个输出。如果该边界值被观测到,模型和 oracle 都必须以相同的值为条件。如果它未被观测到,就不能静默地把它交给 oracle。完整的信息约定细节见附录A。在已发布的 P2 数据中,预热边界值未被保留,因此修复后的剖面审计直接丢弃第一个转移,并使用

$$
\mathcal{I}_{L}^{\mathrm{P2}}=\{L+2,\ldots,T\},\qquad n_{\mathrm{P2}}=T-L-1.
\tag{1}
$$

这仅改变理论校准;学习到的预测不变。该修复只改变了 400 条轨迹中 2 条的有利归类,因此它在不改变实证结论的情况下修复了信息不匹配。

我们研究三种受控机制:

$$
\begin{aligned}
\text{P1:}\quad &Y_{t}=\alpha U_{t-d}+\varepsilon_{t},\\
\text{P2:}\quad &Y_{t}=aY_{t-1}+bU_{t-d}+\varepsilon_{t},\\
\text{P3:}\quad &Y_{t}=aY_{t-1}+\sum_{k=0}^{L}h_{k}U_{t-k}+\varepsilon_{t},\qquad \bm{h}\in\mathcal{H}.
\end{aligned}
\tag{2}
$$

P1 是点延迟,P2 加入输出记忆,P3 使用点核、多路径核或分布核的有限库。这三种情况并非要覆盖所有时间序列机制;它们隔离了论证所需的两个主要复杂性:干扰补偿和分布延迟结构。

模型可以直接报告候选,也可以通过固定读出机制报告。功能性使用通过干预过去的输入并将所得响应轮廓与报告的延迟或核进行比较来单独衡量。对于点报告 $r$,设 $A_{k}$ 表示当声明的干预施加到历史位置 $k$ 时预测响应的幅度,报告和任何干预上下文保持固定。设 $k_{\mathrm{peak}}$ 为固定评估并列规则下的响应峰值,并定义

$$
d_{\mathrm{use}}(r,A)=|r-k_{\mathrm{peak}}|.
$$

因此,正确的报告和较小的结构误差并不自动意味着 $d_{\mathrm{use}}$ 很小。用于验证性 P1 分析的二元“未使用”检验更严格且基于掩码;它在下面的链路 II 实验中定义。完整的生成器、损失、oracle 和干预细节见附录。

## 4 理论

理论与实验回答相同的三个问题。链路 I 询问在任何神经模型介入之前数据使什么成为可能。链路 II 询问正确的报告和良好的预测是否已经足以证明使用了正确的历史。链路 III 询问当预测被迫通过报告的历史时会有什么变化。这三个链路应按此顺序阅读。链路 I 恒等式的完整陈述和证明见附录B和C。

### 4.1 延迟何时可恢复?

对于点延迟模型和固定的观测输入 $u$,两个候选延迟 $d,d^{\prime}$ 的差异为

$$
D_{\mathrm{KL}}(d\|d^{\prime}\mid u)=\frac{\alpha^{2}}{2\sigma^{2}}\|S_{d}u-S_{d^{\prime}}u\|_{2}^{2}.
\tag{3}
$$

因此,当实现输入在两个候选滞后处看起来相似时,恢复是困难的。这是一个以输入为条件的陈述:两个以相同标称 SNR 生成的轨迹,如果其实现历史具有不同的平移几何结构,则可能具有非常不同的延迟信息。在方差为 $\sigma_{U}^{2}$、自相关为 $\rho_{U}$ 的平稳输入下,

$$
\mathbb{E}_{U}D_{\mathrm{KL}}=n_{\mathrm{eff}}\,\frac{\alpha^{2}\sigma_{U}^{2}}{\sigma^{2}}\,[1-\rho_{U}(|d-d^{\prime}|)],
$$

这使序列长度、SNR、滞后间距和自相关的作用变得明确。对于两个先验相等的候选,精确贝叶斯误差为

$$
R^{\star}_{0-1}(d,d^{\prime};u)=\Phi\!\left(-\sqrt{D_{\mathrm{KL}}(d\|d^{\prime}\mid u)/2}\right),
$$

其中 $\Phi$ 是标准正态 CDF。对于两个以上的候选,我们数值计算有限库贝叶斯风险。这直接回答了第一个问题:在这条实现轨迹上,即使是最好的结构决策规则也会有多频繁地出错?

输出记忆使问题变得更加困难,因为错误的延迟可以重新拟合其他参数。对于 P2,以截距增广形式写出真实条件均值

$$
m_{t}^{\star}=\eta^{\star}+a^{\star}Y_{t-1}+b^{\star}U_{t-d^{\star}},
$$

其中 $\eta^{\star}=0$ 在中心化设定中,并令 $\bm{x}_{t,d^{\prime}}$ 包含前一个输出和错误滞后输入(在使用时还包含截距)。这里 $\mathbb{E}^{\star}$ 表示真实 P2 过程下的期望。定义

$$
Q_{d^{\prime}}=\inf_{\bm{\beta}^{\prime}}\sum_{t\in\mathcal{I}_{L}^{\mathrm{P2}}}\mathbb{E}^{\star}[(m_{t}^{\star}-\bm{x}_{t,d^{\prime}}^{\top}\bm{\beta}^{\prime})^{2}],\qquad \kappa_{\mathrm{ARX}}=\min_{d^{\prime}\neq d^{\star}}\frac{Q_{d^{\prime}}}{n_{\mathrm{P2}}(\sigma^{\star})^{2}}.
\tag{4}
$$

小的 $\kappa_{\mathrm{ARX}}$ 意味着错误的延迟可以在干扰参数重新拟合后模仿真实均值。这与普通的滞后相关不同:在我们测量还剩余多少不匹配之前,错误的滞后被允许利用前一个输出并改变其增益。当新息方差固定时,相应的总体剖面 KL 为 $Q_{d^{\prime}}/(2(\sigma^{\star})^{2})$;当该方差也被重新拟合时,为 $\frac{n_{\mathrm{P2}}}{2}\log\!\left(1+\frac{Q_{d^{\prime}}}{n_{\mathrm{P2}}(\sigma^{\star})^{2}}\right)$。因此,$\kappa_{\mathrm{ARX}}$ 是一个分离得分,而不是精确的复合贝叶斯风险。

对于有限核库,精确移除已知输出记忆得到

$$
\widetilde{\bm{y}}=\mathbf{U}\bm{h}+\bm{\epsilon},
$$

其中 $\mathbf{U}=[S_{0}u,\ldots,S_{L}u]$,并且

$$
D_{\mathrm{KL}}(\bm{h}\|\bm{h}^{\prime}\mid u)=\frac{1}{2\sigma^{2}}\|\mathbf{U}(\bm{h}-\bm{h}^{\prime})\|_{2}^{2}.
\tag{5}
$$

定义 th

相似文章

TS-Fault:针对结构性故障的时间序列预测器基准测试

arXiv cs.LG

本文介绍了TS-Fault,这是一个用于评估时间序列预测模型在结构化故障场景(如依赖关系断裂和机制变化)下的基准测试。研究发现,干净数据上的准确性通常与鲁棒性呈负相关,且基础模型特别脆弱。

能理解数据修订的时间序列基础模型

arXiv cs.LG

本文提出了VINTAGE-TS,这是一种考虑修订的时间序列基础模型适配方案,它能区分观测时间与信息可用时间,并提供了一个用于评估数据修订下预测表现的框架。

评估基础模型在时间序列预测中的运行可行性

arXiv cs.LG

本文对基础模型在时间序列预测中的应用进行了评估,与四种操作领域中的监督学习方法进行了比较,并提出了一种复杂性路由器,用于选择性地将序列分配给最优模型类别,以平衡准确性和推理成本。