NVExplain: 使用潜在轨迹分析和结构保持代理模型解释时间序列预测

arXiv cs.LG 论文

摘要

NVExplain 引入了一种模型无关的框架,通过分析潜在轨迹和语义流来解释时间序列预测,使用结构保持代理模型生成具有竞争力和稳定性的人类可读解释。

arXiv:2608.25080v1 公告类型:新 摘要:时间序列预测模型在高风险环境中被广泛使用,但由于现有事后方法往往忽略时间依赖性并无法提供特定预测范围的解释,其预测结果仍难以解释。我们提出了一种模型无关的可解释性框架,通过将每个预测范围归因于时间上相关的滞后历史来解释预测。该框架将预测建模为潜在轨迹,并引入语义流来量化模型内部表示中信息随时间的变化。通过聚合语义流,构建一个滞后-范围归因矩阵,以捕获范围解析的时间影响。为了提高可解释性,我们进一步生成结构保持扰动并拟合稀疏局部代理模型,产生人类可读且时间一致的解释。我们使用忠实度和稳定性诊断在多个基准数据集上评估该方法。结果显示,语义流变体在忠实度方面达到了与标准事后基线相当或更优的性能,同时计算效率显著更高。稳定性分析进一步证明了解释的鲁棒性,并识别了应谨慎应用解释的场景。
查看原文
查看缓存全文

缓存时间: 2026/08/27 09:32

# NVExplain:基于潜在轨迹分析与结构保持代理的时间序列预测解释
来源:https://arxiv.org/html/2608.25080
Manikandan Ravikiran* 机构:NVIDIA, 美国  
Aditi Gautam* 机构:{annali, mravikiran, adgautam}@nvidia.com

###### 摘要

时间序列预测模型广泛应用于高风险场景,但由于现有事后解释方法往往忽略时序依赖性且无法提供针对特定预测步长的解释,其预测结果仍然难以理解。我们提出一个模型无关的可解释性框架,通过将每个预测步长归因于时序相关的滞后历史,来解释预测结果。该框架将预测过程建模为潜在轨迹,并引入*语义流*来量化模型内部表征中信息随时间演变的方式。通过聚合语义流,我们构建了一个滞后-步长归因矩阵,该矩阵捕获了步长解析的时序影响。为提升可解释性,我们进一步生成结构保持的扰动并拟合稀疏局部代理模型,从而产生人类可读且时序连贯的解释。我们通过忠实度和稳定性诊断在多个基准数据集上评估了该方法。结果表明,与标准的事后解释基线相比,语义流变体在多个数据集上达到了具有竞争力的或更优的忠实度,同时计算效率显著更高。稳定性分析进一步证明了解释是稳健的,并识别出在解释时应谨慎应用的场景。

## 1 引言

时间序列预测支撑着能源、金融、交通和工业监测等领域的高风险决策。尽管现代深度学习和基础模型预测器取得了优异的性能[1 (https://arxiv.org/html/2608.25080#bib.bib1), 2 (https://arxiv.org/html/2608.25080#bib.bib2)],但其内部推理过程仍然不透明,这限制了信任度和可靠部署。

事后解释方法如 LIME、SHAP 和积分梯度[3 (https://arxiv.org/html/2608.25080#bib.bib3), 4 (https://arxiv.org/html/2608.25080#bib.bib4), 5 (https://arxiv.org/html/2608.25080#bib.bib5)]已通过 TimeSHAP[6 (https://arxiv.org/html/2608.25080#bib.bib6)] 和 ShapTime[7 (https://arxiv.org/html/2608.25080#bib.bib7)] 扩展到序列场景。然而,预测任务带来了独特的挑战:简单的扰动可能违反时序连续性和季节性;多步预测需要步长解析的推理,因为影响近期预测的滞后与影响较远预测步长的滞后可能不同;并且大多数方法在输入空间中操作,忽略了信息如何在潜在表征中随时间演变。

我们通过一个模型无关的框架来解决这些空白,该框架将预测解释重新定义为分析潜在空间中的语义演变。我们引入*语义流*来量化当时间窗口向前推进时,连续潜在状态之间的变化。该框架从滚动上下文窗口构建潜在轨迹,计算语义流大小,并将其聚合为一个滞后-步长归因矩阵,该矩阵生成针对预测步长解析的历史滞后分布。为了在保持时序结构的同时产生可解释的解释,我们采用结构保持扰动并拟合针对步长的稀疏局部代理模型。

通过与现有基线进行忠实度和稳定性诊断评估,语义流在多个数据集上实现了具有竞争力的或更强的忠实度,同时提供了更具时序连贯性的解释,这强调了潜在稳定性在解释可靠性中的作用。

与通过扰动或 Shapley 式序列移除来估计输入空间重要性的 TimeSHAP 和 ShapTime 不同,NVExplain 通过潜在时序演变的几何结构来解释预测行为——这是一种特定于预测的分解,将滚动的潜在状态变化转换为步长解析的滞后归因。语义流提供了潜在动力学的基本元素,滞后-步长矩阵将这一基本元素转换为多步解释,而稀疏代理阶段则提供了可选的人类可读的局部近似。

总结而言,我们的贡献在于:
1.  引入语义流作为一种潜在空间解释原语;
2.  提出一个用于多步预测的模型无关的滞后-步长归因框架;
3.  为时间序列解释设计结构保持扰动;
4.  使用特定于预测的忠实度和稳定性诊断来评估解释质量。

## 2 方法论

考虑一个预测模型
f: RC×L → RC×H, f: ℝ^{C×L} → ℝ^{C×H},   (1)
其中 C 是通道数,L 是上下文长度,H 是预测步长。给定一个输入上下文窗口
X_t = x_{t-L+1:t} ∈ ℝ^{C×L},   (2)
模型产生一个多步预测
Ŷ_t = f(X_t) ∈ ℝ^{C×H}.   (3)
我们的目标是解释输入上下文 X_t 中的信息如何影响多步预测 Ŷ_t,而无需修改或重新训练模型。我们并非直接归因输入空间的重要性,而是通过分析模型的内部表征如何随时间演变来处理这个问题。*具体而言,我们通过将步长特定的输出归因于历史输入来解释预测。* 提出的框架包括四个阶段:(i) 潜在轨迹构建,(ii) 语义流计算,(iii) 滞后-步长归因,以及 (iv) 结构保持的局部代理建模。

### 2.1 潜在轨迹构建

为了理解预测模型如何处理时序信息,我们通过嵌入滚动上下文窗口,将模型表示为在潜在空间中诱导出一条轨迹。令 embed(·) 表示模型的嵌入接口。对于每个结束于索引 τ 的滚动窗口,我们计算
Z_τ = embed(x_{τ-L+1:τ}) ∈ ℝ^D,   (4)
其中 D 是潜在维度。这产生了一条潜在轨迹
𝒵 = {Z₁, Z₂, ..., Z_T},   (5)
其中 T 表示计算嵌入的滚动窗口数量,因此轨迹包含每个时间窗口的一个潜在状态。为确保在观测上下文之外保持连续性,轨迹使用模型的预测进行扩展,从而允许对历史片段和预测片段进行分析。嵌入接口的实例化方式取决于部署的预测器。对于基于编码器或编码器-解码器的模型,它可能对应于编码器输出、池化的隐藏状态或最终的预测表示。对于解码器专用或未暴露稳定内部状态的 API 式系统,语义流归因应被解释为灰盒组件而非严格黑盒;在这种情况下,仅使用预测查询的结构保持代理阶段仍然可以应用,而潜在流分析则需要暴露的嵌入或稳定的代理表示。因此,NVExplain 在架构和训练程序上是模型无关的,但其潜在流变体假设可以访问一个表示接口。

### 2.2 语义流大小

给定一条潜在轨迹,我们的目标是量化当时间窗口向前推进时信息如何演变。为此,我们测量连续潜在状态之间的变化,以捕捉模型内部表征的动力学。步长 τ 处的语义流大小定义为
m_τ = ‖Z_{τ+1} − Z_τ‖₂, τ = 1, ..., T−1.   (6)
该量捕捉了模型潜在状态中语义变化的速度,表明在每个步骤新信息对表征的影响强度。为了降低对噪声的敏感性,可以使用指数移动平均对潜在轨迹进行可选的平滑:
Z̃_τ = α Z̃_{τ-1} + (1−α) Z_τ.   (7)

### 2.3 滞后-步长归因矩阵

预测需要理解过去信息如何在不同预测步长上贡献不同。为此,我们构建滞后-步长归因分布,量化每个历史滞后对每个预测步长的贡献程度。为此,我们在时序历史上聚合语义流信号,以构建步长特定的归因分布。令 K 表示滞后数量,H 表示预测步长,t 表示被解释预测的窗口索引。我们定义一个滞后-步长分数矩阵
S(j, h) = ∑_{a=0}^{j-1} m_{t-1-a} w_h(a),   (8)
其中 a 表示转移的“年龄”(a=0 是 t 之前的最新转移),w_h(a) 是一个依赖于步长的核函数。我们使用指数核:
w_h(a) = exp(−a / s_h),   (9)
其中 s_h 随步长增加,反映了时间相关性的衰减,并允许较远的预测整合更广泛的历史信息。

最终的归因矩阵通过对滞后进行步长归一化的 softmax 获得:
A(j, h) = exp(S(j, h) / T_sm) / ∑_{j'} exp(S(j', h) / T_sm),   (10)
其中 T_sm > 0 是一个控制归因锐度的 softmax 温度(与轨迹长度 T 和上面使用的窗口索引 τ 不同)。矩阵 A 的每一列定义了固定步长下滞后上的分布,从而实现步长解析的时序解释。

### 2.4 结构保持的局部代理

虽然归因矩阵提供了一个紧凑的全局解释,但我们进一步通过使用时序连贯的扰动拟合稀疏代理模型,来获得可解释的局部摘要。这些扰动上下文是通过结合块自助重采样和频域幅度扰动生成的,保持了连续性和季节结构,每个扰动样本表示为
u^{(i)} = vec(X^{(i)}_{:, L-K+1:L}).   (11)
对于每个通道和步长,我们拟合一个稀疏线性代理:
g_{c,h}(u) = β_{0,c,h} + β_{c,h}^⊤ u,   (12)
使用局部加权的 ℓ₁ 正则化:
min_{β_{0,c,h}, β_{c,h}} ∑_i w_i (g_{c,h}(u^{(i)}) − Ŷ_{c,h}^{(i)})² + λ ‖β_{c,h}‖₁.   (13)
权重在潜在空间中计算:
w_i = exp(−γ ‖Z^{(i)} − Z^{(0)}‖₂²).   (14)
这产生了模型预测行为的可解释且局部忠实的近似。

总体而言,提出的框架产生三个互补的输出:(i) 一个捕获跨预测步长时序影响的滞后-步长归因矩阵,(ii) 表征潜在动力学的语义流统计量,以及 (iii) 可选的代理系数,提供可解释的局部近似。这些输出共同实现了对预测行为的定量和定性分析。

## 3 实验设置

### 3.1 模型、数据集和参数

我们在 MOMENT 预测模型[1 (https://arxiv.org/html/2608.25080#bib.bib1)]上评估提出的框架,将其视为一个具有可访问嵌入接口的黑盒预测器。上下文长度 L=512,模型预测步长为 72,解释是针对预测步长 H=72 的最近 K=128 个滞后进行计算。实验在来自 Nixtla 长期预测基准集合[10 (https://arxiv.org/html/2608.25080#bib.bib10)]的四个数据集上进行:ETTh1、Exchange、ILI 和 Weather,涵盖工业监测、金融、流行病学和气象学等不同领域。我们与四个基线进行比较:Random(随机分配滞后重要性,作为健全性检查的下界)、Attention[9 (https://arxiv.org/html/2608.25080#bib.bib9)](使用归一化的注意力权重)、积分梯度(IntGrad)[5 (https://arxiv.org/html/2608.25080#bib.bib5)] 和 TimeSHAP[6 (https://arxiv.org/html/2608.25080#bib.bib6)]。我们进一步评估提出的两个方法变体:(i) 仅语义流归因,以及 (ii) 包含基于代理解释的完整流程。

### 3.2 评估指标

我们沿着两个互补的轴评估提出的框架:*忠实度*(衡量解释是否捕获了因果时序影响)和*稳定性*(评估解释所基于的潜在表征的可靠性)。

**忠实度。** 我们使用基于滞后替换的指标。对于每个步长 h,令 Δ_abs_h = ‖ŷ_h^{top} − ŷ_h‖ 表示用通道均值替换前 k 个滞后后的绝对预测变化,并定义相对效应为
Δ_rel_h = Δ_abs_h / (‖ŷ_h‖ + ε).   (15)
如果 Δ_rel_h ≥ α 且 Δ_abs_h ≥ γ Δ_abs_h,ctrl,则该步长计为通过,其中 Δ_abs_h,ctrl 是随机和排名最低滞后移除带来的绝对变化,α 是最小效应阈值,γ > 1 是控制边际。整体忠实度计算为
FPR = (1/H) ∑_{h=1}^{H} 1{步长 h 通过}.   (16)

**AOPC 和 Gap。** AOPC(移除顶部 k 个特征后的预测变化累积)衡量当排名最高的滞后被逐步移除时预测的累积退化[8 (https://arxiv.org/html/2608.25080#bib.bib8), 6 (https://arxiv.org/html/2608.25080#bib.bib6)]。忠实度 Gap 是移除排名最高和最低滞后的 AOPC 之差。更高的 AOPC 和更大的 Gap 表明对关键滞后的识别更忠实。报告的值在所有步长上取平均。

**稳定性。** 由于该方法依赖潜在轨迹,我们使用两种诊断来评估其可靠性。*嵌入稳定性*衡量潜在表征对微小输入扰动的敏感性,定义为
R_t = ‖embed(X'_t) − embed(X_t)‖₂ / (‖X'_t − X_t‖_F + ε).   (17)
我们报告扰动试验的汇总统计量(均值和 95 百分位数)。*轨迹稳定性*捕获潜在演变的平滑性,使用过零率、方向翻转和在潜在维度上平均的相对抖动来总结。这些诊断在预测中特别相关,因为时序一致的表征对于可靠的解释至关重要。较低的值表明解释更稳定、更可信。

## 4 初步结果

我们使用忠实度指标评估所提方法。

相似文章

Nexus:面向时间序列预测的智能体框架

Hugging Face Daily Papers

Nexus 提出了一种多智能体框架,将时间序列预测分解为多个专门阶段,利用大语言模型整合数值模式与上下文信息,在基准测试上取得了最先进的结果。