非线性时间序列中的函数值因果影响
摘要
本文认为非线性因果发现中的标量边分数掩盖了状态依赖效应,并提出使用Neural Additive Vector Autoregression和Individual Conditional Expectation的函数值因果影响。
arXiv:2605.26408v1 Announce Type: new
摘要:时间序列中的因果发现越来越多地使用非线性机器学习模型进行,但由此产生的因果关系几乎总是用标量边分数来总结。我们认为这种做法掩盖了非线性自回归模型真正学习到的对象:一个状态依赖的函数,其效果随状态、幅度和背景而变化。我们为加法、贡献可分解架构形式化了函数值因果影响,并表明标量因果分数构成一个严重的信息瓶颈,混淆了状态间变异与状态内残差噪声。使用Neural Additive Vector Autoregression作为代表性架构,我们引入了一个基于Individual Conditional Expectation的实用框架,用于直接从训练模型估计因果响应函数。通过受控合成实验,我们证明具有不可区分标量分数的边可以表现出定性不同的功能行为,包括单调、阈值、饱和和符号变化效应。一项关于民主发展的应用案例进一步表明,函数值分析揭示了以分数为中心的方法系统遗漏的特定于状态和不对称的因果结构。
查看缓存全文
缓存时间: 2026/05/27 09:09
# 非线性时间序列中的函数值因果影响
来源:https://arxiv.org/html/2605.26408
###### 摘要
时间序列中的因果发现越来越多地使用非线性机器学习模型,但由此得出的因果关系几乎总是以标量边分数来概括。我们认为这种做法模糊了非线性自回归模型实际学习的对象:一个状态依赖的函数,其效应随系统状态、幅度和背景而变化。我们为可加性、贡献可分解的架构形式化了函数值因果影响,并表明标量因果分数构成了严重的信息瓶颈,混淆了状态间变异与状态内残差噪声。以神经可加向量自回归作为代表性架构,我们引入了一个基于个体条件期望的实用框架,直接从训练好的模型中估计因果响应函数。通过受控的合成实验,我们证明具有无法区分的标量分数的边可以表现出性质上不同的函数行为,包括单调、阈值、饱和和符号变化效应。一个关于民主发展的应用案例进一步表明,函数值分析揭示了由分数中心方法系统性地遗漏的特定于体制的和不对称的因果结构。
因果推断,非线性时间序列,因果表征,模型可解释性,因果响应函数
## 1 引言
时间序列中的非线性因果发现近年来发展迅速,这得益于灵活的非线性机器学习模型,这些模型学习了丰富、状态依赖的时间依赖性表征(Chen 等,2025 (https://arxiv.org/html/2605.26408#bib.bib15))。神经自回归和可加架构扩展了经典向量自回归(Geiger 等,2015 (https://arxiv.org/html/2605.26408#bib.bib8)),允许因果关系随系统状态变化(Bussmann 等,2021 (https://arxiv.org/html/2605.26408#bib.bib1)),从而能够表示阈值效应、饱和、不对称性以及其他线性方法无法触及的非线性动态(Assaad 等,2022 (https://arxiv.org/html/2605.26408#bib.bib16))。因此,现代因果时间序列模型能够学习有表现力、结构化的有向时间影响表征(Liao 等,2025 (https://arxiv.org/html/2605.26408#bib.bib2))。
尽管有这些进展,非线性因果发现方法的输出几乎总是以高度压缩的形式报告(Montagna 等,2023 (https://arxiv.org/html/2605.26408#bib.bib3))。因果影响通常用标量边分数来概括,这些分数量化了变量之间有向关系的强度或重要性(Tramontano 等,2024 (https://arxiv.org/html/2605.26408#bib.bib7))。这些分数在对边排序、阈值化图以及基准测试性能方面很方便(Job 等,2025 (https://arxiv.org/html/2605.26408#bib.bib17)),并且它们反映了系数在线性向量自回归中所扮演的角色(Ahn, 1997 (https://arxiv.org/html/2605.26408#bib.bib18))。然而,这种做法在非线性因果模型学习的表征与用于评估和解释这些模型的摘要之间引入了一个根本性的不匹配。
在非线性系统中,因果影响通常不能由单一量级表示(Wan 等,2025 (https://arxiv.org/html/2605.26408#bib.bib19))。非线性自回归模型学习的不是固定效应或恒定权重;相反,它们学习的是状态依赖的函数,将过去的系统配置映射到未来的结果(Esarey 和 DeMeritt, 2014 (https://arxiv.org/html/2605.26408#bib.bib27))。因此,此类模型中的每个有向关系对应的不是标量,而是一个函数值因果影响,其效应随系统状态、幅度和上下文而变化(Troster 和 Wied, 2021 (https://arxiv.org/html/2605.26408#bib.bib20))。将这些函数缩减为标量摘要会丢失基本结构,并可能掩盖非线性动态固有的阈值行为、饱和、不对称性和符号变化(Wan 等,2025 (https://arxiv.org/html/2605.26408#bib.bib19))。
这种表征坍缩对于模型输出作为所学因果结构摘要的充分性有重要后果,即使预测精度很高也是如此。标量摘要平均了状态和交互,掩盖了因果影响在何处以及如何运作(Seitzer 等,2021 (https://arxiv.org/html/2605.26408#bib.bib21))。具有相似标量分数的两个因果关系可能对应于性质上不同的机制,而强烈但局部的效应可能看起来与微弱但全局活跃的效应无法区分(Rottman 和 Hastie, 2014 (https://arxiv.org/html/2605.26408#bib.bib28))。因此,标量因果分数充其量只能提供非线性时间序列中因果结构的部分、甚至可能误导性的画面。
为了提供一个例子,考虑民主面板中的两个有向关系。假设一个非线性模型学习到公民自由影响选举质量,但只有在达到中等制度基线之后才有效,低于该阈值则没有效果。第二个关系捕捉了司法约束对选举质量的影响,通过一个类似整体幅度的单调线性效应。两条边收到可比较的标量因果分数,例如大约0.15。然而,它们的政策含义完全不同:第一个意味着存在一个阈值,低于该阈值干预不太可能改善选举结果;第二个意味着在所有司法强度水平上都有统一的边际回报。标量摘要无法传达这种区别。我们在此论文中形式化和估计的函数值因果影响,恰好恢复了这种结构,并且我们在第5.2节 (https://arxiv.org/html/2605.26408#S5.SS2) 中通过实证证明,这种情况确实出现在真实的民主面板数据中。
这种不匹配的后果在理论驱动的领域尤为突出,例如社会科学,这构成了对因果表征的严格压力测试(Sobel, 2021 (https://arxiv.org/html/2605.26408#bib.bib22))。在这些环境中,因果优先级必须根据机制和体制来解释和辩护(Hofman 等,2021 (https://arxiv.org/html/2605.26408#bib.bib29)),而不仅仅是检测或排序。无法解释因果关系如何运作(例如,效应何时激活、饱和或反转)的模型,很少被实质性研究或政策分析采纳,无论其预测性能如何(de Slegte 等,2025 (https://arxiv.org/html/2605.26408#bib.bib23); Gerring, 2021 (https://arxiv.org/html/2605.26408#bib.bib30))。因此,许多非线性因果模型在正是其表现力最有价值的领域中仍然未得到充分利用(De Bruijn 等,2022 (https://arxiv.org/html/2605.26408#bib.bib24))。
在本文中,我们通过将非线性时间序列模型中的因果影响重新定义为函数值对象而非标量分数来弥补这一差距。我们为广泛的可加、贡献可分解的自回归模型形式化了函数值因果影响,独立于特定架构,并表明常用的标量因果分数对应于这些函数的低维投影,构成了信息瓶颈。然后,我们基于个体条件期望(ICE)(Goldstein 等,2015 (https://arxiv.org/html/2605.26408#bib.bib42))引入了一个实用的干预式框架,直接从训练好的模型中估计因果响应函数。通过受控的合成系统,我们证明了性质上不同的因果机制可能坍缩为相似的标量摘要。我们还使用关于民主发展的面板数据集表明,函数值分析揭示了标量分数系统性难以捕捉的依赖于体制的因果行为。
## 2 背景与设定
### 2.1 多元时间序列与自回归预测
我们考虑一个多元时间序列 \(\{X_t\}_{t=1}^T\),其中每个观测 \(x \in \mathbb{R}^N\) 是在时间 \(t\) 测量的 \(N\) 个变量的向量。令 \(K \in \mathbb{N}\) 表示固定的滞后窗口。自回归模型使用最近的历史 \(X_{t-K:t-1} = \{X_{t-K}, ..., X_{t-1}\}\) 来预测当前状态 \(X_t\),从而通过滞后输入捕捉时间依赖性。针对第 \(j\) 个变量的自回归预测器的一般形式为 \(\hat{X}_t^j = f_j(X_{t-K:t-1})\),其中 \(f_j(\cdot)\) 是任意潜在的、非线性函数。在本文中,我们专注于训练以最小化预测损失(例如均方误差)的模型。在此设定下,因果解释遵循标准的格兰杰式预测影响力概念(Zhou 等,2024 (https://arxiv.org/html/2605.26408#bib.bib5); Zhang 等,2024 (https://arxiv.org/html/2605.26408#bib.bib6)),其中因果关系通过预测的改进来操作性地定义。
### 2.2 有向预测影响力与因果边
在此框架中,我们定义有向边 \(i \rightarrow j\) 表示变量 \(i\) 的滞后历史有助于预测变量 \(j\)。形式上,若预测函数 \(f_j(\cdot)\) 依赖于 \(X_{t-K:t-1}^{(i)}\) 且能提高预测精度,则存在边 \(i \rightarrow j\)。此概念与格兰杰因果关系一致(Zhou 等,2024 (https://arxiv.org/html/2605.26408#bib.bib5); Zhang 等,2024 (https://arxiv.org/html/2605.26408#bib.bib6)):如果某个变量的过去有助于预测另一变量的未来,且仅使用其他变量无法达到同等效果,则认为该变量具有因果影响力。重要的是,此定义并不暗示因果图或反事实框架意义上的结构性或干预性因果关系。相反,它捕捉了时间序列中大多数非线性格兰杰因果发现方法所使用的操作性概念——有向预测影响力。
### 2.3 可加与贡献可分解的自回归模型
我们的分析聚焦于一大类自回归模型,这些模型在变量上是可加的(Li 和 Genton, 2009 (https://arxiv.org/html/2605.26408#bib.bib31)),从而允许预测分解为每个变量的贡献。具体来说,对于每个目标变量 \(j\),预测器采取如下形式:
\[
\hat{X}_t^{(j)} = \beta_j + \sum_{i=1}^N f_{ij}\!\left(X_{t-K:t-1}^{(i)}\right)
\]
其中每个 \(f_{ij}(\cdot)\) 建模了源变量 \(i\) 的滞后历史对目标 \(j\) 的影响。这种可加结构确保每个源变量的贡献可以被隔离并单独分析。此类模型包括作为特例的线性向量自回归模型(VAR),其中每个 \(f_{ij}\) 是线性的,以及各种非线性扩展(Kolesár 25),其中 \(f_{ij}\) 通过灵活的函数逼近器(如神经网络或基于样条的模型)参数化。对我们目的而言,关键属性是贡献可分解性(Mediano 等,2022 (https://arxiv.org/html/2605.26408#bib.bib33)):对于任何时间 \(t\),预测值 \(\hat{X}_t^{(j)}\) 可以写成可识别的、特定于源项的加和。神经可加向量自回归(NAVAR)(Bussmann 等,2021 (https://arxiv.org/html/2605.26408#bib.bib1))是该模型类的一个代表性实例,它使用神经网络参数化函数 \(f_{ij}\),同时保持可加性。我们在实验中由于 NAVAR 的灵活性和可解释性而使用它,但我们的分析适用于任何允许类似可加分解的自回归模型。NAVAR 的具体实现细节在附录 A 中提供。
### 2.4 范围与解释
在整篇论文中,我们以上述预测性、格兰杰式的意义解释因果影响力(Zhang 等,2024 (https://arxiv.org/html/2605.26408#bib.bib6); Zhou 等,2024 (https://arxiv.org/html/2605.26408#bib.bib5))。我们的目标不是识别结构性因果效应或对底层数据生成过程中的干预做出反事实声明。相反,我们分析非线性自回归模型学习了关于有向预测关系的什么信息,以及这些关系如何被表征和概括。特别地,我们研究使用标量边分数总结所学习函数 \(f_{ij}(\cdot)\) 的表征后果,并询问这些摘要是否忠实地捕捉了非线性、状态依赖的因果影响所编码的信息。
## 3 函数值因果影响
非线性可加自回归模型学习的是函数,而非标量效应(Li 等,2024 (https://arxiv.org/html/2605.26408#bib.bib34))。然而,在实践中,它们的输出几乎总是使用标量边分数来概括(Rogovchenko 等,2024 (https://arxiv.org/html/2605.26408#bib.bib35))。在本节中,我们形式化此类模型所学习的适当因果对象——函数值因果影响——并说明为什么标量摘要构成了严重的信息瓶颈。
**定义**。考虑第2节 (https://arxiv.org/html/2605.26408#S2) 中引入形式的一个可加自回归模型,其中 \(f_{ij}(\cdot)\) 表示源变量 \(i\) 的滞后历史对目标变量 \(j\) 预测的贡献。对于任何时间 \(t\),定义变量 \(i\) 对变量 \(j\) 的瞬时贡献为:
\[
\mathrm{contrib}_{ij,t} \equiv f_{ij}\!\left(X^{(i)}_{t-K:t-1}\right).
\]
从而预测被加性分解为来自不同源的项。
**函数值影响(边际形式)**。边 \(i \rightarrow j\) 的最简单的函数值因果影响对象是给定源变量最接近滞后的条件下,此贡献的条件期望:
\[
g_{ij}(x) = \mathbb{E}\!\left[\mathrm{contrib}_{ij,t} \;\middle|\; X^{(i)}_{t-1}=x\right].
\]
该函数刻画了源变量 \(i\) 对目标 \(j\) 的期望贡献如何作为源变量状态 \(x\) 的函数而变化。重要的是,即使对所有其他变量和滞后进行平均,\(g_{ij}(\cdot)\) 通常也是非线性和状态依赖的。
**条件与体制依赖扩展**。通过在其他变量上施加条件,可以定义更丰富的函数值影响版本。例如,在目标最近历史上附加条件得到:
\[
g_{ij}(x,y) = \mathbb{E}\!\left[\mathrm{contrib}_{ij,t} \;\middle|\; X^{(i)}_{t-1}=x,\; X^{(j)}_{t-1}=y\right].
\]
更一般地,可以在一个体制变量 \(r_t\) 上附加条件,例如一个汇总指标或系统的离散化状态:
\[
g_{ij}(x \mid r) = \mathbb{E}\!\left[\mathrm{contrib}_{ij,t} \;\middle|\; X^{(i)}_{t-1}=x,\; r_t=r\right].
\]
这些条件定义允许因果影响随体制变化,捕捉非线性系统中常见的不对称、阈值和状态特异的激活模式。
**与标量因果分数的关系**。大多数现有方法通过将函数值影响 \(g_{ij}(\cdot)\)相似文章
贝叶斯因果发现如何失败?潜在混杂下线性高斯网络中结构后果的刻画
本文分析了在潜在混杂下线性高斯网络中贝叶斯因果发现如何失败,推导出一个导致评分函数偏好虚假边的相关性阈值,并刻画了两种不同的后验失败模式。
基于分数的潜在变量因果模型因果发现
本文介绍了在存在潜在变量情况下进行因果发现的基于分数的方法,提供了一致性和分数等价性的理论保证,并统一了几种基于约束的方法。
迈向连续时间因果基础模型
提出了一个连续性准则,用于将离散时间因果先验数据拟合网络扩展到连续时间,利用随机微分方程(SDE)。引入了分类体系和细网格积分方法,在不规则观测时间表上优于朴素积分方法。
基于边际影响的归因方法对全局时间序列解释的失效
本文证明了现有基于边际影响的归因方法从根本上无法捕捉时间序列模型的条件依赖结构,并提出了DAG忠实性作为忠实解释的新标准。
使用零样本时间序列基础模型进行功能MRI和合成信号的预测与因果关系分析
本文介绍了一种零样本时间序列基础模型,应用于功能MRI与合成信号的预测和因果关系分析。