基于倒置自注意力的多元时间序列因果发现
摘要
本文提出了一种利用倒置自注意力机制进行多元时间序列因果发现的新框架,引入了因果自注意力模块(CSAM)和全局因果算法,以识别潜在因果联系并减少虚假相关。
arXiv:2607.28212v1 公告类型:新
摘要:多元时间序列数据中的因果发现因变量间的复杂交互、高维性和非线性依赖而具有挑战性。现有方法往往难以捕捉这些复杂性,导致因果结构不准确。为解决这一问题,我们提出了一种在Transformer架构中利用自注意力机制进行因果发现的新框架。我们的方法引入了一种新颖的倒置因果自注意力机制(CSAM),通过倒置令牌(tokens)并诱导注意力分数的稀疏性,强调潜在和间接的因果关系,聚焦于重要的因果交互并减少虚假相关。此外,我们开发了一种全局因果算法来识别全局因果联系,提供因果影响的整体度量,并配备因果验证模块以确保所识别因果关系的稳健性,从而增强框架的可靠性。在线性和非线性数据集上的实验,以及消融研究和敏感性分析表明,我们的框架优于现有方法,展示了其在复杂多元时间序列中进行因果发现的潜力。
查看缓存全文
缓存时间: 2026/07/31 10:04
# 基于反向自注意力机制的多变量时间序列因果发现
来源:https://arxiv.org/html/2607.28212
11institutetext:悉尼科技大学计算机科学学院,悉尼,澳大利亚 11email:\{Yusen\.Liu, Yifan\.Yin, Huan\.Huo\}@uts\.edu\.au
22institutetext:丹麦技术大学技术、管理与经济系,灵比,丹麦 22email:xiuli@dtu\.dk
33institutetext:天府永兴实验室,成都,中国 33email:ethan\-wy@foxmail\.com
44institutetext:澳门城市大学数据科学学院,澳门,中国 44email:tqzhu@cityu\.edu\.mo
###### 摘要
多变量时间序列数据中的因果发现因变量间复杂的交互、高维性和非线性依赖而具有挑战性。现有方法往往难以捕捉这些复杂性,导致因果结构不准确。为解决这一问题,我们提出了一种新颖框架,利用Transformer架构中的自注意力机制进行因果发现。我们的方法引入了一种新颖的反向因果自注意力机制(CSAM),通过反转令牌(token)并在注意力分数中引入稀疏性,强调潜在和间接的因果关系,聚焦于显著的因果交互并减少伪相关。此外,我们开发了一种全局因果算法以识别全局因果链接,提供因果影响的整体度量,并设计了因果验证模块以确保所识别因果关系的稳健性,增强框架的可靠性。在线性和非线性数据集上的实验以及消融研究和敏感性分析表明,我们的框架优于现有方法,展示了其在复杂多变量时间序列中因果发现的潜力。
## 1 引言
时间序列分析广泛应用于经济学、环境科学和医疗健康等领域。时间序列数据的时序依赖性和动态特性带来了独特挑战,需要先进的分析技术来处理分类和预测等任务。除了这些任务之外,理解多变量时间序列中变量间的因果关系尤为重要,因为它不仅能揭示潜在机制,还能提高预测和分类性能,支持各领域更明智的决策。然而,由于变量随时间推移的复杂交互,时间序列数据中的因果发现仍然具有挑战性。一个主要困难是区分因果关系与相关性,因为时序依赖可能掩盖真实的因果结构,导致潜在的错误解读[13 (https://arxiv.org/html/2607.28212#bib.bib22)]。多变量数据中的高维性和潜在非线性进一步加剧了这一挑战[15 (https://arxiv.org/html/2607.28212#bib.bib18)]。传统方法往往难以应对这些复杂性,这可能限制研究和应用;不准确的因果链接可能导致错误结论和效果不佳的干预,影响关键领域的决策制定[17 (https://arxiv.org/html/2607.28212#bib.bib15)]。
现有的时间序列因果发现方法,包括基于距离的方法[16 (https://arxiv.org/html/2607.28212#bib.bib61)]、基于索引的方法[22 (https://arxiv.org/html/2607.28212#bib.bib20)]和传统统计方法[4 (https://arxiv.org/html/2607.28212#bib.bib1)],主要捕捉线性关系,但往往对噪声敏感,并可能混淆因果关系与相关性,限制了它们在动态多变量环境中的有效性[2 (https://arxiv.org/html/2607.28212#bib.bib11)]。基于核的方法,如核格兰杰因果(KGC)[8 (https://arxiv.org/html/2607.28212#bib.bib4)],将因果发现扩展到非线性关系。基于约束的方法,包括时间序列快速因果推断(tsFCI)[3 (https://arxiv.org/html/2607.28212#bib.bib31)]和PCMCI[14 (https://arxiv.org/html/2607.28212#bib.bib30)],即使存在潜在混杂因素也能检测因果链接。基于评分的方法,如NOTEARS[24 (https://arxiv.org/html/2607.28212#bib.bib33)]和DYNOTEARS[11 (https://arxiv.org/html/2607.28212#bib.bib56)],提供了揭示多变量时间序列因果结构的额外工具,解决了传统方法的一些局限性。
尽管取得了这些进展,但深度学习在因果发现方面的潜力探索仍然有限[10 (https://arxiv.org/html/2607.28212#bib.bib7)],尤其是考虑到它在建模复杂高维数据方面的能力。为进一步解决多变量时间序列数据中的高维性和非线性挑战,我们提出了一种新颖框架,利用反向自注意力机制进行因果发现。首先,我们提出了一种反向因果自注意力机制(CSAM),用于突出潜在和间接的因果关系。具体而言,我们在注意力分数矩阵中应用Sparsemax,引入稀疏性以聚焦于显著的因果交互并减少伪相关。然后,我们开发了一种全局算法,将模型各组件间的注意力分数进行整合,提供一种能捕捉时间序列数据中复杂因果结构的因果影响度量。该方法使模型能够处理非线性交互,同时保持对噪声和混杂因素的稳健性,提高可解释性并减少误报。最后,我们集成排列重要性(PI)[12 (https://arxiv.org/html/2607.28212#bib.bib23)]来验证所识别的因果关系是否稳健,增强我们因果发现流程的可靠性。
综上所述,本文的主要贡献如下:
- −\- 我们提出了一种新颖框架,利用反向因果自注意力机制进行因果发现,能够捕捉多变量时间序列中复杂的非线性因果关系。
- −\- 我们对注意力分数矩阵引入了稀疏性诱导修改,提高可解释性并减少伪相关。
- −\- 我们开发了一种全局因果算法以识别全局因果链接,并设计了因果验证模块以确保所识别关系的稳健性。
- −\- 我们通过在高维复杂时间序列数据上的实验验证了框架,并通过消融研究和敏感性分析证明了每个组件的贡献。
本文结构如下:第2节 (https://arxiv.org/html/2607.28212#S2)回顾时间序列因果发现和注意力机制的相关工作。第3节 (https://arxiv.org/html/2607.28212#S3)介绍本文的定义和假设。第4节 (https://arxiv.org/html/2607.28212#S4)详细介绍我们提出的方法。第5节 (https://arxiv.org/html/2607.28212#S5)展示实验和结果。最后,第6节 (https://arxiv.org/html/2607.28212#S6)总结全文并提出未来研究方向。
## 2 相关工作
##### 时间序列因果发现。
时间序列数据中的因果发现旨在识别因果关系,其中格兰杰因果是一种基础方法。它认为如果时间序列YY的过去值能改进另一个序列XX的预测,则YY格兰杰导致XX[4 (https://arxiv.org/html/2607.28212#bib.bib1)]。在此基础上,KGC[8 (https://arxiv.org/html/2607.28212#bib.bib4)]通过核方法将格兰杰框架扩展到非线性关系。基于距离的方法[16 (https://arxiv.org/html/2607.28212#bib.bib61)]也能捕捉非线性关系,但对噪声敏感且需要仔细的参数调整。此外,基于约束的方法如tsFCI[3 (https://arxiv.org/html/2607.28212#bib.bib31)]即使存在潜在混杂因素也能检测因果链接。PCMCI[14 (https://arxiv.org/html/2607.28212#bib.bib30)]将PC算法[18 (https://arxiv.org/html/2607.28212#bib.bib8)]与瞬时条件独立检验相结合,实现高效的因果结构识别。基于评分的方法,如NOTEARS[24 (https://arxiv.org/html/2607.28212#bib.bib33)]和DYNOTEARS[11 (https://arxiv.org/html/2607.28212#bib.bib56)],使用连续优化来捕捉时序和非线性依赖。此外,[19 (https://arxiv.org/html/2607.28212#bib.bib6),10 (https://arxiv.org/html/2607.28212#bib.bib7)]利用神经网络直接推断因果关系。这些方法共同为分析时间序列中的因果关系提供了一系列工具。
##### 注意力机制。
注意力机制使模型能够专注于相关数据片段,并广泛用于自然语言处理和计算机视觉等领域。注意力机制最初由[1 (https://arxiv.org/html/2607.28212#bib.bib35)]为机器翻译引入,提高了模型的性能和可解释性。由[20 (https://arxiv.org/html/2607.28212#bib.bib36)]提出的完全依赖注意力的Transformer架构在自然语言处理领域树立了新的基准。在时间序列分析中,注意力机制在Informer[25 (https://arxiv.org/html/2607.28212#bib.bib37)]和Crossformer[23 (https://arxiv.org/html/2607.28212#bib.bib38)]等模型中表现出巨大潜力。基于注意力的模型也已应用于因果发现,其中[10 (https://arxiv.org/html/2607.28212#bib.bib7)]将注意力融入卷积神经网络以改进因果效应估计。与这些方法不同,我们提出了一种新颖的CSAM,用于识别多变量时间序列数据中的潜在和非线性因果关系,促进对动态交互的更深理解。
## 3 定义与假设
###### 定义 1(多变量时间序列)
多变量时间序列定义为长度为TT的MM维序列X=(X1,X2,...,XM)\\mathbf\{X\}=\(\\mathbf\{X\}^\{1\},\\mathbf\{X\}^\{2\},\\ldots,\\mathbf\{X\}^\{M\}\),其中每个分量Xi\\mathbf\{X\}^\{i\}表示一个单独的 时间序列。
###### 定义 2(因果图)
给定多变量时间序列X\\mathbf\{X\},其因果图是一个有向无环图(DAG)G=(V,E)G=\(V,E\),其中V={1,2,...,M}V=\\\{1,2,\\dots,M\\\}表示变量(时间序列)的集合,EE是有向边的集合。当且仅当Xi\\mathbf\{X\}^\{i\}格兰杰导致Xj\\mathbf\{X\}^\{j\}时,边(i,j)∈E\(i,j\)\\in E存在。
###### 假设 1(因果马尔可夫性)
因果马尔可夫条件指出,给定直接原因后,每个变量与非效应条件独立,从而将分析聚焦于直接因果依赖。
###### 假设 2(忠实性)
忠实性假设数据中的任何条件独立性都反映真实的因果结构,确保观察到的独立性与实际因果关系相对应。
###### 假设 3(严格因果排序)
因果图中的严格时序排序意味着如果Xi\\mathbf\{X\}^\{i\}导致Xj\\mathbf\{X\}^\{j\},则i0\\epsilon\>0存在,使得对于足够大的TT,Xj\\mathbf\{X\}^\{j\}在有和没有Xi\\mathbf\{X\}^\{i\}作为预测变量时的预测误差之间的最小绝对差超过ε\\epsilon,从而确保真实因果依赖具有最小“信号强度”。
## 4 方法
根据我们提出的定义和假设,我们引入了一种新颖框架,系统地识别多变量时间序列X\\mathbf\{X\}中的格兰杰因果网络。该模型通过矩阵AA来描绘序列组件之间的因果交互。完整时间序列Xt\\mathbf\{X\}\_\{t\}被输入因果自注意力模块(CSAM),该模块在令牌处理和内部动态方面与传统自注意力不同。该模块的输出被送入Transformer,为每个序列Xti\\mathbf\{X\}^\{i\}\_\{t\}生成预测,并在训练过程中识别与其他序列的因果链接。然后通过全局算法和验证策略从Xt\\mathbf\{X\}\_\{t\}推导出格兰杰因果,详见第4.2节 (https://arxiv.org/html/2607.28212#S4.SS2)和第4.3节 (https://arxiv.org/html/2607.28212#S4.SS3)。
### 4.1 因果自注意力机制
Transformer通过自注意力机制有效捕捉序列数据中的复杂依赖。为将其用于因果发现,我们引入了一种反向自注意力机制CSAM,旨在识别多变量时间序列数据中的因果关系。传统自注意力根据输入序列中位置间的亲和度计算注意力分数,公式为:
Attention(Q,K,V)=softmax(QKTdk)V\\text\{Attention\}\(Q,K,V\)=\\text\{softmax\}\\left\(\\frac\{QK^\{T\}\}\{\\sqrt\{d\_\{k\}\}\}\\right\)V (1)
其中QQ、KK和VV分别表示查询、键和值的矩阵,dkd\_\{k\}是键的维度。
在多变量时间序列分析中,每个令牌X={x1,x2,x3,...}X=\\\{x\_\{1\},x\_\{2\},x\_\{3\},\\ldots\\\}表示不同变量的组合,如图1 (https://arxiv.org/html/2607.28212#S4.F1)(a)所示。每个令牌对应一个单一时间点,令牌序列{X1,X2,X3,...}\\\{X\_\{1\},X\_\{2\},X\_\{3\},\\ldots\\\}表示连续的时间点。在自注意力机制中使用这些令牌可以计算时间间关系。
图1:(a) 传统自注意力与 (b) 所提出的因果自注意力机制中令牌表示的对比。
相反,在格兰杰因果分析中,重点是识别不同时间序列之间的关系,而非跨时间间隔的关系。为实现这一点,我们反转了令牌表示。如图1 (https://arxiv.org/html/2607.28212#S4.F1)(b)所示,每个反转令牌X^\\hat\{X\}由单个时间序列内的连续观测组成,X^={x1,x2,x3,...}\\hat\{X\}=\\\{x^\{1\},x^\{2\},x^\{3\},\\ldots\\\},表示一个完整的时间序列。这些反转令牌的集合{X1^,X2^,X3^,...}\\\{\\hat\{X\_\{1\}\},\\hat\{X\_\{2\}\},\\hat\{X\_\{3\}\},\\ldots\\\}表示多个时间序列。在自注意力框架中使用这些反转令牌可以分析跨序列关系,与格兰杰因果目标一致。这种方法保持了每个序列内的时序顺序,同时能够深入探索多变量时间序列中的因果动态。
转置令牌后,我们应用CSAM来揭示时间序列间的格兰杰因果关系,如图2 (https://arxiv.org/html/2607.28212#S4.F2)所示。反转令牌首先通过与权重矩阵Wk^W^\{\\hat\{k\}\}、Wq^W^\{\\hat\{q\}\}和Wv^W^\{\\hat\{v\}\}相乘进行变换,产生键(K^\\hat\{K\})、查询(Q^\\hat\{Q\})和值(V^\\hat\{V\})矩阵:
K^=X^⋅Wk^,Q^=X^⋅Wq^,V^=X^⋅Wv^\\hat\{K\}=\\hat\{X\}\\cdot W^\{\\hat\{k\}\},\\quad\\hat\{Q\}=\\hat\{X\}\\cdot W^\{\\hat\{q\}\},\\quad\\hat\{V\}=\\hat\{X\}\\cdot W^\{\\hat\{v\}\} (2)
必须指出,与标准Transformer中常见维度不同(通常为K∈RN×dk\{K\}\\in\\mathbb\{R\}^\{N\\times d\_\{k\}\},Q∈RN×dq\{Q\}\\in\\mathbb\{R\}^\{N\\times d\_\{q\}\},V∈RN×dv\{V\}\\in\\mathbb\{R\}^\{N\\times d\_\{v\}\}),我们的键(K^\\hat\{K\})、查询(Q^\\hat\{Q\})和值(V^\\hat\{V\})矩阵维度为K^∈RT×dk\\hat\{K\}\\in\\mathbb\{R\}^\{T\\times d\_\{k\}\},Q^∈RT×dq\\hat\{Q\}\\in\\mathbb\{R\}^\{T\\times d\_\{q\}\},V^∈RT×dv\\hat\{V\}\\in\\mathbb\{R\}^\{T\\times d\_\{v\}\},其中NN表示变量数量,TT表示时间...相似文章
MOSAIC:通过稀疏可加可识别因果学习在科学时间序列中进行模块发现
本文介绍了 MOSAIC,这是一种用于科学时间序列中模块发现的方法,它将因果表征学习与稀疏可加可识别因果学习相结合。其目标是在无需事后对齐的情况下,恢复可解释的潜在变量及其关联观测值,并在分子动力学和气候数据等领域进行了验证。
TTCD:基于Transformer的非平稳时间序列数据集成时序因果发现
本文介绍了TTCD,这是一种新颖的框架,利用基于Transformer的特征学习和重建引导的信号蒸馏,从非平稳时间序列数据中进行时序因果发现。
非线性时间序列中的函数值因果影响
本文认为非线性因果发现中的标量边分数掩盖了状态依赖效应,并提出使用Neural Additive Vector Autoregression和Individual Conditional Expectation的函数值因果影响。
代理时代的因果发现
本文认为,语言模型代理应通过提供上下文支持和解释来辅助因果发现工作流程,而非生成因果结论,并介绍了causal-learn+平台以演示这一原则。
因果赌博机的信息导向采样
本文研究了具有不可操纵变量的上下文因果赌博机问题,提出了汤普森采样和信息导向采样(IDS)的因果变体,利用共享因果机制加速决策过程。理论遗憾界和合成任务实验表明,所提方法优于因果和非因果基线。