贝叶斯因果发现如何失败?潜在混杂下线性高斯网络中结构后果的刻画

arXiv cs.AI 论文

摘要

本文分析了在潜在混杂下线性高斯网络中贝叶斯因果发现如何失败,推导出一个导致评分函数偏好虚假边的相关性阈值,并刻画了两种不同的后验失败模式。

arXiv:2607.09449v1 公告类型:新 摘要:贝叶斯因果发现因其通过后验推断量化有向无环图(DAG)上的认知不确定性的能力而被广泛使用。然而,其在潜在混杂下的行为仍知之甚少,因为现有工作通常指出混杂破坏了可识别性,但没有刻画DAG后验分布如何响应。在这项工作中,我们分析了线性高斯因果模型在潜在混杂下的后验行为,重点关注恰好两个观测变量之间的加性潜在混杂。我们推导出一个临界相关性阈值,超过该阈值时评分函数偏好混杂变量之间具有虚假边的图,并表明该阈值随样本量增加而降低——更多数据降低了偏好虚假边所需的相关性。超过这个阈值,我们刻画了由混杂变量周围的局部结构决定的两种不同的后验失败模式。我们的发现得到了多个图结构上精确后验计算的支持,展示了这两种预测的失败模式。
查看原文
查看缓存全文

缓存时间: 2026/07/13 07:53

# 贝叶斯因果发现如何失败?表征潜在混杂下线性高斯网络中的结构性后果  
来源:https://arxiv.org/html/2607.09449  
Silja Renooij 乌得勒支大学信息与计算科学系  
Anna Kononova 莱顿大学莱顿高级计算机科学研究所  

###### 摘要  

贝叶斯因果发现因其能够通过后验推断量化有向无环图(\(DAGs\))的认知不确定性而被广泛使用。然而,其在潜在混杂下的行为仍未被充分理解,因为现有工作通常指出混杂会破坏可识别性,但并未表征 DAG 后验分布如何响应。在本工作中,我们分析了线性高斯因果模型中潜在混杂下的后验行为,重点关注恰好两个观测变量之间的加性潜在混杂。我们推导出一个临界相关性阈值,超过该阈值后,得分函数会倾向于包含混杂变量之间虚假边的图,并表明该阈值随样本量减小而降低——更多数据会降低虚假边被青睐所需的相关性。超过该阈值后,我们根据混杂变量周围的局部结构,描述了两种不同的后验失效模式。我们的发现通过多个图结构上的精确后验计算得到支持,同时展示了预测的两种失效模式。

## 1 引言  

揭示系统变量之间的因果关系是科学领域的核心问题。贝叶斯网络和结构方程模型为表示此类依赖关系提供了原理性框架[17 (https://arxiv.org/html/2607.09449#bib.bib32), 11 (https://arxiv.org/html/2607.09449#bib.bib19)]。结构学习方法旨在从观测数据中恢复代表底层数据生成过程的图,但本质上受限于统计不确定性和可识别性约束[8 (https://arxiv.org/html/2607.09449#bib.bib13)]。相比之下,贝叶斯因果结构学习推断候选有向无环图(DAGs)上的后验分布 \(p(G \mid D)\),这些图代表底层因果系统[6 (https://arxiv.org/html/2607.09449#bib.bib9)],从而能够原理性地量化认知不确定性。该分布允许评估对推断结构的置信度,并支持下游任务,如实验设计和主动因果发现[22 (https://arxiv.org/html/2607.09449#bib.bib41), 16 (https://arxiv.org/html/2607.09449#bib.bib29)],其中候选图的不确定性起着核心作用。然而,这种后验不确定性在建模假设(如潜在混杂)被违反时如何变化,目前尚不清楚。

从观测数据中基于后验的因果结论的可靠性——即后验概率是否如实反映对合理结构的不确定性——取决于两个关键组成部分:可识别性和评分。在可识别性方面,在因果马尔可夫条件、因果充分性(无潜在混杂)和忠实性假设下,即使在无限数据下,观测数据也仅能将因果结构区分到马尔可夫等价类[23 (https://arxiv.org/html/2607.09449#bib.bib43), 25 (https://arxiv.org/html/2607.09449#bib.bib45)]。在评分方面,评分选择——例如线性高斯模型中的贝叶斯高斯等价(BGe)评分[7 (https://arxiv.org/html/2607.09449#bib.bib12), 12 (https://arxiv.org/html/2607.09449#bib.bib20)]——决定了在独立外生噪声和高斯性等假设下,似然和先验如何控制证据转化为候选因果结构上的后验概率。尽管可识别性和评分在标准假设下已被充分理解,但当这些假设被违反时,它们如何相互作用影响后验行为仍不清楚。

在这些假设中,因果充分性对从观测数据中进行因果发现尤为关键。该假设在实践中不可检验,但在许多应用中经常被违反。因果发现方法被广泛应用于基因调控网络从表达数据中的推断等场景[5 (https://arxiv.org/html/2607.09449#bib.bib8), 19 (https://arxiv.org/html/2607.09449#bib.bib35), 1 (https://arxiv.org/html/2607.09449#bib.bib1)]。在这里,未测量的细胞状态、批次效应和潜在调控因子可能引起混杂效应[14 (https://arxiv.org/html/2607.09449#bib.bib22), 3 (https://arxiv.org/html/2607.09449#bib.bib6), 26 (https://arxiv.org/html/2607.09449#bib.bib46)]。类似地,在临床流行病学中,贝叶斯结构学习被用于观测性患者数据,其中未测量的特征被认为是混杂偏倚的公认来源[13 (https://arxiv.org/html/2607.09449#bib.bib21)]。对于贝叶斯因果发现,这些实践中的违反引发了关于潜在混杂下后验不确定性如何表现的问题。

现有关于贝叶斯因果发现和潜在混杂的工作主要分为两类。(i) 大量工作发展在因果充分性假设下对 DAG 的贝叶斯推断——包括 order MCMC[6 (https://arxiv.org/html/2607.09449#bib.bib9)] 和 GADGET[24 (https://arxiv.org/html/2607.09449#bib.bib44)]。(ii) 另一类工作通过转向更丰富的模型类来处理混杂问题,其动机在于存在潜在混杂时,观测变量上的因果结构通常无法从观测数据中识别为一个因果充分的 DAG[21 (https://arxiv.org/html/2607.09449#bib.bib39), 18 (https://arxiv.org/html/2607.09449#bib.bib34)]。这包括基于约束的方法,如 FCI 及其变体[21 (https://arxiv.org/html/2607.09449#bib.bib39), 27 (https://arxiv.org/html/2607.09449#bib.bib48)],这些方法返回部分祖先图,以及同时对有向混合图(ADMGs)和潜在变量进行贝叶斯推断[2 (https://arxiv.org/html/2607.09449#bib.bib3)]——通过改变推断目标来解决该问题。假设违反下的实证基准进一步表明,大多数被基准测试的因果发现方法并未显式支持混杂效应,并且由潜在混杂引起的虚假相关性会降低边选择和图恢复的性能[15 (https://arxiv.org/html/2607.09449#bib.bib27)]。这些方法均未解决一个关键问题:当基于 DAG 的贝叶斯因果发现方法应用于存在未观测混杂的数据时会发生什么:后验是否适当地反映了由此产生的不确定性,还是集中在系统性地错误推断的结构上?更广泛地,这种行为是有结构的且可预测的,还是本质上不可靠的?

在本文中,我们通过提供潜在混杂下后验行为的结构性特征来回答上述问题。我们考虑一个简单但具有代表性的设置:线性高斯加性噪声模型中,一个单一的加性潜在混杂因子恰好影响两个观测变量。在此设置中,我们推导出一个依赖于样本量的临界相关性阈值,超过该阈值后,后验开始向不正确的因果图转移。然后,我们识别出两种性质上不同的失效模式,其中后验行为由受混杂影响的局部区域的结构特性所支配。

## 2 背景  

### 2.1 线性高斯 SCM 与潜在混杂  

一个关于变量 \(\mathbf{X} = (X_1, \dots, X_n)\) 的*结构因果模型*(SCM)将每个变量指定为其因果父节点和独立外生噪声项的一个确定性函数[17 (https://arxiv.org/html/2607.09449#bib.bib32)]。我们使用*线性高斯*SCM,其中每个变量满足  

\[
X_i = \sum_{j \in \mathrm{pa}(i)} \beta_{ij} X_j + \varepsilon_i, \quad \varepsilon_i \sim \mathcal{N}(0, \sigma_i^2),
\]

其中 \(\mathrm{pa}(i)\) 是 \(X_i\) 在有向无环图(DAG)\(G\) 中的父节点集,噪声项 \(\varepsilon_i\) 相互独立,且系数 \(\beta_{ij}\) 远离零以确保每条边上的非平凡依赖。DAG、系数和噪声方差共同在 \(\mathbf{X}\) 上诱导出一个中心化的高斯分布。

上述设置假设每对可观测变量的任何共同原因本身是可观测的。当这一假设不成立时,一个未观测变量 \(H\) 可能同时影响多个可观测变量。我们采用一个高斯*加性潜在混杂*模型:如果 \(H \sim \mathcal{N}(0, \sigma_H^2)\) 混杂了两个在底层 DAG 中不相邻的可观测变量 \(X_j\) 和 \(X_k\),则它们的结构方程变为  

\[
X_j = \sum_{\ell \in \mathrm{pa}(j)} \beta_{j\ell} X_\ell + \gamma_j H + \varepsilon_j, \quad X_k = \sum_{\ell \in \mathrm{pa}(k)} \beta_{k\ell} X_\ell + \gamma_k H + \varepsilon_k, \tag{1}
\]

其中混杂系数 \(\gamma_j, \gamma_k\) 和噪声项独立于 \(H\)。我们选择 \(H\) 为高斯分布,使得边缘化 \(H\) 后 \(\mathbf{X}\) 上的联合分布仍为高斯分布。边缘化引入了 \(X_j\) 与 \(X_k\) 之间的额外协方差贡献 \(\gamma_j \gamma_k \sigma_H^2\):由于 \(X_j\) 和 \(X_k\) 没有边连接,没有表示可观测因果结构的 DAG 可以解释该依赖。

### 2.2 贝叶斯网络结构学习  

贝叶斯网络通过一个有向无环图(DAG)\(G\) 表示变量 \(X_1, \dots, X_n\) 之间的依赖关系,其中每个变量在给定其父节点 \(\mathrm{pa}_G(i)\) 后条件独立于其非后代变量[17 (https://arxiv.org/html/2607.09449#bib.bib32)]。联合分布分解为  

\[
p(X_1, \dots, X_n \mid G) = \prod_{i=1}^n p\bigl(X_i \mid \mathrm{pa}_G(i)\bigr), \tag{2}
\]

不同的 DAG 编码不同的条件独立关系集合。

贝叶斯结构学习的目标是从数据中推断 DAG。由于不同的 DAG 施加不同的条件独立关系,从而产生不同的联合分布分解,观测数据的边际似然 \(P(\mathcal{D} \mid G)\) 依赖于具体的 DAG \(G\)。我们假设数据集包含 \(N\) 个观测值 \(\mathcal{D} = \{\mathbf{x}^{(1)}, \dots, \mathbf{x}^{(N)}\}\),其中每个 \(\mathbf{x}^{(j)} \in \mathbb{R}^n\) 是随机向量 \(\mathbf{X} = (X_1, \dots, X_n)^\top\) 的一个实现。遵循贝叶斯范式[6 (https://arxiv.org/html/2607.09449#bib.bib9)],DAG 上的后验为  

\[
P(G \mid \mathcal{D}) = \frac{P(\mathcal{D} \mid G) \, P(G)}{P(\mathcal{D})} \propto P(\mathcal{D} \mid G) \, P(G), \tag{3}
\]

其中 \(P(G)\) 是 DAG 上的先验,\(P(\mathcal{D}) = \sum_{G'} P(\mathcal{D} \mid G') \, P(G')\) 是一个与 \(G\) 无关的归一化常数。在没有图先验知识的情况下,我们假设所有 DAG 先验等可能,即对所有 \(G\) 有 \(P(G)=c\),因此后验正比于边际似然。

边际似然通过积分掉局部参数 \(\theta\)——定义了每个节点给定其父节点时条件分布的边系数 \(\{\beta_{ij}\}\) 和噪声方差 \(\{\sigma_i^2\}\)——以及参数先验得到:  

\[
P(\mathcal{D} \mid G) = \int P(\mathcal{D} \mid G, \theta) \, P(\theta \mid G) \, d\theta.
\]

两个 DAG 如果蕴含关于 \(X_1, \dots, X_n\) 相同的条件独立关系,则它们是*马尔可夫等价*的;仅凭观测数据无法区分它们[23 (https://arxiv.org/html/2607.09449#bib.bib43), 4 (https://arxiv.org/html/2607.09449#bib.bib7)]。根据定义,两个 DAG 是马尔可夫等价的当且仅当它们具有相同的骨架(忽略边方向得到的无向图)和相同的*碰撞点*集合:三元组 \(X_i \to X_j \leftarrow X_k\),其中 \(X_i\) 和 \(X_k\) 不相邻。由此产生的等价类称为马尔可夫等价类(MECs)。如果一个边际似然将一个 MEC 内的所有 DAG 赋予相同的值,则称其为*评分等价*的,因为这些 DAG 在观测上是不可区分的。只有两种贝叶斯评分满足此性质:针对类别数据的离散 BDe 评分和针对线性高斯 SCM 的高斯 BGe 评分[9 (https://arxiv.org/html/2607.09449#bib.bib14)]。我们在本工作中全程关注 BGe 评分。

对于线性高斯 SCM,在 DAG \(G\) 下 \(\mathbf{X}\) 的联合分布是多变量高斯的,即 \(\mathbf{X} \mid G \sim \mathcal{N}_n(\boldsymbol{\mu}^G, \Sigma^G)\),其均值向量 \(\boldsymbol{\mu}^G\) 和协方差矩阵 \(\Sigma^G\) 与由 \(G\) 蕴含的分解 (2) 一致。BGe 评分[7 (https://arxiv.org/html/2607.09449#bib.bib12)] 在联合均值和精度矩阵 \((\boldsymbol{\mu}, \Sigma^{-1})\) 上放置了一个完全共轭的正态–Wishart 先验:

\[
\boldsymbol{\mu} \mid \Sigma \sim \mathcal{N}_n\bigl(\boldsymbol{\mu}_0, \alpha_\mu^{-1} \Sigma\bigr), \quad \Sigma^{-1} \sim \mathcal{W}_n(\alpha_w, T),
\]

参数化为先验均值 \(\boldsymbol{\mu}_0 \in \mathbb{R}^n\)、均值的先验精度 \(\alpha_\mu > 0\)、先验自由度 \(\alpha_w > n-1\) 以及正定尺度矩阵 \(T \in \mathbb{R}^{n \times n}\)。此处 \(\mathcal{W}_n(\alpha_w, T)\) 表示 \(n\) 维 Wishart 分布。与高斯似然的共轭性产生了一个正态–Wishart 后验,并且 \(G\) 的边际似然 \(P(\mathcal{D} \mid G)\) 可以解析计算,称为 \(G\) 的 BGe 评分。由于评分的模块性,评分的对数可分解为局部评分之和:

\[
s(G) := \log P(\mathcal{D} \mid G) = \log \prod_{i=1}^n P\bigl(\mathcal{D} \mid i, \operatorname{pa}_G(i)\bigr) = \sum_{i=1}^n s\bigl(i, \operatorname{pa}_G(i)\bigr). \tag{4}
\]

由于对数函数是单调的,并且我们对图采用均匀先验,比较 \(s(G)\) 的值等价于比较评分;因此我们全程使用 \(s(G)\)。关于 BGe 评分的更详细阐述可参见 [7 (https://arxiv.org/html/2607.09449#bib.bib12), 12 (https://arxiv.org/html/2607.09449#bib.bib20)]。

## 3 潜在混杂下的虚假边包含  

方程 (1) 中的潜在混杂因子 \(H\) 在 \(X_j\) 与 \(X_k\) 之间诱导了一个额外的依赖关系。一旦这种依赖足够强,它就无法通过观测变量之间的任何有向边来解释。因此,边际

相似文章

非线性时间序列中的函数值因果影响

arXiv cs.LG

本文认为非线性因果发现中的标量边分数掩盖了状态依赖效应,并提出使用Neural Additive Vector Autoregression和Individual Conditional Expectation的函数值因果影响。