基于因果效应约束的可解释因果发现

arXiv cs.LG 论文

摘要

本文提出了一种用于条件因果发现的贝叶斯方法,其中因果图和参数的后验以用户指定的因果效应约束(例如,较大的因果效应)为条件。他们采用稀有事件估计技术来处理后验质量较小的事件,并在合成数据和Sachs蛋白质数据集上验证了该方法。

arXiv:2608.12640v1 公告类型:新 摘要:因果发现旨在根据系统生成的数据揭示潜在的因果关系。然而,目标不仅仅是在给定数据时预测因果边,还要能够解释和说明观察到的或假设的现象,例如特别大的因果效应。我们考虑这种条件因果发现任务,并将其表述为一个贝叶斯推断问题,其中我们针对以某个事件(如因果效应约束)为条件的因果图和参数的后验。不幸的是,这带来了计算挑战:当事件的后验质量较小时,现有的贝叶斯因果发现方法难以处理。为解决这个问题,我们采用稀有事件估计技术在联合图-参数空间中进行推断。我们的方法逐渐将粒子总体推向约束区域,同时保留近似条件后验的样本。在合成图上的实证评估验证了我们在小规模和大规模下的准确性,并且我们在Sachs蛋白质数据集上的案例研究中展示了我们的方法如何通过提供通路级摘要来帮助科学探索。
查看原文
查看缓存全文

缓存时间: 2026/08/14 09:30

# 基于因果效应约束的可解释因果发现
来源:https://arxiv.org/html/2608.12640
Guy Van den Broeck 所属机构:美国加利福尼亚大学洛杉矶分校计算机科学系 美国加利福尼亚州洛杉矶
Benjie Wang 所属机构:美国加利福尼亚大学洛杉矶分校计算机科学系 美国加利福尼亚州洛杉矶

###### 摘要

因果发现旨在从系统生成的数据中揭示潜在的因果关系。然而,其目标不仅仅是根据数据预测因果边,还在于能够解释和说明已观测或假设的现象,例如特别大的因果效应。我们将这种*条件*因果发现任务视为一个贝叶斯推断问题,目标是估计在给定事件(如因果效应约束)条件下因果图和参数的后验分布。不幸的是,这带来了计算上的挑战:当该事件的后验质量很小时,现有的贝叶斯因果发现方法难以应对。为解决这个问题,我们采用稀有事件估计技术在图-参数联合空间中进行推断。我们的方法逐步将粒子群推向约束区域,同时维持近似条件后验的样本。在合成图上的实证评估验证了我们在小规模和大规模下的准确性,并且我们在Sachs蛋白数据集上的案例研究中展示了该方法如何通过路径级总结来辅助科学探索。

00脚注文本:我们的代码可在 https://github.com/ZCX031116/MLS-Framework 获取。

## 1 引言

因果发现的研究动机通常不仅仅在于预测,还在于获得对系统运作方式的可解释且可操作的说明。在科学领域,实践者可能不只是询问给定数据下哪个图最有可能;相反,他们可能询问哪些因果机制可以解释某个与领域相关的特定现象。例如,在著名的Sachs蛋白相互作用研究[31 (https://arxiv.org/html/2608.12640#bib.bib12)]中,人们可能想要理解哪些有向通路能够支持从一个蛋白到另一个蛋白的异常大效应,以及这些通路是否提示了合理的干预或后续实验。

后验样本 \(p(G,B\mid\mathcal{D})\):许多合理的 DAG \(G\) 和权重 \(B\):因果效应约束 \(\mathcal{E}_{ij}^{+}(t)=\{(G,B):\mathrm{CE}_{ij}(G,B)\geq t\}\) 使 \(t\) 成为稀有后验事件:条件后验 \(p(G,B\mid\mathcal{D},\mathcal{E}_{ij}(t))\) 突出显示解释该事件的高频通路,通过 \(\mathrm{CE}_{ij}\) 评分:MLS + MCMC。

图1:条件因果发现概览。从因果图和边权的无约束贝叶斯后验出发,我们以用户指定的极端因果效应事件为条件,得到一个约束后验,其样本可以在通路层面进行总结。

在这项工作中,我们将这种“假设”分析形式化为一种*条件*因果发现形式。给定观测数据,我们寻求既在统计上合理又与用户指定约束(例如从节点 \(i\) 到节点 \(j\) 的大因果效应)相一致的因果结构。这预设可能有许多图都能很好地解释数据,因此需要对认知不确定性进行处理。我们采用贝叶斯方法来解决这个问题,在其中表示对图结构和参数的不确定性。我们不是只采用一个估计图,而是考虑有向无环图(\(G\))和参数(\(\theta\))上的后验分布。我们的目标是以后验中由图和参数确定的事件为条件的后验,例如从 \(i\) 到 \(j\) 的带符号因果效应超过阈值 \(t\) 的事件。目标是刻画在因果效应约束下仍然合理的因果结构和有向通路,同时估计事件本身的后验概率。

条件因果发现带来的计算挑战是现有工具无法很好处理的。特别是,感兴趣的事件在无约束后验下可能很罕见,尤其是当因果效应阈值 \(t\) 很大,或我们施加了多个约束的组合时。基于MCMC的标准后验采样器可能产生很少甚至没有满足约束的样本,而简单的基于拒绝的条件化方法则效率低下。即使获得了满足约束的样本,糟糕的混合也可能导致对例如不同因果路径的统计总结不可靠。

因此,我们将强(例如极端效应)约束下的条件因果发现视为一个稀有事件后验推断问题。我们的方法将自适应多层分裂(AMS)[6 (https://arxiv.org/html/2608.12640#bib.bib13)]与图-参数联合空间上的MCMC核结合起来。从任何贝叶斯因果发现方法获得的后验样本开始,我们的方法逐步收紧效应阈值,同时维持一个有代表性的粒子群,从而同时产生尾部概率估计和条件后验样本。这些样本随后可用于总结哪些边和有向通路最能代表极端效应状态。

我们的贡献如下:

- • 我们将条件因果发现表述为极端效应约束下的后验推断,同时针对约束后验样本和后验尾部概率。
- • 我们提供了一种实用的稀有事件推断过程,能够估计较小的后验尾部概率,同时从相应的约束后验中生成具有代表性的图-参数样本。
- • 我们在 \(d\in\{4,8,16,32\}\) 的线性高斯基准上验证了该方法,并给出了Sachs数据集案例研究,展示极端效应条件化如何实现通路级解释和假设生成。

## 2 相关工作

在背景知识或结构约束下进行因果发现已被广泛研究。这类约束通常编码关于图结构的定性陈述,包括必需的或禁止的边、路径或祖先关系[27 (https://arxiv.org/html/2608.12640#bib.bib27), 4 (https://arxiv.org/html/2608.12640#bib.bib29), 1 (https://arxiv.org/html/2608.12640#bib.bib28)]。先前的工作考虑了在这些约束下学习图的可识别性和算法过程[7 (https://arxiv.org/html/2608.12640#bib.bib31), 8 (https://arxiv.org/html/2608.12640#bib.bib30)]。一条相关的研究线使用干预数据作为纯观测之外的额外信息来源[19 (https://arxiv.org/html/2608.12640#bib.bib32), 5 (https://arxiv.org/html/2608.12640#bib.bib33)]。相反,我们的主要动机是可解释性,而不是编码固定知识。我们的技术方法不同之处在于,该约束被灵活地编码为一个定量评分函数,特别是我们将约束编码为对应于因果效应泛函的值,而不是局部结构陈述。此外,我们不是寻求对单个图的精确识别,而是针对一个保留图形和参数结构不确定性的条件贝叶斯后验。

另一条工作线将因果发现与极值理论相结合,以在因果机制在观测分布尾部最为明显时推断因果方向[17 (https://arxiv.org/html/2608.12640#bib.bib26), 28 (https://arxiv.org/html/2608.12640#bib.bib35), 3 (https://arxiv.org/html/2608.12640#bib.bib36)]。在这些方法中,极值主要是数据生成分布的一个特征,并用于可识别性或结构恢复。我们的动机不同:在我们的设定中,极端事件是用户对因果效应泛函的约束,而推断目标是该约束条件下的后验分布。因此,我们的目标不是从重尾观测中识别因果方向,而是刻画哪些后验图、参数和通路解释了异常大或异常小的因果效应。

对于因果图的后验推断,常见方法是在DAG或更高层表示(如排序)上使用马尔可夫链蒙特卡洛(MCMC)采样[12 (https://arxiv.org/html/2608.12640#bib.bib14), 23 (https://arxiv.org/html/2608.12640#bib.bib15), 36 (https://arxiv.org/html/2608.12640#bib.bib6), 15 (https://arxiv.org/html/2608.12640#bib.bib16)]。最近的工作开发了具有局部信息和自适应提议的高效DAG空间MCMC采样器,包括PARNI-DAG[24 (https://arxiv.org/html/2608.12640#bib.bib23)],它构建由后验信息引导的自适应随机邻域,并可以利用预调优的骨架来提高可扩展性。这些图后验样本不仅有助于表示结构不确定性,还可用于下游因果推断;最近的基准测试工作通过下游处理效应估计来评估贝叶斯因果发现方法[11 (https://arxiv.org/html/2608.12640#bib.bib34)]。

替代方法通过图上的变分推断来近似后验[2 (https://arxiv.org/html/2608.12640#bib.bib17), 25 (https://arxiv.org/html/2608.12640#bib.bib1), 9 (https://arxiv.org/html/2608.12640#bib.bib18), 37 (https://arxiv.org/html/2608.12640#bib.bib11), 10 (https://arxiv.org/html/2608.12640#bib.bib19), 30 (https://arxiv.org/html/2608.12640#bib.bib21), 34 (https://arxiv.org/html/2608.12640#bib.bib20)]。这些方法的目标要么是生成反映结构不确定性的图样本,要么是支持用于因果推断的贝叶斯模型平均[35 (https://arxiv.org/html/2608.12640#bib.bib22)]。

我们的计算方法依赖于稀有事件模拟文献,特别是自适应多层分裂[6 (https://arxiv.org/html/2608.12640#bib.bib13)]。分裂方法通过引入中间阈值并反复将粒子群推向更稀有事件来估计小概率。我们将这一思想应用于贝叶斯因果发现,通过因果效应评分定义层级,并在图-参数联合空间上使用MCMC移动。这既产生了极端效应事件后验概率的估计,也产生了相应条件后验的样本。

## 3 预备知识

##### 因果贝叶斯网络

贝叶斯网络(BN)\((G,\theta)\) 是一个概率模型 \(p(\bm{X})\),定义在 \(d\) 个变量 \(\bm{X}=\{X_{1},\ldots,X_{d}\}\) 上,由有向无环图(DAG)\(G\) 和机制参数 \(\theta\) 指定。该图编码条件独立性,而 \(\theta_{i}\) 参数化 \(X_{i}\) 在给定其父节点下的条件分布。联合分布分解为

\(p(\bm{X}\mid G,\theta)=\prod_{i=1}^{d}p\left(X_{i}\mid\mathrm{pa}_{G}(X_{i}),\theta_{i}\right)\),其中 \(\mathrm{pa}_{G}(X_{i})\) 表示 \(X_{i}\) 在 \(G\) 中的父节点。

在本文中,通用机制参数 \(\theta\) 通过线性高斯结构方程模型实例化。具体地,观测变量满足 \(\bm{X}=\bm{X}B+\bm{\epsilon}\),其中 \(B\in\mathbb{R}^{d\times d}\) 是加权邻接矩阵,且 \(\bm{\epsilon}\sim\mathcal{N}(\bm{b},\Sigma)\),其中 \(\bm{b}\in\mathbb{R}^{d}\),\(\Sigma\in\mathbb{R}_{\geq 0}^{d\times d}\) 是对角矩阵。对于给定的DAG \(G\),只要 \(i\) 不是 \(j\) 在 \(G\) 中的父节点,我们就强制 \(B_{ij}=0\)。

因果贝叶斯网络[33 (https://arxiv.org/html/2608.12640#bib.bib2), 29 (https://arxiv.org/html/2608.12640#bib.bib3)]为 \(G\) 中的有向边添加了因果解释:它们描述了联合分布在干预下如何变化。在线性高斯SEM中,从 \(X_{i}\) 到 \(X_{j}\) 的带符号总因果效应是 \(X_{j}\) 的干预后均值关于 \(X_{i}\) 干预的导数。它具有闭合形式

\(\mathrm{CE}_{ij}(G,B)\triangleq\mathrm{CE}(i\to j\mid G,B)=\left[(I-B)^{-1}\right]_{ij}\) (1) 这是线性结构方程模型的标准总效应公式[32 (https://arxiv.org/html/2608.12640#bib.bib37)]。由于 \(G\) 是无环的,\(B\) 在拓扑排序后是幂零的,因此 \((I-B)^{-1}=I+B+B^{2}+\cdots+B^{d-1}\)。因此,\((I-B)^{-1}\) 的 \((i,j)\) 元素聚合了从 \(X_{i}\) 到 \(X_{j}\) 的所有有向路径上边权的乘积。这个路径和解释在下面很有用,因为我们的条件后验总结侧重于哪些边和有向通路解释了异常大或小的总效应。

在本文的其余部分,我们将图-权状态写为 \(Z=(G,B)\),并将带符号因果效应简写为 \(\mathrm{CE}_{ij}(Z)=\mathrm{CE}_{ij}(G,B)\)。对于目标有序对 \((i,j)\) 和阈值 \(t>0\),我们使用“极端因果效应”来表示总因果效应落在用户指定的后验尾部区域内。特别地,我们定义右尾和左尾事件

\(\mathcal{E}_{ij}^{+}(t)=\left\{Z:\mathrm{CE}_{ij}(Z)\geq t\right\}\), (2) \(\mathcal{E}_{ij}^{-}(t)=\left\{Z:\mathrm{CE}_{ij}(Z)\leq -t\right\}\)。当上下文中的符号明确时,我们用 \(\mathcal{E}_{ij}(t)\) 表示任一尾部事件。这些事件在我们的推断问题中扮演两个角色。首先,我们估计它们的后验概率,例如 \(\mathbb{P}(\mathcal{E}_{ij}^{\pm}(t)\mid\mathcal{D})\)。其次,我们用它们来定义约束后验 \(p\left(G,B\mid\mathcal{D},\mathcal{E}_{ij}^{\pm}(t)\right)\),并从该后验中抽取图-权样本以进行通路级总结。

##### 贝叶斯因果发现

因果发现[22 (https://arxiv.org/html/2608.12640#bib.bib4), 16 (https://arxiv.org/html/2608.12640#bib.bib5)]是推断生成观测数据集 \(\mathcal{D}\) 的DAG \(G\) 的问题。我们做出因果充分性的常见假设,即不存在潜在混淆因素。即使在此假设下,由于采样不确定性和马尔可夫等价性,单个DAG也可能无法从有限观测数据中可靠识别。因此,贝叶斯因果发现通过图和参数上的后验分布来表示不确定性,而不是只采用单一结构。

我们在DAG上放置用户指定的先验 \(p(G)\),并对线性高斯模型使用BGe边际似然 \(p(\mathcal{D}\mid G)\)[13 (https://arxiv.org/html/2608.12640#bib.bib7), 14 (https://arxiv.org/html/2608.12640#bib.bib8)]。该方法本身不要求特定的图先验;在实验中,我们使用稀疏Erdős–R’enyi DAG先验,具体的稀疏性设置见附录A.1 (https://arxiv.org/html/2608.12640#A1.SS1)。在给定 \(G\) 的情况下,边权后验按节点分解:

\(p(B\mid G,\mathcal{D})=\prod_{j=1}^{d}p\left(B_{\mathrm{pa}_{G}(X_{j}),j}\mid G,\mathcal{D}\right)\),其中不在父节点集中的系数

相似文章

用于部分因果效应识别的最优实验

arXiv cs.AI

本文提出了“最大效力问题”,旨在选择受成本约束的实验,以最大程度地缩小部分因果效应的界限。作者提出了图形剪枝准则以减少搜索空间,并在NHANES健康数据集上展示了该方法的应用。

代理时代的因果发现

Hugging Face Daily Papers

本文认为,语言模型代理应通过提供上下文支持和解释来辅助因果发现工作流程,而非生成因果结论,并介绍了causal-learn+平台以演示这一原则。

CausaLab: 面向AI科学家的可扩展交互式因果发现环境

Hugging Face Daily Papers

CausaLab 是一个可扩展的环境,用于评估LLM智能体在交互式因果发现中的表现,同时衡量预测准确性和对潜在因果机制的忠实复现。实验揭示了预测与机制复现之间的差距,突显了当前LLM智能体作为实验性因果推理者的局限性。