图手术与do算子:无环结构因果模型的精确对应
摘要
本文在无环结构因果模型中建立了图手术与do算子之间的精确数学对应,证明了它们在依赖图方面的等价性。
arXiv:2608.17634v1 公告类型:新
摘要:$\operatorname{do}$算子在图形上通过删除指向其目标的箭头来描述,在功能上通过将目标机制替换为常数来描述。称这些操作等价尚未是一个数学陈述:一个返回一个图并仅记住目标,而另一个返回机制并记住施加的值。我们为具有有限内生变量的确定性无环结构因果模型在依赖级别上进行了精确比较。如果$\operatorname{Graph}(F)$提取机制族$F$的依赖关系,我们的主要定理是$\operatorname{Graph}(F^\iota)=\operatorname{Surg}(\operatorname{Graph}(F),T_\iota)$。因此,替换目标机制恰好移除了图手术所移除的依赖关系。对于一个图可能包含未使用箭头的模型$M=(G,F)$,我们刻画了当用$G$代替$\operatorname{Graph}(F)$时相同等式何时成立;当$G$精确记录$F$的依赖关系时,它对每个干预都成立。然后我们定义干预模型,刻画其运行,展示顺序干预如何组合,并证明结果仅取决于其实际依赖祖先的干预。
查看缓存全文
缓存时间: 2026/08/19 10:09
# 图形手术与Do算符
来源:https://arxiv.org/html/2608.17634
非循环结构因果模型的精确对应关系
###### 摘要
do\doexpr算符在图形上表现为删除指向目标变量的箭头,在功能上表现为用常数替换其机制。称这些操作等价尚未构成数学陈述:一个返回图并仅记录目标变量,另一个返回机制并记录施加的值。我们为具有有限内生变量的确定性非循环结构因果模型建立了依赖层面的精确比较。若Graph(F)\Graph(F)提取机制族F的依赖关系,我们的主要定理是:
Graph(F^ι)=Surg(Graph(F),T_ι)\.
\Graph(F^{\iota})=\Surg\bigl(\Graph(F),T_{\iota}\bigr)\.
因此,替换目标机制恰好移除了图形手术所移除的依赖关系。对于图G可能包含未使用箭头的模型M=(G,F),我们刻画了当Graph(F)\Graph(F)被G替代时等式仍然成立的条件;当且仅当G精确记录F的依赖关系时,该等式对所有干预成立。我们随后定义干预模型,刻画其运行,展示顺序干预如何组合,并证明结果仅取决于其实际依赖祖先上的干预。
###### 关键词:
结构因果模型 干预 Do算符 图形手术 依赖图
## 1 引言
do\doexpr算符是结构因果模型中干预的标准记法[4 (https://arxiv.org/html/2608.17634#bib.bib4)]。诸如do(A=a)\doexpr(A=a)的表达式表示A不再由其通常机制计算:它由实验者提供并保持为a。形式语义应识别由此产生的模型并解释其行为。
张猜想删除传入箭头和用常数替换机制是干预的等价视角[6 (https://arxiv.org/html/2608.17634#bib.bib6), Sec. 6.4]。“等价”一词需要精确化。图形手术和机制替换并非字面上相同的操作:它们作用于不同的对象,更重要的是,图形手术无法区分do(A=0)\doexpr(A=0)与do(A=1)\doexpr(A=1)。一个自然的比较是在剩余的依赖关系之间。我们对此比较进行形式化,并为具有有限内生变量的确定性非循环结构因果模型证明它。
我们的出发点是因果模型M≔(G,F)\coloneqq(G,F),包含两个分量。有向无环图G描述哪些变量可以直接影响哪些变量,机制族F说明如何计算它们的值。兼容性要求F使用的每个依赖关系都作为G的箭头出现;并不要求每个箭头都被使用。当G的箭头恰好是F的依赖关系时,我们称该模型是精确的。对于外生状态u,Run(M,u)\Run(M,u)是由机制生成的唯一世界。
我们用类型相容的偏映射ι\iota在V上表示同时干预,其定义域T_ι\是目标集。在图上,Surg(G,T_ι)\Surg(G,T_{\iota})删除进入目标的箭头。在方程中,F^{\iota}用ι\iota提供的常数替换相应机制。我们的中心结果表明,以任一顺序都可以得到相同的依赖图:先更新机制再提取其依赖关系,或者先提取依赖关系再进行图形手术。当提供的图G是精确时,这也等于直接对G进行手术得到的图。
我们的主要结果是:
1. 图形手术与常数机制替换之间的精确对应(定理3.1 (https://arxiv.org/html/2608.17634#S3.Thmtheorem1));
2. 刻画此对应何时与作为因果模型一部分提供的图一致(推论1 (https://arxiv.org/html/2608.17634#Thmcorollary1));
3. 组合顺序干预的法则,包括后续赋值替换先前赋值的事实(定理4.1 (https://arxiv.org/html/2608.17634#S4.Thmtheorem1));以及
4. 祖先定理:一组变量的值仅取决于应用于其实际依赖祖先的那部分干预(定理5.1 (https://arxiv.org/html/2608.17634#S5.Thmtheorem1))。
## 2 结构因果模型
令V为有限内生变量集。每个v∈V有一个非空值集\mathcal{X}_{v}。令
\mathcal{X}≔∏_{v∈V}\mathcal{X}_{v}
为完全赋值集,我们称之为*世界*。对于S⊆V,记x_{S}为世界x∈\mathcal{X}在S上的限制。令\mathcal{U}为非空外生状态集。元素u∈\mathcal{U}可以收集局部扰动、共享背景因子或任何在内生方程外固定的其他信息。不需要概率法则。
V上的机制族是一组函数
F_{v}:\mathcal{U}×\mathcal{X}→\mathcal{X}_{v}\qquad(v∈V)\.
我们有意为每个机制赋予公共域\mathcal{U}×\mathcal{X}。这避免了将先验父集构建到F_{v}的类型中,并让依赖关系可以从函数本身恢复:F_{v}忽略的坐标不贡献箭头。兼容性将要求可能影响F_{v}的每个坐标都由G允许,而非循环性将使所得方程可按拓扑顺序求值。
###### 定义1(依赖图)
机制F_{v}*依赖于*w∈V,如果仅改变w就能改变F_{v}返回的值。即存在u∈\mathcal{U}和世界x,y∈\mathcal{X},它们在所有变量上一致(可能w除外),但满足F_{v}(u,x)≠F_{v}(u,y)。F的依赖图记作Graph(F)\Graph(F),其顶点集为V,当且仅当F_{v}依赖于w时存在箭头w→v。
因此图记录的是实际依赖关系,而不仅仅是允许的依赖关系。
###### 定义2(因果模型)
确定性非循环结构因果模型是一个对M≔(G,F)\coloneqq(G,F),其中G是有向无环图,F是与之兼容的机制族:Graph(F)\Graph(F)的每个箭头也是G的箭头。当G有箭头w→v时,称变量w是v的父节点。当G=Graph(F)\Graph(F)时,模型是*精确的*。
兼容性赋予图和机制不同的角色。图说明哪些依赖关系被允许;机制决定在特定模型中使用了哪些依赖关系。例如,即使F_{v}忽略w,G仍可能包含w→v;这样的模型是兼容的但不是精确的。尽管F_{v}以整个世界作为输入写就,但兼容性确保其值仅依赖于v的父节点。
###### 引理1(仅父节点重要)
若M=(G,F)是因果模型,且两个世界x,y∈\mathcal{X}在v的每个父节点上一致,则对每个u∈\mathcal{U}有
F_{v}(u,x)=F_{v}(u,y)\.
###### 证明
集合V是有限的。通过一次改变一个变量从x变换到y。仅需改变非父节点。若w不是v的父节点,兼容性意味着w→v不是Graph(F)\Graph(F)的箭头。根据定义1,仅改变w不会改变F_{v}返回的值。
###### 引理2(唯一性)
对每个因果模型M=(G,F)和外生状态u∈\mathcal{U},恰好存在一个世界x∈\mathcal{X}满足
x_{v}=F_{v}(u,x)\qquad(v∈V)\.
###### 证明
将变量排序为v_{1},…,v_{n},使得每个父节点出现在其子节点之前。按该顺序构造一个世界。在第k步,任意填充分配的坐标并评估F_{v_{k}}。其父节点已有值,因此引理1使得结果独立于那些临时选择。用其作为x_{v_{k}}。完成的世界满足每个方程。
若x和y都满足方程,沿相同顺序归纳表明它们一致。实际上,它们在v_{k}的父节点上一致,因此引理1给出F_{v_{k}}(u,x)=F_{v_{k}}(u,y),从而x_{v_{k}}=y_{v_{k}}。
###### 定义3(运行)
对于模型M=(G,F)和外生状态u∈\mathcal{U},定义Run(M,u)\Run(M,u)为唯一世界x∈\mathcal{X},使得对每个v∈V有
x_{v}=F_{v}(u,x)\.
## 3 do\doexpr算符
干预在某些变量上提供值,而其他所有变量保持未指定。我们通过仅列出目标变量的值来表示它。
###### 定义4(干预)
干预ι\iota是V上的类型相容偏映射。其定义域T_ι≔dom(ι)⊆V是目标集,且对每个v∈T_ι有ι(v)∈\mathcal{X}_{v}。我们记ι_{v}≔ι(v)。空干预是空映射,记作∅。对于S⊆V,ι|_{S}表示ι在S上的普通限制。当T_ι=\{A\}且ι_{A}=a时,我们将干预记作do(A=a)\doexpr(A=a)。
###### 定义5(图形手术)
对于V上的有向图G和目标集T⊆V,Surg(G,T)\Surg(G,T)与G具有相同的顶点,并恰好删除进入T中顶点的所有箭头。
图形手术仅取决于目标集,不记录在该处施加的值。这些值通过以下对机制的改变引入。
###### 定义6(机制替换)
对于V上的机制族F和干预ι\iota,定义F^{\iota}如下:
F^{\iota}_{v}(u,x)≔
\begin{cases}
ι_{v},& v∈T_{ι},\\
F_{v}(u,x),& v∉T_{ι}.
\end{cases}
###### 示例1(三变量干预)
令V≔\{A,B,C\},每个内生变量值集为\mathbb{R},且\mathcal{U}≔\mathbb{R}^{2}。对于u=(u_{A},u_{B}),定义
F_{A}(u,x)≔u_{A},\qquad F_{B}(u,x)≔x_{A}+u_{B},\qquad F_{C}(u,x)≔2x_{B}\.
则Graph(F)\Graph(F)是链
A→B→C\.
若ι≔do(B=7)\iota\coloneqq\doexpr(B=7),则F^{\iota}_{B}是常数7,而其他两个机制不变。因此Graph(F^{\iota})\Graph(F^{\iota})仅包含B→C,恰好是通过删除进入B的箭头获得的图。更新后的方程有唯一解
(A,B,C)=(u_{A},7,14)\.
###### 定理3.1(图-机制对应)
对于V上的每个机制族F和干预ι\iota,
Graph(F^{\iota})=Surg(Graph(F),T_{ι})\.
\Graph(F^{\iota})=\Surg\bigl(\Graph(F),T_{\iota}\bigr)\.
###### 证明
固定两个变量w,v∈V。若v是目标,则F^{\iota}_{v}是常数,因此Graph(F^{\iota})中没有箭头进入v;图形手术同样删除所有进入v的箭头。若v不是目标,则F^{\iota}_{v}=F_{v},因此w→v是Graph(F^{\iota})的箭头当且仅当它是Graph(F)的箭头;图形手术保留所有此类箭头。因此两个图具有相同的箭头。
该等式在依赖层面比较了图形和功能描述。一个独立的问题是:对模型中提供的图G进行手术是否得到相同的图。
###### 推论1(与所提供图的一致性)
令M=(G,F)为因果模型,ι\iota为干预。则F^{\iota}与Surg(G,T_{ι})\Surg(G,T_{\iota})兼容。此外,
Graph(F^{\iota})=Surg(G,T_{ι})
\Graph(F^{\iota})=\Surg(G,T_{\iota})
当且仅当G中不在Graph(F)\Graph(F)中的每个箭头都进入一个干预目标。因此,该等式对每个干预成立当且仅当M是精确的。
###### 证明
兼容性表示Graph(F)\Graph(F)是G的子图。对两个图应用相同的手术保持此关系,定理3.1将较小的图识别为Graph(F^{\iota})\Graph(F^{\iota})。这证明了干预后的兼容性。
两个经手术修改的图相等当且仅当没有额外箭头存留。箭头在手术中存留当且仅当它不进入目标。因此等式成立当且仅当G中不在Graph(F)\Graph(F)中的每个箭头都进入目标。一致陈述随之而来:精确模型没有额外箭头,而空干预的等式给出Graph(F)=G。
###### 示例2(为何提供的图可能不同)
令V≔\{A,B\},G的唯一箭头为A→B,假设两个机制都不依赖内生变量。则Graph(F)\Graph(F)没有箭头,因此(G,F)是兼容但不精确的。不针对B的干预在Surg(G,T_{ι})\Surg(G,T_{\iota})中保留A→B,而Graph(F^{\iota})\Graph(F^{\iota})没有箭头。如果干预针对B,两个图都没有箭头,因此一致。因此精确性对于每个干预下的一致性是充分的,但对于特定干预下的一致性不是必要的。
在将两个独立的编辑关联起来后,我们现在将其结果打包为一个完整的干预模型。
###### 定义7(Do操作)
对于因果模型M=(G,F)和干预ι\iota,定义
Do(M,ι)≔(Surg(G,T_{ι}),F^{\iota})\.
\Do(M,\iota)\coloneqq\bigl(\Surg(G,T_{\iota}),F^{\iota}\bigr)\.
该对是一个因果模型:删除箭头保持非循环性,推论1提供了兼容性。
Do操作对模型的每个分量应用一个编辑。另一种构造首先替换机制,然后赋予其精确依赖图,得到(Graph(F^{\iota}),F^{\iota})\bigl(\Graph(F^{\iota}),F^{\iota}\bigr)\.
###### 推论2(两种构造的一致性)
对于每个因果模型M=(G,F)和干预ι\iota,对(Graph(F^{\iota}),F^{\iota})\bigl(\Graph(F^{\iota}),F^{\iota}\bigr)是一个精确因果模型。对于每个外生状态u,
Run(Do(M,ι),u)=Run((Graph(F^{\iota}),F^{\iota}),u)\.
\Run(\Do(M,\iota),u)=\Run\bigl((\Graph(F^{\iota}),F^{\iota}),u\bigr)\.
若M是精确的,则更强的模型等式也成立:
Do(M,ι)=(Graph(F^{\iota}),F^{\iota})\.
\Do(M,\iota)=\bigl(\Graph(F^{\iota}),F^{\iota}\bigr)\.
###### 证明
推论1表明Graph(F^{\iota})\Graph(F^{\iota})是非循环图Surg(G,T_{ι})\Surg(G,T_{\iota})的子图,因此它是非循环的。所示对因此是因果模型,并且根据构造是精确的。两个模型都使用机制族F^{\iota},这决定了它们的运行。若M是精确的,推论1还给出Surg(G,T_{ι})=Graph(F^{\iota})\Surg(G,T_{\iota})=\Graph(F^{\iota})。相似文章
超越有向无环图:因果零点与因果微分方程
本文通过引入因果零点与因果微分方程,扩展了Pearl的结构因果模型框架,以处理有向无环图所不允许的对称约束与反馈循环。
Exact Network Surgery:反应式计算图中的功能不变性与梯度可塑性
本文形式化地定义了 Exact Network Surgery,一种在实时计算图中插入残差块的方法,该方法能精确保持功能并允许立即训练。作者证明了理论保证,并在 Julia 的反应式图引擎上进行了实证验证。
基于二部图因果模型的因果推理
本文提出二部图因果模型(BGCMs),以解决在具有循环依赖的平衡系统中因果干预的歧义性,推广了现有的框架,如 Causal Bayesian Networks 和 Structural Causal Models。
基于反事实链和因果图的LLM可解释性
本文提出了一种四阶段方法,用于构建建模LLM推理过程的因果图,利用反事实增强实现稳定的因果发现,并提供透明、概念级的可解释性。
Causal-Audit:通过目标感知因果链构建实现显式可审计的图推理
提出了Causal-Audit框架,该框架通过目标感知因果图构建和路径级证据聚合,实现大语言模型中显式且可审计的因果推理,在多个基准测试上优于现有方法。