联邦因果发现与推断综述
摘要
本综述系统回顾了联邦因果发现与推断,按方法论范式、联邦拓扑和结构范围组织方法,并强调了开放挑战。
arXiv:2606.23741v1 Announce Type: new
摘要:因果推理,包括因果结构的发现和因果效应的推断,是数据驱动决策的基础。在实践中,用于可靠因果分析的数据通常分布在不同机构,由于隐私规定或通信限制无法集中处理。联邦学习(FL)通过在不共享原始数据的情况下实现协作分析来解决这一问题,从而催生了快速发展的联邦因果发现(FCD)和联邦因果推断(FCI)领域。然而,该领域的跨学科性质以及缺乏全面的综述给研究人员带来了入门障碍。本文通过多维分类法提供了系统性回顾,弥补了这一空白。基于任何FCD解决方案背后的三个核心设计决策,即结构如何学习、数据如何划分以及各方获得什么结构知识,我们沿三个轴组织FCD:方法论范式、联邦拓扑和结构范围。我们进一步考察了关键的实际维度,包括时间动态、数据异质性、缺失数据和非相同变量集。对于FCI,我们按目标估计量(平均处理效应与个体化/条件处理效应)和估计策略(从经典加权方法到现代深度生成架构)对方法进行分类。与以往将FCD和FCI分开处理的工作不同,我们将它们的关系形式化为统一联邦因果推理流程中的互补阶段,其中FCD提供FCI中有效效应估计所需的结构知识。最后,我们强调了它们在隐私、通信效率、理论保证和应用领域方面的共同关注点,并指出了未来研究的开放挑战。
查看缓存全文
缓存时间: 2026/06/24 07:48
# 联邦因果发现与推断综述 来源:https://arxiv.org/html/2606.23741 \\ArticleType 综述 \\Year2026 \\MonthJanuary \\Vol68 \\No1 \\DOI \\ArtNo \\ReceiveDate \\ReviseDate \\AcceptDate \\OnlineDate \\AuthorMark \\AuthorCitation 标题引用 yukui@hfut\.edu\.cn han\.yu@ntu\.edu\.sg 王宇维 项国度 唐晓丽 余奎 韩宇 杨强 南京邮电大学计算机学院,南京 210023,中国 合肥工业大学计算机与信息学院,合肥 230601,中国 南洋理工大学计算与数据科学学院,新加坡 639798 香港理工大学数据科学与人工智能系,香港 999077,中国 ###### 摘要 因果推理,包括因果结构的发现和因果效应的推断,是数据驱动决策的基础。在实践中,用于可靠因果分析的数据通常分布在多个机构,由于隐私法规或通信限制而无法集中。联邦学习 (FL) 通过允许在不共享原始数据的情况下进行协作分析来解决这一问题,从而催生了快速发展的联邦因果发现 (FCD) 和推断 (FCI) 领域。然而,该领域的跨学科性质以及缺乏全面的综述,给研究人员带来了入门障碍。本文通过提供基于多维分类法的系统回顾来弥补这一空白。基于任何 FCD 解决方案的三个核心设计决策(结构如何学习、数据如何分区以及各方获得何种结构知识),我们沿着三个轴组织 FCD:方法论范式(基于约束、基于评分、连续优化和混合)、联邦拓扑(水平、垂直和混合)以及结构范围(全局与局部)。我们进一步考察了关键的实际维度,包括时间动态、数据异质性、缺失数据和非相同变量集。对于 FCI,我们根据目标估计量(平均与个性化/条件处理效应)和估计策略(从经典加权方法到现代深度生成架构)对方法进行分类。与先前将 FCD 和 FCI 分开处理的工作不同,我们将它们的联系形式化为统一联邦因果推理流程中互补的阶段,其中 FCD 提供 FCI 中有效效应估计所需的结构知识。最后,我们强调它们在隐私、通信效率、理论保证和应用领域方面的共同关注点,并总结指出未来研究的开放性挑战。 ###### 关键词:因果发现,因果推断,联邦学习,贝叶斯网络,因果结构学习,处理效应估计,隐私保护学习 ## 1 引言 因果推理是科学探究的核心:理解事物*为什么*发生能够实现干预下的预测和稳健的决策。两个互补的任务构成了计算因果分析的支柱。因果发现旨在从观测数据(有时也包括干预数据)中恢复编码变量间因果关系的有向无环图 (DAG) [102, 17, 140]。相比之下,因果推断旨在从可能因非随机处理分配而混杂的数据中量化因果效应的大小,通常是处理效应 [90, 44]。在许多现实场景中,这些任务所需的数据分布在多个机构,例如医院、银行、物联网设备或研究中心,这些机构无法或不愿共享原始记录。隐私法规(如 GDPR、HIPAA)、商业敏感性以及庞大的数据量都阻碍了数据集中化。联邦学习 (FL) [76, 46] 提供了一种原则性的解决方案:参与者仅通过交换中间统计量或模型参数来协作训练共享模型,同时保持原始数据本地化。
参见图注
图 1:联邦因果学习框架的直观说明。(a) 联邦因果发现 (FCD):分布式客户端通过去中心化的统计量或梯度协作恢复全局因果图拓扑(即骨架和边方向),而无需共享原始数据。(b) 联邦因果推断 (FCI):分布式客户端通过联合调整混淆变量和对齐各站点的倾向得分,协作量化处理变量对结果的具体因果效应(例如,平均处理效应 ATE)。
当将因果框架与 FL 结合时,根据具体分析目标的不同,关注点也会发生变化,从而产生两个全新的范式,如图 1 所示:
- • **联邦因果发现 (FCD)** 侧重于“恢复结构”。如图 1 (a) 所示,各个客户端不是汇集原始数据来发现因果关系链接,而是计算局部结构属性(例如条件独立性或图梯度),并在中央服务器安全地聚合这些属性,以拼凑出一个统一的全局有向无环图 (DAG)。
- • **联邦因果推断 (FCI)** 侧重于“量化效应”。如图 1 (b) 所示,假设指定了目标处理变量和结果变量,客户端协作对跨不同人群的处理分配和结果进行建模,以准确估计全局效应指标(例如平均处理效应 ATE),同时不暴露私有的患者协变量。
虽然 FL 在监督预测任务(图像分类、下一个词预测和临床风险评分)中取得了显著成功,但它与因果方法的集成引入了独特的挑战:
1. 1. **结构约束**。与回归不同,因果发现必须产生一个满足无环性的 DAG,这是一个全局的组合约束,在分布式环境中强制实施非常困难。
2. 2. **因果机制和分布的异质性**。联邦因果任务中一个典型的挑战是,客户端不仅在边际数据分布上存在差异(如标准 FL 中的标签偏移或协变量偏移模型所假设的),而且表现出异质的*因果机制*:控制局部数据生成过程的条件分布 \(P(X_i \mid \text{Pa}(X_i))\) 在各站点间不同,甚至客户端可能观测到不同的变量集。这种结构性异质性以两种相互关联的方式体现:在联邦因果发现中,意味着没有一个单一的因果图能够忠实地代表所有客户端;在联邦因果推断中,意味着处理分配机制和协变量分布可能在站点间存在巨大差异,使得简单的数据池化或元分析失效。
3. 3. **可识别性**。因果结论对条件集的充分性、干预数据的可用性以及函数形式的假设很敏感。将这些要求分布到各个客户端,引发了关于可识别性的新问题。
该领域发展迅速:从 2000 年代中期关于隐私保护贝叶斯网络结构学习的早期工作 [122, 29] 到近期在各大会议发表的方法。尽管发展势头强劲,但目前还没有任何现有综述能够提供统一、系统的处理,同时涵盖联邦因果发现和联邦因果推断,并带有细粒度的方法论分类。Rocchi 等人 [94] 从医学领域的角度提供了联邦因果发现的视角,但并未涵盖因果推断或提供细粒度的方法论分类。几篇联邦学习综述 [46, 64] 涉及了隐私保护分析,但未专门讨论因果推理。最近,Deng 等人 [21] 对因果性与联邦学习之间的相互作用进行了广泛综述,涵盖了 FL 如何赋能去中心化因果分析以及因果性如何在可解释性、泛化性和对抗鲁棒性等方面增强 FL 系统。尽管他们的工作为这一新兴领域提供了有价值的高层概述,但我们的综述在*范围*、*分类法*和*深度*上有本质区别:
1. 1. **聚焦的范围**。我们仅专注于联邦因果发现和联邦因果推断的核心算法挑战,而不是采用更广泛的“因果性助力 FL”视角(例如,利用因果性提高 FL 的鲁棒性或公平性)。
2. 2. **多维分类法**。我们为 FCD 提出了首个三维分类法(方法论 × 联邦拓扑 × 结构范围),并为 FCI 提出了二维分类法(估计量 × 估计策略),从而能够对现有方法在以往未综合的维度上进行原则性的、细粒度的比较。
3. 3. **技术深度**。我们提供了详细的算法分析、形式化的问题表述、隐私理论讨论,以及跨方法的理论保证的系统比较。此外,我们是首个明确地将 FCD 和 FCI 之间的联系形式化并分析为统一联邦因果推理流程中互补阶段的工作。
参见图注
图 2:本综述的组织结构和范围。
本综述的主要贡献如下:
1. 1. 我们在一个统一的框架内提供了联邦因果发现和推断的全面、重点突出的综述。与 [21] 中更广泛的“Causal-FL”视角(涵盖“FL 用于因果性”和“因果性用于 FL”,包括可解释性、泛化性和鲁棒性增强)不同,我们的工作致力于对分布式结构学习和效应估计的核心问题进行深入的算法和理论处理。据我们所知,此前尚未有工作提供如此专门、细粒度的方法论分析,同时涵盖 FCD 和 FCI。
2. 2. 我们提出了新颖的多维分类法,即用于 FCD 的三维框架(按方法论、联邦拓扑和结构范围)和用于 FCI 的二维框架(按估计量和估计策略),这使得能够超越单一维度的分类,对现有工作进行原则性的、细粒度的比较。
3. 3. 我们提供了详细的总结表格、在隐私机制、通信效率、理论保证和实际考虑方面的系统比较,以及一份精心策划的参考文献列表,作为研究人员和实践者的参考。
4. 4. 我们明确地将 FCD 和 FCI 之间的联系形式化并分析为统一联邦因果推理流程中的互补阶段,并指出了未来研究的开放性问题和有前景的方向。
**组织架构。** 本综述的整体结构如图 2 所示。在第 2 节 (S2) 预备知识之后,我们系统地综述了联邦因果发现(第 3 节 (S3))和联邦因果推断(第 4 节 (S4))的方法论。第 5 节 (S5) 详细阐述了这两个任务之间的内在联系。此外,第 6 节 (S6) 强调了实际应用,而第 7 节 (S7) 概述了未来的潜在方向。第 8 节 (S8) 对本文进行总结。
## 2 预备知识
### 2.1 因果发现
因果发现旨在从数据中学习一个关于变量集 \(\mathbf{V}=\{X_1,\dots,X_d\}\) 的 DAG \(\mathcal{G}=(\mathbf{V},\mathbf{E})\)。\(\mathbf{E}\) 中的边编码了直接的因果关系:\(X_i \to X_j\) 意味着 \(X_i\) 是 \(X_j\) 的一个直接原因。在结构方程模型 (SEM) 下,每个变量按如下方式生成:
\[
X_j = f_j(\text{Pa}(X_j), \epsilon_j), \quad j=1,\dots,d,
\tag{1}
\]
其中 \(\text{Pa}(X_j)\) 表示 \(X_j\) 在 \(\mathcal{G}\) 中的父节点集,\(f_j\) 是一个(可能非线性的)函数,\(\epsilon_j\) 是联合独立的噪声变量。
**假设与可识别性。** 从数据中恢复 \(\mathcal{G}\) 只有在将图 \(\mathcal{G}\) 与观测到的联合分布 \(P\) 联系起来的一组标准假设下才有可能。*因果马尔可夫条件*要求每个变量在给定其父节点的条件下独立于其非后代,从而 \(\mathcal{G}\) 蕴含了 \(P\) 中的一系列条件独立性。*忠实性*假设则要求其逆,即 \(P\) 中存在的每一个条件独立性都是由 \(\mathcal{G}\) 通过 d-分离蕴含的,从而排除了由因果效应的偶然抵消而产生的独立性。综上所述,马尔可夫和忠实性假设产生了等价关系:在 \(P\) 中 \(X_i \perp\!\!\!\perp X_j \mid \mathbf{S}\) 成立当且仅当 \(\mathbf{S}\) 在 \(\mathcal{G}\) 中 d-分离 \(X_i\) 和 \(X_j\) [102, 90],这正是允许从观测到的统计(不)依赖性推断结构信息的关键。另外两个假设通常也被采用:*因果充分性*,即所有测量变量的共同原因本身都被测量到,因此不存在潜在混淆变量;以及*无环性*,它将假设空间限制为 DAG。即使所有这些条件都成立,仅凭观测数据也只能将 \(\mathcal{G}\) 识别到其*马尔可夫等价类* (MEC),即编码相同条件独立性的 DAG 集合,由一个完全部分有向无环图 (CPDAG) 表示 [102, 17]。解决剩余的方向歧义需要额外的杠杆,例如对公式 (1) 中 SEM 的函数形式 \(f_j\) 或噪声分布 \(\epsilon_j\) 施加限制 [100, 101],或者访问干预数据 [39, 25]。
基于这些假设,经典的因果发现方法分为三大范式,第四类则处理更专门的情况。
**基于约束的方法**(例如 PC [102], FCI [18, 135])测试条件独立性 (CI) 关系,首先学习骨架,然后通过定向规则确定边的方向。它们对假设要求较轻,但对 CI 检验的可靠性敏感,特别是在高维或低样本量设置下。相似文章
FedCausal-Dyn: 一种在动态特征漂移下的联邦学习因果动态范式
FedCausal-Dyn是一种新颖的联邦学习框架,通过将因果特征与虚假变化分离来解决动态特征漂移问题,从而实现稳健的原型聚合。它在联邦领域泛化基准测试上取得了最先进的性能。
CausalDS:在数据科学智能体中进行因果推理的基准测试
介绍CausalDS,一个用于评估基于LLM的数据科学智能体中因果推理的基准。它利用合成结构因果模型和自然语言故事测试关联、干预和反事实推理,以及工具使用和弃权。
DKCD:基于领域知识增强的非结构化数据因果发现
本文介绍了DKCD,这是一个通过整合领域知识图谱与基于LLM的推理来增强高专业领域(如医疗、金融、教育)中从非结构化数据进行因果发现的框架,旨在识别潜在因果因素并提高标注准确性。
CausaLab: 面向AI科学家的可扩展交互式因果发现环境
CausaLab 是一个可扩展的环境,用于评估LLM智能体在交互式因果发现中的表现,同时衡量预测准确性和对潜在因果机制的忠实复现。实验揭示了预测与机制复现之间的差距,突显了当前LLM智能体作为实验性因果推理者的局限性。
联邦图学习中的广义类别发现
本文介绍了 GCD-FGL,这是一种专为动态环境中的广义类别发现而设计的联邦图学习框架。该框架解决了邻域吸收效应和全局语义不一致性等挑战,从而提高了跨分布式客户端对新类别的检测能力。