论在线性参数模型下混合序数与指数族因果有向无环图的可识别性
摘要
本文确立了在线性参数模型下,具有混合序数和指数族节点的因果有向无环图的可识别条件,证明了只要节点有足够的类别和支持点,边的方向就可以仅从联合分布中确定。
arXiv:2609.17942v1 Announce Type: new
摘要: 评估了在线性参数模型(LPMs)中,节点遵循有序逻辑模型或规则单参数指数族时的可识别性问题。这些结果超越了经典结构方程模型,以及基于同质分布族观测节点的现有结果。主要结果表明,只要序数节点至少有三个类别,指数族节点至少有三个支持点,且对充分统计量无限制,那么连接序数节点与指数族节点的每条边的方向,在所有参数值下都可以仅从联合分布中识别。逆命题表明这两个要求都是必要的:三类别要求仅对仿射充分统计量具有约束力,而三支持点要求在典范连接下具有约束力。这一保证扩展到为给定的$d$节点无向骨架中每条此类混合序数-指数族边确定方向。数值实验通过成功分离马尔可夫等价类中的方向,说明了理论结果,这些方向仅凭条件独立性无法区分。
查看缓存全文
缓存时间: 2026/09/17 09:06
# 线性参数模型中混合序数与指数族因果有向无环图的可识别性 来源:https://arxiv.org/html/2609.17942 Sambit Mishra [email protected] 隶属单位:Ming Hsieh电气与计算机工程系 隶属单位:南加州大学 隶属单位:美国加利福尼亚州洛杉矶市 90089 Urbashi Mitra [email protected] 隶属单位:Ming Hsieh电气与计算机工程系 隶属单位:南加州大学 隶属单位:美国加利福尼亚州洛杉矶市 90089 ###### 摘要 本文评估了线性参数模型(LPM)中的可识别性问题,其中节点服从序数logit模型或正则单参数指数族。研究结果超越了经典结构方程模型,也超越了基于同族分布观测的节点可识别性结论。主要结论表明,只要序数节点具有至少三个类别且指数族节点具有至少三个支撑点(对充分统计量无限制),在每个参数值下,连接序数节点与指数族节点的每条边的方向均可仅从联合分布中唯一确定。逆向证明显示这两项要求均属必要:三类别要求仅对仿射充分统计量具有约束力,而三支撑点要求在典范连接下具有约束力。该保证可扩展至在给定dd节点无向骨架中定向每一条此类混合序数-指数族边。数值实验通过成功区分马尔可夫等价类中的方向(这些方向仅凭条件独立性无法区分)验证了理论结果。 ††editor:— ###### 关键词 因果发现、因果推断、有向无环图、可识别性、分布可识别性、指数族、序数分布、结构学习、参数因果模型、线性模型 ## 1 引言 因果推理在现代科学研究中占据重要地位,涉及无线网络(Thomas 等,2024)、肿瘤学(Xue 等,2019)、分子生物学(Triantafillou 等,2017)、金融欺诈检测(Ren,2025)以及数字广告(Hill 等,2015)等多个领域。这些领域的共同点在于需要揭示驱动随机系统的因果机制,而非其相关性。有向无环图(DAG)是建模变量间因果关系的常用结构,其中节点代表变量,有向边编码因果影响的流向(Pearl,2009)。因果发现的核心任务是从数据中恢复图结构。图结构知识有助于设计干预方案并区分原因与相关性,这是大多数因果推断应用的基础。 当前文献将因果DAG恢复分为两大类:干预型和观测型。干预型因果发现通过缩小与数据兼容的图集合来提升可识别性(Hauser 和 Bühlmann,2012)。近期的干预型因果发现研究包括软干预的优化选择与设计(Yang 等,2018;Jaber 等,2020;Peng 等,2026;Peng 和 Mitra,2025)以及因果强盗场景(Lattimore 等,2016;Varici 等,2023;Peng 等,2025)。然而在许多科学场景中,实验成本高昂、不符合伦理或不可行,因此必须仅从观测数据恢复图结构。现有观测型因果发现研究通过基于约束的方法(检验条件独立性)(Spirtes 等,2001)、基于评分的方法(遍历图空间)(Chickering,2002),或近期对恢复极限的有限样本与检测理论刻画(Ghoshal 和 Honorio,2017;Gao 等,2022;Shaska 和 Mitra,2025;Lungu 等,2026;Mishra 和 Mitra,2026)来探索DAG恢复。这些方法的基础都是更根本的可识别性问题:观测分布是否足以确定因果方向?本文针对具有观测数据且节点服从混合序数与单参数指数族分布的因果图,探讨其可识别性。 可识别性理论的一个关键挑战是:在缺乏额外结构假设的情况下,仅凭观测数据难以将因果DAG从其马尔可夫等价类(MEC)中唯一识别出来(Spirtes 等,2001)。现有文献通过结构方程建模(SEM)来应对这一挑战,从而在不同连续与离散族分布中获得可识别性,相关综述见第1.2节。这些结果中,因果机制通常采用两种受限形式之一:要么子节点的值是父节点与外生噪声的确定性函数,要么父节点仅通过结构中介而非直接影响子节点条件分布的参数。真实观测数据很少符合这两类假设。本研究的动机源于流行病学研究中常需在单条记录中混合序数、计数、有界与连续变量。例如德国COVID-19病例动态研究(Steiger 等,2021)将每日新增病例计数与序数干预指标、二元政策变量、连续天气测量值、有界流动性百分比以及无界社会人口份额进行联合建模。由于没有单一的SEM族能原生适配这种异质性,作者必须对连续预测变量进行中心化缩放,并通过主成分分析消除流动性变量的共线性。类似的全球哺乳动物病毒溢出研究(Johnson 等,2015;Johnson 等,2020)也将计数结果变量与序数、二元及连续预测变量混合建模。将这类数据强行纳入连续加性噪声SEM需要潜变量阈值化、连接函数变换和截断,这些操作都可能因模型误设而导致可识别性保证失效及下游因果估计偏差。 另一类相关工作关于参数因果模型(Bodik 和 Chavez-Demoulin,2025;Bodik 和 Chavez-Demoulin,2026)允许父节点值直接影响子节点条件分布的参数。子节点的支撑域、离散度和尾部行为继承自选定的参数族而非外生噪声项,从而允许计数、有界和连续变量在单一图中无需临时变换即可共存。本文将公式调整为构建线性参数模型(LPM),其中每个子节点条件分布的参数是父节点值加权线性组合的函数,权重即为模型参数。这使得不同节点的条件分布族可以不同,父节点仅通过权重定义的线性预测器作用于各子节点。此外,LPM的结构允许使用更高效的基于反向传播的算法,但此类算法不在本文讨论范围内。 我们聚焦于混合设置中的可识别性问题,即一条边连接序数节点与条件分布属于正则单参数指数族的节点。现有参数模型实现的MEC内可识别性均假设所有节点服从单一分布族,未处理跨族边的情况。Bodik 和 Chavez-Demoulin(2025)提出的条件参数因果模型(CPCM)框架虽然以通用形式处理了指数族,但要求两个条件方向都服从指数族形式。我们将序数节点固定为遵循McCullagh(1980)的有序logit模型,并讨论其扩展性。该比例优势累积链接模型在应用文献中一直是序数响应的标准模型(Lall 等,2002;Williams,2006;DeSantis 等,2014;French 和 Shotwell,2022),但如命题1所示,它不满足单参数指数族形式,因此CPCM的可识别性条件不适用于携带序数端点的边。混合分布DAG中序数与指数族节点间边的可识别性因此成为一个开放问题,本研究将对此进行探讨。 本文贡献如下: 1. 证明任何连接序数节点与正则单参数指数族节点的边,在模型的每个参数值下都是分布可识别的,仅需序数节点具有至少三个类别且指数族节点具有至少三个支撑点,对充分统计量无限制。 2. 同时证明逆向结论:当指数族节点仅有两个支撑点时,可构造显式的正向与逆向参数族,在任意序数类别数下诱导出相同的联合分布。类似地,当序数节点仅有两个类别时,建立二分法:方向可识别当且仅当指数族充分统计量在其支撑域上非仿射。 3. 在马尔可夫性、因果充分性和无选择偏差的条件下,建立多元扩展结果:在一般dd节点DAG的每个参数值下定向所有此类边。我们将此结果强化为给定骨架整体方向的可识别性,并证明逆向结论:对于仅彼此相邻而无其他邻接点的边,两项要求仍然必要。 4. 在经典3节点MEC上实证验证该框架,展示方向误差率随样本量增加而衰减,并在MEC内实现可识别性。 ### 1.1 符号说明 因果DAG是定义在dd节点上的有向无环图 \(\mathcal{G}=\left(\mathcal{V},\mathcal{E}\right)\),其中 \(\mathcal{V}=\left\{1,\dots,d\right\}\) 是顶点集,\(\mathcal{E}=\left\{\left(i,j\right)\mid i\to j\text{ 边存在}\right\}\) 是边集。图携带确定性加权邻接矩阵 \(\mathbf{W}_{\mathcal{G}}\in\mathbb{R}^{d\times d}\),定义为: \[ [\mathbf{W}_{\mathcal{G}}]_{i,j}= \begin{cases} 0, & \left(i,j\right)\notin\mathcal{E},\\ w_{i,j}\neq0, & \left(i,j\right)\in\mathcal{E}. \end{cases} \tag{1} \] 我们假设 \(\mathcal{G}\) 是无环的。节点 \(j\) 的父节点集定义为: \[ \mathcal{P}\left(j\right)\triangleq\left\{i\in\mathcal{V}:\left(i,j\right)\in\mathcal{E}\right\}, \tag{2} \] 每个节点 \(i\) 承载一个标量随机变量 \(X_i\),记 \(\mathbf{x}=\left(X_1,\dots,X_d\right)\) 为所有 \(d\) 个变量的向量,\(\mathbf{X}\in\mathbb{R}^{n\times d}\) 是收集 \(\mathbf{x}\) 的 \(n\) 个独立实现的数据矩阵。为简洁起见,我们用 \(\mathbf{x}_{\mathcal{P}\left(i\right)}\) 同时表示父节点变量及其观测值。当涉及多个图时,用 \(\mathcal{P}_{\mathcal{G}}\left(j\right)\) 表示图 \(\mathcal{G}\) 中节点 \(j\) 的父节点集。 ### 1.2 相关工作 现有文献广泛研究了基于加性噪声的SEM来证明因果DAG的可识别性,将因果机制限制为 \(X_i=f_i\left(\mathbf{x}_{\mathcal{P}\left(i\right)}\right)+\varepsilon_i\),其中 \(f_i\) 是确定性函数,噪声变量 \(\varepsilon_i\) 联合独立。对于连续变量,Peters 和 Bühlmann(2014)证明了误差方差相等的线性高斯模型的可识别性,Shimizu 等(2006)证明了线性非高斯模型的可识别性,两种情况分别考虑噪声 \(\varepsilon_i\) 为高斯和非高斯的线性模型 \(X_i=\boldsymbol{\beta}_i^{\mathsf{T}}\mathbf{x}_{\mathcal{P}\left(i\right)}+\varepsilon_i\)。Hoyer 等(2008)考虑了非线性加性噪声模型,Zhang 和 Hyvärinen(2009)引入了后非线性模型 \(X_i=g_1\left(g_2\left(\mathbf{x}_{\mathcal{P}\left(i\right)}\right)+\varepsilon_i\right)\),其中 \(g_1\) 是可逆连接函数。在离散设定中,加性噪声模型(Peters 等,2011)和整数模加性噪声模型(Suzuki 等,2014)也得到类似结果。同时,Cai 等(2018)利用结构不对称性,将原因通过低基数确定性中介传递后再生成结果。在这些情况下,可识别性均通过固定噪声进入的函数形式,并令图中所有节点服从单一分布族来建立。后续研究还允许父节点影响子节点的离散度而非仅均值,得到位置-尺度或异方差噪声模型 \(X_i=f_i\left(\mathbf{x}_{\mathcal{P}\left(i\right)}\right)+g_i\left(\mathbf{x}_{\mathcal{P}\left(i\right)}\right)\varepsilon_i\),其中 \(g_i\) 为正的尺度函数。Immer 等(2023)证明了因果方向……
相似文章
利用高阶累积量学习含潜在混杂变量的最稀疏线性因果DAG
提出了一种有限样本方法,利用高阶累积量恢复含潜在混杂变量的线性非高斯无环模型中的最稀疏DAG,且不限制潜在变量的数量。
贝叶斯因果发现如何失败?潜在混杂下线性高斯网络中结构后果的刻画
本文分析了在潜在混杂下线性高斯网络中贝叶斯因果发现如何失败,推导出一个导致评分函数偏好虚假边的相关性阈值,并刻画了两种不同的后验失败模式。
用于部分因果效应识别的最优实验
本文提出了“最大效力问题”,旨在选择受成本约束的实验,以最大程度地缩小部分因果效应的界限。作者提出了图形剪枝准则以减少搜索空间,并在NHANES健康数据集上展示了该方法的应用。
基于反事实链和因果图的LLM可解释性
本文提出了一种四阶段方法,用于构建建模LLM推理过程的因果图,利用反事实增强实现稳定的因果发现,并提供透明、概念级的可解释性。
从因果合理性到因果可靠性:评估大型语言模型作为校准的直接因果边分类器
本文系统评估了12个经过指令微调的开源权重大型语言模型在基准测试中的表现,以评估其在分类直接因果边方面的可靠性。研究发现,这些模型具有召回率主导的特点,常常过度自信,并且跨提示/模型一致性比语言化置信度能更好地改善校准。