引导而非束缚:为何可废止先验在增强拉格朗日因果发现中失效
摘要
本文探讨了可废止先验在增强拉格朗日因果发现方法中失效的原因,识别出惩罚机制和目标函数的关键问题,并提出了一些效果有限的修复方案。
arXiv:2609.03442v1 公告类型:新
摘要:可微分因果发现方法越来越多地将专家先验编码为禁止边约束,通过增强拉格朗日(ALM)惩罚来强制执行,其假设数据自适应的松弛机制会逐渐忽略并最终覆盖数据持续矛盾的规则。我们表明,这种我们称为\emph{引导而非束缚}的设计,由于两个独立且精确描述的原因而失败,并且直接修复两者仅能部分恢复其效果。首先,序列惩罚递增ALM在任何反事实检查能检测到之前就抑制了错误禁止的真实边:我们给出了自适应松弛必须满足以避免此问题的三个必要条件(命题~\ref{prop:conditions}),证明了DADU——本文引入作为研究对象的自然松弛规则——违反了所有三个条件(推论~\ref{cor:dadu_failure}),并在3{,}072次训练运行中确认了该失败,这些运行涵盖了从4到32个节点的图,其中在DADU下,单个错误先验在87--97\%的试验中抑制了真实边。其次,与机制的任何修复无关,我们以闭式证明了标准相关匹配目标将真实边及其反向边绑定到完全相同的成本$2r^2$(引理~\ref{lem:tie}),这并非因为底层等方差模型不可识别,而是因为归一化到相关性丢弃了使其可识别的方差信息;相反,协方差匹配通过至少$w_0^4$的可证 margin 分离了两个方向(引理~\ref{lem:separation})。
查看缓存全文
缓存时间: 2026/09/04 06:27
# 增广拉格朗日因果发现中可废止先验为何失败 来源:https://arxiv.org/html/2609.03442 ## 引导而非束缚:增广拉格朗日因果发现中可废止先验为何失败 Sairam Sundararaman [email protected]†† ††这些作者对本工作贡献相同。 Sara Girdhar 11footnotemark:1 [email protected] 单位:计算机科学系(人工智能与机器学习) 单位:PES大学 Manit Narasimha Murthy [email protected] 单位:计算机科学系 单位:PES大学 Samrudh N [email protected] 单位:计算机科学系 单位:PES大学 Bhaskarjyoti Das [email protected] 单位:计算机科学系(人工智能与机器学习) 单位:PES大学 ###### 摘要 可微因果发现方法越来越多地将专家先验编码为通过增广拉格朗日(ALM)惩罚强制执行的禁止边约束,其假设在于:数据自适应的松弛机制会降权,并最终覆盖一条数据持续矛盾的规则。我们表明这种被我们称为**引导而非束缚**的设计因两个独立、精确描述的原因而失效,并且直接修复两者只能部分恢复功能。首先,顺序惩罚递增ALM在反事实检查能够检测之前,就已抑制了一条错误禁止的真实边:我们给出了任何自适应松弛为避免此问题必须满足的三个必要条件(命题1 (https://arxiv.org/html/2609.03442#Thmproposition1)),证明了DADU——本文作为研究对象引入的自然松弛规则——违反了所有三个条件(推论1 (https://arxiv.org/html/2609.03442#Thmcorollary1)),并在涵盖4至32个节点图的3,072次训练运行中证实了此失败:在DADU下,一个错误的先验在87–97%的试验中抑制了真实边。其次,与任何机制修复无关,我们以闭式证明,标准相关匹配目标将一条真实边及其反向边关联到完全相同的成本\(2r^2\)(引理1 (https://arxiv.org/html/2609.03442#Thmlemma1)),这并非因为底层等方差模型不可识别,而是因为归一化到相关系数时恰好丢弃了使其可识别所需的方差信息;而协方差匹配则能以至少\(w_0^4\)的可证明间隔(引理2 (https://arxiv.org/html/2609.03442#Thmlemma2))分离这两个方向。我们构建并测试了我们诊断指定的修复方案——一个满足所有三个必要条件的松弛算子与协方差匹配相结合——发现在768次相同图上的配对试验中,它恢复错误禁止边的频率比DADU高出27至52倍(\(p<10^{-5}\)),然而被抑制边的大部分权重仍然被其无约束的反向边吸收,而非恢复到正确方向。最后,我们探究其中任一阻碍是否是我们测试平台所用相关匹配目标的人为产物,通过在Notears/Dagma和golem使用的真实最小二乘与似然目标下重新运行全套实验:可识别性平局确实是相关系数特有的,在两种目标下均消失,正如我们的诊断所预测的那样,但抑制机制并非如此——它在似然目标下恶化,在96–100%的试验中抑制错误禁止边,频率高于相关匹配。结果表明,一个可证明可识别的目标既非必要也非充分条件,无法保护数据从未有机会被倾听的惩罚调度。 ## 1 引言 考虑一位正在构建可微因果发现系统的从业者,他持有一条置信度不完全的领域知识——例如,材料不决定形状。众所周知,不建议将其编码为硬约束:硬约束是不容错的,单个错误的硬约束无法通过任何数量的数据进行纠正。更合理的设计是将此类规则视为一种先验——学习者默认信任它,随着反面证据积累而降低其权重,并在该证据持续且强大时直接覆盖它。这不是一个新想法:这是经验贝叶斯收缩和尖峰-平板先验背后的逻辑,即点质量信念在充分似然证据下让步,而非预先固定。这样表述,这个设计与其说是一种选择,不如说是一种常识:先验应引导学习者,而非束缚他们。 这种直觉在可微因果发现中有其自然实现。此类方法已通过梯度下降在无环性的连续松弛上恢复DAG(Zheng et al., 2018 (https://arxiv.org/html/2609.03442#bib.bib8); Bello et al., 2022 (https://arxiv.org/html/2609.03442#bib.bib9); Ng et al., 2020 (https://arxiv.org/html/2609.03442#bib.bib10); Lachapelle et al., 2020 (https://arxiv.org/html/2609.03442#bib.bib11); Yu et al., 2021 (https://arxiv.org/html/2609.03442#bib.bib12)),并且已具备强制执行硬约束的机制:增广拉格朗日(ALM),与这些方法用于强制执行无环性本身的工具相同(Hestenes, 1969 (https://arxiv.org/html/2609.03442#bib.bib2); Powell, 1969 (https://arxiv.org/html/2609.03442#bib.bib3); Bertsekas, 2014 (https://arxiv.org/html/2609.03442#bib.bib1))。因此,编码禁止边没有任何额外成本——惩罚违反它的学习者,并用ALM在训练过程中逐渐增大该惩罚。进一步使约束可废止的机制是:定期检查数据是否仍然支持被禁止边,如果是,则放松惩罚。理论上,这正是**引导而非束缚**。其结构正确,完全由这些方法已有的部件构建,并且应该有效。但事实并非如此,且第一个原因无法通过更好的阈值修复。 自适应检查的工作方式是询问一个反事实问题:如果现在移除这条边,拟合度会变差多少?对于一条仍接近其数据支持值的边来说,这是一个有意义的问题。但对于一条已被惩罚驱动至接近零的边——一条除名字外实质上已消失的边——则不是一个有意义的问题。无论数据实际想要什么,移除它都将正确报告几乎没有任何损失。顺序惩罚递增ALM几何级数地增大约束,并且在自适应检查有机会查看之前就已进行;当检查运行时,通常已无物可查。我们称之为**早期抑制陷阱**。在广泛范围内调整修正阈值无济于事,因为阈值本应作用的证据在应用任何阈值之前已被抹除。这部分失败与因果发现本身无关:它陈述了当惩罚被允许抢先于旨在保持其诚实性的检查时会发生什么,并且在任何可废止约束通过固定调度增长的惩罚来强制执行的地方都会重现——经典的ALM收敛理论保证了当约束与数据真正不兼容时乘数发散(Bertsekas, 2014 (https://arxiv.org/html/2609.03442#bib.bib1)),但对于在该发散进行期间自适应松弛算子看到的内容则未作说明,而早期抑制陷阱利用的正是这个盲点。 假设这被修复了:假设检查运行得更早,在惩罚造成任何损害之前进行评估,因此它总是在边处于其真实、数据支持的值时观察。这应该能解决问题。但它没有,第二个原因比第一个更有趣,因为它在完美修复第一个原因后依然存在。一个及时、诚实的检查比较模型在每个方向包含候选边时的拟合优度。如果这种比较本身无法区分真实边与其反向边,那么提前评估毫无意义——检查会如实报告两个方向看起来同样好,因为根据这些方法使用的目标,它们确实一样好。这应该令人惊讶:所讨论的模型类别假设每个变量具有相同的噪声方差,而一个已知事实是,在此假设下,因果方向原则上可从数据本身恢复(Peters and Bühlmann, 2014 (https://arxiv.org/html/2609.03442#bib.bib21))。换句话说,这个平局并非继承自一个不可识别的模型。是其他因素丢弃了使识别成为可能的信号,而事实证明这是一个特定的、可避免的建模选择:比较归一化的相关系数而非原始协方差,恰好丢弃了等方差可识别性所依赖的方差不对称性。这是一个比听起来更狭窄的说法:相关匹配是文献中使用的几个拟合目标之一,并非唯一;本文的部分工作是找出这个平局是该特定选择的属性还是禁止边强制执行更广泛的问题——仅凭诊断无法回答,我们将在第7.3节 (https://arxiv.org/html/2609.03442#S7.SS3)中通过直接测试重新审视。 即使两个诊断都已掌握,仍有两个问题:一个满足我们三个必要条件的机制是否实际可构建,或仅仅是可指定?如果构建出来,并结合我们分析规定的协方差匹配,它是否能恢复错误禁止的真实边,或者一旦前两个障碍被清除,是否会出现第三个障碍?我们构建了这样的机制并直接测试。答案具有启发性而非完美:在相同随机图的匹配对中,组合修复方案恢复错误禁止边的频率远高于DADU——差异过大,不可能是偶然。但恢复仍是少数结果。在大多数试验中,禁止惩罚从真实边中挤出的权重被其无约束的反向边吸收,而非恢复到正确方向——这正是我们引理1预测的平局,它并非以闭式奇观出现,而是作为专门为避免它而构建的系统的主要失败模式。 修复我们诊断出的两个障碍是必要的。但这不是充分的。一个直接的问题紧随论文迄今的设置而来:以上所有内容都是在一个单一的拟合目标——相关匹配——上证明和测量的,该目标是我们为测试平台选择的,而非从现有已部署系统中提取的。论证中没有内容要求这个选择,而Notears(Zheng et al., 2018 (https://arxiv.org/html/2609.03442#bib.bib8))、Dagma(Bello et al., 2022 (https://arxiv.org/html/2609.03442#bib.bib9))和golem(Ng et al., 2020 (https://arxiv.org/html/2609.03442#bib.bib10))实际使用的目标是对原始、未归一化数据的最小二乘重构或似然。接受我们在注记1 (https://arxiv.org/html/2609.03442#Thmremark1)中诊断的读者——平局具体源于丢弃尺度信息,而非禁止边强制执行本身——应该预期一旦尺度信息被放回,平局就会消失。我们直接测试这一点,而非将其作为一个合理的推论:第7节 (https://arxiv.org/html/2609.03442#S7)在Notears/Dagma风格的最小二乘目标和golem-EV风格的似然目标下重新运行了全套实验,两者都精确写成这些方法实际优化目标的重构形式。诊断的可识别性方面通过了此测试。抑制方面则没有,而且是在令人不安的方向上:似然目标(恰好如预测那样绕过了平局)实际上比相关匹配更频繁地抑制错误禁止边,而非更少。理清为什么修复一个障碍可能使另一个障碍恶化,是本文剩余部分的主要内容。 本文对所有四个发现——两个失败、部分修复以及任一失败是否特定于我们测试平台目标的检验——给出了精确、经过测试的阐述。 1. **早期抑制陷阱**(第4节 (https://arxiv.org/html/2609.03442#S4)):任何数据自适应松弛为避免不可逆抑制必须满足的三个必要条件(命题1 (https://arxiv.org/html/2609.03442#Thmproposition1)),以及一个证明:DADU——本文作为研究对象引入的自然松弛规则,而非来自现有已发布实现的规则——一旦抑制开始就同时违反所有三个条件(推论1 (https://arxiv.org/html/2609.03442#Thmcorollary1))。 2. **一个精确的可识别性障碍,正确归因**(第5节 (https://arxiv.org/html/2609.03442#S5)):一个闭式证明,表明相关匹配将真实边及其反向边精确关联(引理1 (https://arxiv.org/html/2609.03442#Thmlemma1));对此现象源于丢弃边缘方差信息而非底层模型(Peters and Bühlmann, 2014 (https://arxiv.org/html/2609.03442#bib.bib21))固有不可识别性的精确解释;一个闭式证明,表明协方差匹配能可证明地分离两个方向(引理2 (https://arxiv.org/html/2609.03442#Thmlemma2));以及将此机制推广到任何保持马尔可夫等价性的边反转(命题2 (https://arxiv.org/html/2609.03442#Thmproposition2))。 3. **一个组合机制,构建并测试**(第6节 (https://arxiv.org/html/2609.03442#S6)):一个松弛算子,实现了命题1 (https://arxiv.org/html/2609.03442#Thmproposition1)的所有三个必要条件(命题3 (https://arxiv.org/html/2609.03442#Thmproposition3)),与协方差匹配一起在768个配对合成实例上评估。组合修复方案显著优于DADU(\(p<10^{-5}\)),但在少数试验中恢复了正确边,无约束的反向边仍然是主要的吸引子。 4. **对任一阻碍是否特定于测试平台的检验**(第7.3节 (https://arxiv.org/html/2609.03442#S7.SS3)):全套实验在匹配Notears/Dagma的最小二乘目标和匹配golem-EV的似然目标下重新运行,证实障碍II特定于相关匹配,而障碍I并非如此——并且似然目标(该文献已视其为安全选择)比我们在本文其余部分批评的目标抑制得更频繁。 5. **广泛的实证验证**(第7节 (https://arxiv.org/html/2609.03442#S7)):以上所有内容在6,144次训练运行中评估,涵盖4至32个节点的图、两种边密度、三种噪声尺度、等方差和异方差噪声,以及四个拟合目标,仅报告此受控合成实验直接支持的结果。 在技术部分开始前,有两点值得明确说明,因为它们界定了本文其余部分能够主张的范围。首先是适用范围。机制失败和可识别性障碍适用于任何基于ALM、采用顺序惩罚递增且使用我们测试系列中拟合目标的结构学习者;本文所有实证结果均使用具有已知真实结构的合成线性高斯SEM,选择它们是为了使第4节 (https://arxiv.org/html/2609.03442#S4)和第5节 (https://arxiv.org/html/2609.03442#S5)的主张能够精确对照已知答案进行检验,而非从不确定的估计中得出。这以无法展示当真实世界测量噪声、概念提取或非高斯数据生成过程也参与时两种阻碍的样貌为代价换来了精确性——我们将在后文
相似文章
贝叶斯因果发现如何失败?潜在混杂下线性高斯网络中结构后果的刻画
本文分析了在潜在混杂下线性高斯网络中贝叶斯因果发现如何失败,推导出一个导致评分函数偏好虚假边的相关性阈值,并刻画了两种不同的后验失败模式。
基于因果效应约束的可解释因果发现
本文提出了一种用于条件因果发现的贝叶斯方法,其中因果图和参数的后验以用户指定的因果效应约束(例如,较大的因果效应)为条件。他们采用稀有事件估计技术来处理后验质量较小的事件,并在合成数据和Sachs蛋白质数据集上验证了该方法。
基于边际影响的归因方法对全局时间序列解释的失效
本文证明了现有基于边际影响的归因方法从根本上无法捕捉时间序列模型的条件依赖结构,并提出了DAG忠实性作为忠实解释的新标准。
基于反事实链和因果图的LLM可解释性
本文提出了一种四阶段方法,用于构建建模LLM推理过程的因果图,利用反事实增强实现稳定的因果发现,并提供透明、概念级的可解释性。
A Generalized-Bayes Perspective on Counterfactual Explanations: Posterior-Based Decision-Making and Evaluation
This paper connects counterfactual explanations to generalized Bayes inference, showing that distance-minimization CEs are MAP estimates of a Gibbs posterior, and introduces new decision rules and evaluation metrics.