基于互兼容性的双变量因果陈述评估
摘要
本文提出了兼容性和不兼容性分数,用于评估双变量因果陈述集合,无需依赖忠实性假设,并通过分析大型语言模型的因果主张展示了其实用性。
arXiv:2606.00278v1 公告类型: 新
摘要:对于许多真实世界系统,因果真相难以获取,使得关于因果效应的主张难以评估。我们开发了评估一组 $n$ 个变量上的 $\binom{n}{2}$ 个双变量因果陈述集合的方法。在线性无环陈述的设定下,任何此类集合都可以扩展为唯一的多元因果模型,但我们认为,如果该诱导模型为了解释观察到的相关性而施加了显著的额外混杂,则是不合理的。我们引入了一个兼容性分数来量化这种合理性概念,值得注意的是,该分数无需依赖忠实性假设。此外,我们基于无环性和忠实性假设导出的全局一致性约束,定义了纯图形双变量因果陈述的不兼容性分数。我们提供了理论和实验证据,表明两种分数在通用设置下都能成功区分正确与不正确的因果陈述。此外,我们通过分析大型语言模型提出的因果主张,展示了我们方法的实际适用性。我们的工作旨在为评估来自人类专家或人工智能的因果信息的可靠性奠定基础,尤其是在无法进行其他形式验证的场景中。
查看缓存全文
缓存时间: 2026/06/02 15:46
# 基于互容性评估成对因果陈述
来源:https://arxiv.org/abs/2606.00278
查看 PDF (https://arxiv.org/pdf/2606.00278)
> 摘要:对于许多现实系统,因果真相难以获取,使得关于因果效应的断言难以评估。我们开发了评估一组包含\(n\)个变量中\(\binom{n}{2}\)个成对因果陈述的方法。在线性无环设定下,任何这样的集合都可以扩展为唯一的多元因果模型,但我们认为,如果这种诱导模型为了解释观测相关性而强加了大量额外混杂因素,那它就显得不可信。我们引入了一个兼容性分数来量化这种可信度概念,值得注意的是,该分数不依赖于忠实性假设。此外,我们基于无环性和忠实性假设推导出的全局一致性约束,为纯图形成对因果陈述定义了一个不兼容性分数。我们给出理论和实验证据表明,这两个分数在一般设定下都能成功区分正确与错误的因果陈述。此外,我们通过分析大型语言模型所做的因果断言,证明了我们方法的实际适用性。我们的工作旨在为评估来自人类专家或人工智能的因果信息在缺乏其他验证形式时的可靠性提供基础。
## 提交历史
来自:Dominik Janzing [查看电子邮件](https://arxiv.org/show-email/7bf22f62/2606.00278) **\[v1\]** 2026年5月29日星期五 19:15:09 UTC (2,709 KB)相似文章
基于分数的潜在变量因果模型因果发现
本文介绍了在存在潜在变量情况下进行因果发现的基于分数的方法,提供了一致性和分数等价性的理论保证,并统一了几种基于约束的方法。
相同证据,不同目标:从语言模型状态解码诊断证据如何关联因果问题
本文研究语言模型是否能正确判断诊断证据如何支持或挑战不同的因果主张,并引入了仅改变因果目标的配对提示。在Qwen2.5-7B-Instruct等模型的倒数第二个Transformer隐藏状态上进行的线性读出显示,平衡准确率适中(0.654-0.659),并在49对中恢复了18-21对,表明因果相关性具有一定程度的线性可解码性。
General Probabilities of Causation with Causal Knowledge
This paper derives tighter bounds for multivalued probabilities of causation by incorporating causal information from covariates and mediators, extending prior work from binary settings.
医学因果假设验证与大语言模型
本文介绍了一项初步研究,评估大语言模型在验证医学因果假设方面的准确性,发现尽管它们表现出较高的召回率,但往往无法提供有效的科学证据或拒绝无支持的声明。
当可解码性不足时:语言模型中的逻辑有效性表示、行为分离与因果测试
本文研究了大型语言模型如何内部表示逻辑有效性,表明尽管行为表现不佳,有效性信息仍可从隐藏状态中解码,这表明表示、表达和因果使用具有不同的作用。