基于互兼容性的双变量因果陈述评估

arXiv cs.AI 论文

摘要

本文提出了兼容性和不兼容性分数,用于评估双变量因果陈述集合,无需依赖忠实性假设,并通过分析大型语言模型的因果主张展示了其实用性。

arXiv:2606.00278v1 公告类型: 新 摘要:对于许多真实世界系统,因果真相难以获取,使得关于因果效应的主张难以评估。我们开发了评估一组 $n$ 个变量上的 $\binom{n}{2}$ 个双变量因果陈述集合的方法。在线性无环陈述的设定下,任何此类集合都可以扩展为唯一的多元因果模型,但我们认为,如果该诱导模型为了解释观察到的相关性而施加了显著的额外混杂,则是不合理的。我们引入了一个兼容性分数来量化这种合理性概念,值得注意的是,该分数无需依赖忠实性假设。此外,我们基于无环性和忠实性假设导出的全局一致性约束,定义了纯图形双变量因果陈述的不兼容性分数。我们提供了理论和实验证据,表明两种分数在通用设置下都能成功区分正确与不正确的因果陈述。此外,我们通过分析大型语言模型提出的因果主张,展示了我们方法的实际适用性。我们的工作旨在为评估来自人类专家或人工智能的因果信息的可靠性奠定基础,尤其是在无法进行其他形式验证的场景中。
查看原文
查看缓存全文

缓存时间: 2026/06/02 15:46

# 基于互容性评估成对因果陈述
来源:https://arxiv.org/abs/2606.00278
查看 PDF (https://arxiv.org/pdf/2606.00278)

> 摘要:对于许多现实系统,因果真相难以获取,使得关于因果效应的断言难以评估。我们开发了评估一组包含\(n\)个变量中\(\binom{n}{2}\)个成对因果陈述的方法。在线性无环设定下,任何这样的集合都可以扩展为唯一的多元因果模型,但我们认为,如果这种诱导模型为了解释观测相关性而强加了大量额外混杂因素,那它就显得不可信。我们引入了一个兼容性分数来量化这种可信度概念,值得注意的是,该分数不依赖于忠实性假设。此外,我们基于无环性和忠实性假设推导出的全局一致性约束,为纯图形成对因果陈述定义了一个不兼容性分数。我们给出理论和实验证据表明,这两个分数在一般设定下都能成功区分正确与错误的因果陈述。此外,我们通过分析大型语言模型所做的因果断言,证明了我们方法的实际适用性。我们的工作旨在为评估来自人类专家或人工智能的因果信息在缺乏其他验证形式时的可靠性提供基础。

## 提交历史

来自:Dominik Janzing [查看电子邮件](https://arxiv.org/show-email/7bf22f62/2606.00278) **\[v1\]** 2026年5月29日星期五 19:15:09 UTC (2,709 KB)

相似文章

相同证据,不同目标:从语言模型状态解码诊断证据如何关联因果问题

arXiv cs.CL

本文研究语言模型是否能正确判断诊断证据如何支持或挑战不同的因果主张,并引入了仅改变因果目标的配对提示。在Qwen2.5-7B-Instruct等模型的倒数第二个Transformer隐藏状态上进行的线性读出显示,平衡准确率适中(0.654-0.659),并在49对中恢复了18-21对,表明因果相关性具有一定程度的线性可解码性。

医学因果假设验证与大语言模型

arXiv cs.CL

本文介绍了一项初步研究,评估大语言模型在验证医学因果假设方面的准确性,发现尽管它们表现出较高的召回率,但往往无法提供有效的科学证据或拒绝无支持的声明。