基于互兼容性的双变量因果陈述评估

arXiv cs.AI 论文

摘要

本文提出了兼容性和不兼容性分数,用于评估双变量因果陈述集合,无需依赖忠实性假设,并通过分析大型语言模型的因果主张展示了其实用性。

arXiv:2606.00278v1 公告类型: 新 摘要:对于许多真实世界系统,因果真相难以获取,使得关于因果效应的主张难以评估。我们开发了评估一组 $n$ 个变量上的 $\binom{n}{2}$ 个双变量因果陈述集合的方法。在线性无环陈述的设定下,任何此类集合都可以扩展为唯一的多元因果模型,但我们认为,如果该诱导模型为了解释观察到的相关性而施加了显著的额外混杂,则是不合理的。我们引入了一个兼容性分数来量化这种合理性概念,值得注意的是,该分数无需依赖忠实性假设。此外,我们基于无环性和忠实性假设导出的全局一致性约束,定义了纯图形双变量因果陈述的不兼容性分数。我们提供了理论和实验证据,表明两种分数在通用设置下都能成功区分正确与不正确的因果陈述。此外,我们通过分析大型语言模型提出的因果主张,展示了我们方法的实际适用性。我们的工作旨在为评估来自人类专家或人工智能的因果信息的可靠性奠定基础,尤其是在无法进行其他形式验证的场景中。
查看原文
查看缓存全文

缓存时间: 2026/06/02 15:46

# 基于互容性评估成对因果陈述
来源:https://arxiv.org/abs/2606.00278
查看 PDF (https://arxiv.org/pdf/2606.00278)

> 摘要:对于许多现实系统,因果真相难以获取,使得关于因果效应的断言难以评估。我们开发了评估一组包含\(n\)个变量中\(\binom{n}{2}\)个成对因果陈述的方法。在线性无环设定下,任何这样的集合都可以扩展为唯一的多元因果模型,但我们认为,如果这种诱导模型为了解释观测相关性而强加了大量额外混杂因素,那它就显得不可信。我们引入了一个兼容性分数来量化这种可信度概念,值得注意的是,该分数不依赖于忠实性假设。此外,我们基于无环性和忠实性假设推导出的全局一致性约束,为纯图形成对因果陈述定义了一个不兼容性分数。我们给出理论和实验证据表明,这两个分数在一般设定下都能成功区分正确与错误的因果陈述。此外,我们通过分析大型语言模型所做的因果断言,证明了我们方法的实际适用性。我们的工作旨在为评估来自人类专家或人工智能的因果信息在缺乏其他验证形式时的可靠性提供基础。

## 提交历史

来自:Dominik Janzing [查看电子邮件](https://arxiv.org/show-email/7bf22f62/2606.00278) **\[v1\]** 2026年5月29日星期五 19:15:09 UTC (2,709 KB)

相似文章

反事实评估揭示临床大语言模型和智能体的隐藏能力画像

arXiv cs.LG

本文介绍了因果敏感性得分(CSS),一种干预性指标,用于评估临床大语言模型和智能体在患者输入沿临床意义维度变化时,是否适当地更新其建议。该指标揭示了标准覆盖度指标未能捕捉的隐藏能力画像,暴露了安全盲点和结构性响应能力缺陷。

在模拟复杂系统上验证因果抽象度量

arXiv cs.LG

本文介绍了一个包含十个复杂系统的基准,用于验证因果抽象度量,评估了三十多个候选度量,并提出了因果抽象误差(CAE)作为一种通用的有效性度量,能够可靠地区分有效与无效的解释。