DKCD:基于领域知识增强的非结构化数据因果发现

arXiv cs.CL 论文

摘要

本文介绍了DKCD,这是一个通过整合领域知识图谱与基于LLM的推理来增强高专业领域(如医疗、金融、教育)中从非结构化数据进行因果发现的框架,旨在识别潜在因果因素并提高标注准确性。

arXiv:2607.09348v1 Announce Type: new 摘要:从非结构化数据中进行因果发现在医疗、金融和教育等高专业领域中是一项具有挑战性且尚未充分探索的任务。现有方法通常利用大型语言模型(LLM)的通用知识从非结构化数据中识别因果因素,并将其标注为结构化数据以构建因果图。然而,它们仍受限于两个关键挑战:(CH1)由于缺乏领域特定知识,对潜在因素(数据中隐含但对因果发现至关重要的因素)的识别不足;(CH2)由于缺乏基于领域的推理,因素标注不可靠,从而导致错误传播到最终因果图中。为了解决这些挑战,我们提出了一种新颖的基于领域知识增强的因果发现框架(DKCD),用于在高专业领域从非结构化数据中进行因果发现,该框架包含三个相互关联的组件:(1)知识挖掘:基于可观测因素检索相关领域知识,以支持后续因果推理。(2)知识引导的因果推理:通过相关知识进行推理,发现潜在因果因素以解决CH1,并生成关键因果线索以实现更准确的数据标注,从而解决CH2。(3)因果结构发现:基于更完整的因素集和准确的标注构建最终因果图。在两个领域特定数据集上的实验表明,DKCD显著改善了因果因素识别和因果图构建。
查看原文
查看缓存全文

缓存时间: 2026/07/13 07:58

# DKCD:面向非结构化数据的领域知识增强因果发现  
来源:https://arxiv.org/html/2607.09348  

李欣,王守金,于坤,陈芳  
悉尼科技大学,澳大利亚新南威尔士州悉尼  
xin\.li\-19@student\.uts\.edu\.au,jin\.li\-4@student\.uts\.edu\.au,shoujin\.wang@uts\.edu\.au,Kun\.Yu@uts\.edu\.au,Fang\.Chen@uts\.edu\.au  

###### 摘要  

从非结构化数据中进行因果发现是一项具有挑战性且在医疗、金融和教育等高专业度领域中尚未充分探索的任务。现有方法通常利用大型语言模型(LLMs)的通用知识从非结构化数据中识别因果因素,并将其标注为结构化数据以构建因果图。然而,这些方法仍受到两个关键挑战(CHs)的限制:(CH1) 由于缺乏领域特定知识,难以充分识别数据中隐含但对因果发现至关重要的潜在因素;(CH2) 由于缺乏领域驱动的推理,因素标注不可靠,从而将错误传播到最终的因果图中。为应对这些挑战,我们提出了一种新颖的**领域知识增强因果发现**框架(DKCD),用于高专业度领域中的非结构化数据因果发现,该框架包含三个相互关联的组件:(1) **知识挖掘**:根据可观察因素检索相关领域知识,以支持后续因果推理。(2) **知识引导的因果推理**:结合相关知识进行推理,发现潜在因果因素以解决CH1,并生成关键因果线索以实现更准确的数据标注,从而解决CH2。(3) **因果结构发现**:基于更完整的因素集和更准确的标注,构建最终的因果图。在两个领域特定数据集上的实验表明,DKCD在因果因素识别和因果图构建方面均取得了显著提升。

**DKCD:面向非结构化数据的领域知识增强因果发现**  
李欣,李进,王守金,于坤,陈芳  
悉尼科技大学,澳大利亚新南威尔士州悉尼  
xin\.li\-19@student\.uts\.edu\.au,jin\.li\-4@student\.uts\.edu\.au,shoujin\.wang@uts\.edu\.au,Kun\.Yu@uts\.edu\.au,Fang\.Chen@uts\.edu\.au  

## 1 引言  

请参见说明  
图 1:DKCD 框架概览。DKCD 利用领域知识图谱引导潜在因素发现,并通过注入外部领域知识增强基于 LLM 的因果推理。由此产生的基于知识的因素评分提高了下游因果图构建的鲁棒性和准确性。

从真实世界数据中探索和发现因果关系是许多科学领域的基础 Bunge (2017 (https://arxiv.org/html/2607.09348#bib.bib1)); Illari 等 (2011 (https://arxiv.org/html/2607.09348#bib.bib2)),包括医疗保健 Shi 和 Norgeot (2022 (https://arxiv.org/html/2607.09348#bib.bib3)); Yang 等 (2013 (https://arxiv.org/html/2607.09348#bib.bib79))、金融 Papana 等 (2017 (https://arxiv.org/html/2607.09348#bib.bib4)); Sokolov 等 (2025 (https://arxiv.org/html/2607.09348#bib.bib80)) 和教育 Morrison 和 van der Werf (2016 (https://arxiv.org/html/2607.09348#bib.bib5)); Fancsali (2014 (https://arxiv.org/html/2607.09348#bib.bib81))。在数据驱动的因果发现中,因果关系通常以因果图的形式表示。现有的因果发现算法,如 Peter–Clark (PC) 算法 Spirtes 等 (2000 (https://arxiv.org/html/2607.09348#bib.bib6)); Ramsey (2016 (https://arxiv.org/html/2607.09348#bib.bib7)) 和快速因果推断 (FCI) 算法 Spirtes 等 (2013 (https://arxiv.org/html/2607.09348#bib.bib8)),主要针对具有预定义模式且格式固定的结构化数据(通常以表格形式组织,如关系数据库和电子表格)进行设计。因此,它们在应用于非结构化数据时面临重大限制 Malinsky 和 Danks (2018 (https://arxiv.org/html/2607.09348#bib.bib9)); Yu 等 (2016 (https://arxiv.org/html/2607.09348#bib.bib10))。与此同时,非结构化数据(尤其是自然语言文本)的主导地位日益增强 Siddiqa 等 (2017 (https://arxiv.org/html/2607.09348#bib.bib11)); Eberendu 等人 (2016 (https://arxiv.org/html/2607.09348#bib.bib12)); Azad 等 (2020 (https://arxiv.org/html/2607.09348#bib.bib13)),这要求有方法能够桥接非结构化数据和统计因果发现。随着大型语言模型(LLMs)的出现,从非结构化数据中分析和发现因果关系的新机遇应运而生 Wang 等 (2023 (https://arxiv.org/html/2607.09348#bib.bib14)); Wang (2024 (https://arxiv.org/html/2607.09348#bib.bib15))。LLMs 具备从自然语言中理解、推理和提取知识的强大能力,可以支持因果因素的自动识别,从而减少对数据标注的手工领域专业知识需求 Ashwani 等 (2024 (https://arxiv.org/html/2607.09348#bib.bib16)); Dubey 等 (2024 (https://arxiv.org/html/2607.09348#bib.bib17))。具体来说,COAT 框架 Liu 等 (2024 (https://arxiv.org/html/2607.09348#bib.bib20)) 是一种代表性方法,它利用 LLMs 从非结构化数据中提取因果因素、标注因素值,然后应用统计因果发现算法构建因果图。尽管 COAT 迈出了重要一步,但在应用于高专业度领域(如临床文本分析)时,它仍存在严重局限性,因为在这些领域中因果因素的识别需要大量领域知识,而许多因果因素在非结构化数据中是隐含而非显式陈述的。如图 2 (https://arxiv.org/html/2607.09348#S1.F2) 所示,将 COAT 应用于糖尿病领域数据集,揭示了两个关键挑战(CHs)带来的局限性。

**挑战 1 (CH1)**:COAT 仅依赖 LLMs 的通用知识来提出因果因素。尽管这类知识很广泛,但往往缺乏领域知识 Yu 等 (2024b (https://arxiv.org/html/2607.09348#bib.bib22)); Shou 等 (2023 (https://arxiv.org/html/2607.09348#bib.bib23)),因此难以识别由领域特定观察所暗示的潜在因素。例如,COAT 遗漏了肾脏疾病(以红色节点突出显示),而识别该因素需要将肾功能下降、蛋白尿和糖尿病相关并发症与肾脏疾病联系起来。这类遗漏导致因素集不完整,并限制了最终的因果图。

**挑战 2 (CH2)**:因果图构建还需要准确的因素值标注,作为下游统计因果发现算法的结构化输入。然而,在没有外部领域知识的情况下,LLMs 有限的因果推理能力 Mirzadeh 等 (2024 (https://arxiv.org/html/2607.09348#bib.bib24)) 经常产生不准确或不一致的标注 Burford 等 (2024 (https://arxiv.org/html/2607.09348#bib.bib77)); Zečević 等 (2023 (https://arxiv.org/html/2607.09348#bib.bib78)); Ban 等 (2025 (https://arxiv.org/html/2607.09348#bib.bib73))。例如,COAT 可能主要基于酒精或吸烟等显式因素标注 HUA,而忽略了肾脏疾病的作用,从而导致错误传播到最终推断的因果图中,表现为缺失因果关系以及不确定或错误的方向。尽管 Li 等人 Li 等 (2025a (https://arxiv.org/html/2607.09348#bib.bib19)) 通过 MLLM-CD 将 COAT Liu 等 (2024 (https://arxiv.org/html/2607.09348#bib.bib20)) 扩展到多模态数据集,但同样的挑战依然存在。

请参见说明  
图 2:COAT 在糖尿病数据集上的结果。

为应对这些挑战,我们提出了 DKCD(领域知识增强因果发现)框架,该框架有效地利用领域知识图谱(KGs)来引导因果因素的发现和标注,从而提高从非结构化数据中进行统计因果推断的质量。如图 1 (https://arxiv.org/html/2607.09348#S1.F1) 所示,DKCD 由三个组件组成。(1) **知识挖掘**:利用 LLMs 从非结构化数据中提取可观察因素,并从领域知识图谱中检索相关子图。通过语义匹配过滤检索到的知识,保留最相关的上下文,以支持后续因果推理。(2) **知识引导的因果推理**:基于可观察因素和检索到的知识上下文,该模块推断出非结构化数据中未显式陈述但在该领域具有因果相关性的潜在因素,从而直接解决因素识别不完整的挑战(CH1)。此外,该模块会生成**因果线索**,即因素间合理依赖关系的领域驱动描述。这些线索为评分和标注提供了结构化指导,有助于减少模糊性并提高标注可靠性,从而解决因素标注不准确的挑战(CH2)。(3) **因果结构发现**:有了更完整的因素集和更准确的标注,该模块应用统计因果发现算法来推断最终的因果图。此外,附录中的图 6 (https://arxiv.org/html/2607.09348#A2.F6) 通过糖尿病数据集示例展示了 DKCD 的因果发现过程。我们工作的主要贡献简要总结如下:

- • 我们提出了 DKCD,一种新颖的领域知识增强因果发现框架,该框架将领域知识图谱与基于 LLM 的推理相结合,以增强高专业度领域中从非结构化数据进行的因果发现。
- • 我们设计了一个知识引导的因果推理模块,利用检索到的领域知识来发现潜在因果因素,并生成基于知识的因果线索,从而提高标注准确性。
- • 我们构建了首个带有真实世界知识图谱的领域特定基准,用于评估。大量实验表明,DKCD 在因果因素识别和因果图构建方面均显著优于现有方法。

## 2 相关工作  

**因果发现**旨在从数据中识别因果关系,并通常以因果图的形式表示。现有方法通常分为三类:基于约束的 Niu 等 (2024 (https://arxiv.org/html/2607.09348#bib.bib29)); Vowels 等 (2022 (https://arxiv.org/html/2607.09348#bib.bib18))、基于评分的 Vowels 等 (2022 (https://arxiv.org/html/2607.09348#bib.bib18)) 和连续优化方法 Gong 等 (2024 (https://arxiv.org/html/2607.09348#bib.bib33)); Hyttinen 等 (2016 (https://arxiv.org/html/2607.09348#bib.bib34))。基于约束的方法通过条件独立性检验推断结构,代表性算法包括 FCI Spirtes 等 (2013 (https://arxiv.org/html/2607.09348#bib.bib8))、PC Spirtes 等 (2000 (https://arxiv.org/html/2607.09348#bib.bib6)); Ramsey (2016 (https://arxiv.org/html/2607.09348#bib.bib7)) 和 PCMCI Runge 等 (2019 (https://arxiv.org/html/2607.09348#bib.bib30))。基于评分的方法使用贝叶斯信息准则(BIC)和贝叶斯 Dirichlet 等价均匀(BDeu)等标准评估候选图 Huang 等 (2018 (https://arxiv.org/html/2607.09348#bib.bib31)); Nogueira 等 (2022 (https://arxiv.org/html/2607.09348#bib.bib32)),而连续优化方法则将结构学习重新表述为可微优化,例如 NOTEARS Zhou 和 Chen (2022 (https://arxiv.org/html/2607.09348#bib.bib36)); Lopez 等 (2022 (https://arxiv.org/html/2607.09348#bib.bib35))。尽管现有的因果发现算法在结构化数据上表现良好,但难以直接应用于非结构化文本。DKCD 通过使领域特定的非结构化数据能够进行有效的因果发现,弥补了这一差距。

**LLM 用于因果发现**近年来成为一个有前景的方向 Gopalakrishnan 等 (2024 (https://arxiv.org/html/2607.09348#bib.bib37)); Wu 等 (2023 (https://arxiv.org/html/2607.09348#bib.bib38)); Tong 等 (2024 (https://arxiv.org/html/2607.09348#bib.bib39))。先前的研究利用 LLMs 提取因果因素 Liu 等 (2024 (https://arxiv.org/html/2607.09348#bib.bib20))、估计因果边 Ban 等 (2023 (https://arxiv.org/html/2607.09348#bib.bib40)); Darvario 等 (2024 (https://arxiv.org/html/2607.09348#bib.bib41)),并支持从自然语言数据中进行反事实推理 Gendron 等 (2024 (https://arxiv.org/html/2607.09348#bib.bib42)); Liu 等 (2026 (https://arxiv.org/html/2607.09348#bib.bib45))。然而,仅凭 LLMs 无法可靠地执行因果推理,因为它们的预测主要由预训练数据驱动,这在领域特定环境中限制了鲁棒性。

**KG 引导的 LLM 用于因果发现**引入结构化领域知识以增强基于 LLM 的因果推理和因果分析 Kim 等 (2024 (https://arxiv.org/html/2607.09348#bib.bib47)); Pan 等 (2024 (https://arxiv.org/html/2607.09348#bib.bib48))。代表性研究包括 RC2R Yu 等 (2024a (https://arxiv.org/html/2607.09348#bib.bib49)),它专注于在现有知识图谱上的因果推理,以及 RealTCD Li 等 (2024 (https://arxiv.org/html/2607.09348#bib.bib46)),它对结构化时间序列数据进行因果发现,仅将文本信息作为辅助知识。其他研究将生物医学知识图谱纳入提示或检索框架以支持 LLM 推理 Susanti 和 Färber (2024 (https://arxiv.org/html/2607.09348#bib.bib50)); Lin 等 (2026 (https://arxiv.org/html/2607.09348#bib.bib52))。尽管取得了这些进展,LLMs 仍然难以可靠地区分相关性和因果关系 Wu 等 (2024 (https://arxiv.org/html/2607.09348#bib.bib51)),尤其是在虚假相关性常见的专业领域。此外,这些方法并不直接适用于我们的场景,因为我们的场景需要领域知识来从非结构化数据中提取潜在的因果因素和可靠标注。

## 3 领域知识增强的因果发现  

### 3.1 问题定义  

我们考虑一个数据集 D = {x₁, x₂, …, xₙ},其中每个样本 xₖ ∈ X 代表一个领域特定的文本描述。我们在实验中使用的生成患者病情描述示例见附录 B.1 (https://arxiv.org/html/2607.09348#A2.SS1)。在医疗保健等特定领域环境中,文本描述通常包含丰富的非结构化观察,可以支持潜在因果因素和关系的识别 Li 等 (2025b (https://arxiv.org/html/2607.09348#bib.bib72)); Ban 等 (2025 (https://arxiv.org/html/2607.09348#bib.bib73))。设 V* = {V₁, V₂, …, V_d} 表示领域过程背后完整的真实因果因素集。这些变量之间的真实因果关系由一个有向无环图 (DAG) G* = (V*, E*) 表示,其中 E* 表示有向因果边的集合。因此,从非结构化数据进行因果发现的目标是从 D 推断出一个尽可能接近真实结构 G* 的因果图。

**专业领域中的因果因素识别**。该任务旨在从非结构化数据集 D 中识别出一个相关的因果因素集 V。然而,非结构化数据通常只提供潜在因果因素的部分观察,并遗漏了几个重要的因果因素,要么是因为这些因素需要领域专业知识来推断,要么是因为它们隐含在上下文中。

相似文章

CausaLab: 面向AI科学家的可扩展交互式因果发现环境

Hugging Face Daily Papers

CausaLab 是一个可扩展的环境,用于评估LLM智能体在交互式因果发现中的表现,同时衡量预测准确性和对潜在因果机制的忠实复现。实验揭示了预测与机制复现之间的差距,突显了当前LLM智能体作为实验性因果推理者的局限性。

代理时代的因果发现

Hugging Face Daily Papers

本文认为,语言模型代理应通过提供上下文支持和解释来辅助因果发现工作流程,而非生成因果结论,并介绍了causal-learn+平台以演示这一原则。

联邦因果发现与推断综述

arXiv cs.LG

本综述系统回顾了联邦因果发现与推断,按方法论范式、联邦拓扑和结构范围组织方法,并强调了开放挑战。