通过自适应大型语言模型提案进行不良妊娠结局的因果建模

arXiv cs.LG 论文

摘要

本文介绍了一种神经符号框架,该框架利用大型语言模型作为自适应提案分布来生成因果假设,以对不良妊娠结局进行建模,通过结合先验知识与实证数据评分来改进因果发现。

arXiv:2608.21079v1 公告类型:新 摘要:不良妊娠结局(APOs)如早产和妊娠糖尿病,可能对母婴造成长期影响,但其病因仍难以捉摸。由于数据匮乏和领域知识不完整,该领域的因果发现尤为具有挑战性。因此,纯数据驱动的方法失效,而大型语言模型(LLM)的输出仍不一致或相互矛盾。我们提出了一种神经符号框架,用于生成合理的因果假设,该框架迭代地将大型语言模型的广泛先验知识与数据的实证评分相结合。我们的方法将大型语言模型视为自适应提案分布,生成假设并根据实证数据评分;随后,得分高的图谱用于更新大型语言模型的上下文,引导后续生成向假设空间中更有前景的区域发展。我们在一个真实的临床数据集上评估我们的方法,用于建模APOs及其风险因素,并将我们的结果与专家构建的因果图进行比较。我们的方法恢复了所有专家验证的边,并识别出专家未列出的其他合理因果关系,可能为有针对性的干预提供新的见解。
查看原文
查看缓存全文

缓存时间: 2026/08/24 04:36

# 通过自适应大语言模型建议的不良妊娠结局因果建模
来源:https://arxiv.org/html/2608.21079  
Kavimayil P. Komarasamy21, Saurabh Mathur31, Ameet Soni4, David M. Haas5, Kristian Kersting367, Sriraam Natarajan2  
致谢:1同等贡献。所属机构:2德克萨斯大学达拉斯分校 所属机构:3达姆施塔特工业大学 所属机构:4斯沃斯莫尔学院 所属机构:5印第安纳大学医学院 所属机构:6黑森州人工智能中心 (hessian.ai) 所属机构:7德国人工智能研究中心 (DFKI)

###### 摘要

不良妊娠结局 (APOs),如早产和妊娠期糖尿病,可能对母婴产生长期影响,然而其原因的理解仍不明确。该领域的因果发现尤其具有挑战性,原因在于数据匮乏和领域知识不完整。因此,纯数据驱动方法效果不佳,大语言模型 (LLM) 的输出也往往不一致或相互矛盾。我们引入了一个神经符号框架,用于生成合理的因果假设,该框架迭代地结合了大语言模型的广泛先验知识与基于数据的经验评分。我们的方法将大语言模型视为一种自适应提议分布,生成假设并基于经验数据进行评分;随后,将得到的高评分图用于更新大语言模型的上下文,引导后续生成朝着假设空间中更有前景的区域进行。我们在一个真实的临床数据集上评估了我们的方法,用于建模不良妊娠结局及其风险因素,并将结果与专家构建的因果图进行了比较。我们的方法恢复了所有专家验证过的边,并识别出了专家未列出的额外合理因果关系,可能为针对性干预提供新的见解。

###### 索引词:

因果发现,大语言模型,分布估计

## I 引言

可靠的临床推理需要稳健的因果模型\[21 (https://arxiv.org/html/2608.21079#bib.bib17),22 (https://arxiv.org/html/2608.21079#bib.bib3)\],然而在产科等复杂领域,这些模型很少可用。对不良妊娠结局 (APOs) 的建模,如子痫前期、妊娠期糖尿病和早产,尤其具有挑战性,因为它们源于多种风险因素的相互作用,包括母体人口统计学特征、家族史、既往病史和生活方式因素。尽管现有医学文献提供了关于孤立关联的高度精确知识,但关于APOs背后的整体因果动态仍不完整\[15 (https://arxiv.org/html/2608.21079#bib.bib12)\]。此外,数据驱动的因果发现受到高质量产科数据匮乏以及在孕妇群体中进行干预研究极端困难的限制。

另一方面,尽管大语言模型 (LLMs) 可以根据其庞大的训练语料库建议因果关系,但它们无法进行因果推理;它们未能区分真正的因果关系与仅仅是关联关系\[42 (https://arxiv.org/html/2608.21079#bib.bib18),24 (https://arxiv.org/html/2608.21079#bib.bib20)\]。此外,它们的输出对提示词高度敏感,可能导致缺乏经验依据的矛盾图结构。现有的混合方法试图通过理论精炼范式来缓解这个问题\[6 (https://arxiv.org/html/2608.21079#bib.bib19),23 (https://arxiv.org/html/2608.21079#bib.bib7)\],即通过局部编辑来精炼初始假设,以改善其对数据的拟合度。然而,这些方法对其起始点敏感,常常陷入局部最优解,而这些解完全取决于初始假设的质量。

LLM大语言模型生成的因果图 (G) 阶段A (生成) 评估器 小数据集 阶段B (评估) 选择前K个 先前图集合 (H) 阶段C (更新) 变量X, X, 禁止边F 上下文C

图 1:clara框架。我们的框架通过“生成-评估-更新”循环解决数据稀疏领域的因果发现问题。它使用预训练的LLM生成多样化的因果假设,这些假设使用一个小的临床数据集进行评估。这些带分数的图用于识别在高分图中一致出现的模式,并更新采样分布,使其概率质量向更有前景的区域转移。 在本文中,我们提出了clara(通过自适应重采样和聚合进行因果学习),这是一个神经符号框架,将LLM视为自适应提议分布,并由数据驱动的评估迭代引导。受MIMIC随机优化算法\[9 (https://arxiv.org/html/2608.21079#bib.bib5)\]的启发,clara从LLM迭代采样因果结构,根据经验数据对其进行评分,并使用最高分的因果结构更新后续生成的提示词。这一过程有效地将LLM的采样概率质量集中在高置信度、数据验证过的结构上。

具体而言,我们做出以下关键贡献:(1) 我们引入了clara,一个神经符号框架,它结合了来自LLM的近似知识、不完整的专家知识和一个小的经验数据集来生成合理的因果假设。(2) 我们在针对不良妊娠结局的真实临床数据集上证明了我们方法的有效性。clara恢复了专家构建图中的所有边,并发现了专家图之外的额外合理因果关系。(3) 我们展示了如何在不牺牲性能的情况下提高clara的效率。

本文其余部分的组织结构如下:在回顾必要的背景知识和相关工作之后,我们概述了clara算法并对其进行了分析。然后,我们展示了该算法在不良妊娠结局建模这一实际问题上的经验证据,最后总结全文并概述未来研究方向。

## II 背景

### II-A 因果贝叶斯网络

因果贝叶斯网络 (CBNs) 是一类因果模型 (CMs) 和概率图模型 (PGMs)\[20 (https://arxiv.org/html/2608.21079#bib.bib2),30 (https://arxiv.org/html/2608.21079#bib.bib1)\]。它们表示一组变量 X = {X₁, X₂, ..., Xₙ} 之间的因果关系,使用因果图 G = (X, E),其中每条边 Xᵢ → Xⱼ ∈ E 表示 Xᵢ 是 Xⱼ 的直接原因。这使得CBN区别于仅编码概率依赖关系的标准贝叶斯网络 (BNs);CBN编码因果关系并支持干预推理,这对医学至关重要。形式上,一个关于 X 的CBN定义为 ⟨G, P⟩,其中 G 是因果有向无环图 (因果DAG),P = {P₁, ..., Pₙ} 是每个变量在其父节点条件下的局部条件概率分布集合。CBN将赋值 X = x 的联合分布分解为局部条件概率的乘积:P(x) = ∏ᵢ Pᵢ(Xᵢ | Paᵢ(x))。

我们工作的重点是生成合理的因果假设:即识别准确地表示变量 X 之间因果关系的图 G。数据驱动的方法,如 Peter-Clark (PC\[37 (https://arxiv.org/html/2608.21079#bib.bib6)\])、快速因果推断 (FCI\[38 (https://arxiv.org/html/2608.21079#bib.bib10)\]) 和贪婪等价搜索 (GES\[8 (https://arxiv.org/html/2608.21079#bib.bib23)\]),从观测数据中学习因果图。它们通过将从大量数据中归纳出的模式与结构性假设(如忠实性、因果马尔可夫条件和因果充分性)相结合来确立因果关系(变量选择的详细信息见第IV-A节 (https://arxiv.org/html/2608.21079#S4.SS1))。然而,临床数据集通常小且充满噪声,许多相关变量仅被微弱观测到\[13 (https://arxiv.org/html/2608.21079#bib.bib26)\]。此外,从数据中学习最优的贝叶斯网络结构是困难的,因为可能的图结构数量随变量数量超指数增长\[7 (https://arxiv.org/html/2608.21079#bib.bib27)\]。因此,在复杂且数据稀缺的领域,主要依赖统计信号(如条件独立性)的算法可能无法恢复合理的因果结构。

### II-B LLM增强的理论精炼

理论精炼\[27 (https://arxiv.org/html/2608.21079#bib.bib11)\]是一类混合方法,通过利用领域知识来解决纯数据驱动学习的局限性。使用领域知识允许理论精炼将搜索范围从超指数数量的可能图结构缩小到初始领域知识结构邻域内的局部搜索。这个基线贝叶斯网络结构是使用从专家那里获得的不完整领域知识构建的,并通过局部爬山搜索进行精炼;每一步应用三种原子编辑操作之一:添加、删除或反转有向边。选择每种操作是为了最大化经验结构评分,例如贝叶斯-狄利克雷 (BD\[17 (https://arxiv.org/html/2608.21079#bib.bib25)\]) 评分和贝叶斯信息准则 (BIC\[35 (https://arxiv.org/html/2608.21079#bib.bib28),33 (https://arxiv.org/html/2608.21079#bib.bib24)\])。然而,随着变量数量和潜在关系的增加,指定一个好的初始图变得具有挑战性。

最近的工作使用预训练的大语言模型 (LLMs\[26 (https://arxiv.org/html/2608.21079#bib.bib21)\]) 来解决这个问题。这些模型已成为有效的近似领域知识来源,可用于为理论精炼创建初始假设\[32 (https://arxiv.org/html/2608.21079#bib.bib22),23 (https://arxiv.org/html/2608.21079#bib.bib7)\]。这些模型从其庞大的训练语料库(包括学术文献)中捕捉因果领域知识。然而,虽然LLM可以生成流畅的文本,但它们的推理能力仍然有限,尤其是在因果推断方面\[42 (https://arxiv.org/html/2608.21079#bib.bib18)\]。它们的输出是随机性的,并且在不同运行中不一致。由于爬山法是局部搜索,仅依赖来自LLM响应的单个假设可能导致结构遗漏临床细节。

### II-C 分布估计算法

为了克服理论精炼对不良初始假设的敏感性,我们使用分布估计算法 (EDAs)\[16 (https://arxiv.org/html/2608.21079#bib.bib30)\]。与一次只跟踪单个解的传统优化方法不同,EDAs是一类随机优化方法,它们在整个搜索空间上维护并迭代更新一个分布。这种基于群体的方法允许算法同时探索搜索空间的多个邻域,降低了陷入局部最优解的风险。

我们特别采用了互信息最大化输入聚类 (MIMIC)\[9 (https://arxiv.org/html/2608.21079#bib.bib5)\] 的框架,它通过采样-评估-更新循环,提供了一种有原则的优化机制,将简单初始分布转换为围绕最优解集中的分布。MIMIC从分布中抽取样本,根据目标函数评估它们,并通过学习高分样本的共同结构特征来更新采样分布。这个过程重复进行,不断精炼采样分布,直到它集中在一组高分候选解周围。

clara用两个关键替换实例化了这个循环。clara不是从高分样本中学习显式分布并从中抽取新候选,而是使用LLM作为采样分布,并通过用高分样本替换其上下文示例来更新后续生成。这产生了第III节 (https://arxiv.org/html/2608.21079#S3) 中描述的“生成-评估-更新”循环。

## III 通过自适应重采样和聚合进行因果学习

我们的目标是通过整合来自LLM的近似知识、不完整的专家知识和来自数据的经验证据来构建因果模型。我们将此形式化为以下问题:

给定:一个关于离散变量 X = {X₁, X₂, ..., Xₙ} 的数据集 D,不完整的专家知识(形式为禁止边集合 F),以及一个预训练的大语言模型 O。

目标:通过协调这些知识来源,找到一个因果图 G,准确捕捉 X 上的因果关系。该领域的主要挑战是信息来源固有的不完整性。虽然临床专家提供高精度知识,但他们的专业知识通常局限于特定的亚专科,在完整因果结构方面留下显著的盲区。此外,观测数据的匮乏阻碍了纯数据驱动算法完全捕捉因果结构,导致图结构过于稀疏。最后,虽然大语言模型 (LLMs) 充当广泛的知识来源,但它们的输出本质上是随机且不可靠的;它们通常未能区分真正的因果关系和关联关系,并且对初始提示高度敏感,导致在单次因果图生成中表现不稳定且不准确。

为弥合这一差距,我们引入了通过自适应重采样和聚合进行因果学习 (clara)。如图1 (https://arxiv.org/html/2608.21079#S1.F1) 所示,clara实例化了一个神经符号系统(类型2:符号\[神经\]\[19 (https://arxiv.org/html/2608.21079#bib.bib29)\]),通过采样-评估-更新循环寻找因果图,逐步将预训练LLM的宽泛先验塑形为围绕数据验证过的合理因果图集中的分布。

### III-A 采样因果图

clara首先查询 LLM O 以获取一批 K 个候选因果假设。这利用了LLM广泛的领域知识启动搜索,同时减轻了依赖单个输出的不稳定性。每个样本是通过向LLM提供变量列表 X(附带简要描述)以及形式为禁止边 F 的专家知识来获取的。从LLM采样的每个违反禁止边和无环约束的候选图都会被丢弃并重新采样。

### III-B 使用结构评分评估因果图

clara使用贝叶斯信息准则 (BIC)\[35 (https://arxiv.org/html/2608.21079#bib.bib28)\] 作为结构评分,根据数据集 D 对每个LLM提议 G' 进行评分。BIC平衡了模型对数据的拟合度与其复杂度,定义为:

BIC(G') = log P(D | G') - (log N)/2 * Σᵢ₌₁ⁿ qᵢ (|Xᵢ| - 1)  (1)

其中 log P(D | G') 是数据 D 在给定图 G' 下的对数似然,N 是观测数量,qᵢ = ∏_{Xⱼ∈Pa(Xᵢ)} |Xⱼ| 是 Xᵢ 的父节点配置数量,|Xᵢ| 是 Xᵢ 的状态数量。在离散贝叶斯网络中,每个变量由其所有父节点配置上的条件概率表 (CPT) 参数化。

相似文章

基于反事实链和因果图的LLM可解释性

Hugging Face Daily Papers

本文提出了一种四阶段方法,用于构建建模LLM推理过程的因果图,利用反事实增强实现稳定的因果发现,并提供透明、概念级的可解释性。

CausaLab: 面向AI科学家的可扩展交互式因果发现环境

Hugging Face Daily Papers

CausaLab 是一个可扩展的环境,用于评估LLM智能体在交互式因果发现中的表现,同时衡量预测准确性和对潜在因果机制的忠实复现。实验揭示了预测与机制复现之间的差距,突显了当前LLM智能体作为实验性因果推理者的局限性。

基于研究者指定协变量的LLM文本分析的条件假设生成

arXiv cs.CL

本文介绍了条件假设生成(Conditional Hypothesis Generation),这是一个结合研究者指定协变量的框架,用于引导基于LLM的文本分析发现有意义的子组差异,同时解决诸如层不平衡和符号反转等混杂因素。