从临床叙述构建规划领域模型的神经符号方法
摘要
本文介绍了NSPIN,一个神经符号框架,它使用预训练的大型语言模型从临床叙述中提取结构化事件序列,并为手术过程诱导概率规划领域模型。通过在腹腔镜阑尾切除术记录上的评估,展示了其泛化能力和与外科实践的一致性。
arXiv:2608.21186v1 公告类型:新
摘要:手术如腹腔镜阑尾切除术是复杂、高风险的过程,但将其工作流程形式化以用于决策支持仍然是一个重大挑战。在这种情况下,归纳概率规划领域模型尤其困难,因为缺乏结构化事件数据以及临床叙述中普遍存在隐式动作,这些既不能由经验符号方法也不能由大型语言模型单独充分解决。我们引入NSPIN,一个从非结构化临床叙述中归纳概率规划领域模型的神经符号框架。我们的方法使用预训练的大型语言模型从原始文本中提取和填补结构化事件序列,然后归纳一个PPDDL模型,并通过LLM提出的修订来优化其前提条件,以实证验证为指导。我们在9位外科医生撰写的2,660份腹腔镜阑尾切除术记录上评估了该方法。NSPIN生成的模型能够泛化到未见过的记录,并且专家临床审查表明其归纳的知识与外科实践大体一致。
查看缓存全文
缓存时间: 2026/08/24 04:37
# 基于神经符号方法从临床叙述构建规划领域模型
来源:https://arxiv.org/html/2608.21186
Saurabh Mathur, Michael Skinner, Prasad Tadepalli, Kristian Kersting, Sriraam Natarajan
###### 摘要
腹腔镜阑尾切除术等外科手术是复杂且高风险的流程,但将其工作流程形式化以用于决策支持仍是一项重大挑战。在这种情况下,归纳概率规划领域模型尤为困难,因为缺乏结构化的事件数据,且临床叙述中普遍存在隐式操作,单纯的经验符号方法或大语言模型(LLM)都无法单独解决这一问题。我们提出了NSPIN,一个从非结构化临床叙述中归纳概率规划领域模型的神经符号框架。我们的方法使用预训练LLM从原始文本中提取和填充结构化事件序列,然后归纳出PPDDL模型,并根据经验验证通过LLM提出的修改来优化其前置条件。我们在9位外科医生撰写的2660份腹腔镜阑尾切除术记录上评估了该方法。NSPIN生成的模型能够泛化到未见过的记录,且专家临床审查表明其归纳的知识与外科实践大体一致。
## 引言
手术记录描述了针对特定患者的临床发现及外科医生的处理方式,例如穿孔的阑尾或意外的脓肿(19 (https://arxiv.org/html/2608.21186#bib.bib19))。然而,这些知识仅限于记录它的病历,从未在该患者之外的任何地方被使用过。学习一个关于外科操作及其前置条件与效果的模型,能够将这种经验推广到数千个同类手术案例中,这直接影响患者安全、外科手术培训以及高质量医疗服务的公平获取。此类模型可以支撑人机协同系统(20 (https://arxiv.org/html/2608.21186#bib.bib20)),帮助改进住院医师培训的模拟器(通过捕捉罕见并发症),实现手术记录的自动审查,并通过跟踪外科医生和机构之间的系统性差异来指导质量改进。随着进一步的发展,此类模型有望推动自主手术系统的发展。
形式化外科手术需要一种既能充分表达其结构、又具备足够可解释性以便临床医生验证的表示方法。形式化规划语言,如规划领域定义语言(PDDL)(6 (https://arxiv.org/html/2608.21186#bib.bib8)),为此提供了一个强大的框架,将流程表示为一组状态谓词和参数化的操作模式。这种声明式的符号逻辑表示具有高度可解释性,允许临床医生根据既定的医疗标准进行验证。
NSPIN外科手术记录 "麻醉后,患者经无菌准备并铺巾。于脐上做一横切口。置入一个12毫米套管针……" 模式创建 创建领域模式 序列生成 从数据中提取谓词序列,按时间顺序排列规划模型构建 合成形式化的PPDDL操作符 规划模型 :action port_placement:parameters (?port_size ?location):precondition (and (done_incision_made)):effect (probabilistic 1 (and (done_port_placed)))
图1:用于从临床叙述归纳概率规划模型的NSPIN框架。我们的神经符号方法使用LLM从非结构化的手术记录中提取结构化的谓词。它利用这些结构化信息来合成一个能够泛化到多样化外科工作流程的规划模型。使用LLM将文本中的每个操作和观察进行具体化,使NSPIN能够兼顾显式和隐式提及的信息。然而,从非结构化的临床叙述到形式化符号逻辑的转变代表着重大挑战。从临床记录中提取形式化表示需要处理不同临床医生的语言多样性和多变的写作风格(10 (https://arxiv.org/html/2608.21186#bib.bib22))。它还需要领域知识,因为外科医生通常会省略那些对他们显而易见但对形式化表示中保持逻辑一致性状态至关重要的信息。
我们通过儿童患者腹腔镜阑尾切除术(15 (https://arxiv.org/html/2608.21186#bib.bib21))这一具体案例来解决这一形式化挑战。切除阑尾以治疗急性阑尾炎是儿科外科中最常见的手术之一。在一个大型儿童医院,儿科外科医生一天可能要做十台或更多此类手术。这种高频率和相对直接的手术流程使腹腔镜阑尾切除术成为理想的研究领域。它提供了大量、结构相似(便于比较)、但语言多样(测试自动编译极限)的手术记录密集数据集。使用这个数据集,我们构建了一个能够泛化到同一手术不同实例的操作前置条件和效果模型。除了作为手术本身可解释的表示外,该模型还可以为下游用途(如模拟器场景生成和训练数据增强)合成计划和叙述,这两者都是部署就绪的临床AI系统的重要组成部分。
我们为建立可解释、可泛化的外科手术模型做出了以下关键技术贡献,这些模型能够支持可信赖、可部署的临床AI:(1) 我们介绍了NSPIN,一个神经符号框架,通过结合LLM的语言灵活性和符号归纳的逻辑严谨性,将非结构化手术记录转换为形式化的概率PDDL规划领域。(2) 我们利用预训练LLM的内部世界模型来填补手术记录中的空白,推断出对逻辑计划一致性至关重要的隐式临床操作和前置条件。(3) 我们在9位外科医生撰写的2660份真实世界手术记录的数据库上评估了NSPIN。我们的结果表明,这种神经符号方法产生的规划模型在泛化到未见过的手术工作流程方面,比纯基于LLM的基线方法更有效。
在介绍必要的技术背景之后,我们提出了我们的问题及其解决方案。然后我们概述了我们的评估,最后讨论了未来研究的问题。
## 背景
NSPIN与三个不同的研究领域相关:自动化规划、自然语言处理和神经符号学习。我们观察到,在医疗保健等高风险领域部署模型时,这种多AI模型和系统的组合是必要的。
### 规划领域模型
领域模型用于形式化地表示规划领域。在这项工作中,我们使用概率规划领域定义语言(PPDDL)(30 (https://arxiv.org/html/2608.21186#bib.bib7))来表示临床规划领域。我们首先介绍经典PDDL(6 (https://arxiv.org/html/2608.21186#bib.bib8); 7 (https://arxiv.org/html/2608.21186#bib.bib10)),它表示确定性领域,然后讨论PPDDL,它扩展了PDDL以表示随机性。
经典PDDL将规划问题定义为一个三元组⟨𝒫,s₀,G⟩。其中𝒫=⟨ℱ,𝒪,𝒜⟩是规划领域。这里,𝒪是对象的有限集合,ℱ是一阶逻辑谓词符号的有限集合,描述对象的属性或它们之间的关系,s₀是初始状态,G是目标条件,𝒜是一组参数化的操作模式。每个状态s是所有可能的基础谓词集合ℱ_g的一个子集(4 (https://arxiv.org/html/2608.21186#bib.bib9))。每个操作模式a∈𝒜被定义为三元组⟨pre(a), add(a), del(a)⟩,分别代表操作适用必须满足的条件、执行操作后变为真的事实集合、以及执行操作后变为假的事实集合。具体来说,一个基础操作a_g在状态s下是适用的,如果其前置条件被满足:pre(a_g)⊆s。给定以此符号形式化的问题,经典规划旨在找到一个计划,定义为一个确定性操作的有限序列π=⟨a⁽¹⁾,…,a⁽ⁿ⁾⟩,该序列将初始状态s₀顺序转换为满足目标测试G的状态。
在概率领域中,经典PDDL必须通过概率PDDL进行扩展,以建模每个操作结果具有随机性的领域。操作a不再具有由一组添加和删除效果定义的单一、保证的结果,其效果被定义为多个可能结果上的概率分布。这些随机效果形式化为一组元组{(p₁, add₁(a), del₁(a)), …, (pₖ, addₖ(a), delₖ(a))},其中pᵢ是执行操作a时第i个结果发生的概率,且∑ᵢ₌₁ᵏ pᵢ = 1。
这些(概率)PDDL模型的获取传统上依赖于领域专家的密集手动工程,这通常很脆弱且不可扩展。为了自动化这一过程,已经提出了几种符号归纳学习方法(13 (https://arxiv.org/html/2608.21186#bib.bib31); 16 (https://arxiv.org/html/2608.21186#bib.bib32); 22 (https://arxiv.org/html/2608.21186#bib.bib33)),用于从观察到的执行中提取操作模式。这些方法通常假设可以访问结构化的执行轨迹,通常表示为状态-操作-状态转换(s, a, s'),从中可以估计概率操作动态。
然而,临床叙述很少以这种结构化形式提供。将这些非结构化的文本文档转换为结构化轨迹需要手动注释或自动解析。此外,人工编写的记录常常省略关键但隐式的中间步骤(2 (https://arxiv.org/html/2608.21186#bib.bib4))。因此,即使是一个完美的解析器也会产生不完整且逻辑上有缺陷的轨迹。这些潜在依赖关系和数据稀疏性使得数据驱动的临床规划领域构建充满挑战。因此,现有的操作模型归纳方法不能用于这种场景,因为它们假设存在结构化的符号轨迹或观察到的操作序列,而非原始临床叙述。
图2:使用操作转换模型和NSPIN采样的部分手术序列。NSPIN学习限制可能的下一组操作的操作前置条件,以及每个操作概率性产生的观察效果。这些发出的观察为用于采样候选操作的简单数据驱动操作转换模型提供上下文。蓝色节点代表采样的操作,灰色节点代表发出的观察,橙色箭头表示候选前置条件关系,灰色箭头表示观察流程。在此示例中,套管针置放之后是粘连的观察,这为进行粘连松解提供了背景信息。
### 神经符号AI
我们的框架NSPIN采用神经符号方法(5 (https://arxiv.org/html/2608.21186#bib.bib11))来解决将临床叙述形式化为规划领域的问题。它利用神经网络的表示学习和符号逻辑的结构化推理。神经网络擅长从非结构化文本中提取结构化信息(29 (https://arxiv.org/html/2608.21186#bib.bib12))。神经模型也被用作可学习的启发式方法,以高效导航大型符号搜索空间(3 (https://arxiv.org/html/2608.21186#bib.bib13); 18 (https://arxiv.org/html/2608.21186#bib.bib30))。然而,由于训练数据稀缺和注释成本高昂,这些方法在医学领域的应用受到限制(25 (https://arxiv.org/html/2608.21186#bib.bib14))。
### 预训练LLM
大语言模型(32 (https://arxiv.org/html/2608.21186#bib.bib2))是一类以规模庞大为特征的神经语言模型。这些模型在大量自然语言语料库上进行预训练,使其能够处理文本并应对语言多样性,而无需额外训练。因此,这些模型已被用作零样本文本信息提取器,处理非标准的简写和多变的术语,将不同的自然语言短语映射到相同的底层结构化形式(11 (https://arxiv.org/html/2608.21186#bib.bib6); 23 (https://arxiv.org/html/2608.21186#bib.bib5))。
除了显式提取之外,其预训练也使LLM成为有效的填充引擎,用于推断人类作者通常为简洁而省略的潜在事件和隐式可操作性。此外,LLM还嵌入了关于这些临床叙述的广泛领域知识。它们已被用于过滤掉不合理的对象交互和状态变化,以剪枝巨大的符号搜索空间(27 (https://arxiv.org/html/2608.21186#bib.bib3))。尽管LLM在语言提取和填充方面表现出色,但它们本质上难以进行归纳逻辑推理(9 (https://arxiv.org/html/2608.21186#bib.bib1)),尤其是在涉及长期交互的复杂领域(26 (https://arxiv.org/html/2608.21186#bib.bib15))。因此,它们产生的模型过于简单。此外,最近基于LLM的规划形式化方法通常假设至少有一个在从临床叙述构建模型时不可用的支持源,例如干净的领域描述、可执行的环境反馈或具有已知形式化结构的基准任务(8 (https://arxiv.org/html/2608.21186#bib.bib24); 17 (https://arxiv.org/html/2608.21186#bib.bib25); 33 (https://arxiv.org/html/2608.21186#bib.bib26)),使其不适用于此任务。最后,大多数这些LLM+PDDL工作集中在确定性领域生成上(12 (https://arxiv.org/html/2608.21186#bib.bib28); 21 (https://arxiv.org/html/2608.21186#bib.bib23); 31 (https://arxiv.org/html/2608.21186#bib.bib27)),而我们的设置需要一个概率PPDDL领域模型来捕获跨临床叙述的随机效应。与先前的单实例LLM形式化器不同,NSPIN使用LLM从原始临床叙述中进行提取和填充,同时依赖符号归纳和语料库级别的聚合来构建和验证概率规划模型。
## NSPIN框架
回顾一下,我们的目标是从非结构化记录数据库中归纳出一个临床程序的结构化模型。我们将问题形式化定义如下:
给定:一个数据库𝒟={x⁽ⁱ⁾}ᵢ₌₁ᴺ,其中每个x⁽ⁱ⁾是描述一个程序实例的非结构化临床叙述。
任务:一个概率规划领域模型𝒫,该模型表征该程序的操作、前置条件和随机效应。
此任务提出了两个关键挑战。首先,临床叙述由非结构化文本组成,而归纳规划模型需要结构化的操作和观察数据。其次,叙述具有高度异质性和稀疏性,因为临床医生有不同的记录风格和未相似文章
PACE: 一种用于生成合理且可操作的反事实解释的神经符号框架
本文介绍了PACE,这是一个模块化的神经符号框架,结合了神经预测模型和符号推理,以生成符合领域特定可行性约束的反事实解释。在Adult Income数据集上的案例研究表明,结合符号规则能够产生更合理且可操作的解释。
面向数据敏感领域的LLM输出的神经符号验证(扩展预印本)
本文提出了一种针对高风险领域LLM输出的神经符号验证架构,结合形式化符号方法与神经语义分析。在一个医疗器械损伤评估系统上进行的评估显示,该架构对结构化实体的幻觉检测率超过83%,语义虚构的检测率达72%,报告创建时间缩短30%。
神经符号PRM:通过结构化痕迹和符号验证增强科学推理
本文提出一种神经符号框架,将推理解耦为符号有效性和语义 grounding,利用验证器和训练的PRM来提高LLM在科学推理任务中的可靠性。
安全自适应的云修复:使用神经符号世界模型验证LLM生成的恢复计划
本文介绍了PASE,一个神经符号框架,利用LLM为云系统生成结构化的恢复计划,并通过神经符号世界模型进行验证,可减少超过40%的恢复时间。
经典规划中提升动作模式的可微学习
本文介绍了一种神经网络架构,该架构从完全观测到的状态轨迹中学习提升动作模式,其中动作参数未观测,旨在实现神经符号模型规划域的鲁棒学习。