一种用于自主、免微调临床症状检测的多智能体系统:开发与验证研究

arXiv cs.AI 论文

摘要

Pythia是一个多智能体系统,能够自主编写和优化用于临床概念的提取提示,无需手动提示工程或微调,使用本地托管的开放权重模型。在临床症状检测中,其平均敏感度为0.76,特异度为0.95,在特异度上优于基于词典的方法。

arXiv:2607.12886v1 公告类型:新 摘要:临床笔记包含许多促使患者就医的体征和症状,但这些信息很少进入结构化字段。现有的提取方法要么依赖于不敏感的上下文规则,会产生假阳性,要么依赖于需要大量微调的监督模型。我们提出了Pythia,一个多智能体系统,能够自主编写和优化用于临床概念的提取提示,无需手动提示工程或微调。Pythia运行在本地托管的开放权重模型上,将临床笔记保留在本地基础设施中,并使用开发集的敏感度和特异度选择提示。我们将Pythia与一个精选词典进行了比较,涉及来自400份临床笔记(代表387名患者)的72个体征和症状。开发集(n=300)和验证集(n=100)针对每个概念独立划分。Pythia的平均敏感度为0.76,特异度为0.95,而词典分别为0.82和0.76,并且在62个直接可比较的概念中,有20个概念在两项指标上均达到或超过词典。对于词典将每份笔记都标记为阳性的14个概念,Pythia通过要求存在现在时、由患者归因的发现,而不是任何文本中提及的术语,恢复了平均0.97的特异度。特异度从开发集转移到验证集时,在不同患病率下退化极小,而敏感度转移在患病率低于5%时减弱,在患病率低于2%时达到平均差距0.25。一个针对每个概念在相同开发集上微调的BERT分类器实现了平均敏感度0.23,并且在患病率大约低于5%的概念上敏感度降至零。这些发现表明,自主、免微调的提示优化能够产生从开发集到验证集有效泛化的症状提取提示,同时仍可部署在本地基础设施上。
查看原文
查看缓存全文

缓存时间: 2026/07/15 04:21

# 用于自主、免微调临床症状检测的多智能体系统:开发与验证研究
来源:https://arxiv.org/html/2607.12886
Pedram Fard,马萨诸塞总医院医学部,波士顿,马萨诸塞州,美国  
Jiazi Tian,马萨诸塞总医院医学部,波士顿,马萨诸塞州,美国  
Jingya Cheng,马萨诸塞总医院医学部,波士顿,马萨诸塞州,美国  
Shawn N. Murphy,华盛顿大学生物医学信息学与医学教育系,华盛顿州,美国  
Hossein Estiri,马萨诸塞总医院医学部,波士顿,马萨诸塞州,美国  

###### 摘要

临床记录包含了大量促使患者就医的体征和症状,但这些信息很少进入结构化字段。现有的提取方法要么依赖缺乏上下文敏感性、易产生假阳性的规则,要么依赖需要大量微调的有监督模型。我们提出 Pythia,一个多智能体系统,它能够自动编写并优化针对临床概念的提取提示,无需人工提示工程或微调。Pythia 运行在本地部署的开源权重模型上,将临床记录保留在本地基础设施中,并利用开发集的灵敏度和特异度来筛选提示。我们将 Pythia 与一个经过整理的词典在来自 387 名患者的 400 份临床记录中的 72 个体征和症状上进行了比较。每个概念的开发集(n=300)和验证集(n=100)被独立划分。Pythia 实现了平均灵敏度 0.76 和特异度 0.95,而词典的相应指标为 0.82 和 0.76。在可直接比较的 62 个概念中,Pythia 在两个指标上均达到或超过了词典的有 20 个。对于词典将所有记录都标记为阳性的 14 个概念,Pythia 通过要求识别出以现在时态、归属于患者的发现(而不是任何文本中提及的术语)而恢复了平均 0.97 的特异度。从开发集到验证集,特异度在不同患病率下转移时仅有极小的衰减,而灵敏度的转移在患病率低于 5% 时变弱,在患病率低于 2% 时平均差距达到 0.25。在同一开发集上针对每个概念微调的 BERT 分类器平均灵敏度仅为 0.23,并且在患病率低于约 5% 的概念上灵敏度降至零。这些发现表明,自主的、免微调的提示优化能够生成症状提取提示,这些提示可以有效地从开发集泛化到验证集,同时可部署在本地基础设施上。

## 1 引言

临床记录记载了促使患者就医的体征和症状,其中大量信息从未进入电子健康记录的结构化字段。诊断代码和实验室数值捕获了已确诊的状况,而患者的主诉和疾病的日常病程则存在于自由文本中。因此,依赖症状的研究,包括计算表型分析、监测以及真实世界证据的生成,都需要大规模从记录中提取这些发现[1 (https://arxiv.org/html/2607.12886#bib.bib1),2 (https://arxiv.org/html/2607.12886#bib.bib2),4 (https://arxiv.org/html/2607.12886#bib.bib4)]。这种提取的质量为所有下游应用设定了上限。COVID-19 后急性期综合征说明了这个问题,因为其病例定义依赖于一系列广泛且不断变化的体征和症状,而这些几乎完全记录在叙述性文本中,而非诊断代码中。

可靠地提取症状比仅仅在文本中找到症状名称更复杂。同一术语经常出现在否定陈述、对患者的指令、家族史等中。将当前的发现与这些其他使用场景分离,通过否定、归属和时态处理,一直是临床自然语言处理二十年来面临的核心问题[6 (https://arxiv.org/html/2607.12886#bib.bib6),4 (https://arxiv.org/html/2607.12886#bib.bib4),3 (https://arxiv.org/html/2607.12886#bib.bib3)]。基于规则的词典仍然是默认选择,因为它们透明且不需要标记训练数据,然而它们不考虑上下文,并且其假阳性负担会随着阴性类别的增大而增加[7 (https://arxiv.org/html/2607.12886#bib.bib7),8 (https://arxiv.org/html/2607.12886#bib.bib8)]。

基于学习的方法为融合上下文提供了途径。在已标注记录上训练的 Transformer 编码器取得了强大的提取性能[10 (https://arxiv.org/html/2607.12886#bib.bib10),11 (https://arxiv.org/html/2607.12886#bib.bib11),12 (https://arxiv.org/html/2607.12886#bib.bib12)]。此外,最近一项多机构基准测试将当前最优方法定位为微调的大语言模型,当标记数据稀缺时,这些模型超越编码器[19 (https://arxiv.org/html/2607.12886#bib.bib19),13 (https://arxiv.org/html/2607.12886#bib.bib13)]。这些增益是有代价的,因为基准模型需要数千条已标注记录和权重微调,并且速度远慢于编码器基线[19 (https://arxiv.org/html/2607.12886#bib.bib19)]。提示降低了训练成本,但并未降低设计成本,因为少样本和手工设计的提示仍然依赖于人来编写和修改[14 (https://arxiv.org/html/2607.12886#bib.bib14),15 (https://arxiv.org/html/2607.12886#bib.bib15)]。自动提示优化在不进行权重更新的情况下,根据评估指标搜索指令空间[20 (https://arxiv.org/html/2607.12886#bib.bib20),21 (https://arxiv.org/html/2607.12886#bib.bib21),22 (https://arxiv.org/html/2607.12886#bib.bib22),23 (https://arxiv.org/html/2607.12886#bib.bib23)],并且开源权重模型现在可以在机构内部运行,用于处理隐私敏感的临床文本[24 (https://arxiv.org/html/2607.12886#bib.bib24),25 (https://arxiv.org/html/2607.12886#bib.bib25)]。构建这些系统的约束条件在于它们所需的标记数据以及手动提示设计,而非模型本身。

这种转变在智能体软件工程中有一个名称。在循环工程中,设计者不再为智能体编写提示,而是构建一个循环,该循环设定一个目标,让智能体朝着目标迭代,并使用一个独立的进程来检查目标是否达成,然后停止[osmani2026loop]。该模式基于成熟的机制,因为自动提示优化已经能够在不更新权重的情况下,根据评估指标搜索指令空间[20 (https://arxiv.org/html/2607.12886#bib.bib20),21 (https://arxiv.org/html/2607.12886#bib.bib21),22 (https://arxiv.org/html/2607.12886#bib.bib22),23 (https://arxiv.org/html/2607.12886#bib.bib23)],并且多智能体设计已经将提出解决方案的智能体与验证解决方案的智能体分离开来。临床自然语言处理很少针对临床使用所要求的灵敏度和特异度来评估此类循环。自主提示循环是否能够满足这些临床要求仍然是一个悬而未决的问题。

我们研究 Pythia,一个为临床症状检测实例化循环工程并消除编码器模型微调成本以及每个概念手动提示设计成本的系统。Pythia 为每个概念编写并优化自己的提取提示,无需手动提示工程和权重微调,并且运行在开源权重模型上,因此记录保留在本地基础设施中[30 (https://arxiv.org/html/2607.12886#bib.bib30),25 (https://arxiv.org/html/2607.12886#bib.bib25)]。智能体根据开发集上的灵敏度和特异度分数来选择每个提示,这两个指标决定了记录级别信号在应用于整个人群时的行为。它仅使用这些开发标签来评分和选择提示,从不更新模型权重,并且与词典阈值和有监督比较器使用相同的标记预算进行操作。这种设计旨在填补基于规则匹配(不需要标签但上下文读取能力差)和有监督提取(需要上下文但需要大量标注)之间的空白。

在本研究中,我们将该智能体与两个比较器在来自临床记录的 72 个体征和症状上进行比较:一个经过整理的基于规则的词典,以及一个在相同 300 条记录开发预算上针对每个概念微调的有监督 BERT 分类器。据我们所知,这是首次将循环工程设计的提取器与基于规则和有监督的比较器在临床检测任务上进行评估,并确定了此类循环在临床使用前所需满足的领域约束。有监督比较器展示了内部的标注成本,而非依赖于外部基准[19 (https://arxiv.org/html/2607.12886#bib.bib19)]。我们报告灵敏度和特异度,而不是单一的总结分数;我们根据智能体相对于词典所做的工作点偏移来对概念进行分组;并测量在开发集上选择的提示如何转移到保留的验证集。我们还检查了智能体的优化行为,包括当它停止细化并保留初始提示时。分析确定了自主优化在哪些方面改进了提取,在哪些方面词典仍然更优,以及如何将智能体的工作点设置为临床使用所需。

## 2 背景与相关工作

临床信息提取将叙述性记录转化为结构化变量,基于规则的系统定义了该领域的第一代工作。词典和模式方法将经过整理的术语集与文本进行匹配,诸如 cTAKES 和 CLAMP 等流水线使其能够大规模应用[7 (https://arxiv.org/html/2607.12886#bib.bib7),8 (https://arxiv.org/html/2607.12886#bib.bib8)]。它们的弱点在于上下文,因为诸如“寒战”这样的术语会出现在不仅仅是承认症状存在的短语中,例如否定陈述,因此依赖于表面形式的匹配器无法将当前的发现与其他使用场景分开。因此,处理否定、归属和时态占据了临床自然语言处理二十年的精力[6 (https://arxiv.org/html/2607.12886#bib.bib6),4 (https://arxiv.org/html/2607.12886#bib.bib4),5 (https://arxiv.org/html/2607.12886#bib.bib5)]。

有监督神经模型通过从已标注示例中学习上下文来减少这个问题。诸如临床 BERT 变体的 Transformer 编码器在实体识别和概念提取上表现强劲[11 (https://arxiv.org/html/2607.12886#bib.bib11),10 (https://arxiv.org/html/2607.12886#bib.bib10),12 (https://arxiv.org/html/2607.12886#bib.bib12)]。随后,一项最近的多机构研究确立了指令微调的大语言模型作为当前的最优方法,在低资源跨机构设置中最明显地超越了编码器[19 (https://arxiv.org/html/2607.12886#bib.bib19),13 (https://arxiv.org/html/2607.12886#bib.bib13)]。该研究也衡量了增益的代价。其模型需要 1588 条手动标注的记录语料库和参数高效微调,运行速度比编码器基线慢 5 到 28 倍,且消耗更高的内存和能源[19 (https://arxiv.org/html/2607.12886#bib.bib19)]。作者建议在标记数据充足时使用编码器,这将约束条件定位在标注成本而非模型架构上。

大语言模型也可以通过提示来提取信息,无需微调。少样本提示和手动提示工程在不更新权重的情况下改善了临床实体识别[14 (https://arxiv.org/html/2607.12886#bib.bib14),15 (https://arxiv.org/html/2607.12886#bib.bib15)],而指令微调将其扩展到生物医学实体[16 (https://arxiv.org/html/2607.12886#bib.bib16)]。大语言模型也被用来加速有监督方法所需的标注[17 (https://arxiv.org/html/2607.12886#bib.bib17)],广泛的基准测试已经描绘了这些模型在生物医学任务中的优缺点[13 (https://arxiv.org/html/2607.12886#bib.bib13),19 (https://arxiv.org/html/2607.12886#bib.bib19)]。这些方法仍然依赖于人类编写和修改的提示。自动提示优化通过针对开发集指标搜索指令空间来移除手动步骤[20 (https://arxiv.org/html/2607.12886#bib.bib20),21 (https://arxiv.org/html/2607.12886#bib.bib21),22 (https://arxiv.org/html/2607.12886#bib.bib22),23 (https://arxiv.org/html/2607.12886#bib.bib23)],然而现有的临床应用既不针对临床医生选择的操作点优化提示,也不报告所选提示如何转移到保留数据。用于生成式提取的下游工具已经开始出现[18 (https://arxiv.org/html/2607.12886#bib.bib18)],并且已有本地部署开源权重模型用于隐私保护任务(如去识别化)的演示[24 (https://arxiv.org/html/2607.12886#bib.bib24),25 (https://arxiv.org/html/2607.12886#bib.bib25)],这表明在机构内部进行提取而不将记录发送到外部服务是可行的。

Pythia 占据了这些方法所留出的空间。它自动优化每个概念的提取提示,无需手动提示工程或权重微调,并根据开发集上的灵敏度和特异度分数来选择提示[30 (https://arxiv.org/html/2607.12886#bib.bib30)]。模型在本地运行于开源权重上,因此记录保留在机构内部[25 (https://arxiv.org/html/2607.12886#bib.bib25)]。该方法消除了有监督提取所需的标注和微调负担[19 (https://arxiv.org/html/2607.12886#bib.bib19),16 (https://arxiv.org/html/2607.12886#bib.bib16)],同时提供了基于规则匹配所缺乏的上下文处理能力[6 (https://arxiv.org/html/2607.12886#bib.bib6),7 (https://arxiv.org/html/2607.12886#bib.bib7)]。我们之前介绍了该智能体及其优化过程[30 (https://arxiv.org/html/2607.12886#bib.bib30)]。在此,我们通过与词典在 72 个体征和症状上的比较来描述其特征,并分析自主优化在哪些方面有帮助、在哪些方面没有帮助,以及如何设置其操作点。

## 3 方法

### 3.1 数据与参考标准

我们在从电子健康记录中抽取的 400 份临床记录上评估该系统。临床医生为每条记录标注了每个目标体征或症状的二元存在/不存在标签,这些标签作为参考标准。该集合包含 72 个体征和症状,患病率从低于 2% 到高于 20%。为覆盖这些概念编写了经过整理的词典,这定义了本文报告的正面比较。对于每个概念,我们通过分层随机抽样,根据二元症状状态将 400 条记录划分为开发集(n=300)和保留验证集(n=100),这保持了划分中的患病率。每个概念的划分是独立的,因此一个患者可能在一个概念上属于开发集,在另一个概念上属于验证集。

如表格1 (https://arxiv.org/html/2607.12886#S3.T1) 所示,研究的患者群体是从一个更大的 COVID 患者群体中随机选择的。从 387 名患者中检索出 400 条记录并由临床医生进行标注。

表1:用于测试 Pythia 的患者队列中的人口统计学统计信息。
### 3.2 症状选择

选择带有二元标签的体征和症状是因为它们通常出现在长期新冠患者中,并且集合中的症状由两位临床医生确定。

### 3.3 自主提示优化

Pythia 搜索自然语言提示空间,以找到每个概念级别的记录分类器(图1 (https://a

相似文章

WiseMind:一个知识引导的多智能体框架,用于准确且富有同理心的精神疾病诊断

arXiv cs.CL

WiseMind是一个知识引导的多智能体框架,利用大语言模型进行精神疾病诊断,通过结合用于循证逻辑的“理性思维”智能体和用于共情沟通的“情感思维”智能体,在模拟和真实患者交互中实现了85.6%的诊断准确率。该框架利用DSM-5结构化知识图谱减少幻觉,并在保持临床合理性和心理支持的同时,比单智能体基线高出15-54个百分点。