一个用于评估大语言模型在临床数据登记抽象中表现的歧义分类体系:一项多中心前瞻性研究
摘要
本研究开发了一个歧义分类体系,用于评估大语言模型在从未经处理的电子病历数据中进行临床数据登记抽象时的表现,发现LLM的准确性显著低于人工抽象者,并且随着任务歧义性的增加而下降。
arXiv:2608.20373v1 Announce Type: new
摘要:目的:评估大语言模型(LLM)在未经处理的电子病历(EMR)数据上进行临床数据登记抽象的性能。方法:我们评估了LLM回答美国心脏病学会国家心血管数据注册库(ACC NCDR)登记问题的性能。在一个学术医疗中心的试点研究中,模型为每个登记问题识别候选数据来源,经验丰富的抽象者使用这些结果定义特定问题的文档集。在第二个中心使用第二个ACC NCDR登记库的验证研究中,LLM使用特定问题的文档集回答问题。在审查任何输出之前,两名抽象者独立建立真实情况并将每个问题分配到六个类别之一,按解决所需的歧义性和临床推理程度排序:药物/事件标记、二元临床存在、管理性、定量实验室/生理、临床解释和事件时间。结果:分析样本包括9,430个抽象者答案,调和为4,715个共识答案(501个试点;4,214个验证)。在试点中,每个问题的候选数据来源平均在14.6(标准差13.9)用于人口统计学和89.2(标准差56.1)用于病史和风险因素之间。在验证中,人工评分者间一致性约为98%,而87%的LLM答案完全匹配共识,2%部分匹配,9%不匹配。平均问题级准确率为91.5%(标准差13.4%),针对157个至少有20个答案的问题,并随着歧义性增加而下降,从药物/事件标记的96%到事件时间问题的62%。结论:LLM在未经处理的EMR数据上回答临床登记问题时,准确性远低于人工抽象者。随着歧义性和所需临床推理水平的增加,LLM准确性稳步下降。
查看缓存全文
缓存时间: 2026/08/24 04:14
# 评估大型语言模型在临床登记抽象任务中表现的歧义分类法:一项多中心前瞻性研究 来源:https://arxiv.org/html/2608.20373 Betsy CastilloCarta Healthcare, San Francisco, CA Andrew Y\. Shin Pediatrics, Stanford University School of Medicine, Stanford, CA 高级作者\. 通讯作者:David Scheinker, dscheink@stanford\.edu David Scheinker Pediatrics, Stanford University School of Medicine, Stanford, CA Medicine, Stanford University School of Medicine, Stanford, CA 高级作者\. 通讯作者:David Scheinker, dscheink@stanford\.edu ###### 摘要 **目的** 评估大型语言模型(LLM)在处理未经处理的电子病历(EMR)数据以进行临床登记抽象时的表现。 **方法** 我们评估了LLM在美国心脏病学会国家心血管数据登记(ACC NCDR)登记问题上的表现。在学术医学中心进行的试点研究中,模型为每个登记问题识别了候选数据源,经验丰富的抽象员使用这些结果来定义问题特定的文档集。在第二个中心使用第二个ACC NCDR登记进行的验证研究中,LLM使用问题特定的文档集回答问题。在审阅任何输出之前,两名抽象员独立建立了基准真相,并根据解决该问题所需的歧义程度和临床推理水平,将每个问题分配到以下六个类别之一:药物/事件标记、二元临床存在、管理类、定量实验室/生理、临床解释和事件时间。 **结果** 分析样本包括9,430个经协调达成一致的抽象员答案,对应4,715个共识答案(试点501个;验证4,214个)。在试点中,每个问题的平均候选数据源数量从人口统计学的14.6个(标准差 13.9)到病史和风险因素的89.2个(标准差 56.1)不等。在验证中,人类评分者间的一致性约为98%,而87%的LLM答案与共识完全匹配,2%部分匹配,9%不匹配。在至少有20个答案的157个问题中,平均问题级别准确率为91.5%(标准差 13.4%),并随着歧义程度增加而下降,从药物/事件标记类的96%降至事件时间类的62%。 **结论** LLM在回答基于未经处理的EMR数据的临床登记问题时,即使有了问题特定的文档范围限定,其准确率也远低于人类抽象员。随着歧义程度和所需临床推理水平的增加,LLM的准确率持续下降。 **关键词** 临床自然语言处理;大型语言模型评估;评分者间信度;临床数据抽象;登记质量;CathPCI;EPDI;多机构研究 ## 引言 大型语言模型(LLMs)目前在经过筛选的临床情景描述和多项选择医学考试中达到了专家水平 [1,2]。虽然这些基准测试加速了临床自然语言处理的发展,但它们与现实世界的文档任务有显著差异:大多数依赖于从单一临床背景中预设答案的定义狭窄的问题,并使用单一的整体指标(如准确率或宏平均F1分数)来总结性能 [3,4]。这种综合指标可能掩盖了临床不同任务之间的差异,并且可能无法反映在未经处理的电子病历(EMR)数据上的性能。最近的两项研究说明了这种差距:在一家学术医学中心,四种领先的LLM生成的ICD-9、ICD-10和CPT编码,与临床医生分配的编码相比,精确匹配准确率均低于50% [5];而在一个符合快速医疗保健互操作性资源(FHIR)标准的虚拟EHR环境中,针对300个临床衍生任务,最佳模型取得了69.7%的成功率,但不同任务类别间存在显著差异 [6]。第一项研究涉及单一机构和单一任务;第二项研究的任务仍然是结构化的,其环境是人工的。两者都指出需要在真实的、未经处理的EMR文档(其信息是碎片化、冗余且偶尔冲突的)上评估LLMs。临床登记为此类评估提供了一个实用的框架。越来越多的工作将LLMs应用于肿瘤学 [7]、肺栓塞 [8] 和心血管报告分类 [9] 等登记风格的抽象任务,通常报告较高的总体准确率,但未解释在单个登记内不同问题类型之间性能如何及为何变化。美国心脏病学会国家心血管数据登记(ACC NCDR)定义了数百个结构化问题,由经过培训的医院抽象员直接从EMR中提取,用于质量报告、研究和监管提交 [10];这些数据已成为国家心血管护理具有里程碑意义评估的基础 [11]。这些问题涵盖了从转录出生日期到综合笔记、实验室结果和叙述成编码答案的广泛临床推理范围,在经过培训的抽象员之间,后者可能合理地存在差异;登记机构通过双重独立抽象、解决分歧和测量评分者间信度(IRR)来管理这种变异性,从而产生一个经过裁决的参考标准,非常适合评估LLMs在现实世界、多源EMR任务中的表现。在本研究中,我们区分了两种歧义来源,并测量了LLMs在不同登记问题类别(这些类别要求不同水平的临床推理)上的未经处理的EMR数据准确率。文档歧义出现在不同EMR来源中,相同信息可能出现在多份可能不一致或相互矛盾的病程记录中;我们通过让LLM查找每个问题所有潜在相关数据源,并确定它是否能够自信地从每个来源回答来衡量它。临床歧义源于问题本身,即使文档清晰,也可能允许多种合理的解释;我们用一个歧义分类法来衡量它,经验丰富的抽象员在研究前根据所需的临床推理水平对问题进行分类。我们将类别在分类法中的位置与模型准确率之间的关系称为歧义-性能梯度。 ## 方法 ### 研究设计 我们分两个阶段进行了研究。试点阶段在A机构进行,使用了ACC NCDR电生理设备植入登记(EPDI),包括从3份去标识化患者病历中提取的168个登记问题(501个问题-患者观察值)。验证阶段在B机构进行,使用了ACC NCDR心脏导管插入术和经皮冠状动脉介入治疗登记(CathPCI v5.7.1),包括25份去标识化患者病历中的232个登记问题(4,214个问题-患者观察值)。两个机构使用不同的EMR系统和文档规范,因此相同的概念可能出现在不同类型的病程记录中,使用不同的标签,并具有不同的结构。 ### 基准真相 在每个地点,两名经过ACC/NCDR认证项目认证的心脏登记抽象员独立回答每个问题;分歧通过讨论协调为单一的共识答案,作为参考标准。输入数据包括未经处理的EMR文档,包括临床、手术、会诊和护理记录、诊断影像报告、出院和转诊摘要,以及可用的结构化数据元素。 ### 问题类别分类 在EPDI试点中,问题按登记部分分组,这是一种适用于试点文档路由目标的更粗略的方案。在验证研究之前,抽象员根据每个登记问题所需的歧义程度及相应的临床推理水平独立分组,将每个问题分配到以下六个类别之一(按推理需求从低到高排序):药物/事件标记(n = 62)、二元临床存在(n = 41)、管理类(转录)(n = 18)、定量实验室/生理(n = 10)、临床解释(n = 22)和事件时间(n = 4);完整定义见补充方法。这些计数反映了构成分析集的157个至少有20个可评估观察值的问题(表3);所有232个验证问题均被归类到相同的六个类别。第二位审阅者独立对随机10%的样本进行分类;一致性为92%(Cohen’s κ = 0.89),分歧通过共识解决。 ### LLM协议与文档上下文定向 两个阶段使用相同的模型配置:Claude Sonnet 4.6用于更复杂的登记问题,Claude Haiku 3.5用于更简单的问题,通过应用程序编程接口在机构安全、符合HIPAA标准的云环境中访问;受保护的健康信息未离开机构范围。每个提示包含逐字的ACC NCDR问题定义,包括指定的值集,以及在有信心时回答、无信心时拒绝回答的固定指令;对于具有定义值集的问题,模型从允许的选项中选择或明确弃权(完整提示结构见补充方法)。在试点阶段,我们提示LLM识别每份病历中可能包含回答每个问题所需信息的所有文档来源,并判断对于每个来源是否可用其进行回答。通过连续迭代,这些发现被开发为问题类型与文档上下文之间的结构化映射。在验证阶段,为了隔离问题歧义的影响,模型仅接收分配给每个问题的文档,并为问题适用的每份患者病历生成一个答案。答案与经过裁决的共识进行比对评分,分为完全匹配、部分匹配(答案包含参考值)、不匹配或弃权。 ### 结局与统计分析 主要结局是总体准确率,即非弃权答案中达到完全或部分匹配的比例。次要结局是在至少有20个答案的157个问题中的平均问题级别准确率(有些问题并非适用于所有患者)以及类别级别准确率,即每个类别内的平均问题级别准确率,并通过重复分析在10个答案阈值下测试敏感性。类别间差异使用Kruskal-Wallis H检验和预先指定的配对Mann-Whitney U检验以及等级双列效应量进行检验。试点研究(3名患者)以描述性方式报告;为了描述什么因素驱动可答性,我们拟合了可答百分比与候选源数量、以及包含登记部分作为分类项与否的线性模型(软件详情见补充方法)。 ## 结果 ### 试点研究:识别问题特定的文档子集 人口统计学部分每个问题的平均候选文档源数量最低,为14.6个(标准差 13.9),而病史和风险因素部分最高,为89.2个(标准差 56.1)(表1)。病历大小、文档密度和候选源数量在不同患者间差异显著(补充表S1)。可答率,即模型能够从已识别来源中生成答案的比例,在诊疗过程问题中最低,为40.3%(标准差 28.5%),在实验室问题中最高,为79.0%(标准差 18.5%)(表1)。尽管模型为每个问题识别了许多潜在相关来源,但有很大一部分无法用于回答;在多个部分中,不到一半的候选来源支持生成答案(表1)。关于可答率与候选源数量及登记部分关系的线性模型解释了31%的变异(调整后R²= 0.31),并发现部分归属与可答性强烈相关(F = 18.3; p < 0.0001),而来源数量则不相关。考虑到仅有三名患者的试点性质,此结果以描述性方式报告(补充图S1)。这些结果用于构建验证研究的文档上下文定向方案:对于每组问题,抽象员确定了LLM注意力被限制的文档集(表2;完整检索规格见补充表S2)。 ### 验证研究:总体回答和匹配率 在验证研究中,模型为99%的观察值(4,214个中的4,171个)生成了答案,并对1%(43个)弃权。在所有观察值中,87%与经裁决的抽象员共识完全匹配,2%部分匹配,9%不匹配,1%弃权。分析样本包括由经验丰富的临床抽象员生成并协调达成一致的9,430个答案,对应4,715个共识答案(试点501个,验证4,214个),这些共识答案作为评估LLM表现的参考标准。在协调之前,两名人类抽象员在约98%的问题上达成一致;其余问题,加上在质量审查中标记出的少数问题,被协调为单一的共识答案。所有观察值的加权总体准确率为89.6%。平均问题级别准确率(平等计算232个问题)为84.0%,差异为5.6个百分点。在至少有20个可评估观察值的157个问题中,平均准确率为91.5%(标准差 13.4%;中位数 96.0%;范围 12.0–100.0%):61个问题(39%)准确率为100%,18个(11.5%)低于80%,6个(3.8%)在或低于60%(图1)。放宽阈值到至少10个观察值(165个问题)使分布基本保持不变(平均 90.6%;中位数 96.0%;22个问题,13.3%,低于80%);额外的8个问题抽样更稀疏且略偏难(补充表S3给出了完整的排序分布)。随着类别复杂性增加,平均问题级别准确率稳步下降,从药物/事件标记问题的96.1%降至事件时间问题的62.0%(表3),差距为34.1个百分点。跨类别差异高度显著(Kruskal-Wallis p < 0.0001)。配对对比证实了这一梯度:药物/事件标记与临床解释(Mann-Whitney p < 0.0001;等级双列 r = 0.81),二元临床存在与临床解释(p < 0.0001)显示出大效应,而两个最复杂的类别之间没有差异(p = 0.39)。 ### 临床模糊问题中的准确率 临床解释和事件时间问题在准确率低于80%的问题中被过度代表:这两个类别占分析集的17%(157个问题中的26个),但占18个此类问题中的12个(67%),而在准确率高于90%的114个问题中,仅有6个(5%)来自这两个类别,约有13倍的富集(图2)。准确率为完美的问题包括二元的人口统计学和合并症,如出生日期、糖尿病、高血压和性别(所有准确率均为100%),以及大多数药物给药和术后事件标记(表4);一个值得注意的例外是心肌梗死病史,这是一个二元临床存在问题,模型达到68%的准确率。在准确率等于或低于60%的六个问题中,五个是解释性或时间性问题:心脏导管室就诊指征(12%)、到达日期/时间(20%)、CSHA衰弱量表和心血管不稳定(均为56%),以及出院日期/时间(60%);第六个是管理类的
相似文章
AIPatient Arena:基于电子健康记录的大语言模型在端到端临床咨询工作流中的评估
介绍了AIPatient Arena,一个基于电子健康记录的评估框架,用于评估大语言模型在临床能力的多个维度。研究揭示了在问诊和伦理方面的优势,但在处理模糊性和诊断准确性方面的弱点。
评估大型语言模型中的中文歧义理解能力
本文介绍了基于潜在歧义理论的汉语歧义数据集CHA-Gen,并评估了多个LLM在歧义检测任务上的表现。研究发现,模型虽然面临挑战,但通过思维链提示有所改进,而指令调优则导致过度自信。
一个用于医学大语言模型安全性、鲁棒性和公平性评估的多领域红队框架
本文提出了一个多领域红队框架,用于在690个临床相关场景中评估医学大语言模型的安全性、鲁棒性和公平性。结果表明,高聚合准确率可能掩盖关键失败,而结合临床专家审核的混合评估对于可信的安全性评估是必要的。
MTDiag:面向临床意义的多轮诊断数据集,用于评估大语言模型
本文介绍了MTDiag,一个多轮诊断对话数据集,用于在现实临床诊断场景中评估大语言模型,解决了静态问答基准测试的局限性。
大型语言模型在医学推理中表现出元认知敏感性
一项对照研究评估了大型语言模型在医学推理中的元认知敏感性,发现部分但存在缺陷的置信度校准,其随证据强度和冲突情境而变化。