电子健康记录文档不一致性自动检测初探

arXiv cs.CL 论文

摘要

本文介绍了一项形成性研究,采用两阶段LLM流水线(Gemini 2.5 Pro 和 Flash)检测电子健康记录中的内部文档不一致性,分析了3000份出院小结,并提出了一种分级本体来对不一致性进行分类。

arXiv:2607.22954v1 Announce Type: new 摘要:目标:描述通用大语言模型(LLM)能从真实出院小结中揭示出的内部文档不一致性的种类,并识别限制大规模可靠性的常见失效模式。 材料与方法:我们采用两阶段LLM流水线——开放式候选识别(Gemini 2.5 Pro)后接基于上下文的验证(Gemini 2.5 Flash)——对3000份随机采样的MIMIC-IV-Note出院小结进行处理。随后由临床专家对流水线输出的一部分进行了人工审查。 结果:我们的流水线发现了3460个候选不一致性,影响了69.7%的入院记录。代表性示例涵盖人口统计学、过敏史、手术、诊断、实验室检查、药物和护理计划等领域,对临床推理或患者安全有直接影响。专家审查还揭示了在验证需要时间推理、诊断演变背景或模型本身不具备的门诊处方规范知识时出现的常见失效模式。 讨论:检测高度依赖于上下文:许多被标记的对需要将每个陈述锚定到其来源部分和临床领域,然后评估冲突反映的是真正的矛盾还是缺失的上下文。我们提出了一种涵盖严格矛盾和歧义的分级本体,并通过一个模式按类别、部分、领域和不一致性轴描述每个被标记的案例。 结论:这项形成性研究为后续经过验证的大规模EHR不一致性分析奠定了方法论基础和概念框架。
查看原文
查看缓存全文

缓存时间: 2026/07/28 06:27

# 电子健康档案中文档不一致性自动检测初探
来源:https://arxiv.org/html/2607.22954
\[1\]\\fnmAnru R\.\\surZhang, PhD 1\]\\orgname杜克大学,\\orgaddress\\street2424 Erwin Road,\\city达勒姆,\\postcode27705,\\state北卡罗来纳州,\\country美国 2\]\\orgname哥伦比亚大学医学中心,\\orgaddress\\street622 West 168 Street,\\city纽约,\\postcode10032,\\state纽约州,\\country美国 3\]\\orgname范德比尔特大学医学中心,\\orgaddress\\street2525 West End Avenue,\\city纳什维尔,\\postcode37203,\\state田纳西州,\\country美国

###### 摘要

目的:旨在描述通用大语言模型(LLM)能够从真实出院小结中发现的内部文档不一致性类型,并识别限制大规模可靠性的常见失效模式。

材料与方法:我们采用两阶段LLM流水线——开放式候选识别(Gemini 2.5 Pro)后接基于背景的验证(Gemini 2.5 Flash)——应用于随机抽样的3,000份MIMIC-IV-Note出院小结。随后由临床专家对流水线输出的一个子集进行人工审查。

结果:我们的流水线发现了3,460个候选不一致性,影响69.7%的住院病例。代表性示例涵盖了人口统计学、过敏史、手术、诊断、实验室检查、药物和护理计划等领域,对临床推理或患者安全具有直接影响。专家审查还揭示了当验证需要时间推理、演变中的诊断背景或模型本身不具备的门诊处方规范知识时,出现的常见失效模式。

讨论:检测高度依赖于背景:许多被标记的对需要将每条陈述锚定到其来源章节和临床领域,然后评估冲突反映的是真正的矛盾还是缺失的背景。我们提出了一个涵盖严格矛盾和歧义的分级本体论,并附有一个模式,通过类别、章节、领域和不一致性轴来描述每个被标记的案例。

结论:这项形成性研究建立了方法论基础和概念框架,以指导后续经过验证的大规模电子健康档案不一致性分析。

###### 关键词:

电子健康档案、自然语言处理、患者出院小结、医疗错误、文档

## 1 背景与意义

电子健康档案(EHR)是现代医疗保健的基础,支持广泛的后续任务,如临床护理管理、\[1 (https://arxiv.org/html/2607.22954#bib.bib1)\] 临床结果预测、\[2 (https://arxiv.org/html/2607.22954#bib.bib2),3 (https://arxiv.org/html/2607.22954#bib.bib3)\] 医学术语识别、\[4 (https://arxiv.org/html/2607.22954#bib.bib4)\] 和患者表型分析。\[5 (https://arxiv.org/html/2607.22954#bib.bib5)\] 然而,EHR数据集内信息的可靠性并非无懈可击,先前的研究已记录到普遍存在的问题,如文档不完整、内部不一致以及跨护理环境的有临床意义的错误。\[6 (https://arxiv.org/html/2607.22954#bib.bib6),7 (https://arxiv.org/html/2607.22954#bib.bib7),8 (https://arxiv.org/html/2607.22954#bib.bib8),9 (https://arxiv.org/html/2607.22954#bib.bib9)\] 这些文档错误可能在临床工作流程中传播,并导致诊断错误,后者影响估计5%的门诊就诊。\[10 (https://arxiv.org/html/2607.22954#bib.bib10)\] 文档错误是一种公认的安全风险,可能导致不适当或延迟的护理。\[11 (https://arxiv.org/html/2607.22954#bib.bib11)\] 此外,常见的文档工作流程,如复制粘贴和模板使用,可能会将过时或不正确的信息传播到笔记中,造成内部矛盾,并在有记录的案例中,导致漏诊和患者伤害。\[12 (https://arxiv.org/html/2607.22954#bib.bib12),13 (https://arxiv.org/html/2607.22954#bib.bib13),14 (https://arxiv.org/html/2607.22954#bib.bib14)\] 药物差异是另一个例子:药物史和出院文档中的不一致可能在护理过渡期间持续存在,并导致常规电子检查无法可靠捕获的药物不良事件。\[15 (https://arxiv.org/html/2607.22954#bib.bib15),16 (https://arxiv.org/html/2607.22954#bib.bib16)\] 迄今为止,临床实践中有此类不一致性的经验证据主要来自人工审查:在一项针对门诊笔记阅读者的大型调查中,Bell等人\[17 (https://arxiv.org/html/2607.22954#bib.bib17)\] 发现,大约五分之一的患者报告在笔记中察觉到错误,其中超过40%的报告错误被认为严重或非常严重。虽然令人信服,但此类分析依赖于患者自我报告和人工图表检查,无法扩展到对大型队列的EHR文档质量进行系统性表征。

大语言模型(LLM)最近已成为一种强大的通用自然语言理解技术,在包括法律、\[18 (https://arxiv.org/html/2607.22954#bib.bib18)\] 金融、\[19 (https://arxiv.org/html/2607.22954#bib.bib19)\] 和医学在内的广泛领域表现出了强大的性能。\[20 (https://arxiv.org/html/2607.22954#bib.bib20),21 (https://arxiv.org/html/2607.22954#bib.bib21)\] 具体在临床应用方面,LLM已被用于达到专家水平的医学问答、\[22 (https://arxiv.org/html/2607.22954#bib.bib22),23 (https://arxiv.org/html/2607.22954#bib.bib23)\] 从非结构化笔记中提取临床信息、\[24 (https://arxiv.org/html/2607.22954#bib.bib24),25 (https://arxiv.org/html/2607.22954#bib.bib25)\] 以及临床文本摘要。\[26 (https://arxiv.org/html/2607.22954#bib.bib26)\] 对于自动化医疗错误检测,MEDIQA-CORR共享任务\[27 (https://arxiv.org/html/2607.22954#bib.bib27),28 (https://arxiv.org/html/2607.22954#bib.bib28)\] 已经激发了各种基于LLM的方法,包括检索增强的提示程序、\[29 (https://arxiv.org/html/2607.22954#bib.bib29)\] 错误类别感知集成、\[30 (https://arxiv.org/html/2607.22954#bib.bib30)\] 以及带有上下文提示的思维链提示。\[31 (https://arxiv.org/html/2607.22954#bib.bib31)\] 这些方法在基准测试中已被证明有效,其中底层错误是手动注入到简短、经过精心策划的临床片段中。它们与我们考虑的不一致性检测任务有显著不同,后者操作于真实世界的EHR数据集,如MIMIC-IV,\[32 (https://arxiv.org/html/2607.22954#bib.bib32)\] 其中出院小结包含数千词,并整合了诊断、药物、手术、实验室结果和护理计划等信息。最近的LLM越来越能够处理长上下文输入,但它们能否可靠地发现真实世界临床文档中的不一致性,以及当它们不能时会出现哪些失效模式,这仍然是一个开放性问题。

在这项工作中,我们通过对一个两阶段LLM检测流水线(开放式候选识别后接基于背景的验证)应用于来自大型MIMIC-IV队列的完整出院小结,进行形成性研究来解决这些问题。该流水线发现了跨人口统计学、过敏史、手术、诊断、实验室检查、药物和护理计划领域的不一致性,其中许多对临床推理和患者安全具有严重的下游影响。同时,我们观察到因真实世界EHR数据的复杂性而产生的常见失效模式:不一致性检测高度依赖于背景,需要时间推理、临床知识细微差别以及对通用领域LLM并不天然具备的文档规范的意识。基于这些观察,我们开发了一个临床不一致性的分级本体论——涵盖严格矛盾和歧义——以及一个用于描述每个被标记案例的模式。总之,实证发现和这个本体论-模式框架为系统性、经过验证的EHR不一致性分析奠定了基础,并为这项工作下一阶段所需的策划语料库构建提供了基础。

## 2 方法

### 2.1 数据来源

我们使用MIMIC-IV作为本论文中所有报告分析的发展队列。我们专注于出院小结,这些出院小结是整合文档,总结了住院期间的人口统计学、过敏史、手术、诊断、实验室检查和药物信息。主要数据集是Medical Information Mart for Intensive Care IV(MIMIC-IV),\[32 (https://arxiv.org/html/2607.22954#bib.bib32)\] 以及其相关的临床笔记模块MIMIC-IV-Note,\[33 (https://arxiv.org/html/2607.22954#bib.bib33)\] 从中提取出院小结。MIMIC-IV是一个大型、公开可用、去标识化的EHR数据集,涵盖单一三级学术医学中心的医院和重症监护病房入院情况,并包含超过330,000次住院的纵向结构化临床数据;MIMIC-IV-Note提供相应的自由文本临床笔记,包括临床医生在每次入院结束时撰写的出院小结。从完整的MIMIC-IV-Note出院小结语料库中,我们抽样了3,000份出院小结,作为三个连续的1,000份笔记批次,取自语料库中的不同位置。我们将其视为一个适合对流水线行为进行定性表征的形成性样本;定量分析留待策划语料库开发阶段(第5节 (https://arxiv.org/html/2607.22954#S5))。

### 2.2 伦理与数据访问

对公开可用的MIMIC-IV数据集\[32 (https://arxiv.org/html/2607.22954#bib.bib32)\](包含去标识化的临床记录)的分析是根据其数据使用协议进行的,不需要额外的机构审查委员会(IRB)批准;研究人员完成了PhysioNet认证访问培训并签署了MIMIC数据使用协议。本研究不涉及与人类受试者的直接互动。

### 2.3 基于定性分析的迭代流水线开发

我们迭代式地开发了流水线架构,从一个最小的单提示设计开始,并根据观察到的局限性添加了验证阶段。检测流水线在图1 (https://arxiv.org/html/2607.22954#S2.F1) 中总结,并且是应用于本论文中所有报告结果的版本。本节追溯其两个阶段——开放式候选识别和上下文验证——的迭代开发过程。

参见标题图 1:两阶段不一致性检测流水线概述。第一阶段扫描整个出院小结并返回一个候选不一致性池,每对是潜在冲突的陈述;第二阶段根据周围的临床背景验证每个候选,保留真正的不一致性,排除那些可以通过时间、演变中的诊断或文档规范调和起来的表面不一致性。##### 初始设计:开放式检测。

流水线的初始版本由一个单一的LLM调用组成,该调用将完整的出院小结作为输入,并返回一个候选不一致性列表(此提示作为*第一阶段*保留在最终流水线中)。它以探索模式运行:模型没有要评估的具体主张,必须扫描整个文档以寻找可能不一致的陈述对。提示要求模型考虑跨广泛临床类别的不一致性——药物(存在/缺失、剂量、频率、适应症);诊断和主要状况;具有诊断意义的实验室结果和影像;临床病程和结果;手术、装置、侧向性和代码状态;以及过敏或禁忌症。为减少噪声,它明确排除(i)由时间或预期临床演变清楚解释的差异,(ii)具有相同临床意图的微小数字或措辞差异(例如“26天”与“4周”),(iii)近似持续时间或舍入误差,(iv)冗余措辞,以及(v)对临床解读或管理无影响的表面不一致性。输出是一个候选列表,其中每个条目包含两个冲突的陈述以及为什么表面不一致可能在临床上重要的简要描述。设计上,此阶段针对召回率进行了优化:它产生一个候选池,供下游验证修剪。

##### 添加验证:反转搜索方向。

这种单阶段配置曝光了大量假阳性矛盾:那些孤立看起来不一致但结合周围临床背景阅读时可以调和的候选对。调和通常涉及时间演变(实验室值在不同时间点合法变化)、演变的诊断评估或标准文档规范(例如,住院期间停用的药物在入院和出院药物清单中不同)。这些失败反映了提示要求模型执行的任务(跨整个文档的发散性搜索)与验证所需的任务(针对特定候选的收敛性推理)之间的结构性不匹配。因此,我们添加了一个结构上与第一阶段相反的第二阶段。*第二阶段*将特定的候选对作为输入,并提示模型逐步推理\[34 (https://arxiv.org/html/2607.22954#bib.bib34)\]——识别每条陈述的主张,在出院小结中定位它,并评估时间或更广泛的临床背景是否能调和两者——然后返回关于该表面不一致性是否能在严格的、基于文档的解读下存活的二元判定。只有当出院小结中*没有*合理的时序或临床解释能调和两者时,该对才会被保留,这是一种不对称的举证责任,使该阶段偏向于保守、高精度的分类。第一阶段没有目标,在文档中搜索候选;第二阶段以候选开始,在同一文档中搜索调和背景。这种反向框架相对于单阶段配置大幅减少了假阳性保留。那些通过了第二阶段但在更仔细检查下仍然可调和的残余案例在第3.2节 (https://arxiv.org/html/2607.22954#S3.SS2) 中进行了描述。

##### 计算资源分配。

为最大化计算效率,我们根据所需推理水平将不同模型分配给两个检测阶段。能力更强(也更昂贵)的模型保留给需要假设生成和跨章节推理的开放式候选生成,而更快、性价比更高的模型处理上下文验证。我们使用Gemini 2.5 Pro进行第一阶段(候选识别),使用Gemini 2.5 Flash进行第二阶段(验证)。\[35 (https://arxiv.org/html/2607.22954#bib.bib35)\]

## 3 流水线输出与形成性案例分析

### 3.1 流水线发现的有临床意义的候选不一致性

应用于3,000份抽样的MIMIC-IV出院小结,该流水线在第二阶段验证后识别出3,460个被标记为潜在不一致的陈述对,在69.7%的住院病例中至少检测到一个候选不一致性。由于这些输出尚未根据临床医生注释的参考标准进行完全裁决,我们将其视为流水线生成的候选,而非真实答案。

相似文章