MedicalBench:评估大型语言模型以改进医学概念提取

arXiv cs.CL 论文

摘要

MedicalBench是一个新的基准测试,用于评估大型语言模型从电子健康记录中提取医学概念的能力,重点关注隐含推理和证据支撑。它包含823个专家标注的示例,并显示当前模型表现一般,突显了提取隐含表述的医学概念的难度。

arXiv:2605.20197v1 Announce Type: new 摘要:从电子健康记录中提取医学概念是许多下游应用的基础,但由于医学上有意义的概念通常在叙述中隐含而非明确陈述,因此仍然具有挑战性。现有的带有专家标注证据范围的基准测试强调了将提取的概念扎根于医学文本的重要性,但它们主要关注明确陈述的概念而非隐含概念。我们提出了MedicalBench,这是一个基于证据支撑的医学概念提取基准,用于评估隐含的医学推理能力。MedicalBench将医学概念提取形式化为对病历-概念对的验证任务,并辅以句子级别的证据识别。该数据集基于MIMIC-IV出院小结和人工验证的ICD-10代码构建,通过多阶段大型语言模型(LLM)分诊流程,再经过医学标注和专家审核来整理。它特意包含了隐含的正例、语义上容易混淆的负例,以及LLM判断与医学专家评估不一致的案例。我们定义了两个互补的评估任务:(1)医学概念提取和(2)句子级证据检索,从而能够评估正确性和可解释性。对最先进的LLM进行基准测试显示,性能仍然一般,突出了提取隐含表达概念的难度。我们进一步表明,性能与笔记长度基本无关,说明MedicalBench隔离了推理难度而非表面混杂因素。MedicalBench提供了第一个系统性的隐含、证据支撑的医学概念提取基准,为开发既能识别医学相关概念又能以透明且医学上可靠的方式证明其预测的医学语言模型奠定了基础。
查看原文
查看缓存全文

缓存时间: 2026/05/21 06:31

# 评估大型语言模型以改进医学概念抽取
来源:https://arxiv.org/html/2605.20197
Gregory D. Lyng\* Optum AI  
Sanjit Singh Batra\* Optum AI  
Robert E. Tillman Optum AI  
通讯作者:gregory.lyng, sanjit.batra, rob.tillman @optum.com

###### 摘要

从电子健康记录中抽取医学概念是许多下游应用的基础,但依然具有挑战性,因为诸如诊断等具有医学意义的概念,在医学叙述中常常是隐含而非明确陈述的。现有的、包含人工标注证据片段的基准测试强调了将抽取的概念锚定在医学文本中的重要性。然而,这些基准测试主要侧重于明确陈述的概念,对需要推断的医学相关概念案例覆盖有限。我们提出了 MedicalBench,这是一个新的、基于证据溯源的医学概念抽取基准测试,用于评估隐含医学推理能力。MedicalBench 将医学概念抽取形式化为一个在医学笔记-概念对上进行验证的任务,并结合了句子级别的证据识别。该数据集基于 MIMIC-IV 出院小结和人工验证的 ICD-10 代码构建,通过多阶段大型语言模型(LLM)分诊流程,随后进行医学标注和专家审核来整理。数据集中特意包含了隐含的正例、语义易混淆的负例,以及 LLM 判断与医学专家评估不一致的案例。标注人员提供了句子级别的证据片段和简洁的医学理由。最终数据集包含 823 个高质量样本。我们定义了两个互补的评估任务:(1)医学概念抽取和(2)句子级别证据检索,从而能够评估正确性和可解释性。对最先进的 LLM 和监督基线进行基准测试表明,性能仍然有限,凸显了抽取隐含概念的难度。我们进一步证明,显式地融入推理线索并提示抽取隐含证据可以显著提升医学概念抽取效果,而性能对笔记长度基本不敏感,这表明 MedicalBench 隔离了推理难度而非表面混杂因素。MedicalBench 为基于证据溯源的隐含医学概念抽取提供了第一个系统性基准测试,为开发既能识别医学相关概念、又能以透明且医学上忠实的方式证明其预测的医学语言模型奠定了基础。¹¹¹MedicalBench 数据集可在 PhysioNet 获取(https://physionet.org/content/mimic-iv-ext-medicalbench/1.0.0/)。

## 1 引言

参考图注  
图 1:在我们的 MedicalBench 上,医学专家和 LLM 的医学概念抽取 F1 值。

医学概念抽取旨在从非结构化的临床叙述(如出院小结、病程记录和肿瘤学报告)中识别并结构化关键医学事实(Wiest 等,2025 (https://arxiv.org/html/2605.20197#bib.bib11);Wu 等,2024 (https://arxiv.org/html/2605.20197#bib.bib36);Sushil 等,2024 (https://arxiv.org/html/2605.20197#bib.bib34);Landolsi 等,2022 (https://arxiv.org/html/2605.20197#bib.bib44)) 。准确抽取诊断事件是构建可靠临床知识系统的基础,并为众多下游应用提供支持(Huang 等,2024 (https://arxiv.org/html/2605.20197#bib.bib14);Goldstein 等,2016 (https://arxiv.org/html/2605.20197#bib.bib37))。例如,将自由文本笔记转换为结构化诊断和发现,有助于研究中的队列识别(Afshar 等,2025 (https://arxiv.org/html/2605.20197#bib.bib39);Hein 等,2025 (https://arxiv.org/html/2605.20197#bib.bib9);Sarmiento 和 Dernoncourt,2016 (https://arxiv.org/html/2605.20197#bib.bib13)),改进临床结局预测(Sun 等,2025 (https://arxiv.org/html/2605.20197#bib.bib10);Seinen 等,2022 (https://arxiv.org/html/2605.20197#bib.bib17);Shukla 和 Marlin,2020 (https://arxiv.org/html/2605.20197#bib.bib38)),并简化自动化文档流程(Shahid 等,2025 (https://arxiv.org/html/2605.20197#bib.bib16);Das 等,2025 (https://arxiv.org/html/2605.20197#bib.bib8);Lau 等,2021 (https://arxiv.org/html/2605.20197#bib.bib43))。强大的医学概念抽取通过使隐含信息显式化、机器可读化,支撑着电子健康记录(EHR)的许多二次利用(Gao 等,2024 (https://arxiv.org/html/2605.20197#bib.bib4);Tsai 等,2020 (https://arxiv.org/html/2605.20197#bib.bib18);Xiao 等,2018 (https://arxiv.org/html/2605.20197#bib.bib15))。

医学概念抽取的一个核心挑战是,叙述性文本中与医学概念相关的信息往往是隐含的、碎片化的且依赖于上下文(Perera 等,2015 (https://arxiv.org/html/2605.20197#bib.bib33);Meystre 等,2008 (https://arxiv.org/html/2605.20197#bib.bib35))。例如,一份笔记可能将“低血红蛋白水平”报告为一项发现(暗示贫血这一概念),或者列出“BMI 37”(表明肥胖这一概念),而没有显式使用“贫血”或“肥胖”这些词。实证研究表明,这种隐含记录方式十分普遍:尽管超过一半的患者可能符合肥胖的客观标准,但只有一小部分患者的该疾病被显式记录在结构化问题列表中(Mattar 等,2017 (https://arxiv.org/html/2605.20197#bib.bib42))。

揭示这一局限性的一个重要研究方向将医学概念抽取形式化为一个验证和溯源问题:自动抽取模型不仅仅是识别哪些概念可能适用于患者,还必须判断每个候选概念是否得到临床叙述的支持,并识别相应的证据。最近一些包含专家标注证据片段的数据集展示了将抽取的概念锚定在文本中的重要性,但它们仍然局限于明确陈述的概念,并且对需要从间接证据推断概念的案例覆盖有限(DeYoung 等,2022 (https://arxiv.org/html/2605.20197#bib.bib19);Cheng 等,2023 (https://arxiv.org/html/2605.20197#bib.bib30);Beckh 等,2025 (https://arxiv.org/html/2605.20197#bib.bib5))。更广泛地说,现有的大多数基准测试侧重于文档级别的概念存在与否,而对于为什么一个概念是合理的、支撑证据在哪里却提供很少的见解(Mullenbach 等,2018 (https://arxiv.org/html/2605.20197#bib.bib12))。

在这项工作中,我们引入了 MedicalBench,这是一个旨在评估在真实医学笔记中基于显式证据溯源的医学概念抽取的基准测试。MedicalBench 的任务形式化如下:给定一份医学笔记和一个候选医学概念,模型必须判断该概念是否得到文本支持,如果是,则定位相关证据片段。我们利用 MIMIC-IV 的出院小结和医学概念标签,通过一个多阶段大型语言模型(LLM)分诊流程,随后进行严格的专家标注,构建了具有挑战性的正例和负例。数据集强调隐含案例和语义易混淆的负例,专家标注人员标记支持证据并提供解释性理由。为确保标注质量,我们融入了基于 LLM 启发式方法得出的控制标签,以评估标注人员可靠性。最终数据集包含 823 个高质量、专家标注的样本,据我们所知,这是第一个系统性地评估具有经过验证的证据溯源的隐含医学概念抽取的基准测试。在一系列大型语言模型上,我们发现性能仍然有限,最高的抽取 F1 值低于 0.6(图 1 (https://arxiv.org/html/2605.20197#S1.F1)),突显了这项任务的难度。MedicalBench 为开发和评估医学语言模型提供了基础,这些模型既能识别具有医学意义的概念,又能以透明且医学上忠实的方式证明其预测。

## 2 数据收集

### 2.1 数据源与候选概念

我们使用 MIMIC-IV 数据库构建数据集,该数据库包含 Beth Israel Deaconess Medical Center 住院患者的去标识化电子健康记录(Johnson 等,2023a (https://arxiv.org/html/2605.20197#bib.bib23)),数据来自 physionet(PhysioBank,2000 (https://arxiv.org/html/2605.20197#bib.bib26))上的 MIMIC-IV 存储库(Johnson 等,2024 (https://arxiv.org/html/2605.20197#bib.bib24))和 MIMIC-IV-Note 存储库(Johnson 等,2023b (https://arxiv.org/html/2605.20197#bib.bib25))。遵循 Mullenbach 等人 (2018 (https://arxiv.org/html/2605.20197#bib.bib12)) 的方法,我们提取出院小结作为每次住院('hadm_id')的代表性医学笔记。然后,将每次住院映射到 'diagnoses_icd' 表中所有相关的 ICD-10 诊断以及 'procedures_icd' 表中的所有相关 ICD-10 操作。由于这些计费代码由专业医学编码员分配和审核,我们将其视为感兴趣的临床概念。对于每个代码,我们保留了包括 ICD 章节、父层级和文本描述在内的元数据,用于提示和分析。

### 2.2 基于 LLM 的正例分诊

为了识别 LLM 可能与人类专家产生分歧的挑战性案例,我们执行了一个两阶段分诊过程。在第一阶段,使用一个非推理型 LLM(GPT-4o-mini),输入出院小结和候选医学概念,并要求其将每个笔记-概念对分为三类之一:显式(概念由笔记中的文本片段显式支持)、隐含(概念得到支持但需要临床推断,例如“低血红蛋白水平”暗示贫血)或无关(概念不被支持)。每个对提示 3 次,最终答案通过多数投票得出。解释和证据片段(字符偏移量)在内部存储。具体提示见 A.1 节 (https://arxiv.org/html/2605.20197#A1.SS1)。

在第二阶段,使用一个推理型 LLM(o3)重新评估之前的分歧。我们仅保留那些两个 LLM 均判断概念为“无关”,但该概念(ICD-10 代码)在 MIMIC-IV 中确实被分配给该次住院的案例。这个子集(推定正例)代表了 LLM 的候选假阴性,并构成了具有挑战性的正例的基础。

### 2.3 负例采样策略

为了构建困难的负例,我们设计了两种互补的采样策略。

**基于流行度的负例**:对于每份出院小结,我们根据候选医学概念在 MIMIC-IV 中的流行度进行采样。为了表征其难度,我们额外记录了每个采样的负例与最相关概念之间在 ICD 层级中的跃点数。

**语义相似负例**:为了增加语义混淆,我们对医学概念名称进行嵌入,并采样最相似但不相关的概念。例如,“肥胖”和“BMI 30-39”都描述了与肥胖相关的状况,但在 ICD 层级中属于不同类别(疾病 vs. BMI 分类)。这些困难负例旨在测试关于一个概念是否真正在笔记中被记录的精细推理能力。

这些策略共同最大限度地减少了平凡负例的存在,并丰富了数据集中具有医学挑战性的对比。

### 2.4 标注候选类别

我们招募了 9 名具有医学培训背景的独立专家标注员作为最终权威。每位标注员(两名一组)会收到一份出院小结和一个候选医学概念,并要求将该对标记为“相关”或“无关”。对于“相关”案例,标注员在笔记中高亮证据片段(字符偏移量)并提供简要的文本理由。仅保留两位标注员一致的案例进入数据集。

为确保标签质量,所有标注都经过两阶段审核:

- **初步审核**——一个自动化程序比较每个笔记-概念对的两个独立标注,并根据需要优化高亮。程序标记分类(相关/无关)之间的不匹配;这些问题在继续前被解决。
- **主题专家(SME)审核**——一名主题专家独立验证所选标签的正确性、完整性和一致性,确保证据在医学上是合理的。

我们招募了 9 名具有医学培训背景的独立专家标注员。对于每个笔记和概念对,两名标注员独立审核出院小结,并将概念标记为“相关”或“无关”。对于“相关”对,标注员还额外高亮句子级别的证据片段(记录为字符偏移量)并提供简短的临床理由。

两名标注员之间的分歧未经裁决不会纳入。具体而言,如果初始标签不一致(相关 vs. 无关),则该示例被标记为待解决并接受审核以确定单一最终标签;无法解决至明确最终决策的对则被排除在发布之外。因此,最终数据集仅包含具有经过验证的金标及其相关证据(如适用)的示例。

通过这一流水线,我们整理出了一个包含 352 个黄金正例(显式/隐含)和 471 个黄金负例(无关)的最终数据集。最终数据集强调隐含推理、语义歧义和 LLM 分歧,为医学概念抽取模型提供了一个具有挑战性的基准测试。

## 3 评估指标

为了评估在该数据集上的性能,我们定义了两个子任务。

**(A) 医学概念抽取**:给定一份医学笔记和一个候选医学概念,系统预测该笔记是否记录了该概念。我们计算所有案例上的微平均精确率、召回率和 F1 值,其中真阳性定义为当金标为 True 且模型预测为 True。

**(B) 句子级别证据检索**:对于包含专家标注证据的案例,我们衡量系统正确检索目标句子的程度。我们报告宏平均句子召回率,定义为正确检索到的黄金证据句子所占比例。如果一个包含黄金证据的案例没有返回任何句子,则该案例的召回率为 0。

这两个指标共同评估了概念抽取的正确性以及推理过程的可解释性。

参考图注  
图 2:LLM 在医学概念抽取任务(y 轴)和证据检索任务(x 轴)上的性能。
## 4 结果

我们报告了不同模型在 MedicalBench 上的结果,并按概念抽取(第 4.1 节 (https://arxiv.org/html/2605.20197#S4.SS1))、证据检索(第 4.2 节 (https://arxiv.org/html/2605.20197#S4.SS2))、概念与证据之间的关系(第 4.3 节 (https://arxiv.org/html/2605.20197#S4.SS3))、对隐含提示的需求(第 4.4 节 (https://arxiv.org/html/2605.20197#S4.SS4))、抽取与笔记长度之间的关系(第 4.5 节 (https://arxiv.org/html/2605.20197#S4.SS5))以及案例研究(第 4.6 节 (https://arxiv.org/html/2605.20197#S4.SS6))进行性能分析。

### 4.1 医学概念抽取

参考图注  
图 3:LLM 和一个预训练语言模型(PLM-ICD,一个约 125M 参数的编码器)在医学概念抽取任务上的精确率-召回率比较。

为了评估医学概念抽取效果,我们评价每个模型判断一份医学笔记是否记录了候选医学概念的能力。

相似文章

MEDSYN: 复杂临床病例中多证据综合的多模态大语言模型基准测试

arXiv cs.CL

MEDSYN 是一个多语言多模态基准,用于评估多模态大语言模型(MLLMs)在复杂临床病例上的表现,每个病例最多包含 7 种不同的视觉证据类型。研究表明,虽然前沿模型在鉴别诊断生成方面与人类专家相当,但所有 MLLMs 在最终诊断选择中均存在显著差距,原因是异质临床证据综合能力不足。

LongMedBench:面向长时程临床决策的医疗智能体基准测试

arXiv cs.AI

LongMedBench 是一个新的基准测试,用于评估基于LLM的医疗智能体在长时程临床决策中的表现。它使用来自 MIMIC-IV 的真实电子健康记录数据,包含335名具有多次就诊记录的患者,并提出了针对事实问答、时序推理和长时程决策的评估套件。