EHRNote-ChatQA:基于证据的长篇出院小结多轮临床问答基准
摘要
介绍 EHRNote-ChatQA,这是一个基于证据、覆盖多份出院小结的多轮临床问答基准,经专家验证构建。对 22 个大语言模型的基准测试揭示了在证据溯源和多轮错误累积方面的挑战。
arXiv:2606.15735v1 公告类型:新
摘要:出院小结是关键的临床文档,包含患者整个住院期间的背景信息,医疗专家在患者再入院、持续护理和诊断决策时通常会回顾这些文档。在回顾过程中,医疗专家往往需要迭代整合多份小结的信息,同时验证支持每个答案的证据。尽管大语言模型(LLM)在临床问答中的探索日益增多,现有基准未能充分反映这一场景:它们通常评估考试形式的医学知识,或侧重于单轮问答且缺乏充分的证据溯源评估。我们提出 EHRNote-ChatQA,这是首个针对患者多份出院小结、基于证据的多轮临床问答基准。EHRNote-ChatQA 基于去标识化的 MIMIC-IV 出院小结构建,包含 967 个患者级多轮样本(覆盖 1 至 5 份病历)、16,072 个经医学专家验证的问答对(8,036 个内容问题,每个问题配有一个证据溯源问题),涵盖八个临床类别。该基准通过专家参与流程构建,结合出院小结结构化模式、专家策划的多轮问答模板以及基于 LLM 的生成,随后由 11 位医学专家对每个问答样本进行审查和修订。对 22 个开源和闭源 LLM 的基准测试揭示了若干挑战,包括:LLM 在证据溯源方面比内容回答更难;多轮错误在轮次间累积;单轮临床问答性能无法可靠迁移到该场景。这些发现使 EHRNote-ChatQA 成为评估临床问答系统的严谨且实用的基准。该数据集将通过 PhysioNet 凭证访问公开发布。
查看缓存全文
缓存时间: 2026/06/16 11:51
# EHRNote-ChatQA:面向纵向出院小结的、基于证据的多轮临床问答基准
**来源:** https://arxiv.org/html/2606.15735
Jiyoun Kim¹, Muhan Yeo²,³, Eunhye Jang⁴, Jeewon Yang¹, Hangyul Yoon¹, Su Ji Lee⁵, Hee Jo Han⁵,⁷, Hee-Jae Jung⁸, Doyun Kwon⁶, Jun young Lee³,⁹, Jaehun Lee¹⁰, Jung-Oh Lee¹¹, Sunjun Kweon¹, Jong Hak Moon¹, Daseul Kim¹², Minjae Cho³, Edward Choi¹
¹KAIST
²首尔大学
³首尔大学盆唐医院
⁴成均馆大学SAIHST
⁵延世大学医学院
⁶江南Severance医院
⁷Severance医院
⁸首尔医疗中心
⁹首尔大学医院
¹⁰国家癌症中心
¹¹西奈山伊坎医学院
¹²三星医疗中心
{jiyoun.kim, edward.choi}@kaist.ac.kr
###### 摘要
出院小结是关键临床文档,包含了患者整个住院期间的背景信息。医疗专家在患者再入院、持续护理和诊断决策时,通常会常规性地审查这些小结。审查时,他们往往需要反复综合多份小结中的信息,同时核实支持每个答案的证据。尽管大型语言模型(LLM)在临床问答中的应用日益增多,但现有基准未能充分反映这一场景:它们通常评估考试式的医学知识,或聚焦于单轮问答且证据溯源评估有限。
我们提出了 **EHRNote-ChatQA**,这是首个面向患者多份出院小结、基于证据的多轮临床问答基准。EHRNote-ChatQA 基于去标识化的 MIMIC-IV 出院小结构建,包含967个患者级别的多轮样本(每个样本涉及1至5份笔记),以及16,072个经医学专家验证的问答对(8,036个内容问题,每个问题配有一个证据溯源问题),覆盖八个临床类别。该基准通过一个专家参与构建的流程来完成,该流程结合了出院小结结构化模式、专家策划的多轮问答模板和基于LLM的生成,随后由11位医学专家对每一个问答样本进行审查和修订。
对22个开源和闭源LLM的基准测试揭示了若干挑战,包括:LLM在证据溯源上的表现比内容回答更困难;多轮错误会随着轮次累积;以及单轮临床问答的优异性能无法可靠迁移到本场景。这些发现确立了EHRNote-ChatQA作为评估临床问答系统的严格且实用的基准。该数据集将通过PhysioNet¹¹以凭证访问方式公开¹¹https://physionet.org。
## 1 引言
患者出院小结是全面的临床文档,描述了患者从入院到出院的整个临床过程。它们记录了诸如诊断、药物、手术和实验室检查等临床事件,以及因果关系、诊断推理和患者结局等背景信息。医疗专家(例如临床医生、护士)在再入院、长期护理和诊断决策等场景中,会常规性地审查这些文档,以了解患者既往的临床状态。然而,出院小结往往由不同的临床医生撰写,格式不一致,且包含大量医学缩写。此外,每次入院都会生成一份新的出院小结,随着时间的推移,单个患者会积累多份笔记。因此,审查患者的出院小结需要浏览冗长且分散的文档,这使得提取相关信息变得困难。
大型语言模型(LLM)的最新进展使得针对临床文档的问答成为可能[31, 24],让医学专家无需手动审查每份笔记即可检索到目标信息。然而,要安全地将LLM集成到临床工作流程中,必须满足两个基本要求:(1) 准确回答医学专家迭代式的多轮问题,以及 (2) 将每个答案都追溯到源文档中的可验证证据。
参见图1说明:图1:EHRNote-ChatQA 的一个多轮问答样本示例(为清晰起见,仅显示笔记1和笔记4的部分内容;[chartdateN] 表示笔记#N,已替换为实际图表日期)。给定单个患者的全部出院小结,EHRNote-ChatQA 包含一系列关于这些笔记的*内容*问题(Q1, Q3, Q5, Q7),每个问题都配有一个*证据溯源*问题,要求确定支持前一个答案的确切来源(Q2, Q4, Q6, Q8)。
在实践中,临床询问很少是孤立的;它们本质上是多轮的[9],通常从初始查询开始,然后通过建立在先前上下文基础上的相关后续问题继续。例如,医学专家可能首先问:“哪些症状导致了患者的入院?”,接着问:“对这些症状的评估揭示了什么?”,然后问:“这些症状中是否有任何导致了患者的再次住院?” 此外,除了答案正确性之外,追溯到源文档的能力在临床环境中同样至关重要,因为LLM可能产生幻觉或无法验证的回复[15, 26]。因此,评估模型输出是否能追溯到可验证的证据是必要的[5],让用户能将每个答案追溯到源文档中的特定片段。
尽管有这些要求,现有的临床问答基准未能捕捉真实世界临床使用的关键方面。诸如 MedQA[16]、MedMCQA[25] 和 PubMedQA[17] 等基准通过考试式问题评估医学知识,不涉及患者记录。基于电子健康记录(EHR)的基准,如 EHRNoteQA[20]、emrQA[27] 和 DiSCQ[22],包含专家策划的关于出院小结的问题,但仅限于单轮问答,并且缺乏要求提供支持每个答案来源的证据溯源问题。
为了填补这一空白,我们引入了 **EHRNote-ChatQA**,这是首个基于证据的、多轮、多笔记的临床问答基准,基于患者出院小结构建。该基准利用去标识化的 MIMIC-IV[18] 出院小结,涵盖967名患者(每人1至5份笔记),产生967个多轮样本,包含16,072个问答对:8,036个内容问题,每个问题配有一个证据溯源问题,要求识别支持性来源的位置。每个样本都提供患者完整的出院小结序列作为上下文。示例见附录A。
为了生成反映临床实践中医学专家询问方式的多轮问题,并给出基于患者笔记的临床准确答案,我们与4位医学专家(3位临床医生和1位护士)合作,开发了一个专家知情、结构化的QA生成流程。该流程使用一个全面的出院小结结构化模式和多轮问答模板(两者均由专家定义),作为使用 Gemini 2.5 Pro 进行基于LLM生成的种子。对于每个内容问题,我们还会生成一个配对的证据溯源问题,询问支持该答案的来源位置。然后,11位医学专家在三周内对所有问答样本进行审查和修订,以确保临床自然性、准确性和证据溯源的可靠性。
利用该基准,我们全面评估了22个闭源和开源LLM。我们的评估揭示了若干发现,包括:(1) 模型在内容准确性和证据溯源准确性之间存在显著差距;(2) 错误在轮次间传播;(3) 在现有单轮基准上的强劲表现无法可靠地迁移到多轮评估中。
我们的主要贡献如下:
- **基准**。我们引入了 EHRNote-ChatQA,这是首个基于证据的、多轮、多笔记的临床问答基准,基于患者出院小结构建,包含967个多轮样本和16,072个经医学专家验证的、覆盖八个类别的问答对。
- **数据集构建流程**。我们开发了一个结构化、医学专家知情的数据生成流程,用于生成临床基础扎实的多轮问答数据,该流程结合了出院小结结构化模式、专家策划的多轮问答模板和基于LLM的生成,随后由医学专家对每一个问答样本进行验证。
- **评估**。我们对22个LLM进行了基准测试,并进行了全面分析,包括内容准确性和证据溯源准确性、多轮依赖性与错误传播、以及与现有单轮临床问答基准的比较。
## 2 相关工作
##### 多轮问答基准。
有几个基准用于评估LLM在多轮对话和顺序问答中的表现。MT-Bench[39] 和 MT-Eval[19] 涵盖通用领域的对话主题(例如写作、推理、STEM),并使用 GPT-4 作为裁判对开放式的回答进行评分。CoQA[28] 和 QuAC[6] 是基于阅读理解对话的基准,模型需要回答基于单个文本段落的一系列问题。虽然这些基准对于评估多轮问答至关重要,但它们都未关注患者电子健康记录(EHR),也都不包含要求提供每个答案来源文档的证据溯源问题。
##### 临床问答基准。
现有的临床问答基准涵盖多种场景,包括医学知识评估和基于患者记录的问答。诸如 MedQA[16](USMLE)、MedMCQA[25](印度医学入学考试)和 PubMedQA[17](PubMed 摘要理解)等基准通过考试式或文献理解式问题评估LLM的参数化医学知识,不基于特定患者的记录。与我们场景更接近的基准,如 emrQA[27]、EHRNoteQA[20] 和 DiSCQ[22],是基于患者电子健康记录笔记(例如出院小结)构建的,但仅限于单轮问题,并且没有为每个内容问题配上一个要求提供支持答案的证据来源的问题。
##### 证据溯源基准。
证据溯源评估在通用领域问答和长文本生成中也有研究。Attributed QA[5] 评估模型是否能同时提供答案和对来源语料的归因,而 ALCE[12] 则评估LLM在开放域问答任务(如 ASQA[34]、QAMPARI[4] 和 ELI5[10])中生成答案并附带引用的能力。这些基准强调了可验证问答的重要性,但它们不特定于临床记录,也不评估多轮问答。在患者记录基准中,emrQA[27] 包含了源自临床注释的答案-证据对,而 ArchEHR-QA[32] 为基于出院小结摘录的、患者风格的问题提供了句子级别的证据注释。然而,它们都未涵盖患者的多次出院小结(仅涉及单次笔记),也未在多轮对话场景下评估证据溯源能力。据我们所知,尚无任何先前的基准同时具备 EHRNote-ChatQA 所针对的三个特性:反映医学专家真实临床记录审查过程的多轮问题、跨患者纵向出院小结的多笔记溯源、以及识别每个答案支持来源的逐轮证据溯源问题。表3(附录B)从这些维度将 EHRNote-ChatQA 与先前的患者记录QA基准进行了比较。
## 3 方法
### 3.1 数据源与队列构建
我们使用来自 MIMIC-IV[18] 的去标识化出院小结,该数据库是美国波士顿贝斯以色列女执事医疗中心的患者电子健康记录(EHR)数据库。由于 MIMIC-IV 中约90% 的患者拥有 1–5 份出院小结,我们按五个笔记数量组抽取了1,000名患者,每组200名。我们进一步将患者均匀分配到八个专家定义的问答类别(见第3.2节)——诊断、症状、手术、药物、微生物学、临床评估、临床结局和出院计划——从而为每个类别与笔记数量组合产生25名患者。
### 3.2 出院小结结构化模式与多轮问答模板设计
我们的基准围绕一个核心原则构建:多轮问题应紧密反映医学专家在临床实践中实际询问和跟进的方式,且答案必须基于患者笔记,具有临床准确性。为此,我们与4位医学专家(3位临床医生和1位护士)合作,开发了一个数据生成流程。我们首先定义一个用于结构化出院小结内容的模式,包含19种临床实体类型、每种实体类型3–10个属性,以及23种关系类型(完整模式见附录C)。尽管先前的工作提出了部分结构化出院小结的模式[36, 37, 35, 14],但这些模式忽略了一些重要的实体类型(例如微生物学、过敏、活动),并将临床不同的概念合并到宽泛的类别中——例如,将诊断、症状和发现归入“问题”实体类型,将手术和药物归入“治疗”实体类型。这种粗粒度的表示限制了真实临床提问所需的详细临床属性和关系。因此,我们在先前出院小结模式的基础上,与医学专家共同完善,以获得更全面、更细粒度的表示。
我们还与医学专家共同定义了八个问答类别,反映审查出院小结时的常见询问:诊断、症状、手术、药物、微生物学、临床评估、临床结局和出院计划。与同一批专家合作,我们为每个类别设计了多轮问答模板,用于捕捉临床真实的询问模式,例如查询实体特定信息(例如...相似文章
CLIR-Bench:不规则临床时间序列的多模态问答基准
CLIR-Bench是一个针对不规则采样临床时间序列的多模态问答基准,基于ICU记录构建,包含跨越11个临床变量的6,600个问答实例。它揭示了现有通用模型在处理稀疏时间证据方面的困难,突显了开发更强的不规则时间序列推理方法的必要性。
EHRBench:用于大语言模型临床决策的自动化可靠电子健康记录基准
EHRBench是一个自动化且可靠的基准测试,利用真实电子健康记录评估大语言模型在临床决策任务上的表现,涵盖诊断、治疗和预后任务,包含近100万个问答条目。
ClinicalBench:对 MIMIC-IV 跨入院临床问答中基于断言感知的检索进行压力测试
本文介绍了 ClinicalBench 和 EpiKG 系统,评估了针对 MIMIC-IV 数据在多个人工智能大语言模型(LLM)上的临床问答中基于断言感知的检索能力。研究证明,在检索过程中处理否定和时态信息,相比标准基线能显著提升性能。
ChatHealthAI: 将电子健康记录表示与大型语言模型对齐以实现基于临床的推理
ChatHealthAI 是一个多模态推理框架,它将结构化 EHR 表示与冻结的 LLM 对齐,从而在保持预测性能的同时实现基于临床的推理。
LitTraceQA:科学问答中多阶段证据定位与验证的基准
介绍了LitTraceQA,一个科学问答基准,要求系统检索相关论文、定位支持性证据,并以多种格式生成经过验证的答案。