CliniCIRCA:一个模块化LLM框架,用于从原始EHR叙述中构建纵向心理健康患者旅程

arXiv cs.CL 论文

摘要

CliniCIRCA是一个多阶段LLM框架,用于从非结构化的EHR叙述中重建纵向心理健康患者旅程,无需事件级时间戳即可实现时间分类,并使用临床医生在环评估进行验证。

arXiv:2609.19585v1 公告类型:新 摘要:在心理健康护理中,对患者旅程进行推理是临床医生的关键任务。然而,这些旅程涵盖生物学、心理学和社会事件的纵向进展,通常分散在不同的非结构化文本叙述中,使得时间恢复具有挑战性。我们提出了CliniCIRCA,一个多阶段LLM框架,用于日历锚定、不精确感知的临床年鉴重建。据我们所知,CliniCIRCA是首个无需事件级时间戳即可对非结构化出院摘要中的临床事件进行时间分类的框架。从14,882例MIMIC-III心理健康入院记录中,我们首先构建了一个基准,包含52份出院摘要,CliniCIRCA在其中产生了15,891个时间标记事件。基于临床医生在环评估纠正了629个错误后,我们产出了经验证的金标准标签。最后,纠正后的时间线驱动了一个基于时间的基础总结阶段,将每个来源压缩1.52倍,形成按日期分组的时序记录。然后,我们扩展该框架生成1,000个银标准时间线,并将其作为训练数据进行评估。与零样本和少样本提示相比,指令调优总体上提高了五个开源权重模型在事件提取、时间标记和总结方面的表现,涵盖银标准和临床医生验证评估。
查看原文
查看缓存全文

缓存时间: 2026/09/18 08:56

# CliniCIRCA:一个模块化的大语言模型框架,用于从原始电子病历叙述中构建纵向心理健康患者历程

来源:https://arxiv.org/html/2609.19585

作者:Nimra Ishfaq, Mohit Chandra, Santiago Alvarez Lesmes  
单位:乔治亚理工学院,德克萨斯大学奥斯汀分校,Northwell Health

作者:Adam Coscia, Khatiya Chelidze Moon  
单位:乔治亚理工学院,德克萨斯大学奥斯汀分校,Northwell Health

作者:Xiaohan Ding, Munmun De Choudhury

###### 摘要
在心理健康护理中,对患者历程进行推理是临床医生的一项关键任务。然而,这些历程(包含生物、心理和社会事件的纵向进展)通常分散在不同的非结构化文本叙述中,使得时间线恢复极具挑战性。我们提出了 **CliniCIRCA**,一个多阶段的大语言模型框架,用于**基于日历锚定、考虑不确定性**的**临床年鉴重建**。据我们所知,CliniCIRCA 是首个能在没有事件级时间戳的情况下,对来自非结构化出院小结的临床事件进行时间分类的模型。我们从 **14,882** 条 MIMIC-III 心理健康入院记录中,首先构建了一个包含 **52** 份出院小结的基准测试集。CliniCIRCA 在该测试集上生成了 **15,891** 个带有时间标签的事件。在经过临床医生在环评估修正了 **629** 个错误后,我们得到了经核实的黄金标准标签。最后,修正后的时间线驱动了一个基于时间锚定的摘要生成阶段,将每个源文本平均压缩 **1.52** 倍,生成按日期分组的时间顺序记录。随后,我们将该框架扩展,生成了 **1,000** 条白银标准时间线,并将其作为训练数据进行评估。与零样本和少样本提示相比,指令微调普遍提升了五个开源模型在事件提取、时间标签标注和摘要生成方面的性能,无论是在白银标准评估还是临床医生验证评估中。

## 1 引言
每位患者都遵循一条临床历程:症状、诊断、治疗、生活事件以及对护理反应的纵向进展,展示了其健康状况随时间的变化方式(Kraljevic 等, 2024 (https://arxiv.org/html/2609.19585#bib.bib55); Ruan 等, 2019 (https://arxiv.org/html/2609.19585#bib.bib56))。临床医生利用这一进展来解读患者当前的表现并指导治疗。遗憾的是,这些历程通常并未被记录为明确的时间线(Loftus 等, 2024 (https://arxiv.org/html/2609.19585#bib.bib53); Linhares 等, 2023 (https://arxiv.org/html/2609.19585#bib.bib54); Olex and McInnes, 2021 (https://arxiv.org/html/2609.19585#bib.bib15))。例如,出院小结是纵向患者信息的丰富来源。它们综合了病史、住院过程和临床结果,以自由文本形式呈现,其中事件可能重复出现、非顺序叙述,或仅通过相对时间表达式和上下文相关联(K 等, 2025 (https://arxiv.org/html/2609.19585#bib.bib40); Seinen 等, 2025 (https://arxiv.org/html/2609.19585#bib.bib39); Lee 等, 2024 (https://arxiv.org/html/2609.19585#bib.bib41); Kim 等, 2024 (https://arxiv.org/html/2609.19585#bib.bib38))。因此,从临床文本中恢复时间结构,是临床自然语言处理中建模患者历程的核心挑战(Amirahmadi 等, 2025 (https://arxiv.org/html/2609.19585#bib.bib37); Makarov 等, 2025 (https://arxiv.org/html/2609.19585#bib.bib36))。

患者历程常常分散在不同的文本来源中,这限制了计算系统对这些叙述的使用,因为这些系统需要结构化的纵向表示(Chaturvedi, 2024 (https://arxiv.org/html/2609.19585#bib.bib57); Moharasan and Ho, 2019 (https://arxiv.org/html/2609.19585#bib.bib58))。因此,信息碎片化将重建的负担转移给了临床医生和计算系统。临床医生必须在时间和信息限制下拼凑患者的过程,而模型则必须推断出仍保持隐含的时间关系(Linhares 等, 2023 (https://arxiv.org/html/2609.19585#bib.bib54); Gao 等, 2022 (https://arxiv.org/html/2609.19585#bib.bib17); Olex and McInnes, 2021 (https://arxiv.org/html/2609.19585#bib.bib15))。

> **图 1:方法概述**
> 先前工作将事件重建视为一组可分离的子任务,这使得时间对齐充满挑战。例如,临床摘要将冗长的记录压缩为连贯的叙述,但通常对时间性的保留不足,且很少明确表示复杂或不确定的事件年表(Kruse 等, 2025 (https://arxiv.org/html/2609.19585#bib.bib8); Cui 等, 2025 (https://arxiv.org/html/2609.19585#bib.bib22); Croxford 等, 2025 (https://arxiv.org/html/2609.19585#bib.bib14))。时间信息提取通过提取时间表达式、事件和时间关系来保留更精细的结构,但大多数系统是围绕预定义的标注模式和成对关系分类构建的,而非恢复开放式患者轨迹(Chaturvedi 等, 2025 (https://arxiv.org/html/2609.19585#bib.bib9); Gumiel 等, 2022 (https://arxiv.org/html/2609.19585#bib.bib59); Alfattni 等, 2020 (https://arxiv.org/html/2609.19585#bib.bib60))。最近的大语言模型时间线生成在恢复完整患者轨迹方面更进了一步(Kumar 等, 2026 (https://arxiv.org/html/2609.19585#bib.bib19); Noroozizadeh 等, 2025 (https://arxiv.org/html/2609.19585#bib.bib21); Wang and Weiss, 2025 (https://arxiv.org/html/2609.19585#bib.bib23); Wang 等, 2024 (https://arxiv.org/html/2609.19585#bib.bib4)),但通常依赖于结构化电子病历时间戳、预选的笔记片段或精心整理的病例报告,并且通常使用单一的相对偏移量来表示时间。目前仍缺乏一种统一的、纯文本的重建方法,能够同时保留事件的广度、日历时间、时间不确定性以及患者层面的连贯性。

我们特别关注弥合心理健康护理领域的空白,因为仅凭诊断和手术无法理解患者的病程。Engel 的框架强调疾病是通过生物、心理和社会因素的相互作用而产生的(Engel, 1977 (https://arxiv.org/html/2609.19585#bib.bib42));在心理健康领域,这些因素通常通过药物使用、创伤、社会史、日常功能变化等表现出来(Saha 等, 2026 (https://arxiv.org/html/2609.19585#bib.bib6))。此类信息是轨迹的一部分,而非外围背景,然而事件的组合因患者而异。因此,心理健康记录暴露了固定模式的局限性:狭窄的模式会遗漏可能定义个体病因的事件,而过于详尽的模式很快会变得不切实际。因此,我们将患者历程恢复表述为:**从原始临床叙述中进行开放式词汇、日历锚定、不确定性感知的时间重建**。具体而言,**历程**是在与单次住院相对应的单份出院小结内进行重建,这是迈向多次就诊纵向建模的一步。

我们引入了 **CliniCIRCA**(图 1 (https://arxiv.org/html/2609.19585#S1.F1)),一个三阶段的大语言模型框架,用于将出院小结转换为连贯的时间性临床轨迹。CliniCIRCA 生成两个关联的表示:**输出 A**,一个可检查的事件级时间线,供计算使用和审计;**输出 B**,一个基于相同时间底层构建的、供临床医生阅读的叙述。我们的实验表明,高容量模型(第 6 节 (https://arxiv.org/html/2609.19585#S6))生成的患者历程可以为规模小得多的模型提供有效的监督,尤其是在原子临床事件提取方面,而时间重建仍然是推理密集型任务。通过将碎片化的叙述转换为关联的结构化和可读表示,CliniCIRCA 可以支持纵向病历审查、临床交接和后续护理,同时保留与底层事件的可审计联系。我们在此代码仓库 111https://anonymous.4open.science/r/CliniCIRCA-E5FF/ 中提供了代码。

## 2 数据集
我们使用 MIMIC-III v1.4(Johnson 等, 2016 (https://arxiv.org/html/2609.19585#bib.bib1); Johnson 等, 2015 (https://arxiv.org/html/2609.19585#bib.bib2)),这是一个公开的、来自贝斯以色列女执事医疗中心(2001-2012)的英语去标识化重症监护数据库。CliniCIRCA 接收未经分块、分节解析或归一化处理的原始出院小结。结构化电子病历字段用于选择队列并提供三个时间锚点:(1)出生日期,(2)入院日期,和(3)出院日期。我们在入院级别定义队列:如果一次入院记录包含至少一个来自 ICD-9 精神障碍章节(代码 290–319)的精神疾病诊断,并且可以与一份出院小结配对,则该入院记录被保留。这产生了来自 **12,273** 名患者的 **14,882** 份小结,每份小结被视为一个独立的重建实例。由于入院记录是根据是否存在任何精神障碍诊断代码而非主要诊断来标记的,因此队列既包括主要精神科入院,也包括伴有精神共病的内科/外科入院。更多细节请参见附录 A (https://arxiv.org/html/2609.19585#A1)。

## 3 CliniCIRCA 框架
CliniCIRCA 是一个顺序框架,包含三个大语言模型阶段(图 1 (https://arxiv.org/html/2609.19585#S1.F1)),每个阶段接收上一阶段的输出,并有一个主要任务。**阶段 1** 读取原始出院小结(来自 MIMIC-III 数据集),无需预处理,并提取一个高召回率的原子临床事件列表。**阶段 2** 解析每个事件的时间,根据时间锚点为其分配一个 ISO 日期和一个确定性标签;其输出是 **输出 A**,一个(ISO 日期和确定性标签,原子事件)对的时间线。**阶段 3** 将这些带标签的事件按日期聚合,生成 **输出 B**,一个按日期分组的时间顺序摘要。通过这种方式分解任务,允许每个阶段被独立地提示、评估和改进,并将每个时间决策限制在最适合执行该决策的阶段。

## 4 模型与智能体评估设置
### 4.1 候选池
对于 CliniCIRCA,我们根据其在通用和临床基准测试中的报告性能选择了 **11** 个大语言模型候选者(Yu 等, 2025 (https://arxiv.org/html/2609.19585#bib.bib50); Sarvari and Al-fagih, 2025 (https://arxiv.org/html/2609.19585#bib.bib52); Shi 等, 2024 (https://arxiv.org/html/2609.19585#bib.bib51))。对于专有模型,我们评估了 Gemini 2.5 Pro 和 2.5 Flash(Comanici 等, 2025 (https://arxiv.org/html/2609.19585#bib.bib70));Claude Sonnet 4.6(Anthropic, 2026 (https://arxiv.org/html/2609.19585#bib.bib71))和 Haiku 4.5(Anthropic, 2025 (https://arxiv.org/html/2609.19585#bib.bib72))。对于开源模型,我们评估了 Llama 3.3 70B(Meta AI, 2024 (https://arxiv.org/html/2609.19585#bib.bib73))、Qwen 3.6 35B-A3B(Qwen Team, 2026 (https://arxiv.org/html/2609.19585#bib.bib74))、Gemma 4 26B-A4B(Gemma Team, 2026 (https://arxiv.org/html/2609.19585#bib.bib76))、Mistral Small 3.2 24B-A4B(Mistral AI, 2025 (https://arxiv.org/html/2609.19585#bib.bib77))、Phi-4 Mini 3.8B(Abouelenin 等, 2025 (https://arxiv.org/html/2609.19585#bib.bib79)),以及医学领域大语言模型 - MedGemma 27B(Sellergren 等, 2026 (https://arxiv.org/html/2609.19585#bib.bib80))和 Meditron 3 Qwen 2.5 7B(OpenMeditron, 2025 (https://arxiv.org/html/2609.19585#bib.bib78))。模型规格、生成设置和计算细节请参见附录 B (https://arxiv.org/html/2609.19585#A2)。

### 4.2 实现设置
我们构建了一个包含 **52** 份 MIMIC-III 出院小结的基准测试集,平均每份 **1,774** 词(范围:437–3,583;附录 A.2 (https://arxiv.org/html/2609.19585#A1.SS2))。在这 52 个病例中,29 个主要诊断为精神疾病;其余 23 个为伴有精神共病的内科或外科入院。对于基准测试,每个候选模型都通过阶段 1-2 运行,且模型不跨阶段混合。样本量由功效分析确定(附录 C (https://arxiv.org/html/2609.19585#A3)),用于进行成对的 χ² 比较(大效应量,α=0.05,95%功效),得出 N=52 可达到统计显著性(Ki 等, 2025 (https://arxiv.org/html/2609.19585#bib.bib31); Card 等, 2020 (https://arxiv.org/html/2609.19585#bib.bib46); Dror 等, 2018 (https://arxiv.org/html/2609.19585#bib.bib47))。每个候选模型作为一个固定的流水线配置运行阶段 1-2,产生 **572** 个模型-文档输出,并使用第 5.1 节 (https://arxiv.org/html/2609.19585#S5.SS1) 描述的临床医生编写的评分标准进行评估。我们保留所选模型用于阶段 3,而不是为每个阶段优化单独的模型。这避免了对模型组合进行组合搜索,揭示了单个模型的能力如何在 CliniCIRCA 框架中传播,并简化了可重复性和部署治理(Umeton 等, 2024 (https://arxiv.org/html/2609.19585#bib.bib29); de Hond 等, 2024 (https://arxiv.org/html/2609.19585#bib.bib30); Meskó and Topol, 2023 (https://arxiv.org/html/2609.19585#bib.bib28))。我们根据阶段 2 的结果进行选择,因为摘要阶段依赖于其事件级时间输入的准确性。遵循先前将大语言模型评判员与专家审核的人类标签进行验证的健康领域工作(Mittal 等, 2026 (https://arxiv.org/html/2609.19585#bib.bib13)),两名人类标注者和两名临床医生(均具有相关标注经验且英语熟练)形成了一个反馈循环来评估结果。我们确定了人类评估者对阶段 2 和阶段 3 输出的一致性。

## 5 从出院小结构建患者时间线
### 5.1 阶段 1 与 2:从原始出院小结到带标签的时间线
忠实的临床时间线恢复需要全面的事件提取和准确的时间锚定,然而提取错误会通过时间推理和时间线构建传播(Gumiel 等, 2022 (https://arxiv.org/html/2609.19585#bib.bib59); Alfattni 等, 2020 (https://arxiv.org/html/2609.19585#bib.bib60))。因此,我们将任务分解为阶段 1 进行事件提取和阶段 2 进行时间锚定,允许每个组件被独立指定和评估。完整的生成提示可在附录 D (https://arxiv.org/html/2609.19585#A4) 表 A5 (https://arxiv.org/html/2609.19585#A4.T5)-A6 (https://arxiv.org/html/2609.19585#A4.T6) 中找到。

**表 1:阶段 2 在 52 样本基准测试上的模型选择结果。** 高亮行指示为最终流水线选择的模型。结果在 52 个样本上取平均。维度 A:完整性;维度 B:语义忠实度;维度 C:时间标签准确性。维度 A 到 C 是报告到小数点后两位的李克特量表平均值。每个指标的最佳性能值以**粗体**显示,次佳值以<u>下划线</u>显示。并列值使用相同格式。

**包容性提取和基于锚点的标签标注。** 阶段 1 读取原始出院小结,不应用任何分块、分节解析或归一化,包容且忠实地提取事件。据此,阶段 2 随后根据入院日期、出院日期和出生日期解析每个事件,将其精确分配到以下四个时间类别之一:
1. `[DATE/RANGE] [EXACT]`:事件文本本身写有的日期。
2. `[DATE/RANGE] [APPROX]`:没有写明日期,但该事件可解析到某个锚点或相对于某个锚点的偏移量。
3. `[PRE ADM]`:被表述为入院前的事件。

相似文章

ClinLens:面向纵向多模态临床数据科学的长期编码智能体

arXiv cs.AI

ClinLens是一个新的基准,包含200个可执行的临床数据科学任务,涵盖五个相互关联的MIMIC资源,评估长期编码智能体在纵向多模态数据上的表现。结果显示代码执行能力强,但临床分析正确性较差,凸显了可运行提交与有效分析之间的差距。