PORTER: 基于语言的事件表示实现可移植结构化电子病历基础模型
摘要
PORTER是一种基于语言的结构化电子病历基础模型,通过文本描述和数值表示临床事件,能够实现跨机构的词汇无关迁移,无需重新训练。在儿科预测任务中,PORTER与固定词汇模型性能相当,并在迁移至未见事件描述时恢复了97.1%的AUROC。
arXiv:2606.24102v1 公告类型:新提交
摘要:大多数电子健康记录(EHR)基础模型将临床事件编码为来自固定词汇表的离散事件标记,因此无法直接表示包含未见概念或新概念与数值属性组合的事件。这限制了模型在机构间甚至同一机构内部不同部署流程中的迁移。我们提出PORTER,这是一种基于语言的结构化EHR基础模型,将事件表示与固定词汇表解耦。PORTER通过冻结的文本编码器使用事件描述来表示事件,通过专用路径处理数值,并通过自回归预训练的时间骨干网络学习患者时间线上的临床动态。在儿童医院的74项临床预测任务中,PORTER与具有相同时间骨干和预训练目标的固定词汇模型在平均AUROC上持平。当使用预训练中未见的事件描述渲染相同患者时间线时,PORTER无需重新训练或词汇映射即可迁移,恢复了直接针对目标词汇训练模型平均AUROC的97.1%。当迁移至MIMIC时,PORTER优于固定词汇模型(该模型因69%的事件标记未见而丢弃)。机制分析表明,跨词汇迁移追踪的是患者级表示几何结构的保留,而非文本编码器的规模;数值路径在不破坏临床概念身份的前提下提高了对量值的敏感性。此外,PORTER的AUROC高于特定任务的文本序列化比较器,而计算量仅为后者的1/329。PORTER朝着词汇无关的EHR基础模型迈出了一步,在保持领域内性能的同时减少了对词汇标准化的需求,并实现了高效的跨任务复用。
查看缓存全文
缓存时间: 2026/06/24 07:45
# PORTER:面向可移植结构化EHR基础模型的语言基础事件表示 来源:https://arxiv.org/html/2606.24102 Lin Lawrence Guo 儿童健康评估科学部 多伦多病童医院(SickKids) 加拿大多伦多 &Adam Paul Yan 儿童健康评估科学部 血液学/肿瘤学部门 多伦多病童医院(SickKids) 加拿大多伦多 Emily Vettese 儿童健康评估科学部 多伦多病童医院(SickKids) 加拿大多伦多 &Lillian Sung 儿童健康评估科学部 血液学/肿瘤学部门 多伦多病童医院(SickKids) 加拿大多伦多 ###### 摘要 大多数电子健康记录(EHR)基础模型将临床事件编码为固定词表中的离散事件令牌,因此无法直接表示包含未见概念或新概念-属性组合(如数值)的事件。这限制了跨机构甚至同一机构内不同部署管道的迁移。我们提出PORTER(可移植EHR表示),一种基于语言基础的结构化EHR基础模型,将事件表示与固定词表解耦。PORTER通过冻结的文本编码器利用事件描述来表示事件,通过专用通道整合数值,并利用自回归预训练的时间骨干学习患者时间线上的临床动态。在一家儿科医院的74项临床预测任务中,PORTER与具有相同时间骨干和预训练目标的固定词表模型的平均受试者工作特征曲线下面积(AUROC)持平。当使用预训练中未见的事件描述渲染相同患者时间线时,PORTER无需重新训练或词表映射即可迁移,恢复了直接针对目标词表训练的模型平均AUROC的97.1%。当迁移至MIMIC时,PORTER优于固定词表模型——后者因令牌未见而丢弃了69%的事件。机制分析表明,跨词表迁移追踪的是患者级表示几何结构的保持,而非文本编码器的规模;数值通道在不大幅改变临床概念身份的前提下提升了数值大小敏感性。PORTER在比任务特定文本序列化比较器低329倍平摊计算量的情况下取得了更高的AUROC。PORTER朝着与词表无关的EHR基础模型迈出了一步,减少了对词表协调的需求,同时保持了域内性能并实现了高效的跨任务复用。 ## 1 引言 结构化电子健康记录(EHR)基础模型通过对纵向临床事件序列进行自监督预训练来学习可复用的患者表示。[39 (https://arxiv.org/html/2606.24102#bib.bib39),36 (https://arxiv.org/html/2606.24102#bib.bib36),44 (https://arxiv.org/html/2606.24102#bib.bib44),34 (https://arxiv.org/html/2606.24102#bib.bib34),38 (https://arxiv.org/html/2606.24102#bib.bib38),37 (https://arxiv.org/html/2606.24102#bib.bib37),8 (https://arxiv.org/html/2606.24102#bib.bib8),31 (https://arxiv.org/html/2606.24102#bib.bib31)] 每个事件是某个临床概念的打时间戳实例,例如诊断或实验室结果,可能包含数值等结构化属性。这些模型在时间数据集漂移[15 (https://arxiv.org/html/2606.24102#bib.bib15)]、跨人群[26 (https://arxiv.org/html/2606.24102#bib.bib26)]和跨机构[14 (https://arxiv.org/html/2606.24102#bib.bib14)]迁移中展现了鲁棒性,尽管这种迁移通常假设评估数据可以用预训练期间学到的事件令牌表示进行编码。实践中,用于表示临床事件的代码和描述因机构、编码标准和数据管道而异。大多数结构化EHR基础模型将每个临床事件转换为预训练期间学习的固定词表中的离散事件令牌。[12 (https://arxiv.org/html/2606.24102#bib.bib12)] 这些令牌可能单独表示一个临床概念,或表示临床概念与结构化属性(如离散化的数值区间)的组合。[11 (https://arxiv.org/html/2606.24102#bib.bib11)] 当部署数据包含新的临床概念、同一概念的不同本地代码或名称,或新的概念-属性组合时,这些事件会产生模型没有学习过表示的令牌。即使在同一机构内,模型也可能使用映射到通用数据模型(如观察性医疗结果合作伙伴关系通用数据模型(OMOP CDM))的回顾性数据集进行开发,然后部署到使用不同本地代码或命名约定的生产数据馈送中。因此,即使患者群体和临床环境保持不变,也可能出现词表漂移。 一个可移植的结构化EHR基础模型必须保留临床事件的含义,即使该事件使用不同的代码或描述来表示。标准词表和通用数据模型减少了这种异质性,但映射到它们需要大量劳动、容易出错,并且不能消除概念覆盖范围或本地实现上的差异。数值引入了第二个表示挑战。对于测量事件,临床概念标识测量的内容,而数值和参考范围决定了大小和异常性。因此,可移植模型必须同时表示概念语义和数值,并且不将两者绑定到固定令牌词表。 基于文本的表示已成为减少结构化EHR模型对固定词表和手动协调依赖的一种方法。一系列工作将患者时间线序列化为自然语言,并使用大型语言模型或文本编码器生成患者级表示。[7 (https://arxiv.org/html/2606.24102#bib.bib7),17 (https://arxiv.org/html/2606.24102#bib.bib17),9 (https://arxiv.org/html/2606.24102#bib.bib9)] 这种方法避免了固定事件令牌词表,但要求模型从序列化文本中推断概念语义、时间关系和数值含义。[6 (https://arxiv.org/html/2606.24102#bib.bib6)] 当序列化是任务特定时,患者表示还必须为每个下游任务重新计算。另一系列工作作用于代码或事件级别,通过临床概念描述或跨站点对齐的代码表示来学习表示。[25 (https://arxiv.org/html/2606.24102#bib.bib25),20 (https://arxiv.org/html/2606.24102#bib.bib20),48 (https://arxiv.org/html/2606.24102#bib.bib48),2 (https://arxiv.org/html/2606.24102#bib.bib2),21 (https://arxiv.org/html/2606.24102#bib.bib21),19 (https://arxiv.org/html/2606.24102#bib.bib19)] 这些方法表明,基于文本的代码或事件表示可以提高跨词表、模式、机构和语言的可移植性。它们的区别在于文本编码器在训练期间是冻结的还是更新的,这决定了事件描述的表示受训练词表影响的程度。冻结的预训练编码器将相同的语义映射应用于任何词表的描述,包括训练中未见过的词表,而无需修改模型权重[25 (https://arxiv.org/html/2606.24102#bib.bib25)]。有些也使用自监督目标,但作为监督微调的初始化,而不是学习可重用于下游任务的任务无关患者表示。[21 (https://arxiv.org/html/2606.24102#bib.bib21)] 在现有框架中,数值通常被丢弃、渲染为文本、离散化或通过令牌级方案表示。因此,现有方法尚未在单个结构化EHR基础模型中完全结合词表无关输入、用于可复用任务无关患者表示的自回归预训练以及数值的显式表示(补充表S1)。 我们提出PORTER(可移植EHR表示),一种基于语言基础的结构化EHR基础模型,将概念语义、数值和时间动态分离为不同组件。PORTER并非将完整患者病史序列化为文本,而是在临床事件级别应用语言基础。每个事件都与其底层临床概念的自然语言描述配对,该描述由冻结的文本编码器处理,以提供与词表无关的概念表示。由于此文本编码器每个唯一事件描述只应用一次,而非跨患者历史重复应用,这些表示可以缓存并在患者和下游任务之间重用。对于包含数值的事件,一个单独的学习通路直接编码数值大小和相对异常性,而不是将数值渲染为文本。特征线性调制(FiLM)[33 (https://arxiv.org/html/2606.24102#bib.bib33)] 随后利用这些数值信息来调制文本派生的概念表示,产生事件输入表示。最后,时间骨干通过自回归预训练从这些事件输入表示序列中学习临床动态。预训练后,时间骨干被冻结,并产生可重用的患者表示,下游任务通过线性探针使用这些表示。在推理时,PORTER可以表示预训练中未见过的临床概念,而无需重新训练或显式词表映射,前提是它们可以被渲染为可解释的事件描述。 我们使用一个固定词表EHR基础模型(Fixed-Vocab FM)作为主要比较器,该模型在骨干架构、预训练目标和训练计划上匹配,在三种设置中评估PORTER。首先,我们测试PORTER在74项临床预测任务的域内性能是否与Fixed-Vocab FM相当。其次,我们评估同一机构内的跨词表迁移,将预训练的PORTER应用于事件描述源于机构EHR术语而非预训练所用OMOP派生描述的患者时间线。这种设置在保持患者时间线固定的情况下隔离了词表漂移,并且如果不进行词表映射或重新训练,Fixed-Vocab FM无法直接支持。第三,我们评估到MIMIC的跨站点迁移,其中词表、人群和临床设置与预训练不同。我们还跨评估设置消融数值通路和文本编码器选择,并将PORTER与患者级文本序列化比较器进行比较。 本研究做出以下贡献: - •我们提出PORTER,一种基于语言基础的结构化EHR基础模型,使用事件描述输入而非固定词表输入嵌入。PORTER将冻结的预训练文本编码器(产生与词表无关的概念表示,可缓存和重用)与专用数值通路(通过FiLM整合大小)配对,并通过自回归时间骨干(预训练后冻结,通过线性探针在任务间重用)学习临床动态。 - •我们在可控的跨词表设计中评估PORTER,保持患者和下游任务标签固定,仅更改事件描述命名系统。PORTER迁移到未见事件描述时无需重新训练或词表映射,恢复了目标词表参考模型AUROC的97.1%。文本编码器消融显示,跨词表性能追踪患者级表示几何结构的保持,而非编码器规模。 - •PORTER在74项域内任务上与架构匹配的Fixed-Vocab FM持平,并在外部站点的36项任务中改进了31项的迁移,而Fixed-Vocab FM因令牌未见而丢弃了69%的事件。 - •PORTER的专用数值通路与将数值渲染为文本相比,在保留临床概念身份的同时,提升了对数值大小的敏感性。 - •与任务特定的患者级文本序列化比较器相比,PORTER在74项任务中的69项上取得了更高的AUROC,并且随着任务无关患者表示的重用,平摊计算量更低。 ## 2 方法 ### 2.1 医院数据集 本研究使用来自多伦多病童医院(SickKids,一家三级儿科医院)的EHR数据作为主要开发站点,并使用来自贝斯以色列女执事医疗中心(BIDMC,一家成人学术医疗中心)的MIMIC进行外部评估。SickKids使用Epic(Epic Systems, Verona, WI)作为其企业EHR。SickKids数据集来源于SickKids企业级Azure存储库数据(SEDAR)[13 (https://arxiv.org/html/2606.24102#bib.bib13)],该存储库将SickKids Epic Clarity数据库中的EHR数据整合为面向临床、经过验证和标准化的模式。EHR数据被映射为医疗事件数据标准(MEDS)[1 (https://arxiv.org/html/2606.24102#bib.bib1),40 (https://arxiv.org/html/2606.24102#bib.bib40)]格式,临床概念标准化到观察性医疗结果合作伙伴关系通用数据模型(OMOP CDM)本体。MIMIC数据集(MIMIC-IV, 版本1.0)[23 (https://arxiv.org/html/2606.24102#bib.bib23)]包含2008年至2019年间在BIDMC住院部或急诊科接受治疗的去标识化患者EHR数据。MIMIC数据使用观察性健康数据科学和信息学MIMIC项目提供的代码[30 (https://arxiv.org/html/2606.24102#bib.bib30)]映射到OMOP CDM,随后转换为MEDS格式。作为MIMIC去标识化过程的一部分,患者时间线被偏移至三年窗口内的一个锚定年份。为支持SickKids和MIMIC之间一致的时间分割,我们通过患者标识符的哈希函数,在患者锚定组内确定性地分配一个代表日历年份。将SEDAR数据用于本研究已获得SickKids研究伦理委员会(REB)的批准(REB编号:1000074527)。MIMIC的使用在BIDMC机构审查委员会的监督下获得批准,并在PhysioNet上公开发布。[10 (https://arxiv.org/html/2606.24102#bib.bib10)] ### 2.2 队列定义与分割 队列选择过程总结于补充图S1。预训练队列在患者级别定义。对于SickKids,我们在研究期间纳入了SEDAR中的所有患者,临床事件时间跨度为2018年6月2日(EHR上线)至2026年4月7日。如果患者缺少出生日期则被排除。对于MIMIC,数据集中所有患者均被纳入。在每个数据集中,通过患者标识符的哈希函数将患者确定性地分配到训练集(约90%)和验证集(约10%)。对于SickKids,预训练使用的训练患者事件截至2024年12月31日,验证患者事件截至2025年3月31日。对于MIMIC,预训练使用的训练患者事件截至2016年12月31日,验证患者事件截至2017年12月31日。下游评估队列在入院级别定义。对于SickKids,我们纳入了住院入院患者,其预测时间时年龄为28天或以上。对于MIMIC,我们纳入了住院入院患者,其预测时间时年龄为18岁或以上。入院根据预测时间分配到训练集、验证集和测试集,使用应用于相应预训练队列的相同日历截止点。具有多次住院的患者可贡献入院记录
相似文章
面向令牌化电子健康记录的联邦生成式事件模型
这篇arXiv论文评估了在来自三个医疗系统的ICU EHR数据上,对令牌化生成式事件模型(GEMs)进行联邦训练的效果,结果表明联邦学习能够保留集中式训练的大部分性能,并且与传统监督模型相比,提高了跨站点的可迁移性。
用于模式约束临床信息抽取的检索增强型大语言模型
本文提出了一种模块化的检索增强生成(RAG)流水线,用于从护理人员与患者的对话转录中提取结构化临床观察结果,采用模式约束提示和第二遍审核,基于Llama和GPT骨干模型,取得了80.36%的F1分数。
ChatHealthAI: 将电子健康记录表示与大型语言模型对齐以实现基于临床的推理
ChatHealthAI 是一个多模态推理框架,它将结构化 EHR 表示与冻结的 LLM 对齐,从而在保持预测性能的同时实现基于临床的推理。
训练大型语言模型预测临床事件
本文通过将按时间排序的临床笔记转换为预测示例,将前瞻性学习扩展到临床事件预测。在120B模型上使用LoRA适配器改善了校准性能,并在留出问题上优于GPT-5。
PATHFinder Agent:用于定制化产前护理的智能系统
本文介绍了PATHFinder Agent,一个端到端的对话式AI系统,该系统根据ACOG的PATH指南生成个性化产前护理计划,整合了患者信息采集、动态对话、计划合成及临床医生监督。对包括GPT-5.2在内的前沿大语言模型的评估显示出有希望但不完全的性能,凸显了产前检测建议方面的不足。