LUNG-KGMM: 知识引导的多模态学习用于肺癌发生率预测
摘要
论文提出了LUNG-KGMM,一个知识引导的多模态框架,通过整合EHR、放射学数据和临床指南来预测肺癌发生率,在MIMIC数据集上展示了优越的性能,并进行了现实世界验证。
arXiv:2608.14657v1 公告类型:新
摘要:早期识别肺癌风险对于及时干预至关重要,但现有预测模型受限于其对单一数据模式的依赖以及无法利用结构化临床知识。我们提出LUNG-KGMM,一个知识引导的多模态框架,整合纵向电子健康记录、放射学报告、胸部X光表征和指南衍生知识,用于1至6年的肺癌发生率预测。为了解决模式异质性和潜在数据泄露,我们开发了一个泄露净化的报告处理流水线和一个处理不完全随访的地平线掩码累积训练目标。我们进一步引入临床指导的知识图谱表示,将报告触发的发现-属性-行动关系编码为可审计的知识流。我们从公开可用的MIMIC数据库构建多模态开发队列,并从Xiamen Medical Big Data Platform构建现实世界验证队列。在MIMIC队列上的大量实验表明LUNG-KGMM取得了优于现有方法的性能,而在厦门队列上的验证进一步描述了其跨队列可移植性和本地适配的必要性。MIMIC开发队列公开可访问;厦门队列受本地数据隐私法规管辖。
查看缓存全文
缓存时间: 2026/08/18 10:22
# LUNG-KGMM:知识引导的多模态学习框架用于肺癌发病率预测 来源:https://arxiv.org/abs/2608.14657 查看PDF (https://arxiv.org/pdf/2608.14657) > 摘要:早期识别肺癌风险对于及时干预至关重要,然而现有预测模型受限于对单一数据模态的依赖及其利用结构化临床知识能力的不足。我们提出LUNG-KGMM框架,这是一种知识引导的多模态预测系统,整合了纵向电子健康记录、放射学报告、胸部X光影像表征以及指南衍生的知识,用于实现1至6年内的肺癌发病率预测。为解决模态异质性与潜在数据泄漏问题,我们开发了经过泄漏净化的报告处理流程,以及能处理不完整随访数据的地平线掩码累积训练目标。我们进一步引入了临床指南的知识图谱表征,将报告触发的「发现-属性-行动」关系编码为可审计的知识流。基于公开的MIMIC数据库构建了多模态开发队列,并依托厦门医疗大数据平台建立了真实世界验证队列。大量实验表明LUNG-KGMM在MIMIC队列上实现了超越现有最优方法的性能,而厦门队列的验证进一步揭示了其跨队列可移植性以及本地化适配的必要性。MIMIC开发队列数据已公开获取;厦门队列数据受本地数据隐私法规约束。 ## 提交历史 作者:曹中 [查看邮件 (https://arxiv.org/show-email/12308478/2608.14657)] **[v1]** 2026年7月31日 星期五 10:34:41 UTC (4,821 KB)
相似文章
Lung-R1: 一种知识图谱引导的肺部诊断推理大语言模型
本文介绍了LungKG,这是第一个结构化的肺部知识图谱,以及Lung-R1,这是一个通过知识图谱约束推理和强化学习训练的大语言模型,用于从电子病历中进行肺部诊断推理。Lung-R1-14B在电子病历诊断上达到了最先进的性能。
用于乳腺癌复发预测的多模态机器学习
本文探讨了整合多模态临床数据(包括治疗记录、病理报告和临床医生笔记)的方法,通过基于规则的提取和机器学习,与单模态方法相比,提高乳腺癌复发预测的准确性。
Patients-like-me:用于可解释临床预测的变分LM-GNN框架
本文提出了Patients-like-me(PLM),一个统一的LM-GNN框架,将局部患者语义与全局队列结构相结合,用于可解释的临床预测。它引入了一种变分期望最大化算法,并在MIMIC-III和MIMIC-IV上展示了最先进的结果,同时提供参考患者解释。
大型语言模型作为统一多模态学习器用于临床预测
该论文提出将多模态患者数据(文本、实验室结果、生命体征)转换为单一自然语言序列,并对大型语言模型进行微调以用于临床预测,在三个任务中实现了与专用融合架构相当或更优的性能。
基于LLM探针的主要ICD类别预测
本文提出了一种方法,利用冻结的医学大型语言模型(LLM)表示作为共享嵌入空间,从结构化和非结构化电子健康记录数据中预测主要ICD诊断类别,在MIMIC-IV上取得了优于基线方法的准确率,并展示了向MIMIC-III的迁移能力。