面向可解释、鲁棒且可审计的临床预测的多模态路由

arXiv cs.LG 论文

摘要

本文提出了一种用于临床预测的显式多模态路由框架,利用EHR数据,通过离散的单模态、双模态和三模态路径,以及推理时路径掩码来模拟缺失模态,实现对结构化变量、临床笔记和胸部X射线的可解释、鲁棒且可审计的推理。

arXiv:2607.09982v1 公告类型:新 摘要:电子健康记录(EHR)数据本质上是多模态的,利用多模态可以提高预测性能。然而,现有大多数方法依赖于深度融合,这掩盖了单个模态对预测的贡献,并限制了多模态推理的可解释性。我们提出了一种用于临床预测的显式多模态路由框架,该框架能够通过三种EHR模态:结构化纵向变量(L)、临床笔记(N)和胸部X射线(I),实现可解释、鲁棒且可审计的推理。我们的模型构建了离散的单模态、定向双模态和三模态路径,以捕获单个模态信号和不对称的跨模态交互。为了审计多模态推理并评估鲁棒性,我们引入了推理时路径掩码,该掩码模拟缺失模态并重新加权剩余路径,无需重新训练。我们分析了这些场景下性能和路由权重的变化,以理解模型决策。我们在来自MIMIC-IV的三模态患者住院数据上评估了我们的框架,用于多标签表型预测(K=25)和二元ICU死亡率预测,揭示了不同临床条件组之间模态依赖性的系统性差异。总体而言,我们的框架提供了一种透明、可审计且实用的多模态临床预测方法,提供了可解释性、鲁棒性,并深入了解了不同数据源如何驱动模型决策。
查看原文
查看缓存全文

缓存时间: 2026/07/14 04:15

# 面向可解释、鲁棒且可审计的临床预测的多模态路由
来源:https://arxiv.org/html/2607.09982
,Zhongjie Wuzhongjiew@smu\.edu (https://arxiv.org/html/2607.09982v1/mailto:[email protected])Southern Methodist UniversityDallasUSA,Eric C\. Larsoneclarson@smu\.edu (https://arxiv.org/html/2607.09982v1/mailto:[email protected])Southern Methodist UniversityDallasUSAandMehak Guptamehakg@smu\.edu (https://arxiv.org/html/2607.09982v1/mailto:[email protected])Southern Methodist UniversityDallasUSA

\(2026\)

###### 摘要\.

EHR数据本质上是多模态的,利用多种模态可以提升预测性能。然而,现有大多数方法依赖于深度融合,这使得单个模态如何贡献于预测变得模糊,并限制了多模态推理的可解释性。我们提出一种显式的多模态路由框架,用于临床预测,能够在三种EHR模态上实现可解释、鲁棒且可审计的推理:结构化纵向变量(LL)、临床笔记(NN)和胸部X光片(II)。我们的模型构建了离散的单模态、定向双模态和三模态路径,以捕捉个体模态信号和非对称的跨模态交互。为了审计多模态推理并评估鲁棒性,我们引入了推理时路径掩蔽,模拟缺失模态并在无需重新训练的情况下重新加权剩余路径。我们分析这些场景下性能和路由权重的变化,以理解模型决策。我们在多标签表型预测(K=25K=25)和二元ICU死亡率预测中评估了我们的框架,使用来自MIMIC-IV的三模态患者住院数据,揭示了临床条件组之间模态依赖性的系统性差异。总体而言,我们的框架提供了一种透明、可审计且实用的多模态临床预测方法,提供了可解释性、鲁棒性以及关于不同数据源如何驱动模型决策的洞察。

多模态学习、EHR、路由模块、缺失模态、ICU结局预测

††版权:权利保留
††期刊年份:2026
††doi:XXXXXXX.XXXXXXX
††会议:Smart Connected Health; Month DD–DD, 2026; City, Country
††isbn:978-1-4503-XXXX-X/26/XX
††ccs:计算方法论 神经网络
††ccs:计算方法论 机器学习
††ccs:应用计算 健康信息学
††ccs:计算方法论 学习范式
††ccs:计算方法论 多模态学习
††ccs:计算方法论 模型可解释性

## 1. 引言

ICU中的临床医生通常通过整合异质信息(包括纵向生命体征与实验室测量值、临床笔记和医学影像)来做出高风险决策。这些多样化的数据源被记录在电子健康记录(EHR)中,这促使了多模态AI(MAI)系统的开发,该系统能够联合建模结构化变量、自由文本和图像。与单模态方法相比,多模态模型可以利用互补的临床证据,提升预测性能,并更好地容忍噪声或不完整的输入 (Leeet al.,2023 (https://arxiv.org/html/2607.09982#bib.bib1); Wang and Li,2025 (https://arxiv.org/html/2607.09982#bib.bib20))。通过支持反映临床医生如何跨来源组合证据的结构化多模态推理,多模态系统为准确且有临床意义的决策支持奠定了坚实基础。

最近的研究表明,多模态模型(MAI)在多种临床预测任务中持续带来性能提升 (Huanget al.,2020 (https://arxiv.org/html/2607.09982#bib.bib8); Patilet al.,2025 (https://arxiv.org/html/2607.09982#bib.bib23); Wanget al.,2025b (https://arxiv.org/html/2607.09982#bib.bib21); Sunet al.,2024 (https://arxiv.org/html/2607.09982#bib.bib22))。然而,大多数MAI系统依赖深度融合策略,将多个模态合并为单一的潜在表示,这使得模型行为难以解释。这种不透明性在临床环境中尤其成问题,因为临床信任不仅依赖于预测准确性,还依赖于了解哪些证据来源驱动特定预测。由于每个模态的相关性随临床结局而变化,有效的多模态系统必须超越单一的固定融合策略,而是以透明且任务感知的方式自适应地组合模态。缺乏这种透明度,即使是高性能的MAI模型也可能难以获得临床接受。

为了解决这些挑战,我们提出了一种多模态路由框架,该框架显式地分离并评估结构化实验室数据(LL)、临床笔记(NN)和医学影像(II)的贡献及其交互。该框架定义了十个显式路径,包括单模态、定向双模态和三模态信息流。通过将诸如A←BA←B和B←AB←A的路径视为不同的,模型捕捉到了更符合临床推理过程的非对称跨模态效应。可学习的路由权重量化了每条路径对最终预测的贡献,从而实现局部和全局的可解释性。

我们使用来自MIMIC-IV数据集的三模态ICU住院数据,在两个临床相关的任务上评估我们的方法:二元ICU死亡率预测和25种条件的多标签表型预测。除了预测性能,我们分析路由激活和系数,以描述任务间证据的组合方式。我们还通过推理时路径掩蔽来评估模型鲁棒性,模拟缺失模态的情况,并检查在不完整信息下路由权重如何重新分配。该分析为模型行为和在现实临床条件下的可靠性提供了可审计的视图。我们的贡献包括:

- •我们提出了一种基于路由的多模态框架,显式地建模单模态、定向双模态和三模态交互,捕捉跨模态的临床推理。
- •我们实现了路由激活和系数来量化每个交互的贡献,跨25种表型提供局部和全局可解释性。
- •我们分析缺失模态场景下路由权重和性能的变化,以评估鲁棒性并审计模型的多模态推理。

## 2. 相关工作

### 2.1. EHR中的多模态融合

大量研究探索了将结构化电子健康记录(EHR)数据与临床笔记和医学影像等非结构化模态集成。例如,MINGLE将结构化EHR变量建模为超图,并从其他模态注入信息以学习共享的患者表示 (Cuiet al.,2024 (https://arxiv.org/html/2607.09982#bib.bib6))。其他方法采用多模态Transformer联合编码临床时间序列和笔记,通过ICU时间线上的自注意力融合信息用于死亡率预测 (Lyu et al.,2023 (https://arxiv.org/html/2607.09982#bib.bib10)),或使用基于LSTM的联合融合模块聚合序列和图像数据,如MedFuse (Hayat et al.,2022 (https://arxiv.org/html/2607.09982#bib.bib17))。尽管这些方法展示了强劲的性能提升,但它们依赖深度融合机制,将多个模态压缩到单一潜在空间,这难以判断预测是由特定模态、跨模态交互还是虚假相关性驱动的。晚期融合方法通过在决策级别组合模态特定模型来部分解决这个可解释性瓶颈。例如,Ruan等人 (2025 (https://arxiv.org/html/2607.09982#bib.bib12)) 通过晚期融合结合结构化数据和临床笔记,RadFusion将CT成像与EHR数据集成用于肺栓塞检测 (Zhou et al.,2021 (https://arxiv.org/html/2607.09982#bib.bib18))。尽管这些方法允许显式分析单模态贡献,但它们是在决策级别组合模态,并未捕捉模态如何交互以共同影响预测。

更近期的一类工作显式建模多模态交互,而不是将融合视为纯粹相加的过程 (Wörtwein et al.,2022 (https://arxiv.org/html/2607.09982#bib.bib28); Tsai et al.,2020 (https://arxiv.org/html/2607.09982#bib.bib29))。TriMF (Wang et al.,2025a (https://arxiv.org/html/2607.09982#bib.bib7)) 构建了三个双模态路径,但将它们求和为单个多模态嵌入,在预测之前折叠了路径结构。我们的框架则将每个单模态、定向双模态和三模态路径保留为单独参数化的路径,并支持推理时加权,从而无需重新训练即可进行多模态推理的事后审计。

混合专家(MoE)架构是另一种在缺失模态条件下进行多模态融合的重要方向。MoE-Health在特定模态组合上预训练专家,并对top-kk路径应用门控 (Wang and Yang,2025 (https://arxiv.org/html/2607.09982#bib.bib25))。FuseMoE引入了拉普拉斯门控稀疏MoE融合模态嵌入,旨在灵活处理缺失模态和不规则时间采样 (Han et al.,2024 (https://arxiv.org/html/2607.09982#bib.bib50))。Flex-MoE用稀疏MoE路由替换Transformer前馈层,在模态嵌入上配合可学习的缺失模态库 (Yun et al.,2024 (https://arxiv.org/html/2607.09982#bib.bib51))。一个相关方法FAME对单模态嵌入应用公平感知的标量加权 (Hooman et al.,2025 (https://arxiv.org/html/2607.09982#bib.bib15))。这些方法通过在预测前进行拼接、加权求和或堆叠自注意力来融合模态,并不暴露方向性的跨模态路径。因此,像“基于影像的条件笔记”与“基于笔记的条件影像”这样的交互贡献无法被单独检查或消融,而这是我们的路径级审计框架背后的机制。

### 2.2. 可解释性与可审计的多模态推理

显式建模多模态交互自然实现了可解释性和可审计性——这是临床决策支持的关键需求。与深度融合方法中模态贡献纠缠不清不同,基于路由的交互建模暴露了与临床推理相一致的独特证据路径。可学习的路由系数量化了每个单模态和跨模态路径的贡献,既支持患者层面的局部解释,也支持跨表型的全局分析。

前面讨论的混合专家方法等先前的多模态方法已经通过处理模态缺失来保持预测性能 (Yao et al.,2024 (https://arxiv.org/html/2607.09982#bib.bib24); Al-Dailami et al.,2025 (https://arxiv.org/html/2607.09982#bib.bib27))。尽管有效,这些方法对于特定跨模态交互的可用性或移除如何影响模型决策的洞察有限。

在我们的框架中,缺失模态分析作为一种审计机制,而非仅仅是一种鲁棒性策略。通过在推理时屏蔽与缺失模态相关的路径,并归一化剩余路径,我们直接观察到模型如何重新分配在证据路径上的依赖。路由权重和性能的变化揭示了预测是由互补模态支持还是由狭窄、潜在不可靠的信号主导。这使得临床医生和研究人员能够根据支持预测的多模态证据结构来评估自动预测的可靠性。

总体而言,通过将多模态交互建模与显式路由和推理时审计相结合,我们的方法为EHR数据中可解释且可审计的多模态预测提供了一个透明且临床基础坚实的框架。

## 3. 方法

### 3.1. 问题形式化

我们设计了一个多模态AI(MAI)框架,该框架联合建模三种临床模态——结构化纵向数据(LL)、临床笔记(NN)和医学影像(II)——并在多个监督临床预测任务上进行训练。为了以统一的方式处理这些异质模态,我们将每个模态表示为一个令牌或特征单元的序列。对于模态M∈{L,N,I}M∈{L,N,I},输入令牌记为XM={x1,x2,...,xTM}XM={x1,x2,...,xTM},其中TMTM是该模态的令牌数量。对于结构化数据,令牌对应按时间排序的临床事件(例如,生命体征或实验室测量值);对于临床笔记,令牌对应文本中的单词或子词;对于医学影像,令牌源自卷积骨干网络(如ResNet),对应图像的空间特征区域。

每个模态由一个模态特定的编码器encMencM处理,以捕捉每种数据类型的独特结构,产生隐藏表示:

(1) HM=encM(XM)HM=encM(XM)
其中HM∈RBsz×TM×dMHM∈RBsz×TM×dM,BszBsz是批次大小,dMdM是编码器特定的隐藏维度。嵌入通过池化操作(例如,CLS令牌选择、均值池化或最大池化)沿TMTM维度聚合,得到总结整个模态的单一全局向量zM∈RBsz×dMzM∈RBsz×dM。由于令牌数量TMTM可能因患者而异,我们定义了一个二元掩码MM∈{0,1}Bsz×TMMM∈{0,1}Bsz×TM,指示对池化有贡献的有效令牌(非填充)。

不同的编码器产生具有模态特定维度的潜在表示。为了对齐这些表示,我们对每个模态的池化输出应用线性投影:

(2) z~M=zMWM+bM,z~M∈RBsz×d,z~M=zMWM+bM,z~M∈RBsz×d,
其中zM∈RBsz×dMzM∈RBsz×dM是模态MM的池化编码器输出,WM∈RdM×dWM∈RdM×d是可学习的投影矩阵,bM∈RdbM∈Rd是偏置向量。投影后的表示z~Mz~M随后用于后续的融合和跨模态交互模块。

在以下小节中,我们详述所提出框架的每个组件,如图1所示。

请参阅图注
图1. 所提出的多模态路由框架的架构。

### 3.2. 模态特定编码器

##### 结构化编码器。

结构化模态由按每小时间隔聚合的纵向序列组成,包括生命体征、用药和其他测量值。每个临床事件被嵌入为一个令牌表示,并添加位置嵌入以保持纵向顺序。我们通过BEHRT Transformer (Li et al.,2020 (https://arxiv.org/html/2607.09982#bib.bib14)) 传递该序列。令患者级别的令牌嵌入为

HL=[hL,1,...,hL,TL]∈RBsz×TL×dL,HL=[hL,1,...,hL,TL]∈RBsz×TL×dL,
其中TLTL是每小时区间的数量,dLdL是令牌嵌入维度。我们通过取[CLS]令牌输出来获取患者级嵌入。

相似文章

大型语言模型作为统一多模态学习器用于临床预测

arXiv cs.AI

该论文提出将多模态患者数据(文本、实验室结果、生命体征)转换为单一自然语言序列,并对大型语言模型进行微调以用于临床预测,在三个任务中实现了与专用融合架构相当或更优的性能。

用于乳腺癌复发预测的多模态机器学习

arXiv cs.LG

本文探讨了整合多模态临床数据(包括治疗记录、病理报告和临床医生笔记)的方法,通过基于规则的提取和机器学习,与单模态方法相比,提高乳腺癌复发预测的准确性。

LongMoE:基于轨迹感知的混合专家模型的纵向多模态学习

arXiv cs.LG

LongMoE提出了一个统一框架,同时解决多模态临床学习中的模态缺失和纵向动态问题,利用上下文感知插补、注意力令牌化、轨迹感知编码和稀疏混合专家路由。在ADNI、OASIS-3和MIMIC-IV上的实验表明,在缺失模态情况下鲁棒性得到提升,同时在完整模态设置下仍具有竞争力。