Mr.Dec:基于日常纵向多模态建模的30天再入院预测
摘要
Mr.Dec是一个基于Transformer的多模态模型,它通过序列化日常电子健康记录更新和胸部X光检查结果来预测30天医院再入院,并在MIMIC数据集上取得了最先进的性能。
arXiv:2608.16929v1 公告类型:新
摘要:预测30天医院再入院对于评估患者稳定性和优化医疗资源至关重要。随着住院期间证据积累,临床风险动态演变,捕捉这些动态轨迹至关重要。然而,许多现有方法将复杂的纵向历史压缩为固定表示,常常丢失反映患者生理状态演变的粒度化、日级别临床信号。为解决这一问题,我们提出Mr.Dec(多模态再入院风险预测解码器),它将每次入院建模为日常多模态事件的自然时间序列。通过利用Transformer解码器,Mr.Dec将日常电子健康记录(EHR)更新和间歇性胸部X光(CXR)检查结果整合到时间对齐的流中,反映实际的临床工作流程。为确保鲁棒性,我们使用疾病特定监督对比学习作为辅助正则化,以在潜在空间中诱导诊断感知结构。在MIMIC-IV和MIMIC-CXR数据集上的评估表明,Mr.Dec通过保持临床序列的完整性实现了最先进的性能。此外,我们的模型识别出入院内的“关键日”,为实时风险分层提供可操作且基于临床的解释。代码可在以下地址获取:https://github.com/yejix-ai/MR.DEC
查看缓存全文
缓存时间: 2026/08/19 10:17
# Mr.Dec:面向30天再入院预测的日级时序多模态建模
来源:https://arxiv.org/html/2608.16929
机构信息:Yeji X, 首尔, 韩国
联系方式:{mj\.kim, jh\.moon\}\@yejix\.ai###### 摘要
预测患者30天内再入院风险对于评估患者稳定性及优化医疗资源至关重要。随着住院期间临床证据的积累,风险会动态演变,因此捕捉这些动态轨迹至关重要。然而,许多现有方法将复杂的纵向病史压缩为固定表示,常常丢失反映患者生理状态变化的、细粒度的日级临床信号。为此,我们提出了Mr\.Dec(多模态再入院风险预测解码器),该模型将每次入院建模为日级多模态事件的自然时间序列。通过利用Transformer解码器,Mr\.Dec将每日电子健康记录(EHR)更新与间歇性的胸部X光(CXR)发现整合到一个时间对齐的流中,反映了实际的临床工作流程。为确保模型的鲁棒性,我们采用疾病特异性监督对比学习作为辅助正则化,以在潜在空间中诱导诊断感知的结构。在MIMIC\-IV和MIMIC\-CXR数据集上的评估表明,Mr\.Dec通过保持临床序列的完整性实现了最先进的性能。此外,我们的模型能够识别入院期间的“关键日”,为实时风险分层提供可操作且基于临床依据的解释。代码可在以下链接获取:https://github\.com/yejix\-ai/MR\.DEC
## 1 引言
图1:Mr\.Dec(多模态再入院风险预测解码器).对于每个住院日n,文本化的EHR(例如,映射到自然语言描述的ICD编码)由临床编码器编码,同日的CXR由视觉编码器编码,生成模态特定的\[CLS\]表示\{fEHRnCLS,fCXRnCLS\}\\\{f\_\{\\mathrm\{EHR\}\_\{n\}\}^\{\\mathrm\{CLS\}\},\\,f\_\{\\mathrm\{CXR\}\_\{n\}\}^\{\\mathrm\{CLS\}\}\\\}\(当未进行CXR检查时,fCXRnCLSf\_\{\\mathrm\{CXR\}\_\{n\}\}^\{\\mathrm\{CLS\}\}省略)\.日级特征按时间顺序序列化,并通过模态特定层进行投影;将模态嵌入和日嵌入相加得到嵌入的token序列Femb=\(h1,...,hL\)F\_\{\\mathrm\{emb\}\}=\(h\_\{1\},\\ldots,h\_\{L\}\)\。我们接着附加两个可学习的特殊token,得到解码器输入F~emb=\[Femb,\[READMIT\],\[SupCon\]\]\\tilde\{F\}\_\{\\mathrm\{emb\}\}=\[F\_\{\\mathrm\{emb\}\},\\texttt\{\[READMIT\]\},\\texttt\{\[SupCon\]\}\]\。\[READMIT\]和\[SupCon\]的最终隐藏状态被分别输入到独立的MLP头,用于优化Lreadmit\\mathcal\{L\}\_\{\\mathrm\{readmit\}\}的再入院风险估计,以及优化LSupCon\\mathcal\{L\}\_\{\\mathrm\{SupCon\}\}的入院级表示学习。
预测30天全因医院再入院是衡量医疗质量和患者稳定性的广泛基准。计划外再入院会恶化患者预后并造成巨大的经济负担,每年耗费数十亿美元。虽然出院后的环境因素也会影响风险Lax等人\[2017 (https://arxiv.org/html/2608.16929#bib.bib6)\]; Sterling等人\[2022 (https://arxiv.org/html/2608.16929#bib.bib7)\]; Navathee等人\[2018 (https://arxiv.org/html/2608.16929#bib.bib8)\],但一个核心的工程目标是最大化利用院内数据中的判别信号,在出院前识别高风险群体Alarcón等人\[2024 (https://arxiv.org/html/2608.16929#bib.bib4)\]; Reddy等人\[2025 (https://arxiv.org/html/2608.16929#bib.bib3)\]; Miao and Yu \[2023 (https://arxiv.org/html/2608.16929#bib.bib2)\]; Jiang等人\[2023 (https://arxiv.org/html/2608.16929#bib.bib5)\]; Subasi \[2024 (https://arxiv.org/html/2608.16929#bib.bib10)\]; Lv等人\[2023 (https://arxiv.org/html/2608.16929#bib.bib11)\]; Tang等人\[2023 (https://arxiv.org/html/2608.16929#bib.bib1)\]\。操作目标是建立一个稳健的筛查机制,能够解读患者不断演变的轨迹,以支持分诊和资源分配。精确的纵向建模对于捕捉可能需要干预的、微妙的失稳迹象至关重要。
为此,再入院建模已朝着更丰富的患者表示方向发展。早期方法依赖于行政变量,如ICD编码作为静态分类特征Reddy等人\[2025 (https://arxiv.org/html/2608.16929#bib.bib3)\]; Okolie等人\[2025 (https://arxiv.org/html/2608.16929#bib.bib12)\],但这些缺乏反映复杂临床进展所需的粒度。近期研究采用了多模态学习,认识到仅依靠结构化编码是不够的。这包括使用大语言模型整合临床笔记Jiang等人\[2023 (https://arxiv.org/html/2608.16929#bib.bib5)\]; Miao and Yu \[2023 (https://arxiv.org/html/2608.16929#bib.bib2)\],以及利用深度神经网络整合CXR Tang等人\[2023 (https://arxiv.org/html/2608.16929#bib.bib1)\]; Miao and Yu \[2023 (https://arxiv.org/html/2608.16929#bib.bib2)\]; Subasi \[2024 (https://arxiv.org/html/2608.16929#bib.bib10)\]; Lv等人\[2023 (https://arxiv.org/html/2608.16929#bib.bib11)\]; Reddy等人\[2025 (https://arxiv.org/html/2608.16929#bib.bib3)\]\。这种融合通过结合文本的语义上下文和影像的视觉证据等互补信号,改善了预测效果。
在多模态领域内,融合时间序列EHR和常规CXR为日级轨迹追踪提供了坚实基础。尽管临床笔记可以增加语义细节,但它们通常不规则、主观且具有回顾性Jiang等人\[2023 (https://arxiv.org/html/2608.16929#bib.bib5)\]; Miao and Yu \[2023 (https://arxiv.org/html/2608.16929#bib.bib2)\],这可能导致报告延迟和观察者偏差。相比之下,时间序列EHR(例如,实验室数据)和CXR更直接地代表了生理状态:数值信号提供即时的定量指标,而CXR则提供了独立于观察者的内部病理视图,例如可能无法通过编码捕捉到的肺水肿进展Tang等人\[2023 (https://arxiv.org/html/2608.16929#bib.bib1)\]。因此,对日常临床演变的高保真追踪得益于强调这些客观的快照。然而,现有的最先进系统,如MM\-STGNNTang等人\[2023 (https://arxiv.org/html/2608.16929#bib.bib1)\]和MuSTMiao and Yu \[2023 (https://arxiv.org/html/2608.16929#bib.bib2)\],常常将可变长度的入院过程聚合为静态表示,以利用群体层面的结构,这可能会稀释患者内的时间粒度并削弱因果依赖性。这就催生了一种替代设计,优先考虑序列保真度而非全局图拓扑结构,尤其是当生理变化的时间点在临床上具有决定性意义时。
为了弥合这一差距,我们提出了Mr\.Dec(多模态再入院风险预测解码器),一个日级因果Transformer,它通过将每次住院建模为每日EHR记录与间歇性同日CXR观察交错的按时间顺序排列的token流,来保留入院内的时间结构。我们的贡献有三方面:(i) 我们提出了一种新的多模态轨迹架构,联合建模纵向EHR和间歇性CXR,并在30天再入院预测上取得了最先进性能;(ii) 我们提出了一种高效的日记录分词方法,支持更长的序列,以便在整个住院期间进行细粒度的风险追踪,无需重新训练单独的单模态模型;(iii) 我们开发了基于临床依据的训练和分析组件,包括针对标签噪声和不平衡下鲁棒性的疾病特异性监督对比正则化,以及基于梯度的“关键日”识别,将预测的风险变化与日级EHR和CXR联系起来。
## 2 方法
#### 问题形式化
我们将30天全因再入院预测表述为一项**院内因果轨迹建模**任务,其动机在于有证据表明,随着住院期间临床证据的积累,再入院风险会发生演变Jiang等人,[2019 (https://arxiv.org/html/2608.16929#bib.bib17); Davis and Greiner,2024 (https://arxiv.org/html/2608.16929#bib.bib18)\]。单次入院表示为N天住院日的时间序列S=\(d1,d2,...,dN\)\\mathcal\{S\}=\(d\_\{1\},d\_\{2\},\\ldots,d\_\{N\}\),其中每天是一个多模态记录dn:=\(xnEHR,xnCXR\)d\_\{n\}:=\\big\(x\_\{n\}^\{\\text\{EHR\}\},x\_\{n\}^\{\\text\{CXR\}\}\\big\)\。这里,xnEHRx\_\{n\}^\{\\text\{EHR\}\}表示第n天观察到的结构化EHR,xnCXRx\_\{n\}^\{\\text\{CXR\}\}表示第n天获取的胸部X光片(若可用;否则xnCXR=∅x\_\{n\}^\{\\text\{CXR\}\}=\\varnothing\)。给定完整的院内病史HN=\(d1,...,dN\)\\mathcal\{H\}\_\{N\}=\(d\_\{1\},\\ldots,d\_\{N\}\),我们的模型预测入院级结果y^=fθ\(HN\),\\hat\{y\}=f\_\{\\theta\}\(\\mathcal\{H\}\_\{N\}\),同时通过解码器内的掩码自注意力机制强制执行因果关系,使得每个token仅从交错流中的先前token聚合证据。
### 2\.1 Mr\.Dec(多模态再入院风险预测解码器)
#### 层次化多模态分词
我们将完整的入院病史HN\\mathcal\{H\}\_\{N\}编码为一个日对齐的、可变长度的token流,以反映CXR并非每天获取的事实(图1 (https://arxiv.org/html/2608.16929#S1.F1)\)。对于每个住院日n∈\{1,...,N\}n\\in\\\{1,\\ldots,N\\\},文本化的EHR由冻结的临床编码器(例如,BioClinical ModernBERT\Sounack等人,[2025 (https://arxiv.org/html/2608.16929#bib.bib16)\])编码得到fEHRnCLSf\_\{\\text\{EHR\}\_\{n\}\}^\{\\text\{CLS\}\},同日的CXR(若存在)由冻结的视觉编码器(例如,EVA\-X\-Base\Yao等人,[2025 (https://arxiv.org/html/2608.16929#bib.bib15)\])编码得到fCXRnCLSf\_\{\\text\{CXR\}\_\{n\}\}^\{\\text\{CLS\}\}。
我们按时间顺序序列化日级token,每天发出一个EHR token,并仅在影像日插入CXR token于其后。我们将入院的交错token特征表示为F=\(f1,...,fL\),F=\(f\_\{1\},\\ldots,f\_\{L\}\),其中
F=\[fEHR1CLS,fCXR1CLS⏟Day1,fEHR2CLS⏟Day2,fEHR3CLS,fCXR3CLS⏟Day3,...,fEHRNCLS,fCXRNCLS⏟DayN\]\.\{\\scriptsize F=\\Big\[\\underbrace\{f\_\{\\text\{EHR\}\_\{1\}\}^\{\\text\{CLS\}\},\\,f\_\{\\text\{CXR\}\_\{1\}\}^\{\\text\{CLS\}\}\}\_\{\\text\{Day \}1\},\\underbrace\{f\_\{\\text\{EHR\}\_\{2\}\}^\{\\text\{CLS\}\}\}\_\{\\text\{Day \}2\},\\underbrace\{f\_\{\\text\{EHR\}\_\{3\}\}^\{\\text\{CLS\}\},\\,f\_\{\\text\{CXR\}\_\{3\}\}^\{\\text\{CLS\}\}\}\_\{\\text\{Day \}3\},\\dots,\\underbrace\{f\_\{\\text\{EHR\}\_\{N\}\}^\{\\text\{CLS\}\},\\,f\_\{\\text\{CXR\}\_\{N\}\}^\{\\text\{CLS\}\}\}\_\{\\text\{Day \}N\}\\Big\]\.\}
因此,token长度为L=N\+∑n=1NI\[xnCXR≠∅\]\.L=N\+\\sum\_\{n=1\}^\{N\}\\mathbb\{I\}\\\!\\left\[x\_\{n\}^\{\\text\{CXR\}\}\\neq\\varnothing\\right\]\。每个tokenfif\_\{i\}具有模态mi∈\{ehr,cxr\}m\_\{i\}\\in\\\{\\text\{ehr\},\\text\{cxr\}\\\}和住院日索引ni∈\{1,...,N\}n\_\{i\}\\in\\\{1,\\ldots,N\\\}。我们使用模态特定投影将fif\_\{i\}投影到模型维度dmodeld\_\{\\text\{model\}\},并加入模态和日嵌入:hi=GELU\(Wprojmifi\+bprojmi\)\+Memb\(mi\)\+Demb\(ni\),h\_\{i\}=\\text\{GELU\}\\\!\\big\(W\_\{\\text\{proj\}\}^\{m\_\{i\}\}f\_\{i\}\+b\_\{\\text\{proj\}\}^\{m\_\{i\}\}\\big\)\+M\_\{\\text\{emb\}\}\(m\_\{i\}\)\+D\_\{\\text\{emb\}\}\(n\_\{i\}\),\(1\)
其中Memb\(⋅\)M\_\{\\text\{emb\}\}\(\\cdot\)和Demb\(⋅\)D\_\{\\text\{emb\}\}\(\\cdot\)分别表示可学习的模态和日嵌入查找表。我们将得到的解码器输入嵌入序列表示为Femb:=\(h1,...,hL\)F\_\{\\mathrm\{emb\}\}:=\(h\_\{1\},\\ldots,h\_\{L\}\)。
#### 多模态再入院风险预测解码器
我们通过将解码器输入F~emb=\[Femb,\[READMIT\],\[SupCon\]\]\\tilde\{F\}\_\{\\mathrm\{emb\}\}=\[F\_\{\\mathrm\{emb\}\},\\texttt\{\[READMIT\]\},\\texttt\{\[SupCon\]\}\]输入因果Transformer解码器(图1 (https://arxiv.org/html/2608.16929#S1.F1)\)来建模入院轨迹。掩码自注意力强制执行按时间顺序的信息流:每个位置仅从先前的token聚合信息,因此附加的摘要token可以关注整个入院流,同时尊重其时间顺序。
##### 训练目标\。
我们使用F~emb\\tilde\{F\}\_\{\\mathrm\{emb\}\}中附加的摘要token联合优化两个目标。令zreadmit\\mathbf\{z\}\_\{\\text\{readmit\}\}和zsupcon\\mathbf\{z\}\_\{\\text\{supcon\}\}分别表示\[READMIT\]和\[SupCon\]的最终隐藏状态。我们使用一个MLP分类头将zreadmit\\mathbf\{z\}\_\{\\text\{readmit\}\}映射到入院级概率y^\\hat\{y\},并使用一个单独的MLP投影头将zsupcon\\mathbf\{z\}\_\{\\text\{supcon\}\}映射到投影表示z~supcon\\tilde\{\\mathbf\{z\}\}\_\{\\text\{supcon\}\}。这解耦了预测和对比信号,模型通过以下公式进行端到端训练:Ltotal=Lreadmit\+λLSupCon,\\mathcal\{L\}\_\{\\text\{total\}\}=\\mathcal\{L\}\_\{\\text\{readmit\}\}\+\\lambda\\,\\mathcal\{L\}\_\{\\text\{SupCon\}\},其中λ=0\.3\\lambda=0\.3用于缩放对比贡献。
再入院预测\。我们使用二元交叉熵监督入院级预测:Lreadmit=−\[ylogy^\+\(1−y\)log\(1−y^\)\]\.\\mathcal\{L\}\_\{\\text\{readmit\}\}=\\-\\big\[y\\log\\hat\{y\}\+\(1\-y\)\\log\(1\-\\hat\{y\}\)\\big\]\.\(2\)
疾病特异性监督对比学习\。我们对投影表示z~supcon\\tilde\{\\mathbf\{z\}\}\_\{\\text\{supcon\}\}应用监督对比损失,以在潜在空间中施加诊断超组感知结构,并提高对噪声再入院标签的鲁棒性。我们使用粗诊断标签SUPER\_GROUP111我们使用以下类别的诊断超组:循环系统(19\.4%),内分泌与代谢(13\.1%),症状与体征(8\.4%),呼吸系统(7\.9%),创伤与中毒(7\.6%),消化系统(7\.2%),泌尿生殖系统(5\.9%),因素与服务(5\.2%),血液与免疫(5\.2%),精神障碍(4\.9%),神经系统(4\.5%),肌肉骨骼与皮肤(4\.5%),感染(3\.7%),以及肿瘤(2\.5%)\。;每次入院被分配一个最频繁的粗ICD\-10类别(共14类)作为其SUPER\_GROUP。对于批次B\\mathcal\{B}中的一个锚定入院ii,正样本P\(i\)\\mathcal\{P\}\(i\)是共享相同再入院标签yy和相同SUPER\_GROUP的入院。为确保所有锚点都有正样本,每个小批次包含至少两个每个(SUPER\_GROUP,yy)组合的样本,同时组合根据其流行度按比例采样。这里,sim\(⋅,⋅\)\\mathrm\{sim\}\(\\cdot,\\cdot\)表示余弦相似度,τ=0\.1\\tau=0\.1是温度超参数。令z~i\\tilde\{\\mathbf\{z\}\}\_\{i\}表示入院ii的\[SupCon\]token的投影头输出。损失为:LSupCon=∑i∈B−1\|P\(i\)\|∑p∈P\(i\)logexp\(sim\(z~i,z~p\)/τ\)∑a∈B∖\{i\}exp\(sim\(z~i,z~a\)/τ\)\.\\mathcal\{L\}\_\{\\text\{SupCon\}\}=\\sum\_\{i\\in\\mathcal\{B\}\}\\frac\{\-1\}\{\|\\mathcal\{P\}\(i\|\}\\sum\_\{p\\in\\mathcal\{P\}\(i\)\}\\log\\frac\{\\exp\(\\mathrm\{sim\}\(\\tilde\{\\mathbf\{z\}\}\_\{i\},\\tilde\{\\mathbf\{z\}\}\_\{p\}\)/\\tau\)\}\{\\sum\_\{a\\in\\mathcal\{B\}\\setminus\\\{i\\\}\}\\exp\(\\mathrm\{sim\}\(\\tilde\{\\mathbf\{z\}\}\_\{i\},\\tilde\{\\mathbf\{z\}\}\_\{a\}\)/\\tau\)\}\.\(3\)
## 3 实验
### 3\.1 实验相似文章
预测中期阿尔茨海默病进展:基于ADNI临床和生物标志物历史数据实现24个月CDR-SB变化的残差间隙感知变换器
本文提出了一种残差间隙感知变换器,将混合效应统计参考与基于变换器的残差学习相结合,利用ADNI临床和生物标志物历史数据预测24个月CDR-SB变化,在均方误差和相关性上均优于基线模型。
DT-Transformer:一个在真实世界健康系统上进行疾病轨迹预测的基础模型
DT-Transformer是一个基础模型,在Mass General Brigham(MGB)健康系统的11家医院中,基于170万名患者的5710万条结构化EHR记录进行训练,在896个疾病类别的下一事件预测中展现出强大的区分能力。
大型语言模型作为统一多模态学习器用于临床预测
该论文提出将多模态患者数据(文本、实验室结果、生命体征)转换为单一自然语言序列,并对大型语言模型进行微调以用于临床预测,在三个任务中实现了与专用融合架构相当或更优的性能。
MiGHT-EHR:面向异质时序电子健康记录的多任务图变换器
本文介绍了MiGHT-EHR,一种针对异质时序EHR数据的多任务图变换器,联合建模临床实体、时间轨迹和任务依赖。在MIMIC-III和MIMIC-IV上,它在药物推荐、住院时长、死亡率和再入院预测方面均优于现有最先进方法。
CardioMeta: 跨人群与电子健康记录数据中糖尿病、高血压和心血管疾病的校准多任务预测
CardioMeta是一个校准的多任务框架,用于在NHANES和MIMIC-IV数据上联合预测糖尿病、高血压和心血管疾病,强调泄漏控制、校准和透明可靠性。