NeoTriFuse:基于缺失异质性的可靠性感知多模态融合用于新生儿死亡率风险预测
摘要
NeoTriFuse是一个可靠性感知的多模态融合框架,用于新生儿死亡率风险预测。它显式地将缺失数据建模为可靠性信号,以动态调整特征贡献,从而在不完整的临床监测数据上提升性能。
查看缓存全文
缓存时间: 2026/08/28 09:38
# NeoTriFuse:缺失异质性下的可靠性感知多模态融合用于新生儿死亡率风险预测
来源:https://arxiv.org/html/2608.26436
纪远天
单位:商业分析系,悉尼大学,悉尼,澳大利亚
邮箱:[\{jtia0016,qshe0501\}@uni\.sydney\.edu\.au](mailto:{jtia0016,qshe0501}@uni.sydney.edu.au)
沈清成
单位:商业分析系,悉尼大学,悉尼,澳大利亚
邮箱:[\{jtia0016,qshe0501\}@uni\.sydney\.edu\.au](mailto:{jtia0016,qshe0501}@uni.sydney.edu.au)
林晔
单位:Molly Wardaguga原住民生育权利研究所,查尔斯达尔文大学,达尔文,澳大利亚
邮箱:[\{haohui\.lu,andrew\.lin,yu\.gao\}@cdu\.edu\.au](mailto:{haohui.lu,andrew.lin,yu.gao}@cdu.edu.au)
高瑜
单位:Molly Wardaguga原住民生育权利研究所,查尔斯达尔文大学,达尔文,澳大利亚
邮箱:[\{haohui\.lu,andrew\.lin,yu\.gao\}@cdu\.edu\.au](mailto:{haohui.lu,andrew.lin,yu.gao}@cdu.edu.au)
陆浩辉
单位:Molly Wardaguga原住民生育权利研究所,查尔斯达尔文大学,达尔文,澳大利亚
邮箱:[\{haohui\.lu,andrew\.lin,yu\.gao\}@cdu\.edu\.au](mailto:{haohui.lu,andrew.lin,yu.gao}@cdu.edu.au)
###### 摘要
基于床旁监护数据的新生儿死亡率风险预测仍面临诸多挑战,包括极端类别不平衡、异质性临床风险因素、多尺度时间动态以及显著的数据缺失。我们提出了NeoTriFuse,这是一个针对缺失异质性新生儿监护数据的可靠性感知多模态融合框架。与传统多模态方法主要将缺失视为预处理问题不同,NeoTriFuse将缺失建模为一个显式的可靠性信号,在融合过程中动态调节各模态的贡献。该框架通过可靠性引导的门控机制,整合了静态围产期变量、局部-全局时间编码器和患者级统计摘要,并联合优化死亡率预测和辅助的住院时长目标。NeoTriFuse取得了具有竞争力的性能,F1分数为0.6736±0.0216,AUROC为0.9454±0.0056。消融研究表明,局部-全局时间架构和患者级摘要分支对预测性能贡献最大,而可靠性感知门控在异质性观测完整性下为依赖阈值的指标提供了额外提升。敏感性分析进一步表明,在邻近的超参数设置下性能稳定。总体而言,研究结果支持可靠性感知多模态融合是现实临床缺失条件下新生儿死亡率预测的一种实用方法。
###### 关键词:
新生儿死亡率 健康信息学 多模态学习 时间建模 可靠性感知融合
## 1 引言
新生儿恶化风险评估在临床上很有价值,但实践中仍然困难。严重结果很少见,生理测量值噪声大且不完整,并且相同的生命体征模式可能对不同胎龄、出生体重或临床病史的婴儿具有不同含义[22]。在新生儿重症监护室(NICU),一些风险表现为突然的短期不稳定,而其他风险则仅在数天内缓慢变化时才可见。先前关于心率特征和HR/SpO2时间序列特征的研究表明,重复的生理监测可以提供超越基线临床变量的预后信息[7, 18]。因此,死亡率模型需要同时解读监护时间序列和更稳定的围产期背景。
近期新生儿研究提出了两个经验。深度序列模型可以从生命体征流中学习难以手动定义的模式[4],而精心设计的临床和统计摘要在小型不平衡数据集中仍能保持强大表现[12, 25]。2024年儿科学会NICU死亡率预测挑战赛说明了这一点:多个团队使用相同数据集,在特征工程和验证处理得当的情况下,更简单的模型与更复杂模型相比仍具有竞争力[25, 6]。这促使我们采用混合设计,在保留显式患者级摘要的同时,从监护流中学习时间表示。
挑战不仅在于最大化区分度,还在于产生具有临床意义的操作阈值。在罕见死亡率预测中,模型可以通过对婴儿进行合理排序获得较高的受试者工作特征曲线下面积(AUROC),同时在固定阈值下仍可能产生较弱的精确率-召回率平衡;当阳性类别罕见时,精确率-召回率分析通常比ROC分析更具信息性[23]。这一区别很重要,因为临床风险分层依赖于可操作的风险组和后续评估,而不仅仅是排序,并且临床预测指南强调阈值选择和验证,而不仅仅是区分度[24]。同时,新生儿监护记录通常具有异质性:一些婴儿有密集的重复测量,而其他婴儿则有较短或不够完整的轨迹。因此,一个有用的模型应考虑观测可靠性的差异,同时保留已知在表格基线中表现良好的简单患者级摘要。
本研究探讨是否可以通过缺失异质性下的可靠性感知多模态融合来改进新生儿死亡率预测。NeoTriFuse旨在通过结合三种形式的证据来解决这个问题:静态围产期风险、时间生命动态和患者统计摘要。目标不是将架构复杂性作为主要贡献,而是测试缺失和覆盖率是否可以作为可靠性信号,来指导这些信息源的融合方式。
我们的贡献如下:
- 我们将新生儿死亡率预测构建为缺失异质性下的可靠性感知多模态融合,其中观测覆盖率有助于确定每个模态应贡献多少。
- NeoTriFuse将缺失建模为一个显式的可靠性信号,动态调节静态、时间和摘要表示,而不是将缺失仅视为预处理问题。
- 引入局部-全局时间架构,将用于短期生理变化的卷积层与用于更长时间依赖性的基于Transformer的编码相结合。
- 患者级统计摘要(包括均值、变异性、极值、最后观测值、序列长度和覆盖率)被保留为一个专用的表示分支,以保留具有临床信息的聚合模式。
## 2 相关工作
传统的新生儿风险模型使用出生时可用的变量(包括胎龄、出生体重和早期临床状况)来估计发病率风险[22]。这些变量在最近的机器学习研究中仍然重要:Li等人[12]使用了母亲和新生儿入院特征来预测极早产儿的生存率,综述则强调了队列定义、验证、缺失数据处理和可解释性[16, 11]。静态预测因子可审计且具有临床意义,但它们无法完全描述入院后发展的恶化情况。这促使我们设计能够在保留围产期背景的同时,允许重复测量更新风险表示的模型。
持续的生理监测为新生儿风险预测提供了互补信息。先前的研究已将心率特征和HR/SpO2动态与新生儿感染、死亡率和呼吸系统并发症联系起来[7, 18, 20]。深度学习方法也已被应用于早产儿死亡率预测及相关ICU预测任务[4],而NICU脓毒症研究强调了在使用重复心肺测量时,进行严格验证并与更简单基线进行比较的重要性[9, 17, 21]。由于新生儿恶化可能通过短期不稳定和更长时间的时间进展出现,NeoTriFuse同时包含了局部时间建模和基于全局注意力的表示,而不是依赖单一的时间编码器。
2024年儿科学会(PAS)NICU死亡率预测挑战赛是本研究最接近的共享数据参考[6]。Sullivan等人[25]发现,当特征和阈值选择得当时,逻辑回归、随机森林、XGBoost、CatBoost和神经网络提交的作品都具有竞争力。这与强调验证和任务适当评估而非仅模型复杂性的临床预测指南一致[8, 24]。因此,我们的比较包括梯度提升树和随机森林[19, 2, 10, 5],并且我们的模型保留了显式的患者级摘要,而不是仅依赖学习的序列表示。
最后,临床监测数据受到缺失和覆盖率异质性的影响。缺失值可能反映工作流程、监测持续时间、设备可用性或临床稳定性,而非随机噪声。由于简单插补可能会丢弃这个观测可靠性信号,NeoTriFuse将缺失和覆盖率作为可靠性感知融合的输入。这种设计也与更广泛的强调可检查的临床ML系统和事后解释工具相一致[15]。
## 3 方法
### 3.1 问题设置
对于每个婴儿,令
\[
\mathbf{X} = [\mathbf{x}_1, \ldots, \mathbf{x}_T] \in \mathbb{R}^{T \times d_t}
\]
表示时间监护序列,其中每个时间步包含HR/SpO2摘要变量、时间特征和显式缺失指示符。在此基准公式中,\(\mathbf{X}\)包含模型数据表中每个婴儿所有可用的监护记录。因此,任务是在可用监护记录结束时进行回顾性完整记录死亡率风险分类,而不是在入院时或最初24-48小时内的固定时间窗早期预警。令 \(\mathbf{s} \in \mathbb{R}^{d_s}\) 表示静态人口统计和围产期变量,并令 \(y \in \{0,1\}\) 为住院死亡率标签。除了死亡率预测外,我们还使用对数变换的住院时长
\[
\ell = \log(1 + \mathrm{LOS})
\]
作为辅助回归目标。模型从 \((\mathbf{X}, \mathbf{s})\) 估计死亡率概率 \(\hat{y}\) 和辅助LOS值 \(\hat{\ell}\)。
### 3.2 输入表示
静态向量 \(\mathbf{s}\) 包括人口统计和围产期协变量,如胎龄、出生体重、性别、Apgar评分、分娩方式和母亲年龄相关信息。缺失的时间值并非简单丢弃。相反,输入包含掩码特征,以便模型能够区分观测到的正常值和缺失值。
为了将稳定的患者级信息提供给神经模型,我们还计算一个摘要向量
\[
\mathbf{z} = \psi(\mathbf{X}) \in \mathbb{R}^{d_z},
\]
其中 \(\psi(\cdot)\) 包含特征级别的均值、标准差、最小值、最大值、最后观测值、序列长度和覆盖率。这些特征与强大的表格基线使用的摘要相似,但在这里它们与时间分支联合学习。
这种表示有意将原始时间证据与聚合的患者描述符分离。如果摘要特征仅附加到时间序列上,模型将需要间接学习它们的患者级含义。如果它们仅由单独的基于树的基线使用,神经模型将失去对在小型临床数据集中特别有用的鲁棒描述符的访问。通过使 \(\mathbf{z}\) 成为一个专用分支,NeoTriFuse可以将稳定的摘要信息与学习到的时间模式相结合,同时仍允许消融测试该分支是否增加价值。
### 3.3 NeoTriFuse
图1提供了NeoTriFuse的概述。该模型围绕可靠性感知多模态融合而非简单特征连接进行组织:三个输入分支提供互补证据,缺失衍生的可靠性门在预测前调节它们的贡献。
请参见图注
图1:缺失异质性下的可靠性感知多模态融合NeoTriFuse概述。该模型整合了时间HR和SpO2序列、静态临床变量、患者级摘要统计以及从缺失和观测覆盖率导出的可靠性向量。局部和全局时间编码器生成 \(\mathbf{h}_{temporal}\),而可靠性引导的门在融合前调节时间、静态和摘要表示。融合后的表示用于死亡率预测,并辅助进行住院时长预测。
#### 局部-全局时间编码
局部分支应用一维时间卷积来捕捉监护序列中的短期变化:
\[
\mathbf{h}_{loc} = \mathrm{Pool}(\mathrm{CNN}(\mathbf{X}))。
\]
全局分支使用Transformer编码器对更长程的依赖性进行建模[26]:
\[
\mathbf{h}_{glob} = \mathrm{Pool}(\mathrm{Transformer}(\mathbf{X}))。
\]
两个时间表示被拼接并投影以获得
\[
\mathbf{h}_{temp} = W_t [\mathbf{h}_{loc}; \mathbf{h}_{glob}] + \mathbf{b}_t。
\]
采用这种局部-全局设计是因为新生儿恶化可能以突发不稳定或在整个监测窗口内较慢趋势的形式出现。
#### 静态和摘要分支
静态临床变量和摘要向量被映射到相同的隐藏维度:
\[
\mathbf{h}_{stat} = f_s(\mathbf{s}), \quad \mathbf{h}_{sum} = f_z(\mathbf{z}),
\]
其中 \(f_s\) 和 \(f_z\) 是多层感知机。保持 \(\mathbf{h}_{sum}\) 作为一个专用分支使得NeoTriFuse能够将稳定的摘要信息与学习到的时间模式相结合,同时仍允许消融测试该分支是否增加价值。相似文章
融合并非放之四海而皆准:面向时间-事件建模的跨模态表示对齐
介绍了一种基于基础模型的框架,用于CT影像与纵向EHR数据之间的跨模态表示对齐,以实现时间-事件预测,并在肺栓塞和心血管疾病队列上评估了融合策略。
探测、融合与可信度:面向多模态癌症分析的基础模型表征系统评估
本文系统评估了用于多模态癌症分析的基础模型表征,在真实世界队列上对单模态与多模态融合策略进行基准测试,并通过共形预测评估可信度。
质量感知多模态融合何时真正发挥作用?一种用于决策级依赖的防泄漏诊断方法
本文提出了一种防泄漏诊断方法,通过跨测试样本打乱可靠性分数,来检验质量感知多模态融合方法在推理时是否真的使用了这些分数。在StressID和CMU-MOSEI上的实验表明,打乱后的可靠性分数并未改变性能,说明质量信号仅在能可靠预测单模态正确性时才会影响决策。
TIER-MoE: Trust-Informed Expert Routing via Conditional Modality Risk for Multimodal Fusion in Biomedical Classification
This paper introduces TIER-MoE, a risk-guided subspace mixture-of-experts model for multimodal biomedical classification that estimates sample-specific modality reliability from out-of-fold predictions and routes modalities to experts, improving performance and calibration on four public datasets.
FusionSense: 三阶段近传感器学习实现运行时自适应多模态边缘智能
FusionSense提出了一种面向多模态边缘智能的三阶段近传感器学习框架,通过融合感知滤波同时降低计算与通信开销,在RGB-深度/激光雷达任务上实现高达33倍的能耗节省和显著的数据缩减收益。