SHIFT:基于不完整和异质性基因组数据的生存预测
摘要
SHIFT是一种缺失感知的生存模型,利用掩码自注意力机制在不进行测试时插补的情况下从不完整基因组输入进行预测,在胶质母细胞瘤和肺鳞状细胞癌的多个队列中表现出强大的泛化能力。
arXiv:2607.07725v1 Announce Type: new
摘要:基因组预测模型通常难以跨机构迁移,因为不同中心的测序面板各不相同,导致部署时出现结构性特征缺失。应对这一挑战的现有方法通常将分析限制在队列共有的基因上,排除具有不完整特征的患者,或依赖测试时插补,但这些做法都会降低鲁棒性,并限制多中心数据的利用。我们提出 Survival prediction Handling Incomplete Features using Transformer(SHIFT),这是一种缺失感知的生存模型,可直接从不完整的基因组输入进行预测,无需测试时插补。SHIFT将每个基因组特征单独表示,并使用掩码自注意力机制以及特征可用性掩码,使得预测仅基于观测到的输入。此外,我们在训练过程中引入变速率特征掩码,以提高对异质性缺失模式的鲁棒性。我们在胶质母细胞瘤和肺鳞状细胞癌上评估了该方法,并在多个队列中进行了外部验证,包括一个具有严重跨队列面板不匹配的挑战性场景。在这些设置下,SHIFT表现出强大的泛化能力,与标准生存基线和基于插补的方法相比更具优势,而且能够使用单个模型处理不同的特征集。我们还发现,在模型开发过程中纳入来自不完整队列的患者可以提升在外部数据上的性能,这表明部分观测的队列不必排除在模型构建之外。这些结果支持将缺失感知建模作为精准肿瘤学中多中心生存预测的实用策略。
查看缓存全文
缓存时间: 2026/07/10 06:13
# SHIFT:从不完整且异构的基因组数据中进行生存预测
来源:https://arxiv.org/html/2607.07725
\\theorembodyfont\\theoremheaderfont\\theorempostheader
:\\theoremsep
慕尼黑工业大学(TUM)医学与健康学院,慕尼黑,德国 慕尼黑机器学习中心(MCML)\\NameAyhan Can Erdur\\Emailcan\.erdur@tum\.de \\addr放射肿瘤科,TUM大学医院 \\addr慕尼黑工业大学(TUM)医学与健康学院医疗与医学人工智能讲席,慕尼黑,德国\\NameSabri Mustafa Kahya\\Emailmustafa\.kahya@tum\.de \\addr慕尼黑工业大学(TUM),慕尼黑,德国\\NameBenedikt Wiestler\\Emailb\.wiestler@tum\.de \\addr图像引导诊断与治疗人工智能,慕尼黑工业大学(TUM)医学与健康学院,慕尼黑,德国 慕尼黑机器学习中心(MCML)\\NameJana Lipkova\\Emailjlipkova@hs\.uci\.edu \\addr病理学系,医学院 生物医学工程系,工程学院 加州大学尔湾分校,尔湾,加利福尼亚州,美国
###### 摘要
基因组预测模型往往难以跨机构迁移,因为不同机构的测序 panel 不同,导致在部署时出现结构性特征缺失。应对这一挑战的现有方法通常将分析限制在队列间共享的基因上,排除具有不完整特征谱的患者,或依赖测试时的数据插补,这些方法都可能降低鲁棒性并限制多中心数据的使用。我们提出了一种**利用 Transformer 处理不完整特征的生存预测**(SHIFT)模型,这是一种对缺失值敏感的生存模型,能够直接从不完整的基因组输入中进行预测,无需测试时的数据插补。SHIFT 分别表示每个基因组特征,并使用掩蔽自注意力机制以及特征可用性掩码,使得预测仅基于观测到的输入。此外,我们在训练中引入了可变率的特征掩蔽策略,以提高对异构缺失模式的鲁棒性。我们在胶质母细胞瘤和肺鳞癌上对该方法进行了评估,并在多个队列上进行了外部验证,包括一个具有严重跨队列 panel 不匹配的挑战性场景。在这些设置下,SHIFT 表现出很强的泛化能力,并且在性能上优于标准的生存基线方法和基于插补的方法,同时能够在不同的特征集上使用单一模型。我们还发现,在模型开发过程中纳入来自不完整队列的患者可以提升在外部数据上的性能,这表明部分观测队列无需被排除在模型构建之外。这些结果支持将缺失值感知建模作为精准肿瘤学中多中心生存预测的一种实用策略。
## 1 引言
基因组数据通过提供分子层面的见解,为预后、风险分层和治疗规划提供信息,在精准医学中发挥着核心作用。人工智能(AI)和机器学习(ML)的最新进展已证明其能够根据基因组图谱预测患者生存期[Yousefi 等人,2017 (https://arxiv.org/html/2607.07725#bib.bib38);Chaudhary 等人,2018 (https://arxiv.org/html/2607.07725#bib.bib5);Lee,2023 (https://arxiv.org/html/2607.07725#bib.bib28);Wiegrebe 等人,2024 (https://arxiv.org/html/2607.07725#bib.bib36)]。然而,由于各中心间基因组数据的巨大异质性,此类模型的开发和部署仍然充满挑战。测序平台、诊断流程和资源可用性的差异导致测量基因集的显著变化,从广泛的测序检测到仅测量部分基因的靶向 panel [Chen 等人,2024 (https://arxiv.org/html/2607.07725#bib.bib12);Flores 等人,2023 (https://arxiv.org/html/2607.07725#bib.bib18);Garcia 等人,2017 (https://arxiv.org/html/2607.07725#bib.bib20)]。这种特征可用性的变异性给 AI 模型的开发和部署带来了重大挑战,如图 1 (https://arxiv.org/html/2607.07725#S1.F1) 所示。
大多数现有的 AI 模型假设输入是完整观测的,无法稳健地处理缺失数据。因此,特征谱不完整的患者常常被排除在研究之外,这减少了训练队列的规模和多样性,并可能放大选择偏倚 [Lipkova 等人,2022 (https://arxiv.org/html/2607.07725#bib.bib29)]。或者,模型可能只在队列间共享的特征子集上进行训练,但这种策略可能会丢弃相关的基因组学信息并限制模型性能。数据插补是另一种常用策略;然而,它可能扭曲潜在生物信号,并在模型预测中引入偏倚 [Donders 等人,2006 (https://arxiv.org/html/2607.07725#bib.bib15);Alwateer 等人,2024 (https://arxiv.org/html/2607.07725#bib.bib1)]。由于基因组数据中的缺失通常是结构性的而非随机的(不同机构测量不同的基因集),这一问题会进一步加剧。在这种情况下,很大一部分特征可能需要进行插补,从而放大这些问题。在实践中,这通常需要为每个可用的基因子集训练单独的模型,这很难跨中心扩展。在不同中心部署不同的模型可能会进一步加剧医疗保健中的不平等 [Chen 等人,2023 (https://arxiv.org/html/2607.07725#bib.bib10)]。
为了应对这些挑战,我们提出了**利用 Transformer 处理不完整特征的生存预测**(SHIFT),这是一种基于 Transformer 的模型,用于从不完整的表格型基因组数据进行生存预测。SHIFT 使用掩蔽自注意力机制,该机制根据每个患者可用的基因组信息动态调整模型注意力焦点,同时处理缺失值。SHIFT 使用随机变化的特征缺失率进行训练,鼓励模型从部分观测的输入中学习特征间关系,并在推理时遇到自然产生的不完整特征谱时利用这些依赖关系。这种设计使得 SHIFT 能够在异构的基因组 panel 上进行训练和部署,而无需针对特定站点进行重新训练或数据插补。我们在两种癌症类型——胶质母细胞瘤(GBM)和肺鳞癌(LUSC)上评估了所提出的框架,评估了其预测性能和对外部队列的泛化能力。我们的评估考虑了由于跨中心数据异质性而产生的严重结构性缺失的队列,反映了真实的临床场景。在这些场景下,我们证明了 SHIFT 可以作为传统基于插补方法的实用替代方案。我们进一步表明,即使是高度不完整的队列,也能在训练过程中提供信息性信号,从而提升整体模型性能。我们的主要贡献总结如下:
1. 1. 我们提出了 SHIFT,一种基于 Transformer 的模型,用于在不进行插补的情况下从不完整的基因组数据进行生存预测。
2. 2. 我们在训练中采用了一种可变率掩蔽(VRM)策略,以提高对跨队列差异的鲁棒性。
3. 3. 我们表明,严重不完整的队列仍能在模型开发过程中贡献有用的信号,支持更具包容性的多中心建模。
图注说明图 1:应对跨中心基因组数据异质性的挑战。(A) 数据收集的差异可能导致测量的基因集存在显著变异,并导致队列间不兼容。(B–C) 这种异质性给模型训练和部署带来了挑战。(D) SHIFT 通过使用单一统一模型从缺失数据中进行鲁棒学习和推断来应对这些挑战。### 关于机器学习在医疗保健背景下的通用见解
我们的研究为医疗保健中的机器学习带来了三个更广泛的见解:首先,尽管不同机构可用的数据存在差异,但可以使用单一模型跨机构进行生存预测。这在医疗保健环境中非常重要,因为缺失往往是结构性的,源于不同机构的检测方法和临床工作流的差异。其次,使用模拟缺失数据进行模型训练可以提高鲁棒性和预测性能。我们的实验表明,使用我们的 VRM 策略进行训练不仅能提高推理时处理不完整数据的性能,而且还能作为一种数据增强和正则化形式,甚至在无缺失数据的队列上也提升了性能。第三,不应自动将不完整的队列排除在模型开发之外。当缺失值由模型直接处理时,即使是特征缺失严重的队列也能提供有用的信号。这些发现表明,如果医疗保健 ML 系统设计为针对每个患者的异构特征进行学习,而不是假设完全标准化的输入,那么它们可能变得更鲁棒、更易于部署。
## 2 相关工作
**生存预测模型。** 多年来,已经开发了大量用于生存预测的模型。可以说,Cox 比例风险模型 [Cox,1972 (https://arxiv.org/html/2607.07725#bib.bib14)] 仍然是标准的临床基准,它假设对数线性风险比,并广泛应用于许多临床研究。现代方法通常利用数据驱动的学习而不是参数化模型,并将其重新用于生存分析:随机生存森林(RSF)[Ishwaran 等人,2008 (https://arxiv.org/html/2607.07725#bib.bib22)] 通过对右删失数据使用对数秩分割来扩展随机森林,可以在无分布假设的情况下捕捉非线性效应。DeepSurv [Katzman 等人,2018 (https://arxiv.org/html/2607.07725#bib.bib25)] 用优化 Cox 偏似然的深度神经网络替换线性风险函数。DeepHit [Lee 等人,2018 (https://arxiv.org/html/2607.07725#bib.bib27)] 将生存问题重新定义为在一组预定义时间区间上的离散时间多标签分类,避免了比例风险假设。使用 SELU 激活函数的自归一化网络(SNN)[Klambauer 等人,2017 (https://arxiv.org/html/2607.07725#bib.bib26)] 非常适合表格型基因组数据 [Chen 等人,2022 (https://arxiv.org/html/2607.07725#bib.bib9),2021b (https://arxiv.org/html/2607.07725#bib.bib8);Jaume 等人,2024 (https://arxiv.org/html/2607.07725#bib.bib23)],因为它们可以在没有批归一化的情况下训练更稳定的模型,代表了当前最先进的方法。关于肿瘤学中用于生存预测的 ML 模型的详细综述见 [Wiegrebe 等人,2024 (https://arxiv.org/html/2607.07725#bib.bib36)]。
**处理不完整基因组输入的缺失数据方法。** 解决缺失数据的方法通常分为两类:插补和自适应。
1) **插补方法** 在预处理过程中近似或填充缺失数据。常见方法包括 k 近邻(KNN)[Beretta and Santaniello,2016 (https://arxiv.org/html/2607.07725#bib.bib2);Pujianto 等人,2019 (https://arxiv.org/html/2607.07725#bib.bib32)]、均值插补 [Petrazzini 等人,2021 (https://arxiv.org/html/2607.07725#bib.bib31)] 和基于回归树的插补 [Burgette and Reiter,2010 (https://arxiv.org/html/2607.07725#bib.bib3)]。然而,这些方法最适用于缺失相对稀疏且近似随机缺失的情况。在跨队列基因组学中,缺失往往是结构性的,由于测序 panel 的差异,大量的特征块可能缺失 [Flores 等人,2023 (https://arxiv.org/html/2607.07725#bib.bib18);Chen 等人,2024 (https://arxiv.org/html/2607.07725#bib.bib12)]。合成数据生成已成为一种替代策略 [Chen 等人,2021a (https://arxiv.org/html/2607.07725#bib.bib7);Yi 等人,2019 (https://arxiv.org/html/2607.07725#bib.bib37);Forestier 等人,2017 (https://arxiv.org/html/2607.07725#bib.bib19)],特别是在图像和时间序列数据的插补中。然而,其应用于预后基因组任务仍然存在问题,因为无法保证合成数据能保留临床相关信号,这些信号比特定突变的存在或缺失更为复杂。这些方法也容易产生幻觉 [Cohen 等人,2018 (https://arxiv.org/html/2607.07725#bib.bib13)],损害下游生存预测的可靠性。通常,基于插补的流程需要为每个部署环境选择和拟合一个单独的策略,限制了其在高度异质的基因组图谱下的实用性。
2) **自适应策略** 修改模型架构以原生地适应不完整输入。一个很有前景的例子是基于 Transformer 的注意力掩蔽。在掩蔽自注意力中,对应于缺失特征的标记被排除在注意力交互之外,因此模型仅从观测到的子集构建表示。这一思想在具有缺失值的时间序列设置 [Fan 等人,2024 (https://arxiv.org/html/2607.07725#bib.bib17);Neog 等人,2025 (https://arxiv.org/html/2607.07725#bib.bib30);Zhang 等人,2024 (https://arxiv.org/html/2607.07725#bib.bib40)] 以及表格分类 [Caruso 等人,2026 (https://arxiv.org/html/2607.07725#bib.bib4)] 中显示出了潜力。与我们最接近的先前工作是 [Caruso 等人,2026 (https://arxiv.org/html/2607.07725#bib.bib4)],它将掩蔽注意力应用于表格数据。然而,先前的工作关注的是简单的二分类任务,在这些任务中,一小部分输入变量通常足以进行正确预测。这些工作还只考虑了少量输入中随机的数据缺失。处理缺失数据的方法在文献中有详细综述 [Heymans and Twisk,2022 (https://arxiv.org/html/2607.07725#bib.bib21);Zhou 等人,2024 (https://arxiv.org/html/2607.07725#bib.bib41);Joel 等人,2022 (https://arxiv.org/html/2607.07725#bib.bib24)],并且在肿瘤学中仍然是一个开放的挑战 [Lipkova 等人,2022 (https://arxiv.org/html/2607.07725#bib.bib29);Flores 等人,2023 (https://arxiv.org/html/2607.07725#bib.bib18)]。
SHIFT 模型扩展了先前的工作,能够从不完整的基因组数据进行生存预测,解决了跨机构结构性缺失这一现实世界挑战。我们的工作重点在于模型对外部队列的泛化能力,并研究训练期间可变的数据缺失是否会改善异构部署条件下的泛化性能。
## 3 方法
### 3.1 问题设定与离散时间生存预测目标
我们的目标是使用基因组特征 \(\mathbf{x}^{(i)} \in \mathbb{R}^d\) 来预测患者生存期,其中 \(d\) 表示基因组变量的数量,\(i \in \{1,\dots,P\}\) 索引患者。遵循标准的生存分析符号 [Zadeh and Schmid,2020 (https://arxiv.org/html/2607.07725#bib.bib39)],每个患者关联: (1) 一个观测到的生存时间 \(T_{\mathrm{cont}}^{(i)}\),定义为从诊断到死亡或最后一次随访的时间;以及 (2) 一个删失指示符 \(c^{(i)} \in \{0,1\}\)。
遵循先前的深度生存模型 [Vale-Silva and Rohr,2021 (https://arxiv.org/html/2607.07725#bib.bib34);Chen 等人,2021b (https://arxiv.org/html/2607.07725#bib.bib8);Jaume 等人,2024 (https://arxiv.org/html/2607.07725#bib.bib23)],我们将生存预测视为一个离散时间问题,而不是直接回归连续的生存时间。具体来说,对于每个训练折,我们将连续时间轴划分为 \(K=4\) 个非重叠区间 \([t_0, t_1)\), \([t_1, t_2)\), \([t_2, t_3)\), \([t_3, t_4)\)相似文章
AdaSurvMamba:面向多模态生存分析的动态融合与语义扫描
提出AdaSurvMamba,一种用于多模态生存分析的自适应框架,通过双尺度重要性感知重建模块和语义聚合扫描来改进全切片图像与基因组图谱的整合,在五个TCGA队列上实现一致性的性能提升。
将数据驱动预测与分配对齐:一种以决策为中心的生存分析方法
本文介绍了一种面向决策的生存分析学习方法,该方法通过NDCG优化将预测模型与后续分配决策对齐。应用于美国心脏移植数据后,排名性能提升了50-100%,每年可能带来数千额外生命年。
医疗中的联邦生存分析:跨机构异质性乳腺癌数据的多模型评估
本文系统评估了联邦学习下三种生存模型(Cox、DeepSurv、RSF)在异质性乳腺癌数据上的表现,发现联邦学习优于本地训练,且RSF在各客户端间提供了最佳性能平衡。
SurvivalPFN:通过上下文贝叶斯推断进行生存预测的摊销
SurvivalPFN 是一种先验数据拟合网络,通过上下文学习摊销生存分析的贝叶斯推断,在 61 个数据集上实现了强大的预测性能,无需特定任务训练或超参数调优。
SHIFT:面向检索增强生成中知识冲突缓解的门控调制激活引导
介绍了SHIFT框架,该框架利用可学习的门控调制自适应地引导大语言模型的内部激活,以不到0.01%的可训练参数缓解检索增强生成中的知识冲突。