AdaSurvMamba:面向多模态生存分析的动态融合与语义扫描

arXiv cs.LG 论文

摘要

提出AdaSurvMamba,一种用于多模态生存分析的自适应框架,通过双尺度重要性感知重建模块和语义聚合扫描来改进全切片图像与基因组图谱的整合,在五个TCGA队列上实现一致性的性能提升。

arXiv:2607.16260v1 公告类型: 新论文 摘要: 利用全切片图像(WSIs)和基因组图谱进行多模态生存分析是癌症预后的基础。近年来,像Mamba这样的状态空间模型已成为序列建模的强大工具。然而,将这一成功推广到复杂的多模态任务受到两个关键限制的阻碍。首先,传统的融合策略假设多模态交互强度是静态的,忽略了不同患者和局部区域中每个模态诊断重要性的波动。其次,标准的Mamba架构沿着预定义的物理路径处理令牌。这种刚性扫描破坏了空间分散的医学特征的语义连续性,并加剧了长距离衰减。为解决这些挑战,我们提出了AdaSurvMamba,一种用于多模态生存分析的新型自适应框架。该框架采用双尺度重要性感知重建(DSIR)模块来动态调节跨模态交互强度,在序列和令牌两个层面评估诊断重要性,以重建输入表示。此外,我们提出了语义聚合扫描(SAS)模块来克服上下文碎片化。SAS模块通过共享原型池将离散令牌动态重组为语义连续的序列,并利用全局模态上下文和语义先验显式调节状态转移步长,从而自适应控制信息吸收率。在五个TCGA队列上的实验表明,该方法相比现有方法具有一致性的性能提升。代码可在 https://github.com/zjlGO/AdaSurvMamba 获取。
查看原文
查看缓存全文

缓存时间: 2026/07/21 06:48

# AdaSurvMamba:面向多模态生存分析的动态融合与语义扫描
来源:https://arxiv.org/html/2607.16260
11institutetext:大连理工大学 22institutetext:阿尔伯塔大学 33institutetext:耶鲁大学
33email:yrpiao@dlut\.edu\.cn, miaozhang@dlut\.edu\.cnTingwei Liu, Baokun Yue, Jingjing Li, Yongri Piao\(🖂\), Miao Zhang\(🖂\), Leiye Liu, Jiahong Jiang, Wei Ji, Huchuan Lu

###### 摘要

利用全切片图像(Whole Slide Images, \(WSIs\))和基因组图谱的多模态生存分析是癌症预后评估的基础。近年来,Mamba等状态空间模型已成为序列建模的强大工具。然而,将这一成功迁移至复杂的多模态任务中,仍受到两个关键限制的制约。首先,传统的融合策略假设多模态交互强度是静态的,忽视了不同患者和局部区域中每种模态的诊断重要性波动。其次,标准的Mamba架构沿预定义物理路径处理标记。这种刚性扫描方式破坏了空间分散的医学特征的语义连续性,并加剧了长距离衰减问题。为应对这些挑战,我们提出AdaSurvMamba,一种新颖的自适应多模态生存分析框架。该框架包含一个双尺度重要性感知重建(DSIR)模块,可动态调节跨模态交互强度。它在序列和标记两个层次评估诊断重要性,从而重建输入表示。此外,我们提出一个语义聚合扫描(SAS)模块,以克服上下文碎片化问题。SAS模块通过共享原型池将离散标记动态重组为语义连续的序列,并利用全局模态语境和语义先验显式调节状态转移步长,从而自适应地控制信息吸收速率。在五个TCGA数据集上的实验表明,该方法一致优于现有方法。代码可从https://github.com/zjlGO/AdaSurvMamba获取。

## 1 引言

深度学习极大地推动了计算病理学中WSI分析的发展[28 (https://arxiv.org/html/2607.16260#bib.bib27),26 (https://arxiv.org/html/2607.16260#bib.bib28)]。生存分析是癌症预后和治疗规划中的基础任务[20 (https://arxiv.org/html/2607.16260#bib.bib1)]。准确预测需要对肿瘤有全面理解,这进一步促进了临床决策中多模态数据的应用。具体而言,全切片图像(WSI)揭示了详细的肿瘤形态学信息,而基因组图谱则提供了分子改变的关键见解。这两种模态提供不同但高度互补的预后线索[19 (https://arxiv.org/html/2607.16260#bib.bib2),21 (https://arxiv.org/html/2607.16260#bib.bib3)]。因此,整合WSI和基因组学的多模态深度学习方法近年来在生存预测中取得了显著成功[3 (https://arxiv.org/html/2607.16260#bib.bib13),7 (https://arxiv.org/html/2607.16260#bib.bib14),4 (https://arxiv.org/html/2607.16260#bib.bib5)]。

该领域的许多早期方法依赖后期融合来整合这些多样特征[2 (https://arxiv.org/html/2607.16260#bib.bib4),4 (https://arxiv.org/html/2607.16260#bib.bib5)]。虽然在一定程度上有效,但这些策略往往无法捕捉关键的跨模态协同效应。近期方法尝试通过引入注意力机制或混合监督来更好地对齐病理与基因组特征[3 (https://arxiv.org/html/2607.16260#bib.bib13),7 (https://arxiv.org/html/2607.16260#bib.bib14),8 (https://arxiv.org/html/2607.16260#bib.bib16),17 (https://arxiv.org/html/2607.16260#bib.bib17)] 以克服此限制。与此同时,Mamba架构在序列建模任务中取得了显著成功,例如全切片图像分类[24 (https://arxiv.org/html/2607.16260#bib.bib6),12 (https://arxiv.org/html/2607.16260#bib.bib7),25 (https://arxiv.org/html/2607.16260#bib.bib29),27 (https://arxiv.org/html/2607.16260#bib.bib30)]。这一成功激发了将Mamba应用于多模态生存分析的初步尝试,催生了SurvMamba[5 (https://arxiv.org/html/2607.16260#bib.bib8)] 和 ME-Mamba[23 (https://arxiv.org/html/2607.16260#bib.bib9)] 等框架。与之前使用固定跨模态交互或预定义扫描的生存模型不同,DSIR学习患者层面和标记层面的模态相关性,而SAS在执行扫描前进行语义重排序。这也不同于主要针对常规图像重新设计空间扫描路径的视觉Mamba变体,因为我们的设计针对稀疏的WSI区域和无序的基因组特征。

另一个挑战是扫描过程中语义连续性的破坏。标准的Mamba模型沿预定义扫描路径处理特征。然而,输入标记的具体排列对序列建模性能有着深远影响[11 (https://arxiv.org/html/2607.16260#bib.bib11),16 (https://arxiv.org/html/2607.16260#bib.bib12)]。在WSI中,生物学相关的组织斑块往往分散在遥远的位置。基因组特征也缺乏自然的顺序。按固定顺序处理这些输入,会导致语义上相连的元素在序列中相距甚远。由于Mamba存在长距离衰减问题[9 (https://arxiv.org/html/2607.16260#bib.bib10)],这种强制的距离阻止了有效交互并导致严重的语义碎片化。因此,如何将这些离散特征聚合成语义相连的序列,仍是一个有待解决的关键问题。

为应对这些挑战,我们提出AdaSurvMamba,一种新颖的自适应多模态生存分析框架。它动态控制特征交互并保持语义连续性。该框架包含一个双尺度重要性感知重建(DSIR)模块和一个语义聚合扫描(SAS)模块。DSIR模块克服了现有融合方法的刚性。它在序列和标记两个层次评估诊断重要性,从而重建输入表示。这种重建直接调节多模态交互强度,使模型能够聚焦于最关键的预后信号。在此基础上,SAS模块克服了语义碎片化问题。它进一步将重建后的特征重组为语义连续的扫描序列,使得相关标记在状态转移过程中保持连接,避免了预定义扫描路径的缺陷。DSIR和SAS模块共同使AdaSurvMamba能够灵活地整合特征并捕捉鲁棒的上下文。在多个公共数据集上的大量实验验证了我们框架的有效性。

## 2 方法

图1 (https://arxiv.org/html/2607.16260#S2.F1) 展示了AdaSurvMamba的整体架构。该框架处理WSI斑块和基因组图谱。一个冻结的基础模型对WSI斑块进行编码,而一个可学习的SNN将来自RNA-seq、CNV和突变数据的六个功能组映射为六个标记 \(X_g \in \mathbb{R}^{6 \times D}\)。接着,双尺度重要性感知重建 (DSIR) 模块计算全局和局部重要性权重,以动态调整这些多模态特征。随后,语义聚合扫描 (SAS) 模块将调整后的标记重组为语义连贯的序列,用于状态空间建模。最后,网络聚合增强后的表示来预测患者生存。

![图1:提出的AdaSurvMamba框架概述。为清晰起见,DSIR和SAS模块内的详细计算流程主要以病理(WSI)分支展示,基因组分支遵循对称的处理范式。](图1:提出的AdaSurvMamba框架概述。为清晰起见,DSIR和SAS模块内的详细计算流程主要以病理(WSI)分支展示,基因组分支遵循对称的处理范式。)

### 2.1 预备知识

Mamba通过结构化状态空间模型(SSMs)进行序列建模。连续动力学将输入 \(x(t)\) 映射到输出 \(y(t)\),通过隐藏状态 \(h(t)\):

\[
h'(t) = \mathbf{A} h(t) + \mathbf{B} x(t), \quad y(t) = \mathbf{C} h(t) + \mathbf{D} x(t),
\]
其中 \(\mathbf{A}, \mathbf{B}, \mathbf{C}, \mathbf{D}\) 是可学习的矩阵。离散化将此过程转化为循环形式:
\[
h_t = \mathbf{\bar{A}} h_{t-1} + \mathbf{\bar{B}} x_t.
\]
关键的创新在于其选择性机制。参数 \(\mathbf{B}, \mathbf{C}\) 以及时间尺度 \(\Delta\) 成为依赖于输入的函数。这使得模型在状态转移过程中能够选择性地保留或遗忘信息。然而,这个循环过程严格遵循输入标记的预定义物理顺序。这种刚性阻碍了多模态医学数据中长距离依赖关系的有效建模。

### 2.2 双尺度重要性感知重建

现有的融合方法对所有样本应用静态的交互权重。这忽略了模态重要性不仅在不同患者间存在差异,而且在局部特征对内部也存在变化。DSIR 模块通过在两个互补尺度上动态重建特征来解决这一问题。

**跨模态上下文提取。** 我们在病理标记 \(X_p \in \mathbb{R}^{N \times D}\) 和基因组标记 \(X_g \in \mathbb{R}^{M \times D}\) 之间建立早期交互。为了避免标准交叉注意力的巨大计算负担,我们采用一种高效协同注意力机制。它从线性投影的模态中计算联合亲和度矩阵,以得到注意力向量,然后显式地调整原始标记。这产生了上下文感知特征 \(C_p \in \mathbb{R}^{N \times D}\) 和 \(C_g \in \mathbb{R}^{M \times D}\),以最小的开销有效弥合了初始语义鸿沟。

**全局重要性评估。** 主导的预后模态通常在不同患者间有所差异。我们通过一个全局置信度路由器来量化这种宏观偏好。全局平均池化将 \(X_p\) 和 \(X_g\) 压缩为向量 \(v_p, v_g \in \mathbb{R}^D\)。一个多层感知器处理它们的拼接,以产生序列级别的重要性权重 \(w_p, w_g \in \mathbb{R}^D\)。这些权重反映了当前患者中每种模态的整体贡献。

**局部特征调制。** 即使在全局调整之后,单个标记对的重要性仍然存在差异。我们通过一个局部融合网络来建模这种微观变化。以病理分支为例,该网络处理拼接张量 \([X_p, C_g]\),以生成初始门控对数 \(L_p \in \mathbb{R}^{N \times 2 \times D}\)。然后我们注入全局重要性权重以获得最终的门控信号:
\[
\tilde{L}_p[:,0,:] = L_p[:,0,:] + w_p, \quad \tilde{L}_p[:,1,:] = L_p[:,1,:] + w_g.
\]
沿模态维度应用 softmax 操作得到动态门控 \(G_{raw}\) 和 \(G_{ctx}\)。重建后的病理表示为:
\[
\hat{X}_p = X_p \odot G_{raw} + C_g \odot G_{ctx}.
\]
基因组分支经历对称过程以产生 \(\hat{X}_g \in \mathbb{R}^{M \times D}\)。这种双尺度策略在特征进入SSM之前放大了关键信号。

### 2.3 语义聚合扫描

标准的 Mamba 沿固定物理路径处理标记。这破坏了在原始数据中空间分散的医学特征的语义连续性。SAS 模块通过基于语义内容动态重组标记并调制状态转移来解决这一问题。

**语义原型构建。** 病理学和基因组学具有不同的信息结构。我们构建一个共享原型池 \(E_{shared} \in \mathbb{R}^{r \times d_p}\) 来将两种模态映射到统一的语义空间。这里 \(r\) 是语义解耦的秩,\(d_p\) 是原型维度。对于模态 \(m \in \{p, g\}\),我们学习一个系数矩阵 \(Q_m \in \mathbb{R}^{T_m \times r}\) 来提取模态特定的原型:
\[
P_m = Q_m E_{shared} \in \mathbb{R}^{T_m \times d_p},
\]
其中 \(T_m\) 是该模态的原型数量。这种设计捕捉了模态细节,同时通过共享池强制跨模态对齐。由于基因组学被压缩为六个通路级别的标记,较少的原型总结了主要分子程序而不会过度碎片化,而数量众多且异构的WSI斑块则需要更精细的分组。这是一个由消融研究支持的设计选择,而非假设基因组异质性有限。

**语义序列形成。** 一个线性路由器和 Gumbel-Softmax 为 \(\hat{X}_m\) 中的每个标记生成离散路由权重 \(R_m \in \mathbb{R}^{L_m \times T_m}\)。这些权重具有双重架构目的。在空间上,它们支配一个 argsort 操作,以确定性地将具有相同分配的标记聚类,形成连续序列 \(\tilde{X}_m\)。在语义上,它们与原型池相乘以提取可区分的上下文偏差。通过将此偏差显式注入连续的 SSM 步长(\(\Delta_t\)),模型建立了一个有效的梯度路径回到路由器,从而以端到端的方式优化离散的语义重组。

**单模态上下文聚合。** 在进入 SAS 模块之前,每个模态分支通过注意力池化独立地聚合其重建后的序列。这产生了全局特征向量 \(f_p \in \mathbb{R}^D\) 和 \(f_g \in \mathbb{R}^D\),它们捕捉了当前患者病理和基因组学的整体诊断信号。这些向量也通过一个分类器以生成辅助风险预测 \(\hat{h}_p\) 和 \(\hat{h}_g\),提供额外的监督。全局特征作为模态级别重要性的紧凑表示。

**语义引导的状态调制。** 在状态空间模型中,步长 \(\Delta\) 控制有多少新信息流入隐藏状态。我们使用语义原型和全局模态上下文显式地引导这个信息流。首先,我们通过一个线性投影 \(Proj_{dyn}\) 将每个标记特征 \(\hat{x}_t\)(\(\tilde{X}_m\) 的第 \(t\) 行)压缩为低维动态向量 \(x_t^{dyn}\):
\[
x_t^{dyn} = Proj_{dyn}(\hat{x}_t) \in \mathbb{R}^{d_{dyn}}.
\]
然后我们将 \(x_t^{dyn}\) 与全局特征 \(f = [f_p; f_g] \in \mathbb{R}^{2D}\) 连接起来,并将结果馈入步长

相似文章

基于拓扑感知排序的图Mamba生存分析

arXiv cs.LG

本文提出TopoMamSurv,一种用于全切片图像生存分析的图Mamba框架,采用拓扑感知排序解决Mamba对输入顺序的敏感性问题,并融合双向Mamba和图卷积网络(GCN)实现空间上下文建模。