MultiSigBERT:通过多模态和序列建模在肿瘤学中超越生存分析
摘要
MultiSigBERT 是一种用于肿瘤学生存分析的新型多模态框架,它采用路径签名变换来整合电子健康记录数据,以提升风险预测效果。
arXiv:2608.16972v1 Announce Type: new
摘要:机器学习已成为现代医疗保健不可或缺的组成部分,整合异质数据源为改善临床决策提供了前所未有的机会。电子健康记录(EHR)包含互补信息——包括叙述性临床报告、数值测量和结构化变量——但大多数生存模型仍局限于单一模态或未能利用患者轨迹的时间特性。我们提出MultiSigBERT,一个基于路径签名表示的多模态序列生存建模统一框架。在此,叙述性医学报告(自由文本)通过提取和平均上下文词嵌入转换为句子嵌入。这些表示随后通过特定于模态的主成分分析(PCA)进行压缩,并与结构化协变量连接形成联合时间轨迹,然后使用Signature变换进行编码,这是一种来自粗糙路径理论(Rough Paths theory)的工具,无需监督即可高效捕捉跨模态的高阶时间交互。计算出的Signature特征最终作为高维特征纳入LASSO正则化Cox模型,以估计个体化风险分数。我们新型MultiSigBERT流程的性能通过分析来自Léon Bérard中心的一个真实世界肿瘤学队列得到展示,该队列包含超过120,000份医学报告和来自2,500多名患者的结构化记录。该模型在独立测试集上实现了0.743的一致性指数(标准差0.029),证明了联合建模多模态时间动态与患者层面几何结构对生存预测的益处。
查看缓存全文
缓存时间: 2026/08/19 10:19
# MultiSigBERT:通过肿瘤学中的多模态和序列建模超越生存分析
来源:https://arxiv.org/html/2608.16972
Paul Minchella (✉)
单位:法国里昂第二大学光大学院,69500 Bron,法国
邮箱 [{paul.minchella, stephane.chretien, guillaume.metzler}@univ-lyon2.fr](mailto:{paul.minchella,%20stephane.chretien,%20guillaume.metzler}@univ-lyon2.fr)
Stéphane Chrétien
单位:法国里昂第二大学光大学院,69007 Bron,法国
邮箱 [{paul.minchella, stephane.chretien, guillaume.metzler}@univ-lyon2.fr](mailto:{paul.minchella,%20stephane.chretien,%20guillaume.metzler}@univ-lyon2.fr)
Guillaume Metzler
单位:法国里昂第二大学光大学院,69007 Bron,法国
邮箱 [{paul.minchella, stephane.chretien, guillaume.metzler}@univ-lyon2.fr](mailto:{paul.minchella,%20stephane.chretien,%20guillaume.metzler}@univ-lyon2.fr)
Loic Verlingue
Rémi Vaucher
单位:EPITA,法国里昂 69007
邮箱 [[email protected]](mailto:[email protected])
###### 摘要
机器学习已成为现代医疗保健不可或缺的组成部分,其中整合异构数据源为改进临床决策提供了前所未有的机会。电子健康记录包含互补信息——包括叙述性临床报告、数值测量和结构化变量——然而大多数生存模型仍然局限于单一模态或未能利用患者轨迹的时间特性。我们提出了MultiSigBERT,一个基于路径签名表示的肿瘤学多模态序列生存建模统一框架。在此框架中,叙述性医学报告(自由文本)通过提取和平均上下文词嵌入,被转换为句子嵌入。然后,这些表示通过特定于模态的PCA进行压缩,并与结构化协变量连接,形成联合时间轨迹,然后使用签名变换进行编码,签名变换是粗糙路径理论中的一个工具,能够高效地捕捉跨模态的高阶时间交互,无需监督。最终,计算出的签名特征作为高维特征被纳入LASSO正则化的Cox模型中,以估计个体化风险评分。我们新型MultiSigBERT流程的性能通过分析来自Léon Bérard中心的真实世界肿瘤学队列得到展示,该队列包含超过12万份医疗报告和来自2500多名患者的结构化记录。该模型在独立测试集上达到了0.743(标准差0.029)的一致性指数,证明了联合建模多模态时间动态与患者水平几何结构对生存预测的益处。
###### 关键词:多模态自然语言处理、签名变换、生存分析、肿瘤学
## 1 引言
### 1.1 背景与挑战
生存分析旨在建模直到感兴趣事件发生的时间,例如死亡、复发或疾病进展。在肿瘤学中,准确的生存预测对于治疗选择、临床试验入选和随访规划至关重要。现代电子健康记录包含异构且互补的信息,包括结构化临床变量、实验室测量、分子数据和叙述性医学报告。这种多样性为改进生存建模提供了强大潜力。然而,整合这些数据源仍然具有挑战性。大多数经典的生存模型依赖于静态基线协变量,并忽略了患者随访的纵向性。即使是最近的机器学习方法,也常常难以处理不规则、异步和时间依赖的临床数据。此外,许多现有方法是单模态的,专注于结构化变量或非结构化文本。这些方法未能捕捉塑造患者轨迹并影响预后的模态间交互。为了解决这些局限性,我们引入了MultiSigBERT,一个旨在整合异构临床数据,并以原则性和可解释性方式建模时间动态的多模态序列生存框架。通过结合嵌入表示、粗糙路径签名、基于图的聚类和稀疏生存建模,该模型为分析真实世界的多模态肿瘤学数据提供了一种统一的方法。
### 1.2 相关工作
生存分析是临床研究中的一项基本任务,旨在估计事件发生的时间,如死亡或复发。Cox比例风险模型[7]因其可解释性和扎实的理论基础仍是经典参考。正则化扩展,特别是LASSO惩罚[24],使其能够应用于高维场景。最近,基于神经网络的生存模型已被提出,以捕捉非线性效应和复杂的特征交互。DeepSurv[15]将Cox部分似然应用于深度架构,用于基于结构化静态数据的个性化预测。为了建模纵向动态,Dynamic-DeepHit[17]引入了带有时间注意力的循环网络。DySurv[20]进一步整合了条件变分自编码器,以整合时间依赖的EHR特征。从数学角度看,粗糙路径理论最近作为一种原则性框架出现,用于编码时间数据。CoxSig[3]将签名变换引入生存建模,展示了强大的实证性能以及诸如普适性和时间重参数化不变性等理论保证。SigBERT[21]的作者引入了一个框架,结合特定领域的语言模型与粗糙路径签名特征,用于肿瘤学中的时间生存分析。应用于Léon Bérard中心的叙述性报告,SigBERT达到了0.75(标准差0.014)的一致性指数和0.80(标准差0.029)的时间依赖性AUC,证明了适当编码的临床文本可以显著改善生存风险估计。然而,SigBERT仅关注叙述性医学报告,没有明确解决其他临床模态的整合问题。更广泛地说,异构临床数据源的原则性结合在生存建模中仍是一个主要挑战。相关方法的摘要见补充材料中的第一张表格。
### 1.3 我们的贡献
基于专注于叙述性医学报告的SigBERT[21],我们将此方法扩展到多模态设置。此外,原始框架并未在地标预测设计中制定,这可能在构建时间特征时导致时间信息泄漏。为了解决这些局限性,我们引入了,一个旨在整合肿瘤学中异构临床数据的多模态生存建模框架。该方法在一个统一的时间表示内,联合利用非结构化临床文本、结构化数值变量及其纵向演变。更具体地说,这项工作做出了三个主要贡献。首先,我们引入了一个多模态时间编码框架,该框架在签名变换之前,将文本嵌入和结构化临床变量结合到同步的轨迹中。叙述性报告首先使用OncoBERT[26]编码为句子嵌入。结构化数值变量单独处理,并通过线性插值与相同的时间轴对齐。然后在每个时间点将两种模态连接起来,形成多模态向量,随后使用签名变换进行编码,使模型能够以数学上原则性的方式捕捉高阶时间依赖性和跨模态交互。其次,我们提出了一个基于地标的稳健生存建模流程,通过将特征构建限制在预测时间之前可用的观察数据,从而防止时间信息泄漏,从而能够从纵向临床数据中进行定义明确的动态风险预测。最后,我们提供了一个高效且可解释的生存建模框架,结合签名特征与稀疏Cox回归。这种设计能够在保持预测因素可解释性的同时,实现大型临床队列的可扩展分析。此外,我们通过评估仅文本与全模态配置,对模态特定贡献进行了系统的实证比较,从而量化了多模态融合对生存预测的附加值。据我们所知,是第一个在连贯且计算高效的流程中,将文本和结构化数值数据的多模态时间编码与稀疏生存建模相结合的生存框架。完整实现可在关联的GitHub仓库获取:https://github.com/MINCHELLA-Paul/MultiSigBERT。主笔记本multisigbert_study.ipynb包含额外的实验结果,所有描述性统计图见`results/descriptive_statistics`。
## 2 方法
### 2.1 全局概述
提出的MultiSigBERT框架将异构临床数据整合到一个统一的时间表示中,用于生存建模。该数据集由纵向患者水平记录组成,结合了叙述性医学报告、结构化时间依赖临床变量和右删失生存结果。形式上,对于每个患者i,我们观察一系列临床时间点 \{t1(i),...,tNi(i)\}, \left\{t^{\{i\}}\_{1},\dots,t^{\{i\}}\_{\{N\_{i}\}}\right\},在这些时间点记录了文本报告和结构化协变量。每份报告被编码为句子嵌入,生成患者临床轨迹的时间索引表示。此外,我们在不规则时间点观察到的结构化纵向变量与同一时间轴对齐。生存结果由一对(Ti,Di) (T\_{i},D\_{i})定义,其中Ti≥0 (T\_{i}\geq 0)表示观察到的事件发生时间或删失时间,Di∈\{0,1\} (D\_{i}\in\{0,1\})是事件指示符,Di=1 (D\_{i}=1)表示观察到事件(例如死亡),Di=0 (D\_{i}=0)表示观察被右删失。目标是学习从患者特定的时间表示到与Cox比例风险框架兼容的风险函数的映射。对于每个患者,临床笔记在连续的时间戳上被观察,形成有序的非结构化文本序列,反映了疾病进展、治疗反应和随时间做出的医疗决策。在我们的队列中,这些文件主要包括会诊报告(68%)和住院报告(27%),提供了丰富的预后信息时间来源。同时,结构化变量如体重、Karnofsky指数、血压和脉搏率在不规则的时间点被记录。这些定量测量提供了关于患者生理状态的补充信息。所有模态都经过预处理并在时间上对齐,以构建连贯的多模态轨迹。详细的描述性统计报告在关联GitHub仓库提供的笔记本`descriptive_statistics.ipynb`中。为防止信息泄漏并定义一致的预测任务,我们采用地标设计。对于固定的地标时间L (\boldsymbol{\mathrm{L}}),仅使用在回溯窗口[L−w,L] ([\boldsymbol{\mathrm{L}}\-\boldsymbol{\mathrm{w}},\boldsymbol{\mathrm{L}}])内观察到的数据来构建患者表示,并在L (\boldsymbol{\mathrm{L}})之后预测生存情况。该框架保持了时间因果关系,并确保签名系数在有限、排序良好的轨迹上计算,而不纳入未来信息。每个模态首先嵌入到专用的向量空间中,可选择压缩,并在时间上连接。由此产生的多模态序列使用签名变换进行编码,产生捕捉高阶时间交互的固定维度表示。此外,签名变换特别适合处理不规则采样时间点和异构数据模态,这两者在现实世界的机器学习设置中都是主要挑战。最后,这些签名衍生的特征用于拟合LASSO正则化的Cox模型,产生个体化风险评分,同时确保稀疏性、强大的预测性能和计算效率。完整流程的概览——从嵌入提取和时间编码到几何聚类和生存估计——如图1所示(https://arxiv.org/html/2608.16972#S2.F1)。参考标题图1:MultiSigBERT流程概览。步骤1:多模态表示。叙述性临床报告被转换为句子嵌入,并与在时间t1,...,tN (t\_{1},\dots,t\_{N})观察到的结构化变量结合,形成多模态向量vt (v\_{t})。步骤2:地标限制。仅保留在窗口[L−w,L] ([\boldsymbol{\mathrm{L}}\-\boldsymbol{\mathrm{w}},\boldsymbol{\mathrm{L}}])内的观察以避免时间信息泄漏。步骤3:签名编码。截断序列(vt)t ((v\_{t})\_{t})通过路径签名变换进行编码,产生捕捉跨模态时间交互的固定维度表示Si (\mathbb{S}\_{i})。步骤4:生存建模。在签名特征上拟合LASSO正则化的Cox模型,以估计个体化风险评分。步骤5:评估。使用C指数和Brier分数评估性能。
### 2.2 多模态嵌入提取
临床数据集结合了结构化数值变量和非结构化数据,如自由文本报告。为了将这些异构模态整合到一个统一的生存框架中,每个输入首先必须转换为数值向量表示。让我们首先考虑叙述性医学报告。这些纵向文件捕捉了患者的临床随访,包括随时间记录的会诊报告、住院摘要和医疗观察。我们使用OncoBERT[26]对它们进行编码,OncoBERT是一个基于CamemBERT[19]的语言模型,在Léon Bérard中心的肿瘤学笔记上进行了微调。这种特定领域的微调改善了肿瘤学术语和临床上下文的语义表示。令Ri(t) (\mathscr{R}\_{i}(t))表示在时间t与患者i相关的原始临床报告。OncoBERT编码器ΦOncoBERT (\Phi\_{\mathrm{OncoBERT}})将此报告映射为一个上下文化的令牌嵌入序列:(ew)w∈Ri(t)=ΦOncoBERT(Ri(t)), \big(e\_{w}\big)\_{w\in\mathscr{R}\_{i}(t)\}=\Phi\_{\mathrm{OncoBERT}}\(\mathscr{R}\_{i}(t)\),其中ew∈Rpe\_{w}\in\mathbb{R}^{p}表示与令牌w相关的上下文化嵌入,p=768。然后使用平滑逆频率(SIF)池化策略[2],从这些上下文化的令牌嵌入获得固定维度的句子表示vi(t)∈Rpv\_{i}(t)\in\mathbb{R}^{p}。具体而言,vi(t)=1|Ri(t)|∑...相似文章
AdaSurvMamba:面向多模态生存分析的动态融合与语义扫描
提出AdaSurvMamba,一种用于多模态生存分析的自适应框架,通过双尺度重要性感知重建模块和语义聚合扫描来改进全切片图像与基因组图谱的整合,在五个TCGA队列上实现一致性的性能提升。
用于乳腺癌复发预测的多模态机器学习
本文探讨了整合多模态临床数据(包括治疗记录、病理报告和临床医生笔记)的方法,通过基于规则的提取和机器学习,与单模态方法相比,提高乳腺癌复发预测的准确性。
Token级别跨模态Transformer与对比多任务学习用于乳腺癌亚型分类和生存预测
本文提出了UMMT,一种基于Token级别的跨模态Transformer与对比多任务学习,用于乳腺癌亚型分类和生存预测,在METABRIC和TCGA-BRCA数据集上取得了最先进的结果。
医疗中的联邦生存分析:跨机构异质性乳腺癌数据的多模型评估
本文系统评估了联邦学习下三种生存模型(Cox、DeepSurv、RSF)在异质性乳腺癌数据上的表现,发现联邦学习优于本地训练,且RSF在各客户端间提供了最佳性能平衡。
基于多组学的乳腺癌预测机器学习模型基准测试
本文使用来自 TCGA-BRCA 的多组学数据,系统地基准测试了用于 ER 状态预测的经典机器学习模型(Random Forest、XGBoost 等),发现 RNA 表达提供了最强的预测信号,并且在整合的多组学设置中,Random Forest 达到了 90.3% 的平衡准确率。