FederatedRSF : 联邦随机生存森林用于部分重叠的医学数据

arXiv cs.LG 论文

摘要

本文介绍了FederatedRSF,一个用于联邦随机生存森林的Python包,它能处理跨机构的部分重叠医学数据而无需共享原始数据,并在乳腺癌数据上展示了与集中式训练相当的性能。

arXiv:2605.22954v1 公告类型:新 摘要:多中心生存预测可以提高稳健性和泛化能力,但隐私法规和机构治理往往阻止跨机构汇集患者级别的临床和基因组数据。在实践中,部署因特征空间异质性而进一步复杂化,即各站点收集不同的协变量或使用不同的测序面板,导致特征集仅部分重叠。我们提出了FederatedRSF,一个实现联邦随机生存森林的Python包,它聚合本地训练的生存树,并仅将特征兼容的树重新分发给每个站点,从而在无需共享原始数据的情况下实现部分重叠的推理。我们在scikit-survival包中分发的GBSG2乳腺癌队列上评估了FederatedRSF,通过保留部分特征子集来模拟跨客户端的特征异质性,并使用Harrell一致性指数(C-Index)在重复交叉验证和站点分割下评估区分能力。结果表明,联邦模型可以达到与集中式训练设置相当的性能。
查看原文
查看缓存全文

缓存时间: 2026/05/25 08:57

# FederatedRSF:面向部分重叠医学数据的联邦随机生存森林
来源:https://arxiv.org/html/2605.22954
\\journaltitle

期刊标题此处\\DOIDOI在制作过程中添加\\volXX\\accessPublished: 在制作过程中添加的日期\\appnotes论文

0年 0年 0年

Jonas Harriehausen†\\ORCID0009\-0002\-9882\-4616Amirreza Aleyasin†\\ORCID0000\-0003\-2742\-7138Lion Philipp WolfYoungjun Park\\ORCID0000\-0002\-9963\-7014Anne\-Christin Hauschild\\ORCID0000\-0002\-7499\-4379\\orgname吉森尤斯图斯-李比希大学医学与医疗预测深度学习研究所,德国吉森\\orgname黑森人工智能中心(hessian.AI),德国达姆施塔特\\orgname哥廷根大学医学中心医学信息学系,德国哥廷根\\orgname马克斯·普朗克衰老生物学研究所,德国北莱茵-威斯特法伦州科隆

(日期)

###### 摘要

多中心生存预测能够提升模型的鲁棒性和泛化能力,然而隐私法规和机构治理往往禁止跨机构汇集患者级别的临床和基因组数据。实际部署中,特征空间异质性进一步增加了复杂性,即不同站点收集的协变量不同或使用不同的测序面板,导致特征集仅部分重叠。我们提出FederatedRSF,一个实现联邦随机生存森林的Python包,它聚合本地训练的生存树,并仅将特征兼容的树重新分发给各站点,从而在部分重叠的情况下实现推理,无需共享原始数据。我们在scikit-survival包中分发的GBSG2乳腺癌队列上评估FederatedRSF,通过为各客户端保留部分特征子集来模拟特征异质性,并在重复交叉验证和站点划分下使用Harrell一致性指数(C-Index)评估判别能力。结果表明,联邦模型可以达到与集中训练设置相当的性能。

###### 关键词:

联邦学习,生存分析,随机生存森林,特征异质性,隐私保护机器学习,医疗数据

††issue:x## 1 引言

准确的生存预测在肿瘤学研究和临床决策支持中至关重要,尤其是针对经常存在右删失(即某些患者在最后一次随访时事件尚未发生)的生存时间结局,这需要专门的建模方法(ishwaran2008random)。当代生存建模越来越多地使用各种协变量,包括临床变量和通过测序分析获得的分子特征。灵活的非参数模型,如随机生存森林(RSF),已被广泛用于分析删失数据(ishwaran2008random)。然而,单中心队列在规模和多样性上往往受限,因此需要多队列分析来提升鲁棒性和泛化能力(kairouz2021advances)。

在汇集不同机构间的患者级别临床和基因组数据时,一个重大挑战是确保符合隐私法规和机构治理协议,例如欧盟《通用数据保护条例》(GDPR)和美国HIPAA隐私规则(gdpr2016;hipaa2000)。联邦学习(FL)通过在不集中原始数据的情况下实现协作模型开发,有效缓解了这一挑战。它聚合的是本地计算的模型更新或计算产物。因此,联邦学习已成为利用隐私敏感分布式数据集的一种广泛采用的方法(mcmahan2017federated)。

尽管将临床协变量与测序衍生特征结合用于生存预测前景广阔,但一个显著的部署挑战是特征空间异质性,即参与站点使用的协变量集并不相同(ye2023heterogeneous)。在靶向测序应用中,不同机构常依赖不同的基因面板和检测设计。比较研究表明,这些面板可能涵盖不同的基因集,因此需要分析重叠的基因或处理面板不匹配问题(quy2022interassay)。从联邦学习的角度来看,这些场景偏离了标准水平FL中共同特征空间的假设,而是涉及垂直或异质FL框架,这些框架明确管理部分特征重叠(yang2019federated)。

我们提出FederatedRSF,一个实现联邦随机生存森林的Python包,用于在协变量空间部分重叠的情况下进行去中心化生存建模。FederatedRSF基于针对右删失结果的随机生存森林(ishwaran2008random),并以开源Python包形式发布,构建于scikit-survival之上。我们在scikit-survival分发的GBSG2乳腺癌生存数据集上评估FederatedRSF,通过在各客户端保留部分协变量子集来模拟特征空间异质性,并将联邦训练与匹配的本地和集中参考模型进行比较。

## 2 材料与方法

### 2.1 输入数据

我们考虑K个参与站点。站点k持有本地协变量矩阵Xk和右删失生存结局Yk=(Tk, δk),其中Tk表示观察到的事件或删失时间,δk∈{0,1}指示事件是否发生。目标是在不传输患者级别记录的情况下,实现跨站点的协作生存预测。

### 2.2 部分特征重叠下的联邦随机生存森林

所提出的方法遵循本地训练和模型联邦方案,每个站点本地训练一个随机生存森林,随后交换模型训练的生存树。联邦步骤被设计为明确考虑特征空间异质性,仅分发那些在站点本地条件和特征可用性下可用的生存树。

具体来说,该方法分三步进行:(1) 本地模型训练。每个站点在自身数据(Xk, Yk)上使用标准生存树构建方法(具有删失感知的分裂准则)训练本地RSF。结果是生存树的集合(本地森林),代表从本地数据中提取的模型级别信息。(2) 树聚合与兼容性过滤。中央协调器收集本地训练的森林,形成联邦候选树池。对于目标站点i,协调器通过检查树中使用的所有分裂特征是否存在于站点i的可用协变量中,来确定哪些树与该站点的特征集兼容。每个兼容的树都被重新分发给站点i,确保即使在客户端间存在部分特征重叠的情况下,推理仍能良好定义。(3) 本地推理与评估。每个站点将接收到的兼容树整合到其本地估计器集中,并在本地测试数据上进行预测,从而得出风险评分和生存性能指标。

在任何阶段均不交换原始协变量、生存时间或个体级别结局。通信仅限于模型对象(以及可选的轻量级元数据,以确保一致的特征命名)。完整的实现细节和伪代码见补充方法。

### 2.3 实验

我们在scikit-survival分发的GBSG2乳腺癌队列(sksurv.datasets.load_gbsg2; n=686)上评估FederatedRSF。该数据集包含八个临床协变量和一个右删失的生存时间结局(事件发生率≈44%)。

为模拟跨站点的特征空间异质性,我们通过为每次站点划分的每个客户端随机保留35%的预独热协变量,模拟了K=10个客户端。每个客户端的数据在特征丢弃后进行独热编码,并对齐到所有站点保留特征的并集(缺失特征表示为NaN)。通过将每次站点划分运行中所有客户端的训练集合并,我们获得了Centralized-SRF(站点受限特征)数据划分。

交叉验证协议、比较配置和统计检验的完整细节见补充方法。

## 3 实现

该包使用Python编写,需要Python 3.11或更新版本。在本文中,我们称该方法及软件为FederatedRSF,源代码仓库托管在GitHub上的FRSF4POD,包通过PyPI作为federated-rsf分发(pip install federated-rsf)。此外,它需要scikit-survival库(≥0.27.0)作为随机生存森林的基础实现。该包实现了面向部分重叠数据的联邦随机生存森林。它支持跨多个客户端联合训练随机生存森林模型,而无需共享原始数据或丢弃并非所有客户端都可用的特征。

### 3.1 安装

该包可以通过pip从PyPI安装:pip install federated-rsf,也可以从GitHub上的源码安装,安装说明见(链接 (https://github.com/HauschildLab/FederatedRSF#user-installation))。

### 3.2 数据格式

该包的主要输入格式是表格数据,X值为pandas DataFrame,y值为结构化NumPy数组。y值应包含一个布尔列'censor'和一个浮点列'time'。一个中间数据格式是DataSchema,它存储数据集的特征名称以及一个字典形式的映射,将本地特征名称映射到联邦特征名称。

### 3.3 组件

关于输入数据和预处理,包的主要组件是DataSchema、SchemaCreator和SchemaAligner。DataSchema是一个数据类,包含特征名称以及可选的从本地到集中特征名称的映射。SchemaCreator用于根据所有本地模式创建全局DataSchema。SchemaAligner用于将从SchemaCreator接收到的DataSchema应用于本地数据集。

在模型训练本身方面,主要组件是LocalRandomSurvivalForest和FederatedRandomSurvivalForest。LocalRandomSurvivalForest在本地数据上进行训练。FederatedRandomSurvivalForest用于收集和重新分发所有LocalRandomSurvivalForest的树。

### 3.4 工作流程

工作流程的图形说明见图1(https://arxiv.org/html/2605.22954#S3.F1)

- • 客户端为所有具有相同数据的特征分配通用名称(如果它们尚未有相同名称)。例如:AGE,age,age_datetime → age
- • 客户端使用其本地特征名称和上一步的映射创建DataSchema
- • 收集所有DataSchema并聚合,为每个客户端创建一个带有特征映射的联邦DataSchema
- • 客户端将联邦DataSchema应用于其数据集,并训练其本地模型。
- • 聚合本地模型,接收来自适合其本地特征的其他模型的所有树,并将结果树重新分发给客户端。
- • 客户端根据其更新策略将联邦树整合到自身系统中。
- • 客户端使用最终模型。

### 3.5 可重复性

所有利用随机性的函数和类都包含一个参数random_state,以确保结果可重现。重现本文和补充材料中图表的脚本可在GitHub仓库的examples文件夹中找到(链接 (https://github.com/HauschildLab/FederatedRSF/tree/main/examples))。

参见图注

图1:FederatedRSF管道概览。每个客户端持有一个部分重叠特征的本地数据集。数据集通过对齐到共同特征空间(在每个本地数据集中添加占位特征)。然后每个客户端独立训练本地RSF模型,生成一组生存树,无需共享原始数据。在聚合步骤中,本地训练的树被组合成一个联邦RSF模型。每个客户端接收所有适合其本地特征集的树。最后,客户端用从联邦RSF接收到的生存树扩展其本地生存树。此图使用BioRender.com创建。

## 4 结果

每个客户端本地测试集的汇总判别性能见图2(https://arxiv.org/html/2605.22954#S4.F2)。本地训练的平均C指数为0.619±0.136。FederatedRSF的C指数随着参与客户端数量的增加单调提升,从K=2时的0.619±0.136到K=10时的0.646±0.133。在K=2时与本地基线一致是机械性的:每个客户端只有一个对等方时,兼容性过滤器很少允许超出各客户端本地已训练的跨站点树,联邦增益仅从K≥3时开始累积。

跨250次匹配运行的配对比较证实,联邦带来的增益具有统计显著性,并且FederatedRSF恢复了异质协变量空间下可用的全部判别能力。从Local到FederatedRSF(K=10),C指数平均提升了+0.027(中位数+0.018;Wilcoxon符号秩检验p=1.9×10⁻⁸;配对t检验p=2.2×10⁻⁹)。Centralized-SRF达到了可比较的平均值0.649±0.128,并且Centralized-SRF与FederatedRSF(K=10)之间的差异不具有统计显著性(平均Δ=+0.004,中位数Δ=0.000,Wilcoxon p=0.51,配对t检验p=0.46)。作为背景,直接从Local到Centralized-SRF平均提升了+0.030(Wilcoxon p=1.1×10⁻⁶,配对t检验p=2.1×10⁻⁷)——与FederatedRSF在不汇集原始数据的情况下取得的增益几乎相同。因此,FederatedRSF在统计上与在相同特征约束下训练的集中模型无法区分,同时仅交换模型工件。

完全Centralized RSF设定了经验上限为0.698±0.121。Centralized与Centralized-SRF之间平均0.049的间隙量化了面板异质性本身造成的不可约判别损失,与训练方案无关。树级别联邦在统计不确定性范围内恢复了异质协变量空间下可达到的全部性能。

参见图注

图2:GBSG2队列上各配置的汇总C指数。每个箱线图汇总了250次评估(5次站点划分×5折×10个客户端位置)对各自保留测试集的测试结果。每个箱线上方的数字给出了跨运行的平均值和标准差。配置按C指数平均值升序排列。*Local*表示无联邦的每个站点RSF;*Fed (K clients)*表示客户端数量为K时的FederatedRSF;*Centralized-SRF*表示在保留后特征并集上训练的集中RSF(无隐私约束,与FederatedRSM相同的受限特征空间);*Centralized*表示在原始未保留队列上训练的RSF。虚线标记了随机判别水平(C=0.5)。

## 5 讨论与结论

FederatedRSF通过在隐私约束和部分重叠特征空间下仅交换特征兼容的生存树,支持联邦生存预测。在GBSG2评估中,联邦化相比本地训练有所提升,并且在统计上与在相同特征约束下训练的集中模型无法区分;与完全

相似文章

多发性硬化症诱导的脑损伤模拟联邦分析

arXiv cs.LG

本文介绍了一个用于多发性硬化症(MS)脑损伤联邦分析的模拟框架,该框架将图像分割与临床数据分析相结合,在保护患者隐私的同时测试联邦学习方法。

准确且资源高效的联邦持续学习

arXiv cs.LG

FedRAN是一种资源感知的分析型联邦持续学习框架,用紧凑的随机特征统计量替代基于梯度的更新,在显著降低通信与计算成本的同时实现高精度。