基于多组学的乳腺癌预测机器学习模型基准测试
摘要
本文使用来自 TCGA-BRCA 的多组学数据,系统地基准测试了用于 ER 状态预测的经典机器学习模型(Random Forest、XGBoost 等),发现 RNA 表达提供了最强的预测信号,并且在整合的多组学设置中,Random Forest 达到了 90.3% 的平衡准确率。
arXiv:2607.16250v1 Announce Type: new
摘要:雌激素受体(ER)状态是乳腺癌诊断、预后和治疗选择中的关键生物标志物。高通量测序技术的最新进展使得能够生成多组学数据集,为计算预测任务提供互补的分子信息。本研究使用来自 TCGA-BRCA 队列的转录组(RNA 表达)、基因组(拷贝数变异;CNV)和蛋白质组(RPPA)数据,对 ER 状态预测的经典机器学习模型进行了系统的基准测试分析。采用了严格的实验框架,包括分层训练-测试分割、分层五折交叉验证、类别不平衡处理和折特定特征选择,以确保可靠的评估并防止数据泄露。在单组学和多组学设置中评估了 Random Forest、XGBoost、LightGBM、CatBoost、支持向量机(SVM)和逻辑回归。结果表明,RNA 表达提供了最强的预测信号,而多组学整合相比单一模态带来了适度但一致的改善。在所有评估方法中,Random Forest 在整合的多组学设置中取得了最佳整体性能,平衡准确率为 90.3%,ROC-AUC 为 97.1%。此外,反复选择的生物学相关基因,包括 \textit{ESR1}、\textit{PGR}、\textit{FOXA1} 和 \textit{GATA3},支持了所学模型的生物学有效性。这些发现表明,经过仔细正则化的经典机器学习方法对于小型高维基因组数据集仍然非常有效,并且多组学整合为乳腺癌 ER 状态预测提供了互补信息。
查看缓存全文
缓存时间: 2026/07/21 06:47
# 多组学乳腺癌预测的机器学习模型基准测试 来源:https://arxiv.org/html/2607.16250 ###### 摘要 雌激素受体(ER)状态是乳腺癌诊断、预后和治疗选择中的关键生物标志物。高通量测序技术的最新进展使得生成多组学数据集成为可能,这些数据集为计算预测任务提供了互补的分子信息。本研究使用来自TCGA-BRCA队列的转录组(RNA表达)、基因组(拷贝数变异;CNV)和蛋白质组(RPPA)数据,对用于ER状态预测的经典机器学习模型进行了系统性的基准测试分析。我们采用了严格的实验框架,包括分层训练-测试分割、分层五折交叉验证、类别不平衡处理以及每折特有的特征选择,以确保评估的可靠性并防止数据泄露。评估了随机森林、XGBoost、LightGBM、CatBoost、支持向量机(SVM)和逻辑回归在单组学和多组学设置中的表现。结果表明,RNA表达提供了最强的预测信号,而多组学整合在单个模态基础上带来了适度但一致的改进。在所有评估的方法中,随机森林在整合多组学设置中取得了最佳整体性能,获得了90.3%的平衡准确率和97.1%的ROC-AUC。此外,反复选出的生物学相关基因,包括ESR1、PGR、FOXA1和GATA3,支持了所学模型的生物学有效性。这些发现表明,经过仔细正则化的经典机器学习方法对于小型、高维基因组数据集仍然非常有效,并且多组学整合为乳腺癌ER状态预测提供了互补信息。 ## I. 引言 乳腺癌仍然是全球最常见且临床异质性最高的癌症之一。乳腺肿瘤内的分子异质性导致患者在预后、治疗反应和生存结果方面存在显著差异。因此,雌激素受体(ER)、孕激素受体(PR)和HER2状态等生物标志物是现代乳腺癌诊断和治疗决策的重要组成部分。 在这些生物标志物中,ER状态尤为重要,因为它直接影响内分泌治疗选择和临床管理策略。ER阳性和ER阴性肿瘤表现出明显不同的生物学行为和转录程序。因此,能够从分子数据准确预测ER状态的计算方法,可能有助于改进精准医学工作流程,并加深对乳腺癌亚型的生物学理解。 高通量测序技术的最新进展使得大规模生成包含基因组、转录组、蛋白质组和临床信息的多组学数据集成为可能[10 (https://arxiv.org/html/2607.16250#bib.bib10),13 (https://arxiv.org/html/2607.16250#bib.bib13)]。癌症基因组图谱(TCGA)等公共数据库提供了癌症患者的全面分子图谱,并已成为计算癌症研究的重要资源。然而,有效建模多组学数据集面临着几个计算挑战,包括高维度、特征冗余、类别不平衡和样本量有限。 机器学习方法因其捕捉非线性生物学关系的能力,在高维生物医学数据集上表现出强大性能[14 (https://arxiv.org/html/2607.16250#bib.bib14)]。特别是集成树方法和基于核的模型在基因组预测任务中显示出很强的适用性。尽管深度学习方法在人工智能的许多领域已占主导地位,但其在小型基因组数据集上的应用仍然具有挑战性,因为深度架构通常需要更大的样本量才能实现可靠的泛化。 因此,本研究主要侧重于使用TCGA-BRCA的多种组学模态,系统性地对经典机器学习模型进行ER状态预测的基准测试。这项工作既研究了单组学策略,也研究了多组学学习策略,同时强调稳健的实验方法、生物学可解释性以及适用于小型基因组数据集的可靠评估实践。 ## II. 研究目标 本研究旨在系统评估机器学习方法在使用TCGA-BRCA队列多组学数据预测乳腺癌雌激素受体(ER)状态方面的有效性。鉴于乳腺癌的异质性以及来自转录组、基因组和蛋白质组来源的互补分子信息的可用性,本研究探讨了不同组学模态在单独使用以及整合到统一框架时如何贡献于预测性能。 为实现这一目标,首先分别分析RNA表达、拷贝数变异(CNV)和蛋白质表达(RPPA)数据以评估其各自的预测价值,然后采用多组学整合策略,以确定组合模态是否能提供超越单组学模型的额外信息。研究进一步比较了几种广泛使用的机器学习算法,包括随机森林、XGBoost、LightGBM、CatBoost、支持向量机和逻辑回归,以确定在保持稳健性和可解释性同时提供强大预测性能的模型。 除了模型性能,本研究还考察了跨交叉验证折选出的特征的生物学意义和一致性。特别关注通过分层训练-测试分割、分层交叉验证、每折特有的特征选择、类别不平衡处理以及使用多个互补性能指标来确保严格的评估框架。通过这一分析,本研究旨在确定多组学整合是否能改进ER状态预测,并识别出一种在预测准确性、泛化能力和生物学可解释性之间取得平衡的建模策略。 ## III. 数据集描述 本研究使用了从UCSC Xena浏览器获取的TCGA-BRCA队列中公开的乳腺癌多组学数据。该数据集提供了乳腺癌患者在多个生物学层面的匹配分子图谱[10 (https://arxiv.org/html/2607.16250#bib.bib10)],使得能够在统一分析框架内研究互补的基因组、转录组和蛋白质组信息。本研究包含了三种组学模态:代表转录组活性的RNA表达数据、反映基因组改变的拷贝数变异(CNV)数据,以及通过反相蛋白质阵列(RPPA)技术获得的蛋白质表达测量值。 原始队列包含705个患者样本。在数据清理并移除ER状态注释不明确或不可用的样本后,最终留下549例患者用于下游分析。所产生的数据集包含604个RNA表达特征、860个CNV特征和223个蛋白质表达特征,构成了包含1,687个分子变量的组合多组学特征空间。预测任务被定义为二元分类问题,每位患者被分类为ER阳性或ER阴性。 最终队列呈现出适度的类别不平衡,约75.4%的样本属于ER阳性类别,24.6%属于ER阴性类别。由于不平衡的类别分布可能会使常规性能指标产生偏差,本研究采用了平衡评估指标和类别加权学习策略,以确保对两个类别的模型性能进行可靠评估。 ## IV. 多组学数据的挑战 多组学基因组数据集伴随着若干重要的计算和生物学挑战。 ∙ **高维度**:组合数据集包含1,687个分子特征,但仅有549个可用患者样本。这造成了一个高维小样本学习问题,显著增加了过拟合的风险。在这种情况下,许多机器学习模型可能记忆噪声而非学习有生物学意义的模式。 ∙ **类别不平衡**:ER阳性类别在数量上远超ER阴性类别。因此,仅凭标准准确率会产生误导,因为一个将所有样本预测为ER阳性的朴素分类器仍可能获得高表观准确率,而不具备临床意义的区分能力。 ∙ **小样本量**:虽然TCGA提供了生物学上丰富的数据,但对于复杂的机器学习模型,尤其是通常需要更大数据集的深度学习架构而言,有效可用样本的数量仍然相对有限。 ∙ **特征冗余与相关性**:参与共享生物学通路的基因通常是高度相关的。如果不通过特征选择和正则化进行适当处理,这种冗余会增加噪声并降低模型的泛化能力。 ∙ **数据泄露风险**:不当的预处理可能意外地允许测试数据的信息影响训练过程,从而导致过于乐观的评估指标。在高维基因组数据集中,防止数据泄露尤为关键。 ## V. 数据预处理流程 我们开发了一个结构化的预处理流程,以确保可靠的模型训练和无偏的性能评估。特别关注最小化数据泄露、处理类别不平衡以及保持涉及RNA表达、CNV、蛋白质表达和多组学数据集的所有实验的一致性。 #### 标签清理 原始TCGA-BRCA队列包含705个患者样本。为确保模型训练期间有可靠的监督信息,仅保留具有明确定义ER状态注释的样本。标记为NaN、Indeterminate、Not Performed或Performed but Not Available的样本被排除,因为这些标签会引入歧义,并可能对模型学习产生负面影响。经过这一清理过程,剩余549例患者用于下游分析。 #### 标签编码 为便于二元分类,将ER状态标签转换为数值形式,ER阴性样本编码为0,ER阳性样本编码为1。这种表示确保了与所有机器学习算法的兼容性,同时保留了目标变量的临床解释意义。 #### 分层训练-测试分割 清理后的数据集使用80/20分层分割划分为训练子集和测试子集。采用分层分割以保持两个子集中ER阳性和ER阴性样本的原始分布,从而降低因类别分配不均而导致的性能估计偏差风险。这种方法确保了留出的测试集仍然是整个队列的代表。 #### 特征选择 鉴于数据集的高维性质,使用通过SelectKBest实现的ANOVA F统计量进行特征选择。为防止信息泄露,特征选择在交叉验证期间于每个训练折内独立进行,而非在数据分割之前。对于RNA、CNV、RPPA和多组学实验,每个折内选择前300个特征,从而在降维和保留生物学相关信息之间取得平衡。 #### 特征缩放 仅在基础学习算法需要时才应用特征缩放。具体而言,支持向量机和逻辑回归使用了StandardScaler标准化,因为这些方法对特征量级差异敏感。相比之下,随机森林、XGBoost、LightGBM和CatBoost等基于树的集成模型使用原始特征值进行训练,因为基于决策树的方法本质上是尺度不变的。 ## VI. 实验策略 为了系统评估每种组学模态在进入多组学整合之前的预测贡献,我们采用了一种渐进式实验策略。 与其在研究开始时直接组合所有模态,不如先独立评估每个组学层。这种设计能够更清晰地解释预测贡献,并避免在组合特征空间中掩盖较弱的模态。因此,本研究分为四个连续的实验阶段。 **仅RNA实验**。首先评估RNA表达数据,因为ER信号传导从根本上是由转录驱动的。由于ER作为一种转录因子发挥功能,基因表达谱预计包含ER活性最直接的表示。因此,仅RNA实验作为本研究的主要基线。 **拷贝数变异(CNV)实验**。第二阶段独立研究拷贝数变异特征。CNV数据反映的是结构性基因组改变,而非直接的转录活性。因此,预计CNV提供的信息会较弱,但可能具有互补性。 **蛋白质表达实验**。然后使用RPPA衍生的特征独立评估蛋白质表达数据。蛋白质水平的测量反映了下游通路活性,可能捕捉到转录组水平未完全体现的生物学状态。 **多组学整合**。最后,将RNA、CNV和蛋白质特征组合成一个统一特征空间进行多组学学习实验。 这一阶段的主要目标是确定整合多种分子模态是否能在单组学基线基础上改进ER状态预测。 ## VII. 为何在深度学习之前选择经典机器学习 尽管深度学习方法在计算机视觉和自然语言处理等领域已展现出强大成功,但基因组数据集呈现了显著不同的约束。本研究使用的数据集仅包含549个可用患者样本。深度神经网络通常需要更大的数据集才能可靠泛化。在小样本高维设置下,深度架构极易过拟合且优化不稳定。相比之下,经典机器学习方法为基因组表格数据提供了若干优势: - • 集成树方法通过装袋和特征子采样自然地实现正则化。 - • SVM使用核函数有效建模非线性关系。 - • 经典模型在小型数据集上计算效率高。 - • 特征重要性分析提高了生物学可解释性。 - • 保守的超参数控制更容易实现。 这些优势使得经典机器学习方法特别适用于样本量有限的高维基因组数据集。因此,深度学习主要被作为未来扩展而非本研究的核心建模策略进行探索。 ## VIII. 处理小数据集与类别不平衡 由于TCGA-BRCA队列中的样本数量相对于分子特征空间的维度有限,我们在整个实验流程中纳入了若干方法学保障措施,以提高模型可靠性、降低过拟合风险,并确保在两个ER类别上的公平评估。 ∙
相似文章
用于乳腺癌复发预测的多模态机器学习
本文探讨了整合多模态临床数据(包括治疗记录、病理报告和临床医生笔记)的方法,通过基于规则的提取和机器学习,与单模态方法相比,提高乳腺癌复发预测的准确性。
医疗中的联邦生存分析:跨机构异质性乳腺癌数据的多模型评估
本文系统评估了联邦学习下三种生存模型(Cox、DeepSurv、RSF)在异质性乳腺癌数据上的表现,发现联邦学习优于本地训练,且RSF在各客户端间提供了最佳性能平衡。
Token级别跨模态Transformer与对比多任务学习用于乳腺癌亚型分类和生存预测
本文提出了UMMT,一种基于Token级别的跨模态Transformer与对比多任务学习,用于乳腺癌亚型分类和生存预测,在METABRIC和TCGA-BRCA数据集上取得了最先进的结果。
探测、融合与可信度:面向多模态癌症分析的基础模型表征系统评估
本文系统评估了用于多模态癌症分析的基础模型表征,在真实世界队列上对单模态与多模态融合策略进行基准测试,并通过共形预测评估可信度。
技能增强型AI代理在医学研究分析中的应用:一项NSCLC转录组生物标志物任务中的探索性多模型人类评估
本探索性研究在NSCLC生物标志物任务中使用多模型人类评估,评估将AI代理与医学研究技能包相结合是否能提高转录组研究分析输出的质量(与原生AI相比)。结果显示有方向性但无统计显著性的改善,强调了进行更大规模、更稳健评估的必要性。