一种基于DNA甲基化的中枢神经系统肿瘤分类的新机器学习方法
摘要
本文提出了一种结合稀疏随机投影与多项逻辑回归的新型机器学习方法,用于从DNA甲基化数据中对中枢神经系统肿瘤进行分类,其准确率较现有方法提高了4-5个百分点,达到了最先进水平。
arXiv:2607.01307v1 Announce Type: new
摘要:DNA甲基化分析已成为中枢神经系统(CNS)肿瘤分类的有力方法,但在跨队列可转移性、方法学正确性以及稳健的多类别评估方面仍存在重要挑战。在这项工作中,我们提出了一种新颖且方法学严谨的机器学习方法,用于基于甲基化的CNS肿瘤分类,该方法结合了稀疏随机投影进行降维与多项逻辑回归进行分类。我们在一个广泛使用的参考分类器所建立的相同通用实验设置下评估了所提出的方法。在包含2,801个样本的参考队列中,我们的方法在分层3折交叉验证下实现了96%的平均准确率。在独立的1,104样本临床评估队列中,它在91个类别层面达到86%的准确率,在甲基化类别家族层面评估预测时达到93%的准确率。这些结果相较于当前最先进的参考数据——类别层面一致性82%和家族层面一致性88%——分别提升了约4和5个百分点。这一改进具有临床意义:在诊断环境中,肿瘤分类正确率提高5个百分点可直接影响癌症亚型分配,进而影响治疗方案的选择及后续临床决策。我们的结果表明,所提出的模型基于更稳健的机器学习方法论,在各种评估设置下均持续优于先前的最先进技术,并能实质性地提高CNS肿瘤分类的可靠性。
查看缓存全文
缓存时间: 2026/07/03 05:39
# 一种基于DNA甲基化的中枢神经系统肿瘤分类新机器学习方法 来源:https://arxiv.org/html/2607.01307 11机构:佩洛塔斯联邦大学,巴西南里奥格兰德州佩洛塔斯 22机构:阿雷格里港临床医院,巴西南里奥格兰德州阿雷格里港 22邮箱:paulo\.ferreira@inf\.ufpel\.edu\.brLucas Coutinho FreitasLaís dos Santos GonçalvesWilliam Borges DominguesLucas Petitemberte de SouzaMariana B\. MichalowskiVinicius F\. Campos ###### 摘要 DNA甲基化分析已成为中枢神经系统(CNS)肿瘤分类的有力方法,但在跨队列可迁移性、方法学正确性和稳健的多类别评估方面仍存在重要挑战。本文提出了一种新颖且方法学严谨的基于甲基化的CNS肿瘤分类机器学习方法,该方法结合了稀疏随机投影(用于降维)和多项逻辑回归(用于分类)。我们在一个广泛使用的参考分类器所建立的相同通用实验设置下评估了所提出的方法。在包含2,801个样本的参考队列上,我们的方法在分层3折交叉验证下达到了96%的平均准确率。在包含1,104个样本的独立临床评估队列上,它在91个类别级别上达到了86%的准确率,当在甲基化类别家族级别评估预测时,准确率达到了93%。这些结果优于相应的最新参考数据(82%的类别级别一致性和88%的家族级别一致性),分别获得了大约4个和5个百分点的绝对提升。这种改进具有临床相关性:在诊断环境中,肿瘤正确分类提高5个百分点可以直接影响癌症亚型的分配,进而影响治疗方案选择和后续临床决策。我们的结果表明,所提出的模型基于更强的机器学习方法实践,在各种评估设置中始终优于先前的最新技术,并能够实质性地提高CNS肿瘤分类的可靠性。 ## 1 引言 中枢神经系统(CNS)肿瘤的准确分类对于指导诊断、预后和个性化治疗决策至关重要。DNA甲基化分析已成为一种超越组织病理学、改善肿瘤分类的强大工具,能够在分子水平上实现CNS肿瘤诊断的精准化。在CNS肿瘤中,髓母细胞瘤是一个关键例子,DNA甲基化分析已彻底改变了其分类和风险分层。 Capper等人[3 (https://arxiv.org/html/2607.01307#bib.bib1)]开发了一种基于DNA甲基化的分类器,能够以显著的准确性实现CNS肿瘤的分子分类。该分类器利用全基因组CpG甲基化特征来区分91个肿瘤甲基化类别。尽管该分类器是研究用途的工具而非临床验证的测试,但基于甲基化的分类已展现出直接的诊断和临床实用性,并已被纳入多个中心的常规神经病理学工作流程。 他们的训练数据集包含2,801个参考样本,通过Illumina 450K芯片进行检测。工作流程使用基于排列的随机森林重要性评分,在43组探针集(每组包含100棵树)中对428,799个CpG探针进行排序,然后选择排名最高的10,000个探针。依赖固定的探针子集可能会低估位于选定集合之外、本可贡献额外预测价值的生物学信息CpG位点。值得注意的是,该手稿并未明确说明为何特别选择10,000个特征,也未报告评估性能如何随选定探针数量变化的敏感性分析。 作者采用具有固定超参数(10,000棵树,每类下采样至8个样本)的随机森林分类器。然而,他们并未为这些设计选择提供详细的理由或敏感性分析。这些参数对于集成模型的行为和性能至关重要。尽管他们报告了校准模型概率,但标准校准方法是为二元设置设计的,需要针对多类别上下文进行调整,例如采用“匹配vs不匹配”的公式。 关于性能评估,作者报告AUC为0.99,表明预测准确性很高。然而,该指标是基于阈值的二值化“匹配vs不匹配”公式得出的,而非来自原始的91类别预测任务。因此,报告的AUC反映的是模型的区分能力,而非其实际的多类别性能。包含多类别评估指标将有助于更全面地理解模型行为,并增强报告结果的可解释性和临床稳健性。 作者还对1,104个前瞻性病例进行了临床评估。该分类器与组织病理学诊断的一致性逐步提高,从类别级别的76%上升到考虑更广泛甲基化类别家族(MCFs)时的88%。这反映了捕捉肿瘤类型之间生物学关联性的努力,但也改变了评估的粒度。然而,在分析的这一点上,评估框架从单个甲基化类别扩展到了甲基化类别家族(MCFs),后者将相关实体分组为更广泛的诊断类别。在此更高层次的分类下,同一MCF内的预测被认为是一致的,从而得到88%的报告性能。这种方法反映了捕捉肿瘤实体之间生物学和临床邻近性的努力,但也引入了评估粒度的转变,在解释结果时应仔细考虑其背景。 鉴于上述可用分类器的方法学局限性,我们提出了一种新颖的机器学习方法,该方法遵循高维数据的最佳实践,并增强了结果的正确性、可重复性和可解释性。我们使用稀疏随机投影(SRP)来减少特征空间,这是一种适用于具有数十万个变量且每类样本相对较少的数据集的高效降维技术。SRP在保持相关数据结构的同时提高了模型的可处理性。此步骤从探针级别测量值中计算出紧凑特征,从而避免依赖固定的、手动选择的CpG位点子集。对于分类,我们使用逻辑回归,这是一个在高维、小样本量问题中成熟的模型,并且我们不应用下采样。我们使用分层交叉验证在参考队列上评估所提出的工作流程,并在独立临床数据集上进行验证,报告全面的性能指标和每类分析。在[3 (https://arxiv.org/html/2607.01307#bib.bib1)]所描述的相同实验设置下,我们的方法实现了更优的性能。 本文其余部分结构如下:第2节 (https://arxiv.org/html/2607.01307#S2)介绍基于甲基化的肿瘤分类和机器学习最佳实践的基础知识。第3节 (https://arxiv.org/html/2607.01307#S3)分析[3 (https://arxiv.org/html/2607.01307#bib.bib1)]提出的方法,讨论特征选择、校准和验证方面的问题。第4节 (https://arxiv.org/html/2607.01307#S4)介绍我们提出的工作流程。第5节 (https://arxiv.org/html/2607.01307#S5)展示实验设置和结果,第6节 (https://arxiv.org/html/2607.01307#S6)总结全文。 ## 2 DNA甲基化基础 DNA甲基化是表观遗传调控的核心机制,经典描述为在不改变DNA序列的情况下改变基因功能的可遗传调控。在哺乳动物中,甲基化主要发生在胞嘧啶的5号碳位置,在CpG二核苷酸处形成5-甲基胞嘧啶(5mC)。另一种甲基化形式可发生在腺嘌呤的N6位置(6mA),产生N6-甲基腺嘌呤。据估计,人类基因组中约60–80%的CpG位点被甲基化。5mC的功能影响高度依赖于背景:相似的甲基化模式可能与转录激活或抑制相关,具体取决于基因组位置和基因特异性调控环境[5 (https://arxiv.org/html/2607.01307#bib.bib12)]。 DNA甲基化在各种生物过程中起着至关重要的作用,包括胚胎发育、基因组印记、X染色体失活以及染色体稳定性的维持[1 (https://arxiv.org/html/2607.01307#bib.bib13)]。表观遗传调控通过多种机制介导,包括直接胞嘧啶甲基化(5mC)、翻译后组蛋白修饰(如甲基化、乙酰化、磷酸化和泛素化)以及非编码RNA的调控[4 (https://arxiv.org/html/2607.01307#bib.bib14)]。许多这些过程是可逆的,并能以协调的方式运作。 在癌症表观基因组学中,识别候选表观遗传生物标志物通常需要检测异常甲基化区域,包括相对于其他探针和样本表现出低甲基化(甲基化程度低)或高甲基化(甲基化程度高)的差异甲基化模式。甲基化水平通常使用beta值和M值进行量化。Beta值代表甲基化信号强度的比例,介于0和1之间;值低于或等于0.2通常被解释为低甲基化,而值高于或等于0.8则被解释为高甲基化。M值定义为甲基化与未甲基化信号强度的对数比,由于其良好的统计特性,在统计分析中常被优先使用。值小于或等于−2通常表示低甲基化,值大于或等于2表示高甲基化[2 (https://arxiv.org/html/2607.01307#bib.bib15)]。 DNA甲基化微阵列通过结合亚硫酸氢盐转化和基于探针的杂交化学技术,在数十万个CpG位点处量化甲基化。简而言之,提取的基因组DNA经过亚硫酸氢盐处理,使未甲基化的胞嘧啶转化为尿嘧啶(扩增后读作胸腺嘧啶),而甲基化的胞嘧啶保持不变。转化后的DNA被扩增、片段化,并与检测每个CpG的阵列探针杂交(对于Infinium检测,通过I型和II型探针设计,使用甲基化和未甲基化通道)。扫描后,原始数据存储在成对的IDAT文件中,这些文件包含每个颜色通道(绿色和红色)的探针级荧光强度。Illumina的DNA甲基化微阵列可大规模进行全基因组CpG甲基化分析。Infinium MethylationEPIC v1.0(EPICv1)芯片可检测超过450,000个CpG位点,而Infinium MethylationEPIC v2.0(EPICv2)更新并扩展了探针内容,将功能相关位点的覆盖范围增加到近930,000个CpG位点[6 (https://arxiv.org/html/2607.01307#bib.bib22)][7 (https://arxiv.org/html/2607.01307#bib.bib23)]。 IDAT文件中的这些原始强度由标准软件(例如minfi)读取,以进行质量控制、背景校正和归一化,然后转换为甲基化度量。最常见的度量是beta值,定义为甲基化信号强度相对于总信号的比例,通常计算为β = M / (M + U + α),其中M和U是甲基化和未甲基化强度,α是一个小的偏移量,用于在低强度下稳定估计。Beta值范围从0到1,提供了清晰直观的甲基化水平表示。 ## 3 Capper等人的分类器 在下文中,我们批判性地审视了Capper等人[3 (https://arxiv.org/html/2607.01307#bib.bib1)]提出的基于甲基化的分类器,不仅关注其突出的性能数据,更重要的是关注构成整个流程的方法学选择以及对它们进行论证的透明度。 ### 3.1 特征选择 Capper等人分类流程的基础步骤之一是对甲基化数据进行降维,原始数据每个样本包含约428,799个CpG探针。为了降维,作者应用了基于随机森林重要性分数的有监督特征选择策略,最终选择排名前10,000的探针作为模型训练的输入特征。 这个选择是一个固定的设计决策,但文章没有提供选择这个具体特征数量的理论或经验理由。没有任何迹象表明测试了替代阈值,也没有讨论保留更多或更少探针所涉及的权衡,尽管这样的选择对模型复杂性和生物学代表性有明显影响。鉴于这一步骤在建模过程中的重要性,这种缺乏透明度和方法学严谨性是分类器的一个显著缺陷。 ### 3.2 学习模型与校准协议 采用的核心分类模型是由10,000棵树组成的随机森林,使用固定的特征子集大小(mtry)为100进行训练,并采用下采样策略将每个树中每类样本限制为最多8个。这些选择对于任何集成模型的性能和行为都至关重要,但应用时没有进行讨论、基准测试或敏感性分析。没有理由解释为何选择10,000棵树(而不是更小、计算效率更高的集成)、固定的特征子集大小或可能扭曲类别先验的激进类别平衡策略。超参数调整或甚至对替代方案进行最小程度探索的缺失表明这些参数是任意选择的。这种方法直接违背了既定的机器学习实践。 除此之外,作者指出他们校准了随机森林的分数,但未能解释这是如何实现的。标准校准技术本质上是为二元分类设计的。要将其应用于多类别上下文,必须要么在一对多方案中校准每个类别,要么仅校准最终的“匹配vs不匹配”概率,正如[3 (https://arxiv.org/html/2607.01307#bib.bib1)]通过定义分类分数阈值(≥0.9)所隐含的那样。然而,论文没有提供关于校准是按类别、全局还是在匹配置信度上进行的事后校准的细节,整个校准机制不透明。 校准引入了第二个学习层,通常是一个回归模型,它可以调整随机森林输出中的偏差,但也存在掩盖原始模型系统性缺陷的风险。如果未正确嵌套在交叉验证折叠内,此步骤可能导致过拟合和过于乐观的概率估计,尤其是应用于已经从易泄漏的特征选择中受益的输出时。如果没有清晰描述校准方法及其与验证的集成,就不可能评估预测概率的可信度或临床安全性。 ### 3.3 性能报告 Capper等人报告
相似文章
使用CNN和ResNet架构的MRI图像脑肿瘤自动检测
本文提出了一种使用CNN和ResNet架构并结合迁移学习的自动化深度学习方法,用于MRI图像中的脑肿瘤检测,准确率高达97%。
基于分布的深度多实例学习在非小细胞肺癌肿瘤比例评分中的应用
介绍了一种基于分布的多实例学习框架,利用零膨胀贝塔建模,从组织病理学切片中改进非小细胞肺癌肿瘤比例评分的预测。
从丢失的溯源中学习:用于癌症登记肿瘤组分类的多实例学习
本文提出了一种基于注意力的多实例学习(ABMIL)框架,利用癌症登记处的患者级别标签来训练用于肿瘤组分类的深度学习分类器,无需每份报告的注释,在BC癌症登记处的任务上实现了0.83的宏F1。
基于多组学的乳腺癌预测机器学习模型基准测试
本文使用来自 TCGA-BRCA 的多组学数据,系统地基准测试了用于 ER 状态预测的经典机器学习模型(Random Forest、XGBoost 等),发现 RNA 表达提供了最强的预测信号,并且在整合的多组学设置中,Random Forest 达到了 90.3% 的平衡准确率。
用于乳腺癌复发预测的多模态机器学习
本文探讨了整合多模态临床数据(包括治疗记录、病理报告和临床医生笔记)的方法,通过基于规则的提取和机器学习,与单模态方法相比,提高乳腺癌复发预测的准确性。