MS-MLB:基于血液的MS分类的开放机器学习基准
摘要
本文介绍了MS-MLB,这是一个开放机器学习基准,利用公开的GSE17048队列,从全血RNA表达数据中对多发性硬化症进行分类。它提供了一个可重复、受泄漏控制的评估流程,并报告梯度提升(Gradient Boosting)为表现最佳的方法。
arXiv:2608.05196v1 公告类型:新
摘要:多发性硬化症(MS)通过临床评估、磁共振成像、适当的实验室证据以及排除更佳解释来诊断。血液RNA表达数据可能包含疾病相关的免疫信号,但血液RNA分类器不能替代临床诊断。本文介绍了MS-MLB(多发性硬化症机器学习基准),这是一个可复现的开放基准,用于从全血RNA表达数据中进行基于机器学习的MS研究分类。MS-MLB使用公开的GSE17048队列,将其转换为MS与健康对照的分类任务,并在一个共享的、受泄漏控制的流程下评估多种算法,研究人员无需重新配置评估即可重新运行。评估包括嵌套交叉验证、未触碰的分层留出集、自助法置信区间、ROC和精确率-召回率分析、校准测量以及探索性的MS研究评分。在最终基准总结中,梯度提升(Gradient Boosting)在留出集上按MS研究评分排名第一,MS研究评分为93.83,AUC-ROC为0.989,敏感性为0.950,特异性为0.778,$F_{1}$得分为0.927,Brier得分为0.050。先前的研究已将机器学习应用于MS血液转录组数据,包括PBMC分期分类和全血诊断特征建模。本文的贡献不同且更为聚焦。据我们所知,MS-MLB是首个专注于从GSE17048全血RNA表达数据中进行MS与健康对照分类的开放基准,并在框架内内置了有文档说明的外部模型提交路径。该评分仅用于研究比较,未经临床验证。该基准可在此访问:https://github.com/duckyquang/MS-MLB
查看缓存全文
缓存时间: 2026/08/07 07:48
# MS-MLB:一个基于血液的MS分类开放机器学习基准 来源:https://arxiv.org/html/2608.05196 ###### 摘要 多发性硬化(MS)通过临床评估、磁共振成像、适当时结合实验室证据,并排除更合理的解释来诊断。血液RNA表达数据可能包含与疾病相关的免疫信号,但血液RNA分类器不能替代临床诊断。本文提出了MS-MLB(Multiple Sclerosis – Machine Learning Benchmark,多发性硬化——机器学习基准),一个可复现的开放基准,用于基于全血RNA表达数据的机器学习MS研究分类。MS-MLB使用公共GSE17048队列,将其转化为MS与健康对照的分类任务,并在一个共享的、防止数据泄漏的流水线中评估多种算法,研究者无需重新配置评估即可重新运行。该评估包括嵌套交叉验证、未触碰的分层留出集、自助法置信区间、ROC与精确率-召回率分析、校准测量,以及一个探索性的MS研究评分。在最终基准汇总中,Gradient Boosting在留出集上的MS研究评分排名第一,MS研究评分为93.83,AUC-ROC为0.989,灵敏度为0.950,特异度为0.778,\(F_1\)分数为0.927,Brier分数为0.050。已有研究将机器学习应用于MS血液转录组数据,包括PBMC分期分类和全血诊断特征建模。本文的贡献不同且更聚焦。据我们所知,MS-MLB是第一个专注于从GSE17048全血RNA表达数据中进行MS与健康对照分类的开放基准,并在框架内内置了文档化的外部模型提交途径。该评分仅用于研究比较,尚未经过临床验证。基准访问地址:https://github.com/duckyquang/MS-MLB。 ## I 引言 多发性硬化是一种中枢神经系统的慢性免疫介导疾病。2017年修订的McDonald标准描述了通过临床证据、空间和时间上的播散,以及排除更可能诊断来进行诊断的方法[1 (https://arxiv.org/html/2608.05196#bib.bib1)]。这些标准界定了本文的边界。基于血液表达谱训练的模型可以支持研究分类任务,但不能在没有临床解读的情况下在真实患者中确立MS诊断。 血液RNA表达在科学上相关,因为MS涉及中枢神经系统之外以及内部的免疫活动。全血包含循环免疫细胞、来自免疫激活的RNA信号,以及与治疗相关的表达变化。这些信号可能有助于在带标签的队列中区分MS患者和健康对照。它们也可能反映亚型组成、药物暴露、年龄、性别或批次效应。这些可能信号的混合使得仔细的基准测试成为必要。 GSE17048队列提供了144名个体的全血mRNA表达数据,包括99名MS患者和45名健康对照[2 (https://arxiv.org/html/2608.05196#bib.bib2)]。MS组包括原发进展型、复发缓解型和继发进展型样本。因此,该数据集适用于合并的MS与健康对照任务。它对于强有力的临床主张来说规模太小,但足以测试一个可复现的机器学习流水线能否在固定规则下比较算法。 核心问题在于特征与样本之间的比率。全血表达数据集可能包含数千个测量特征,而样本数仍然很少。在这种情况下,模型可能看似准确,因为来自验证或测试样本的信息意外进入了模型开发。交叉验证之前的特征选择是微阵列分类中性能膨胀的已知来源[4 (https://arxiv.org/html/2608.05196#bib.bib4)]。当调参和报告在同一个重采样循环上执行时,模型选择也可能过度拟合验证过程[3 (https://arxiv.org/html/2608.05196#bib.bib3)]。 MS-MLB通过“基准优先”的设计来应对这一问题。它定义了一个开放评估路径,使标准算法以及后来的外部模型在相同的预处理、调参、评分和输出结构下接受测试。通过固定这些决策一次并将其暴露在单一入口点,框架将正确评估的负担从每个单独用户转移到共享基础设施上。这是本文的具体新颖性声明。先前的MS血液转录组学研究已经存在,包括PBMC机器学习分期分类器和全血转录组诊断研究[10 (https://arxiv.org/html/2608.05196#bib.bib10),11 (https://arxiv.org/html/2608.05196#bib.bib11)]。据我们所知,还没有一篇论文将开放的GSE17048全血RNA基准与外部模型提交作为核心研究对象。 研究问题是:一个可复现的机器学习基准能否比较从全血RNA表达数据中进行MS与健康对照分类的算法,同时减少常见的评估偏差并允许外部模型比较?答案通过嵌套交叉验证、留出测试、自助法置信区间、校准分析和探索性的MS研究评分来评估。 本文还将基准测试视为一个可复现性问题。如果后来的读者看不到分割方式、特征选择时机、类别平衡方法或评分公式,就很难比较所报告的AUC。开放代码不能解决所有科学问题,但它给了其他研究者一个可以检查的具体对象。这就是为什么本文将论文定义为开放基准,而非封闭模型报告。 这种框架对于早期生物医学机器学习研究尤其相关。许多论文和基准训练若干模型并报告最高准确率。这种格式在组学数据中可能具有误导性。一个可复现的基准反而要求完整的评估路径:使用了哪些数据、预处理何时拟合、调参如何与测试分离、保存了哪些输出,以及如何提交另一个模型。通过直接编码这些步骤,MS-MLB让经验较少的用户默认遵循正确的评估路径,而不是从零散惯例中重建。本文将这一路径作为研究产物。 ## II 方法 ### II-A 数据来源与任务定义 该基准使用公共Gene Expression Omnibus数据集GSE17048。GEO记录表明,对144名个体的全血中所有已知基因进行了mRNA表达测量,包括99名MS患者和45名健康对照[2 (https://arxiv.org/html/2608.05196#bib.bib2)]。MS样本包括43例原发进展型MS、36例复发缓解型MS和20例继发进展型MS[2 (https://arxiv.org/html/2608.05196#bib.bib2)]。在本基准中,所有MS亚型被合并为一个阳性类别,标记为MS。健康对照标记为HC。 合并亚型增加了可用于训练的正样本数量,但也限制了解释。该模型应被解读为针对该队列的合并MS与健康对照分类器。它不区分疾病亚型,不估计进展风险,也不对临床孤立综合征进行建模。这些任务需要针对这些问题设计的数据集。 ### II-B 仓库实现 MS-MLB在Python中实现,位于Blood-RNA-ML-benchmark仓库[9 (https://arxiv.org/html/2608.05196#bib.bib9)]。存储的运行使用随机种子42,分层80%训练和20%留出分割,五个外层交叉验证折,三个内层交叉验证折,2000个自助法样本,按最大方差筛选至1000个特征,监督式SelectKBest特征选择最多200个特征,以及使用三个最近邻的SMOTE[9 (https://arxiv.org/html/2608.05196#bib.bib9)]。分割后,未触碰的留出集包含29个样本。 仓库存储了数据集文件、主基准脚本、示例外部模型代码、输出文件和运行元数据。README将本文描述为一个用于使用全血RNA表达数据进行MS分类的出版风格机器学习基准测试框架[9 (https://arxiv.org/html/2608.05196#bib.bib9)]。运行元数据记录了评分权重,并包含直接警告:MS研究评分是探索性的,不是经过验证的临床诊断评分[9 (https://arxiv.org/html/2608.05196#bib.bib9)]。 ### II-C 预处理与泄漏控制 每个估计器都被置于一个不均衡学习流水线中。该流水线依次应用中位数填充、最大方差筛选、标准缩放、基于ANOVA的监督式SelectKBest特征选择、SMOTE,然后是分类器。这些步骤仅在交叉验证期间的当前训练折内拟合。相同的规则适用于最终留出评估之前。这一设计是基准的技术核心。 在基因表达工作中,泄漏问题很容易被忽略,而且即使是谨慎的用户也可能无意中犯这个错误。如果在交叉验证之前对完整数据集执行监督式特征选择,验证标签会影响所选基因集。Ambroise和McLachlan表明,这会使微阵列分类器的误差估计产生偏差[4 (https://arxiv.org/html/2608.05196#bib.bib4)]。MS-MLB通过将监督式选择置于特定折的流水线内,将这个失败模式从用户手中移除。SMOTE也在流水线内,因此仅在每次分割的训练部分生成合成少数类样本[5 (https://arxiv.org/html/2608.05196#bib.bib5)]。 ### II-D 模型注册表 基准比较了Logistic Regression、Support Vector Machine、Random Forest、Gradient Boosting、K-Nearest Neighbors、Naive Bayes、Neural Network和Stacking Ensemble。仓库还包括在包可用时的XGBoost支持,尽管本文讨论的已存储留出输出不包含XGBoost结果行。超参数通过内层交叉验证循环中的网格搜索进行调优,使用AUC-ROC作为优化目标。 这个模型集覆盖了线性、基于核的、基于树的、基于距离的、概率性、神经网络和集成方法。目的是在一个受控框架下进行比较。一个更简单的模型如果表现良好且比更复杂的模型泛化更好,仍然可以具有科学价值。因此,基准报告完整排行榜,而不是选择单个模型并隐藏其余模型。 ### II-E 指标与评分设计 基准报告准确率、平衡准确率、灵敏度、特异度、精确率、\(F_1\)分数、Matthews相关系数、AUC-ROC、PR-AUC和Brier分数。AUC-ROC衡量跨阈值的排序性能。PR-AUC提供关于阳性类别性能的额外信息。灵敏度衡量正确标记为MS的MS样本比例。特异度衡量正确标记为健康对照的健康对照样本比例。Brier分数衡量概率误差。 MS研究评分是一个从0到100的加权分数。公式为: MS研究评分 = 100 × [ 0.25 × AUC-ROC + 0.15 × PR-AUC + 0.25 × 灵敏度 + 0.15 × 特异度 + 0.10 × \(F_1\) + 0.10 × (1 − Brier分数) ] 该评分对区分能力和灵敏度给予较高权重,同时保留特异度、\(F_1\)、PR-AUC和校准。权重是研究选择,不是临床权重。 评分细分——前3个模型: 每个指标如何贡献最终MS诊断评分 参见标题 图1:对MS研究评分的多指标贡献分解。并排条形图分离出表现最好的三个模型(Stacking Ensemble、SVM和Neural Network),展示了包括ROC曲线下面积(AUC-ROC)、召回率、\(F_1\)分数、精确率和Brier分数在内的单个指标如何被加权,以计算最终的复合研究指标。每个条形反映基于底层基准公式对总分(满分100)贡献的绝对分数。 ### II-F 外部模型途径 MS-MLB允许外部研究者通过一个单一的、文档化的接口添加自己的模型。用户可以提供定义`EXTERNAL_MODELS`字典的Python文件,或以joblib或pickle格式提供预训练模型文件。可调优的外部估计器会自动包装在相同的预处理流水线中,因此提交者无需重新实现泄漏控制。预训练模型可以按原样测试,但如果其训练数据、特征顺序或预处理历史未知,比较则较弱。将提交保持为单一入口点是故意的:它降低了进行公平比较所需的工作量,并减少了用户可能引入错误的环节。 这一外部模型路径是“首次”声明的一部分。先前的MS转录组机器学习研究已报告了分类器和生物标志物特征[10 (https://arxiv.org/html/2608.05196#bib.bib10),11 (https://arxiv.org/html/2608.05196#bib.bib11),12 (https://arxiv.org/html/2608.05196#bib.bib12)]。本文为同一基准任务定义了一个可复用的比较接口。因此,研究者可以扩展该基准,在不重写评估系统的情况下,测试估计器与已存储基线的对比。 ### II-G 可复现性输出 仓库保存了留出结果、嵌套交叉验证摘要、自助法置信区间、ROC输出、模型比较表、图表和运行元数据。元数据文件记录了随机种子、测试集大小、交叉验证设置、自助法次数、特征选择设置、SMOTE设置、标签、外部模型文件、评分权重、Python版本和平台[9 (https://arxiv.org/html/2608.05196#bib.bib9)]。这些文件很有用,因为它们允许在运行后检查结果,而不是仅通过文字重新构建结果。 ### II-H 标签处理与类别不均衡 正类是MS,负类是健康对照。分割采用分层方式,以尽可能在训练和留出分区中保持类别比例。类别不均衡通过训练流水线内的SMOTE处理。这避免了在分割之前创建合成观察。SMOTE仅用于每个折的训练部分,这使验证和留出样本保持在重采样步骤之外。 ### II-I 嵌套交叉验证原理 嵌套交叉验证将超参数选择与性能估计分离。内层循环选择模型设置。外层循环估计调优后的模型在保留的训练折上的行为。这一点很重要,因为最佳超参数集可能部分是因为它拟合了小数据集中的噪声而被选中[3 (https://arxiv.org/html/2608.05196#bib.bib3)]。因此,非嵌套网格搜索可能给出乐观的估计。基准将嵌套估计保留在输出中,使最终留出结果不是呈现的唯一证据。 ### II-J 自助法不确定
相似文章
基于多组学的乳腺癌预测机器学习模型基准测试
本文使用来自 TCGA-BRCA 的多组学数据,系统地基准测试了用于 ER 状态预测的经典机器学习模型(Random Forest、XGBoost 等),发现 RNA 表达提供了最强的预测信号,并且在整合的多组学设置中,Random Forest 达到了 90.3% 的平衡准确率。
一种基于DNA甲基化的中枢神经系统肿瘤分类的新机器学习方法
本文提出了一种结合稀疏随机投影与多项逻辑回归的新型机器学习方法,用于从DNA甲基化数据中对中枢神经系统肿瘤进行分类,其准确率较现有方法提高了4-5个百分点,达到了最先进水平。
用于乳腺癌复发预测的多模态机器学习
本文探讨了整合多模态临床数据(包括治疗记录、病理报告和临床医生笔记)的方法,通过基于规则的提取和机器学习,与单模态方法相比,提高乳腺癌复发预测的准确性。
多发性硬化症诱导的脑损伤模拟联邦分析
本文介绍了一个用于多发性硬化症(MS)脑损伤联邦分析的模拟框架,该框架将图像分割与临床数据分析相结合,在保护患者隐私的同时测试联邦学习方法。
生物医学拉曼光谱的机器学习:从光谱采集到临床转化
本综述考察了机器学习在生物医学拉曼光谱流程中的作用,从预处理和信号校正到临床转化,强调了可靠Raman-AI系统的障碍和未来方向。