一种可复现的日志驱动AutoML框架,用于医疗风险预测中可解释的流水线优化
摘要
本文介绍了yvsoucom-iterkit,一个确定性的日志驱动AutoML框架,用于医疗风险预测中可复现的流水线优化。在糖尿病和中风数据集上评估了超过18,000个流水线配置,取得了强劲的性能,并揭示了具有组件冗余的结构化搜索空间。
arXiv:2605.21528v1 Announce Type: new
Abstract: 准确且可复现的疾病风险预测仍然面临挑战,原因包括特征异质性、样本有限以及严重的类别不平衡。本研究介绍了yvsoucom-iterkit,一个确定性的日志驱动自动机器学习框架,它将流水线优化构建为一个完全可复现的配置级系统。每个流水线被编码为可追踪的日志实体,从而能够分析组件归因、交互、相似性和跨种子鲁棒性。在Pima Indians糖尿病和中风数据集上超过18,000个流水线配置的实验揭示了一个结构化且部分冗余的搜索空间,其中性能由一小部分交互组件主导。随机森林重要性分析识别出数据增强(0.454)、模型选择(0.198)和不平衡处理(0.101)是Pima数据集上的关键驱动因素,而不平衡处理主导了中风数据集(0.406)。组件相似性分析显示出强烈的冗余性:特征选择变体(biMax-biMean)的RMS距离仅为0.0252,mixup与无增强高度匹配(0.0279),TomekLinks与无不平衡处理对齐(0.0325),而高斯噪声与无增强的差异更大(0.10)。该框架使用集成模型取得了强劲且稳定的性能(Pima数据集:Weighted-F1 0.89,Macro-F1 0.88;中风数据集:Weighted-F1 0.94),但由于类别不平衡,Macro-F1在中风数据集上较低(0.67)。跨种子分析揭示了性能与鲁棒性之间的权衡,集成模型的变异性(0.023-0.026)低于SVM。这些结果表明,有效的AutoML优化可以专注于一组精简的高影响组件。
查看缓存全文
缓存时间: 2026/05/22 08:47
# 一种可重现的日志驱动型自动化机器学习框架,用于医疗风险预测中的可解释流水线优化
来源:https://arxiv.org/html/2605.21528
\[orcid=0000-0000-0000-0000\] 1\]organization=杭州师范大学基础医学院, addressline=浙江省杭州市余杭区余杭塘路2318号, city=杭州, postcode=311121, state=浙江, country=中国
\[orcid=0000-0002-9893-6135\]\\cormark\[1\] 2\]organization=杭州域智科技有限公司, addressline=, city=杭州, postcode=, state=浙江, country=中国
\\cortext \[cor1\]通讯作者
###### 摘要
准确且可重现的疾病风险预测仍然面临挑战,原因包括特征异质性强、样本有限以及严重的类别不平衡。本研究引入了 yvsoucom-iterkit,这是一个确定性的、日志驱动的自动化机器学习框架,它将流水线优化形式化为一个完全可重现的配置级系统。每条流水线被编码为一个可追溯的日志实体,从而能够分析组件归因、交互、相似性以及跨种子的鲁棒性。在皮马印第安人糖尿病和中风数据集上,对超过 18,000 条流水线配置进行的实验揭示了一个结构化的、部分冗余的搜索空间,其中性能由一小部分相互作用的组件决定。随机森林重要性分析表明,在皮马数据集上,数据增强 (0.454)、模型选择 (0.198) 和不平衡处理 (0.102) 是关键驱动因素,而不平衡处理在中风数据集上占主导地位 (0.407)。组件相似性分析显示出很强的冗余性,特征选择变体 (biMax–biMean) 的均方根距离较低 (0.0252),mixup 与无增强非常接近 (0.0279),TomekLinks 与无不平衡处理一致 (0.0325),而高斯噪声与无增强的差异更大 (0.10)。该框架使用集成模型取得了强劲且稳定的性能(皮马数据集上加权 F1 为 0.89,宏 F1 为 0.88;中风数据集上加权 F1 为 0.94),而由于类别不平衡,中风数据集上的宏 F1 较低 (0.67)。跨种子分析揭示了一种性能-鲁棒性权衡,集成模型的变异性 (0.023–0.026) 低于 SVM。这些结果表明,有效的 AutoML 优化可以聚焦于一小部分高影响力组件。
###### 关键词:
自动化机器学习\\sep日志驱动系统\\sep可重现机器学习\\sep流水线优化\\sep类别不平衡\\sep医疗风险预测\\sep模型可解释性
{highlights}
- 一个确定性、日志驱动的 AutoML 框架,可实现完全可重现且可追溯的流水线优化
- 大规模评估(18,000+ 条流水线)揭示了结构化的、部分冗余的 AutoML 搜索空间
- 性能由一小部分相互作用的组件决定
- 集成模型取得了强劲且稳定的性能(皮马数据集上宏 F1 ≈ 0.88;中风数据集上加权 F1 ≈ 0.94),而中风数据集在严重类别不平衡下宏 F1 降低(≈ 0.67)
- 跨种子分析揭示了一种性能-鲁棒性权衡,集成模型更稳定(σ ≈ 0.023–0.026),而 SVM 则不然
## 1 引言
慢性疾病,如糖尿病和脑血管疾病,是全球主要的健康挑战,影响着全球数亿人。早期识别高风险个体对于及时干预和减少严重并发症(包括心血管和神经系统疾病)至关重要。随着结构化临床数据的日益丰富,机器学习 (ML) 技术已成为医疗风险预测的重要工具,能够从异质性临床属性中发现复杂模式\[HaibeKains2020\]。
尽管取得了显著进展,开发可靠的基于 ML 的医疗预测模型仍然面临挑战。临床数据集通常规模小、不平衡且异质性强,模型性能对预处理决策(包括特征选择、归一化和数据增强)高度敏感。许多现有研究依赖于手动设计或优化不充分的流水线,限制了跨数据集和临床场景的可重现性和泛化能力。
自动化机器学习 (AutoML) 通过实现模型架构和超参数的数据驱动探索,已成为一种有前景的解决方案。然而,大多数现有的 AutoML 框架,如 Auto-sklearn、TPOT 和 AutoGluon,主要关注模型选择和超参数优化,而将预处理和数据转换步骤视为固定或仅松散优化的组件。因此,预处理策略与学习算法之间的复杂相互作用仍未得到充分探索,特别是在样本小且不平衡的医疗数据集中,这些相互作用至关重要。
为了解决这些局限性,我们提出了 yvsoucom-iterkit,这是一个以流水线为中心的 AutoML 框架,它在统一的搜索空间中联合优化预处理和建模过程。该框架将特征选择、归一化、数据增强、类别不平衡处理和分类模型视为一等公民组件,从而能够系统地探索它们的组合。它作为一个完全自动化且可重现的实验引擎运行,能够在无需人工干预的情况下生成、执行和评估数千条流水线配置。
与我们之前的工作\[huang2026\_ssrn\]相比,本研究通过引入额外的数据集、扩展流水线搜索空间以及引入全面的跨种子评估以评估鲁棒性,显著扩展了所提出系统的范围和严谨性。此外,该框架集成了自动日志记录和统计分析模块,使得在大规模实验中进行透明且可重现的基准测试成为可能。
为了评估所提出系统的有效性和通用性,我们在两个代表性的医疗预测任务上进行了广泛实验:使用皮马印第安人糖尿病数据集进行糖尿病风险预测,以及使用医疗中风数据集进行中风风险预测。这些数据集在特征组成、类别分布和临床背景方面存在显著差异,为评估鲁棒性和可迁移性提供了严格的测试平台。实验结果表明,所提出的框架能一致地识别出高性能且稳定的流水线配置,凸显了在预处理和建模阶段进行联合优化的重要性。
尽管本研究聚焦于两个代表性的医疗任务,但所提出的框架被设计为一个用于结构化数据的通用 AutoML 系统。它支持预处理和建模策略的灵活组合,并可轻松应用于涉及分类预测任务的其他领域。本工作的主要贡献和发现总结如下:
- **•** 我们提出了一个以流水线为中心的 AutoML 框架,该框架在统一的、完全可重现的配置空间中联合优化预处理、数据增强、不平衡处理和分类模型,用于医疗数据分析。
- **•** 我们引入了一种日志驱动 (LogDir) 的执行范式,通过将每条流水线配置与其性能结果相关联,实现透明且可追溯的大规模实验。
- **•** 我们在皮马和中风数据集上对 18,000 多条流水线配置进行了大规模评估,支持从原始指标分布到流水线级行为、组件级归因、跨组件交互以及跨种子鲁棒性的多层次分析。
- **•** 我们发现 AutoML 搜索空间高度结构化且部分冗余,许多配置产生近乎等效的性能,只有一小部分组件驱动性能变化。
- **•** 我们发现集成模型始终在准确性和鲁棒性之间实现最佳平衡,而高容量模型(如 SVM)对不同种子的随机变化表现出更高的敏感性。
- **•** 我们识别出强烈的数据集依赖性行为:皮马数据集表现出相对稳定的性能景观,而中风数据集由于严重的类别不平衡而表现出明显的敏感性。
本文的其余部分组织如下。第 2 节 (https://arxiv.org/html/2605.21528#S2) 回顾了医疗预测和 AutoML 的相关工作。第 3 节 (https://arxiv.org/html/2605.21528#S3) 介绍了所提出的方法论和框架。第 4 节 (https://arxiv.org/html/2605.21528#S4) 报告了实验结果,随后在第 5 节 (https://arxiv.org/html/2605.21528#S5) 和第 6 节 (https://arxiv.org/html/2605.21528#S6) 进行了讨论和总结。
## 2 相关工作
### 2.1 自动化机器学习
自动化机器学习 (AutoML) 已发展成为一种核心范式,通过自动化算法选择、超参数调整以及在有限程度上进行流水线构建,来减少模型开发中的人工工作量\[hutter2019automated, HE2021106622\]。早期的系统,如 Auto-WEKA\[Thornton2013\],将组合算法选择和超参数 (CASH) 问题形式化,并使用贝叶斯优化来解决。后续的方法,包括 TPOT\[Olson2016\],引入了进化策略来探索流水线配置,而 Auto-sklearn\[Feurer2015, Feurer2022\] 则结合了元学习和集成构建以提高效率和鲁棒性。最近的框架,如 AutoGluon\[Erickson2020AutoGluon\] 和 H2O AutoML\[LeDell2020H2O\],进一步强调了在大规模应用中的可扩展性和集成学习。
尽管取得了这些进展,现有的 AutoML 系统在很大程度上仍然保留了一种*以模型为中心的优化范式*。预处理操作——如特征选择、归一化和数据增强——通常被视为辅助性或弱参数化的组件,而不是搜索空间中的一等公民\[Zoller2021Benchmarking\]。即使探索了流水线结构(例如 TPOT),搜索过程也往往是随机的且不透明的,限制了可解释性和可重现性。此外,大多数框架将预测性能作为主要目标,而对鲁棒性、变异性以及跨运行统计可靠性的考虑有限\[Bischl2023Hyperparameter\]。
这些局限性在医疗场景中尤其具有约束性,因为模型行为对预处理选择和数据结构高度敏感。因此,现有的 AutoML 方法只能提供部分自动化,且缺乏进行系统性流水线级分析所需的透明度。
### 2.2 医疗数据中的预处理与不平衡学习
由于医疗数据集的内在特征,包括样本量小、特征类型异质性强以及严重的类别不平衡,预处理是临床机器学习中模型性能的关键决定因素。特征选择方法,特别是基于信息论的方法,如信息增益和互信息,已被广泛采用以提高泛化能力并减少过拟合\[Guyon2006, Chandrashekar2014, li2017feature\]。包装法和嵌入法进一步扩展了这些方法,但通常会增加额外的计算复杂性和不稳定性\[Saeys2007Feature\]。
类别不平衡进一步使预测建模复杂化。诸如 SMOTE\[Chawla2002SMOTE\]、Tomek Links\[Tomek1976\] 和混合重采样方法(例如 SMOTEENN\[Batista2004SMOTEENN\])等技术旨在重新平衡类别分布。最近的方法,包括 ADASYN\[He2008ADASYN\] 和 MixUp\[zhang2018mixup\],引入了自适应或插值增强以改进泛化能力。成本敏感学习和焦点损失机制也被提出来在算法层面解决不平衡问题\[Lin2017FocalLoss\]。
尽管这些方法在特定场景下已被证明有效,但它们通常是在隔离或手动构建的流水线中进行评估。因此,它们的组合效果、交互作用和权衡仍然理解不足。此外,先前的研究很少探讨预处理决策如何不仅影响预测准确性,还影响*在随机变化下的稳定性*,而这一点对于临床环境中的可靠部署至关重要。
### 2.3 机器学习在医疗风险预测中的应用
机器学习技术已被广泛应用于医疗风险预测任务,包括糖尿病诊断和中风预测。集成方法,如随机森林\[Breiman2001\] 和 XGBoost\[chen2016xgboost\],由于能够建模非线性关系并处理特征交互,常常被报道在结构化临床数据上表现强劲\[sarwar2020diagnosis\]。梯度提升框架在表格领域也表现出优于深度学习方法的表现\[Grinsztajn2022Tabular\]。
大量关于皮马印第安人糖尿病数据集和中风预测基准的研究报告,通过定制化的预处理和模型调整组合获得了改进的性能\[pati2023review, patil2013performance, Singh2025StrokeML\]。深度学习方法,包括多层感知机和混合架构,也已被探索,但通常需要大量的调整和更大的数据集才能达到竞争性表现\[Shickel2018DeepEHR\]。
然而,这些方法通常是数据集特定的,并且依赖于手动或启发式设计选择。因此,它们的结论往往难以泛化,并且由于实验配置报告不完整,可重现性有限\[Pineau2021ImprovingReproducibility\]。更重要的是,现有研究主要侧重于优化单一流水线或一小部分配置,而不是系统地探索更广泛的流水线空间。这限制了我们识别可泛化模式、量化变异性或理解不同流水线组件相对重要性的能力。
### 2.4 研究空白与贡献
以上分析揭示了当前研究中的一个基本空白:缺乏一个统一的、可重现的、可系统分析的、用于结构化医疗数据中*以流水线为中心* AutoML 的框架。现有的 AutoML 系统强调模型级优化,但缺乏对预处理-模型交互的透明且确定性的探索。相反,关于预处理和医疗预测的研究为个体技术提供了有价值的见解,但未能将它们整合到一个可扩展且可重现的实验框架中。此外,鲁棒性和随机敏感性很少被纳入评估协议,尽管它们在实际临床部署中非常重要。
为了解决这些局限性,我们提出了 yvsoucom-iterkit,一个以流水线为中心的 AutoML 框架,它在统一的、完全可枚举的搜索空间中显式地建模预处理操作、增强策略、不平衡处理和分类算法。与先前的方法不同,所提出的系统采用了一种*日志驱动且确定性的执行范式*,从而能够实现:
- **•** 对数千条流水线配置进行系统且详尽的探索,
- **•** 通过结构化日志记录所有实验细节实现完全可重现性,
- **•** 组件级和交互级统计分析,
- **•** 以及通过多种子实验进行鲁棒性评估。
这种设计将 AutoML 从一个黑盒优化问题转变为一个透明且可分析的实验过程,从而能够更深入地理解流水线组件如何影响预测性能、稳定性和交互作用。相似文章
DoctorAgents:一个面向小型临床时序数据迭代优化AutoML流程的智能体框架
本文提出DoctorAgents,一种智能体AI框架,利用专门的LLM智能体对小型、异质性临床时序数据集进行端到端机器学习流程的迭代生成、验证与优化,性能优于成熟的AutoML基线方法。
TRIAGE:利用LLM对不规则采样的医学时间序列进行可解释风险预测的辩证推理
TRIAGE是一个框架,训练LLM从不规则采样的医学时间序列中生成辩证推理以进行连续风险评分,从而改善校准性和可解释性。
机器学习用于2型糖尿病风险预测的综合评估:大规模外部验证与公平性分析
本文构建了一个多维框架,用于评估基于机器学习的2型糖尿病风险预测模型的区分度、校准度、可解释性和算法公平性,揭示了在现实世界分布偏移下性能显著下降以及按年龄和肥胖程度存在的偏差。
从结构化临床数据预测心血管风险的大语言模型
本文提出了一种混合框架,将结构化临床数据与LLM生成的叙述相结合,用于冠状动脉疾病预测,在变量提取方面实现了高保真度,并比较了机器学习模型与基于LLM的零样本和少样本分类。
加速合成电子健康记录生成中的可重复研究
本文介绍了一个轻量级、端到端的基准测试框架,用于可重复的合成电子健康记录(EHR)生成,将多个基线模型(MedGAN、CorGAN、PromptEHR、HALO)和一个GPT-2基线统一到单个流水线中,并配备严格的隐私-效用评估套件。