重新思考如何评估健康人工智能中的方法学进展
摘要
本文重新实现了12种历史和近期算法,以研究在健康人工智能中评估电子健康记录方法学进展的障碍,发现综合算法比较在任务和数据集之间具有迁移性,但临床有意义的任务表现出更大的任务-算法交互作用。
arXiv:2609.18134v1 Announce Type: new
摘要: 电子健康记录(EHRs)中人工智能(AI)的方法学进展取决于我们确定哪些算法在何种条件下表现更好的能力。然而,这种进展被认为受到可重复性困难和定义临床有意义评估任务的障碍的阻碍。我们通过在一个共享评估框架内重新实现12种历史和近期算法,并在两个临床数据集MIMIC-IV和NWICU上评估它们,来实证研究这些障碍。我们比较了两个互补的任务族:专家编写的临床有意义任务和基于随机抽样事件代码和预测时间范围定义的生成任务。我们询问相对算法比较是否在任务族和数据集之间迁移,残余任务异质性是否包含有用的方法学结构,以及受控比较揭示了过去十年的进展如何。我们发现综合成对比较在评估设置之间强烈迁移,包括从随机生成任务到临床有意义任务以及跨数据集。同时,临床有意义的任务表现出更大的任务-方法交互作用,提供了初步证据表明任务属性可以帮助解释何时特定建模选择是有利的。最后,新算法并不总是优于早期方法:梯度提升树在与现代、广泛且稀疏的EHR表示配对时仍然具有高度竞争力。总之,这些结果表明有用的方法学知识可能比通常假设的需要更少的任务工程,同时强调了理解跨任务和方法中残留的结构异质性的重要性。
查看缓存全文
缓存时间: 2026/09/17 09:17
# 重新思考我们评估健康人工智能方法学进展的方式 来源:https://arxiv.org/html/2609.18134 Matthew McDermott 电子邮件:[[email protected]](mailto:[email protected]) 隶属:哥伦比亚大学生物医学信息学系 ###### 摘要 电子健康记录(EHR)领域的人工智能(AI)方法学进展,取决于确定哪些算法在何种条件下表现更优。然而,这种进展被认为受到了可复现性困难以及难以定义临床有意义评估任务的阻碍。我们通过重新实现12个历史及近期算法,将其置于一个共享的评估框架内,并使用两个临床数据集(MIMIC-IV 和 NWICU)进行评估,对这些障碍进行了实证研究。我们比较了两个互补的任务类别:由专家编写的临床有意义任务,以及从随机抽样的事件代码和预测时间范围定义的生成任务。我们探讨了以下问题:相对的算法比较在不同任务类别和数据集之间是否可迁移;残余的任务异质性是否包含有用的方法学结构;以及受控比较揭示了过去十年的哪些进展。总体的配对比较在不同评估设置之间表现出强烈的可迁移性,包括从随机生成任务到临床有意义任务,以及跨数据集的迁移。同时,临床有意义的任务表现出更强的任务-算法交互作用,提供了初步证据表明任务属性可能有助于解释特定建模选择在何种情况下具有优势。最后,更新的算法并未一致地优于早期方法:梯度提升树在与高容量、宽而稀疏的EHR表示结合时,仍然极具竞争力。总之,这些结果表明,有用的方法学知识可能并不像通常假设的那样需要大量的任务设计,同时也凸显了理解任务和算法之间持续存在的结构化异质性的必要性。 ††workshop:Machine Learning for Health \(ML4H\) 2026††proceedings:: Submitted to ML4H 2026:\\mlhtrackname††workshop:Machine Learning for Health \(ML4H\) 2026###### 关键词 电子健康记录,评估,健康人工智能 ## 1 引言 人工智能(AI)应用于结构化电子健康记录(EHR)数据,有望彻底改变患者护理\[30 (https://arxiv.org/html/2609.18134#bib.bib3), 2 (https://arxiv.org/html/2609.18134#bib.bib33), 27 (https://arxiv.org/html/2609.18134#bib.bib34), 29 (https://arxiv.org/html/2609.18134#bib.bib35)\],并在科学界和媒体中获得了越来越多的关注\[32 (https://arxiv.org/html/2609.18134#bib.bib4), 21 (https://arxiv.org/html/2609.18134#bib.bib5)\]。尽管如此,许多研究人员仍然担忧该子领域的方法学进展和严谨性\[18 (https://arxiv.org/html/2609.18134#bib.bib6), 1 (https://arxiv.org/html/2609.18134#bib.bib7)\],他们认为,该领域大量的研究并未能实质性地帮助我们回答关键的方法学问题,例如某些算法在给定的数据集和任务上为何以及何时优于其他算法\[8 (https://arxiv.org/html/2609.18134#bib.bib8)\]。评论者指出了阻碍严谨方法学进展的许多可能障碍,包括:(i) 定义足够临床有意义的评估任务以表征AI算法的困难\[1 (https://arxiv.org/html/2609.18134#bib.bib7), 20 (https://arxiv.org/html/2609.18134#bib.bib12)\];以及 (ii) 长期存在的可复现性和可迁移性危机,阻碍了跨研究复制任务定义或重用模型代码\[16 (https://arxiv.org/html/2609.18134#bib.bib11), 11 (https://arxiv.org/html/2609.18134#bib.bib13), 18 (https://arxiv.org/html/2609.18134#bib.bib6)\]。 虽然有实证证据表明可复现性危机阻碍了方法学知识的积累——例如,Johnson等人\[11 (https://arxiv.org/html/2609.18134#bib.bib13)\]发现神经网络算法相对于梯度提升树报告的性能提升在复现时常常发生逆转——但障碍 (i) 所获得的实证描述却非常有限。具体而言,我们尚不清楚在临床“无意义”任务上识别出的算法间相对比较(例如,当算法1和算法2在给定数据集和任务上从头开始训练时,算法1是否优于算法2)是否与在高质量、专家确定的任务上进行的相同比较一致。如果在这两种环境下得出的结论高度相似——并且越来越多来自其他机器学习领域评估的证据表明这是合理的\[26 (https://arxiv.org/html/2609.18134#bib.bib17)\]——那么该领域的法学进展将比之前预期的更容易实现,为深入了解不同算法在多样化临床环境中的相对性能开辟新途径。 在这项工作中,我们通过一个共享的实现和评估框架,实证研究了这个问题,以及健康人工智能中更普遍的方法学进展。我们使用一个基于MEDS的公共接口\[15 (https://arxiv.org/html/2609.18134#bib.bib14)\],重新实现了一系列历史和近期的ICU及EHR模型(注:由于我们的模型是复现结果,我们的发现并不意味着原始作者的结果无效;我们对任何给定模型的复现本身可能存在错误或缺陷。未咨询被重新实现模型的作者),并在两个公开的临床数据集——MIMIC-IV\[10 (https://arxiv.org/html/2609.18134#bib.bib1)\]和NWICU\[19 (https://arxiv.org/html/2609.18134#bib.bib2)\]上进行评估,评估范围涵盖临床有意义的任务(由专家明确编写以捕获有意义的预测)和随机生成的任务(这些任务询问来自数据词汇表的随机抽样代码是否会在随机抽样的时间范围内发生,且无需临床策划)。我们利用我们的研究结果来回答三个关键问题: **Q1:** 算法的排名和比较在不同评估设置(如跨数据集,或在临床有意义任务与随机生成任务之间)是否一致? **Q2:** 除了全局排名的一致性外,是否有证据表明任务、算法和数据集属性之间存在共享结构,这可以告诉我们特定算法在目标设置中何时可能表现良好? **Q3:** 当过去十年开发的算法在共同的实现、训练和评估框架中进行评估时,如果有任何证据,会出现什么样的方法学进展证据? 我们的分析表明:(1) 关于算法性能的比较性结论在不同评估设置之间具有统计显著的相似性,特别是在临床有意义任务和随机生成任务之间,这表明障碍 (i) 可能不是方法学研究的主要障碍;(2) 有初步但有意义的证据表明任务、数据集和算法之间存在共享结构,*尤其是在临床有意义的任务上*,这暗示了未来进展的机遇;(3) 有重要的证据表明存在方法学进展,尽管其方向与典型的人工智能发展并不一致:我们比较中表现最佳的算法是梯度提升树模型,但前提是它与极其宽泛、稀疏的全特征空间表格化表示相结合,而不是历史上此类模型所使用的受限的、临床驱动的特征化方法。 总之,我们做出了以下关键贡献: 1. 我们提供了十二个人工智能算法的可复现、标准接口的重新实现,这些算法可以通过公共接口应用于任何MEDS数据集,为未来的方法学研究提供稳健的基线比较。 2. 我们提供了丰富的算法性能比较,涵盖区分性能和计算性能,跨越一系列任务和两个数据集,为哪些算法可能表现最佳以及计算成本如何提供了具体指导。 3. 我们表明,随机生成的任务提供了高度可靠的相对算法性能估计,即使是跨数据集的,这表明在电子健康记录人工智能领域,存在一条更易实现的稳健方法学研究途径。 4. 我们发现初步证据表明,将任务属性与算法和数据集属性相关联可以提供进一步的方法学见解,这意味着相对算法排名部分可以通过评估环境的特征来预测。 ## 2 方法 为了解决第1节引入的三个关键问题,我们采用了以下高层实验流程。首先,我们重新实现多种历史上已发表的算法,使它们可以通过一致的接口在任何MEDS数据集上的任何二元分类任务上进行训练,但其他方面忠实于其原始的、已发表的形式。然后,我们在来自两个系列的目标任务集合上训练这些对齐的算法:专家定义的临床有意义任务和随机生成的任务(后者是随机定义的,不需要临床专业知识)。我们通过在留出受试者上的每任务AUROC来评估训练好的算法。这一过程在两个公开的纵向重症监护EHR数据集——MIMIC-IV和NWICU上进行复制,这两个数据集在规模和临床范围上差异显著(附录C中的表3)。利用这些评估结果,我们直接回答我们的问题:对于Q1,我们计算这些算法在任务类别和数据集之间的AUROC排名一致性;对于Q2,我们评估算法排名的方差在多大程度上与任务、数据集和算法组合的结构化属性相关;对于Q3,我们评估总体最佳性能如何随这些算法的首个公开制品日期而变化,并检查区分高性能与低性能算法的其他属性。全文使用的统计程序(排名一致性检验、任务级别逆转率、方差分解和不确定性量化)在附录B.1中有详细说明。 ### 2.1 模型 #### 模型选择。 通过文献综述(附录A)确定的49种ICU和EHR建模方法中,我们任意选择了五个模型家族。我们有意添加了几个模型和基线,以最近的预训练方法来锚定比较。MEDS-Tab\[22 (https://arxiv.org/html/2609.18134#bib.bib18)\]作为一个强大的表格基线被纳入,使用其基于XGBoost的配置以及使用相同MEDS-Tab特征化的额外逻辑回归变体(MEDS-Tab-LR)。我们还包括了\[11 (https://arxiv.org/html/2609.18134#bib.bib13)\]中死亡率可复现性研究的XGBoost模型(ICU-XGBoost)作为有历史依据的ICU基线。最后,添加了MOTOR\[28 (https://arxiv.org/html/2609.18134#bib.bib19)\]和MEDS-EIC-AR\[17 (https://arxiv.org/html/2609.18134#bib.bib20)\]作为潜在的强大新竞争者。表1总结了所有评估的模型变体。 #### 模型实现。 所有十二个模型都使用代理式生成性AI编码工作流(Claude Code with Claude Opus 5;见附录E)重新实现,每个模型分配一个代理,而实现模板、验证程序和人工审查在所有模型间保持固定。因此,每个模型在实现过程中获得了大致相等的“专家关注”,而不是精力集中在单个模型或家族上。为了减少实现变量性以及明显的复现错误影响比较的风险,我们使用来自公共模板仓库的固定模型接口和验证工作流(注:发布时将发布)。对于每个模型,我们首先检查原始论文、补充材料、源代码、配置、预处理和评估代码,并记录哪些组件被移植、调整或省略。然后,实现通过一系列分阶段测试。首先,在一个小合成数据集上,我们构建了一个受控的预测问题,其中单个事件代码决定二元标签,而序列长度或事件位置不会泄露结果,验证模型通过其实际的预处理和特征化流程恢复此信号,并使用打乱标签作为阴性对照。本地端到端测试还检查完整工作流是否仅为请求的样本和拆分生成预测。其次,模型通过隔离的MEDS-DEV接口执行,以验证安装、配置和输出兼容性。第三,它们在MIMIC-IV演示任务上运行,以在全面实验之前暴露与数据相关、序列化、资源和规模相关的故障。对于需要特定输入特征的模型,我们提供特定于数据集的谓词文件,将可用的MEDS事件尽可能映射到所需特征。然后,从固定的、干净的提交开始运行全数据实验,跨模型使用相同的任务包,记录代码修订、配置、数据集、任务和资源信息以确保可复现性。 表1:我们评估中考虑的模型,按其首个公开制品的日期排序。 ### 2.2 任务 所有任务都是二元预测问题。对于每个数据集,我们使用10个临床有意义的任务和10个随机生成的任务,产生四个评估设置(数据集 × 任务类别),在这些设置中,评估的算法和评估程序保持固定。完整的任务定义、队列大小、患病率以及特定数据集的差异在附录D中提供。 #### 随机生成的任务。 随机生成的任务由一个事件代码和一个预测时间范围定义,灵感来自EveryQuery任务参数化\[3 (https://arxiv.org/html/2609.18134#bib.bib25)\]。对于每个任务,预测时间从有资格的患者时间线中采样,标签表示在预测时间后的时间范围内是否发生该事件。仅当候选任务满足统计充分性和删失要求时才被保留;特别是,我们要求 \min(n_{\mathrm{pos}}, n_{\mathrm{neg}}) \geq 150(注:见附录D.2了解少数类别下限的推导及其与AUROC估计误差的关系)。在有资格的事件代码-时间范围对中,任务在采样时受到多样性约束,限制重复代码和单个事件类别的过度代表。每个数据集独立采样十个任务,因此MIMIC-IV和NWICU的随机生成任务集是故意不同的。 #### 临床有意义的任务。 同时,我们使用ACES\[34 (https://arxiv.org/html/2609.18134#bib.bib26)\]定义临床动机的任务,每个任务由临床触发、预测时间锚点、预测时间范围以及(适当时)针对已处于目标状态患者的排除标准来指定。我们力求使MIMIC-IV和NWICU任务套件尽可能相似,在所需信息可用的情况下调整跨数据集的任务定义,并涵盖不同的临床专科、预测时间范围和问题类型,包括实验室异常、急性器官功能障碍、干预措施、利用率和死亡率。为了回答我们的主要方法学问题,并不要求完全对应。
相似文章
衡量关键指标:医疗保健中生成式、多模态及智能体AI的基准测试
本文提出了一个针对医疗保健领域生成式、多模态及智能体AI进行基准测试的结构化框架,旨在解决高基准得分与实际临床可靠性、安全性和相关性之间的差距。
我们评分正确吗?理解医学基准测试中的失败模式
本文分析了医学AI基准测试中的失败模式,表明评分标准缺陷可导致分数变化高达15.9个百分点,强调了在临床AI中需要稳健的评估方法。
为什么我们通过AI能取代什么来衡量其进步,而不是它能让人类做什么?
本文批评了AI取代人类角色的主流焦点,并提出通过AI如何增强人类能力来评估其进步,从而使人们能够完成之前无法完成的任务。
立场:医疗AI忽视真实治疗结果
本文立场文章论证了医疗AI在训练和评估中忽视了真实治疗结果,阻碍了其改善患者护理的能力,并建议纳入实际结果数据以符合循证医学原则。
AI Morbidity and Mortality: 一个临床AI失败审查框架
本文提出了一种名为AI Morbidity and Mortality (AI M&M)的非责备框架,用于对临床AI失败进行案例审查,旨在将个体错误转化为可操作的机构学习。