CoMedBench:多源合成医学数据保真度与下游效用的基准
摘要
CoMedBench 是一个可复现的基准测试,用于评估跨37个数据集-任务组合的合成医疗数据生成器,结果表明合成训练数据在表格型任务上保留了大部分下游信号,但时间序列ICU任务仍然对生成器敏感。
查看缓存全文
缓存时间: 2026/08/14 09:31
# CoMedBench:合成医学数据保真度与下游效用的多源基准 **摘要** 临床数据的可及性对于开发可靠的医疗机器学习系统至关重要,但直接使用电子健康记录受到隐私法规、机构审查、数据使用协议以及重识别风险的约束。合成数据提供了一种实用的替代方案:它可以在减少敏感患者记录暴露的同时,保留有用的统计和临床结构。然而,关于合成数据在医疗领域效用的证据仍然零散。先前的研究通常评估单一生成器、一个数据集或一个狭窄的下游任务,使得我们难以判断合成数据何时能支持模型开发,何时无法保留任务关键信号。我们提出了 CoMedBench,这是一个可复现的基准,在统一的临床有效性框架和共享的训练与评估引擎下评估一组生成器,涵盖已建立的危重症数据集上的静态表格型与时间序列下游任务。总体而言,该基准涵盖两个模态下的 37 个数据集-任务对,包括 20 个静态表格任务和 17 个时间序列 ICU 任务,这些任务来自七个公开数据源:三个重症监护数据库(MIMIC-III、MIMIC-IV 和 eICU),以及 UCI 机器学习库、CDC BRFSS 糖尿病队列(2015)、NHANES(1999-2014)和 pycox 生存数据集(GBSG 和 METABRIC)。该基准通过比较在真实数据和合成数据上训练并测试的模型,同时评估统计保真度和任务效用。在这些设置下,合成训练数据保留了下游信号的大部分:在表格任务上,参考生成器 CoMed-CTGAN 的平均 AUROC 效用(合成与真实性能之比)为 90.6%,最强生成器 CoMed-TVAE 则达到 97.3%。时间序列 ICU 任务更难且对生成器更敏感:CoMed-CTGAN 保留 81.6% 的 AUROC,在基于不平衡性的 AUPRC 下仅保留 64.0%,而 CoMed-TVAE 仍保留约 95% 的 AUROC。通过将评估聚焦于下游临床预测而非仅仅视觉相似性,该基准阐明了合成数据在哪些场景有用、时间结构在哪些场景仍是瓶颈,以及未来生成器应如何为医疗 AI 进行评估。 ## 引言 图1:二维 t-SNE(困惑度30,标准化特征)显示 MIMIC-III 心力衰竭队列中真实与合成 ICU 记录的对比。不同生成器在合成数据对真实流形的覆盖程度上差异显著:高保真模型(CoMed-TVAE、CoMed-GC)与真实点充分混合,而低保真模型(CoMed-CTGAN、CoMed-CopulaGAN)则使真实区域的覆盖不足。这种视觉/统计相似性与任务有用性之间的差距,正是我们构建本基准的动机。现代医疗 AI 依赖于大规模、具有代表性且精心整理的临床数据集\(8 (https://arxiv.org/html/2608.12805#bib.bib12)\)。电子健康记录(EHR)、重症监护数据库、实验室测量和纵向监测流中包含支持死亡率预测、再入院建模、住院时长估计和表型分析等任务的信号。然而,这些数据难以共享:临床数据集包含受保护的健康信息、罕见诊断,以及人口学和临床属性的组合,即使经过常规去标识化处理,患者仍可能被识别。因此,许多医疗机器学习研究依赖于少量公共资源,如 MIMIC-III、MIMIC-IV 和 eICU,而大型机构数据集对大多数研究人员仍不可及\(11 (https://arxiv.org/html/2608.12805#bib.bib1);10 (https://arxiv.org/html/2608.12805#bib.bib2);22 (https://arxiv.org/html/2608.12805#bib.bib3)\)。 图2:基准覆盖范围。37 个数据集-任务对按模态(表格/公共与时间序列/ICU)和来源划分;公共 UCI 数据集进一步按临床子类分组(死亡率、糖尿病、癌症及其他疾病),而每个 ICU 数据库(MIMIC-III、MIMIC-IV、eICU)均包含死亡率、再入院和住院时长任务。 合成临床数据已成为降低这种访问障碍的一种有前景的途径。数据持有者无需发布原始患者记录,而是训练一个生成模型并发布旨在近似源数据分布的人工记录。如果成功,合成数据可以在不暴露原始记录的情况下支持算法原型设计、外部基准测试、软件测试和多机构合作。 核心挑战在于,合成数据必须有用,而不仅仅是看起来真实。生成器可以匹配边际分布,同时扭曲稀有结局、合并症结构、药物-实验室依赖性关系或时间动态。这些扭曲对下游任务是有害的,因为预测信号往往存在于少数类、罕见事件和时间相关轨迹中\(20 (https://arxiv.org/html/2608.12805#bib.bib11)\)。一个在汇总统计下看似忠实的合成数据集,在用于训练临床相关任务的模型时可能失败;图1 (https://arxiv.org/html/2608.12805#Sx1.F1) 正说明了这一差距。 现有的医疗合成数据评估报告了保真度、隐私和效用,但效用往往是在不同的数据集、模型、指标和任务定义下测量的,这使得比较变得困难。因此,研究人员仍然缺乏对一个基本问题的实际答案:对于哪些医疗下游任务,合成数据可以充当真实临床数据的有效替代品? 本文通过 CoMedBench 填补了这一空白,它是一个使合成数据评估可控且可比较的基准。CoMedBench 应用一个模型无关的临床有效性层,并将一组生成器封装在单一训练流程中,使得生成器是各次运行之间唯一变化的组件;同时通过两个互补的场景评估每个合成表:统计保真度(衡量生成记录与源分布的接近程度)和下游效用(衡量在合成数据上训练的模型迁移到真实测试数据的表现)。这种设计将表观真实性与实际有用性区分开来。 我们的工作贡献如下: - 基于领域有效性的受控评估。我们在统一的临床有效性框架和共享的训练与评估流程下评估四类生成器,从而在没有预处理、结构验证或下游评估差异混淆的情况下进行性能比较。 - 一个多源临床基准。37 个数据集-任务对——来自七个公共数据源的 20 个静态表格和 17 个时间序列 ICU 任务,每个任务均评估统计保真度和下游效用。 - 合成数据能保留下游信号,但不均衡。最强生成器 CoMed-TVAE 在表格任务上保留了约 97% 的真实数据 AUROC,在时间序列任务上保留约 95%;在静态表格任务上效用很高,但在时间序列、不平衡的 ICU 任务上会下降(AUPRC 效用低至约 64%),且没有单一生成器在所有评估设置中占优。 - 保真度是必要但不充分的代理指标。总体统计保真度与下游效用仅中度相关(总体 r=0.67,ρ=0.74);因此必须直接度量效用,而罕见事件的时间序列 ICU 任务是最主要的瓶颈。 ## 相关工作 图3:CoMedBench 流程。真实数据(直接作为平面表使用,或将 ICU 住院的多变量序列汇总为每次住院的特征向量)驱动一个统一的配置驱动引擎——预处理与元数据、临床有效性控制,以及一个合成器 G_θ——其中跨运行唯一变化的阶段是合成器。由此得到的合成表 D_syn 和真实表 D_real 通过在同一组五个分类器上训练,并在完全相同的留出真实测试集上进行测试来比较(TRTR 与 TSTR),从而得到效用比。 ### 表格与时间序列数据中的合成数据 面向结构化数据的合成数据可分为单表、多表和时间序列合成。单表方法生成一个包含混合类别列和连续列的平面表,侧重于分布保真度、隐私和机器学习效用;示例包括 CTGAN 风格模型、差分隐私归一化流、扩散模型和基于自编码器的表格生成器\(29 (https://arxiv.org/html/2608.12805#bib.bib4);17 (https://arxiv.org/html/2608.12805#bib.bib5);14 (https://arxiv.org/html/2608.12805#bib.bib9)\)。这些方法适用于静态临床队列,但当关系型 EHR 数据库被展平为单个表时,可能会丢失关键关系。 多表合成则保留跨互连表(例如患者-入院、诊断-手术以及实验室-药物关系)的依赖关系,更好地反映真实世界的医疗数据库——其中下游标签依赖于分布在多个表中的信息。这类关系方法对于重建真实的 EHR 结构非常重要,而不仅仅是生成独立的行。 时间序列合成侧重于顺序记录,其中顺序、缺失、不规则采样和时间动态具有临床意义。这一方向与 ICU 任务尤其相关,因为先前使用 GRU-D 等模型和已建立的 MIMIC-III 基准的研究表明,时间趋势和缺失模式对死亡率、失代偿、住院时长和表型分析具有预测性\(3 (https://arxiv.org/html/2608.12805#bib.bib6);9 (https://arxiv.org/html/2608.12805#bib.bib7)\)。 ### 下游任务中的合成数据 合成数据最有用的场景是它能够支持下游任务,而不仅仅是看起来与真实数据统计相似。一种常见的评估方式是“在合成数据上训练、在真实数据上测试”(TSTR):将生成数据上训练的模型在留出的真实测试集上评估,直接度量合成数据是否保留了可迁移的预测信号。 已建立的 MIMIC-III 和 MIMIC-IV 基准提供了常规的结构化和时间序列任务——死亡率、再入院、住院时长和表型分析——用于评估合成临床数据是否保留了有用的预测信号\(9 (https://arxiv.org/html/2608.12805#bib.bib7);3 (https://arxiv.org/html/2608.12805#bib.bib6);6 (https://arxiv.org/html/2608.12805#bib.bib8);7 (https://arxiv.org/html/2608.12805#bib.bib27);2 (https://arxiv.org/html/2608.12805#bib.bib24);15 (https://arxiv.org/html/2608.12805#bib.bib14);19 (https://arxiv.org/html/2608.12805#bib.bib23);23 (https://arxiv.org/html/2608.12805#bib.bib22);16 (https://arxiv.org/html/2608.12805#bib.bib26);1 (https://arxiv.org/html/2608.12805#bib.bib13);12 (https://arxiv.org/html/2608.12805#bib.bib25)\)。这些任务是我们基准的动机,因为合成数据可能在静态表格预测上表现良好,却无法保留时间模式或罕见事件信号。 ### 医疗 AI 中的合成数据 诸如 MIMIC-III、MIMIC-IV 和 eICU 等公共数据集推动了危重症研究,但机构 EHR 数据的广泛访问仍然受限\(11 (https://arxiv.org/html/2608.12805#bib.bib1);10 (https://arxiv.org/html/2608.12805#bib.bib2);22 (https://arxiv.org/html/2608.12805#bib.bib3)\)。 合成医疗数据可以在不暴露原始患者记录的情况下支持原型设计、测试、教育和基准测试\(4 (https://arxiv.org/html/2608.12805#bib.bib29);27 (https://arxiv.org/html/2608.12805#bib.bib28)\)。然而,仅靠隐私保护是不够的:生成的数据还必须保留临床结构,如结局发生率、合并症模式、药物-实验室关系和时间恶化趋势。这构成了我们基准的动机,即评估合成数据是否支持已建立的下游任务,而不仅仅是匹配广泛的统计性质。 ## 方法 ### CoMedBench 框架概述 CoMedBench 将合成临床数据的生成和评估视为一个统一的、配置驱动的流程,并均一地应用于每个(数据集×任务)对。每个实验由一个紧凑的任务规范定义:输入特征矩阵、主键列、预测标签和特征类型规则。一个共享引擎消费该规范并执行四个阶段(图3 (https://arxiv.org/html/2608.12805#Sx2.F3)):(1)预处理与元数据,加载平面特征矩阵,填补缺失值,并为每一列分配显式类型;(2)临床有效性控制,一个模型无关的层,对每个生成器一致地强制实施模式(schema)和任务特定的有效性规则;(3)合成,拟合生成器 G_θ 并采样一个合成表 D_syn,其标签分布与真实类比例匹配;(4)评估,沿两个轴对 D_syn 与真实数据 D_real 进行评分:统计*保真度*和下游机器学习*效用*(TRTR 与 TSTR)。由于每个数据集、任务和生成器都应用相同的四个阶段,各次运行之间只有合成阶段(或单一消融设置)发生变化,因此该研究是一个受控基准,而不是松散耦合实现之间的比较。 ### 数据集、任务和表示 我们评估了三个重症监护数据库——MIMIC-III、MIMIC-IV 和 eICU\(11 (https://arxiv.org/html/2608.12805#bib.bib1);10 (https://arxiv.org/html/2608.12805#bib.bib2);22 (https://arxiv.org/html/2608.12805#bib.bib3)\),以及一组公共临床和表格数据集\(25 (https://arxiv.org/html/2608.12805#bib.bib18);18 (https://arxiv.org/html/2608.12805#bib.bib20);24 (https://arxiv.org/html/2608.12805#bib.bib19);5 (https://arxiv.org/html/2608.12805#bib.bib16);13 (https://arxiv.org/html/2608.12805#bib.bib21);28 (https://arxiv.org/html/2608.12805#bib.bib17);21 (https://arxiv.org/html/2608.12805#bib.bib10)\)。任务是二分类或多分类预测:院内死亡率、ICU 和医院 30 天再入院、ICU 住院时长,以及疾病/结局分类。图2 (https://arxiv.org/html/2608.12805#Sx1.F2) 显示了该套件按模态、来源和任务的分布。 每个任务都建模为一个平面表(每行对应一个患者或一次住院)。在*表格*表示中,数据集本身就是一个平面特征矩阵,可直接使用。在*时间序列到表格*表示中,每次 ICU 住院的多变量时间序列被汇总为每次住院的特征向量:每个临床变量 v 用 v_first、v_min、v_max 和 v_mean 表示(在可用情况下还包括 v_last、v_median、v_std),同时加入人口统计学和上下文特征,从而为每次住院生成一个固定宽度的行。 ### 预处理与元数据 加载每个表并分配主键:如果存在原生标识符(如住院 ID)则使用之,否则创建代理键;删除标签缺失的行。我们构建单表元数据,为每个列分配显式类型:将键作为标识符(在采样时重新生成),将标签作为 c
相似文章
MedCUA-Bench:面向临床计算机操作智能体的截图型基准测试
MedCUA-Bench是一个新的基准测试,用于评估计算机操作智能体在临床软件任务上的表现,涵盖10个医学领域的18个场景,并包含安全维度。结果显示,当前智能体表现不佳,尤其在真实OpenEMR上,凸显了可靠性方面的显著差距。
LongMedBench:面向长时程临床决策的医疗智能体基准测试
LongMedBench 是一个新的基准测试,用于评估基于LLM的医疗智能体在长时程临床决策中的表现。它使用来自 MIMIC-IV 的真实电子健康记录数据,包含335名具有多次就诊记录的患者,并提出了针对事实问答、时序推理和长时程决策的评估套件。
CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR
Introduces CliniCARE-Bench, a deployment-oriented benchmark for evaluating AI agents on clinical audit tasks over longitudinal EHR data, with 25 clinician-validated scenarios and 750 patient cases. It assesses verdict accuracy, evidence grounding, policy adherence, and calibrated abstention, finding that raw accuracy overstates investigation quality.
MedBench v5:面向临床多模态模型的动态、过程导向且具有幻觉感知能力的基准测试
MedBench v5 是一个面向临床多模态模型的动态、过程导向的基准测试,集成了幻觉检测和压力测试,超越静态问答,评估在信息流压力下的推理和稳定性。
衡量关键指标:医疗保健中生成式、多模态及智能体AI的基准测试
本文提出了一个针对医疗保健领域生成式、多模态及智能体AI进行基准测试的结构化框架,旨在解决高基准得分与实际临床可靠性、安全性和相关性之间的差距。