一种用于全合成生存训练的过滤式生成器混合模型
摘要
本文介绍了FoGS,一种过滤式生成器混合管道,它从多个生成模型中选择合成样本来改进生存分析训练,在多个数据集上超越真实数据训练,同时保护隐私。
arXiv:2607.00127v1 Announce Type: new
摘要:生存分析对时间至事件数据进行建模,但在临床环境中,训练数据成本高昂且稀缺:事件需经数年随访积累,队列规模小,且隐私法规限制跨机构共享。表格生成模型有望实现数据增强和隐私保护的队列共享,但其本身对数据需求量大——在生存分析典型的小规模队列中,单个生成器通常难以充分刻画人群特征,导致基于其输出训练的下游模型无法达到真实数据的性能。FoGS(生存分析过滤式生成器混合模型)将合成数据构建重新定义为样本选择而非生成。从四个架构各异的表格生成器中抽取候选池,每个样本由基于真实数据训练的七个生存模型集成进行评分,利用适当评分规则作为样本级合理性代理。一个两层管道在外循环中优化选择策略——生成器配额、评分器权重、随机补全以及基于事件时间和删失的分层平衡——针对留出的下游性能,内循环则调优下游模型(XGBoost-Cox)。在16个公共数据集上,采用训练于合成数据、测试于真实数据(C-index和IBS,0-100尺度)的方案,FoGS在C-index上平均提升+2.17,在IBS上平均提升+0.67,在9/16的数据集上两项指标均提升,在13个数据集上至少一项提升(单侧Wilcoxon检验p=0.039和p=0.035)。在大多数队列中,它达到或超过真实数据训练的性能,且相对于未过滤采样,最近邻隐私边界无显著变化。因此,在隐私受限的临床环境中,对异质生成器池进行样本过滤是真实数据训练的可行替代方案。
查看缓存全文
缓存时间: 2026/07/02 05:35
# 针对完全合成生存训练的自适应生成器混合滤波方法 来源:https://arxiv.org/html/2607.00127 Eugenio Lomurno\* 米兰理工大学,意大利米兰 Alberto Archetti 米兰理工大学,意大利米兰 Matteo Matteucci 米兰理工大学,意大利米兰 ###### 摘要 目标:生存分析是一种用于多个关键领域中时间至事件建模的统计框架。在临床场景中,训练数据的收集尤为昂贵,因为事件需要在多年的随访中积累,队列规模通常较小,且隐私法规限制了跨机构的数据共享。理论上,表格生成模型既能提供数据增强,又能实现隐私保护的队列共享,但这些模型本身对数据需求量很大:在生存分析典型的小队列场景下,单个生成器很难充分刻画总体分布,以至于在其输出上训练的下游模型往往无法达到真实数据的性能水平。我们的目标是使完全合成训练在该场景下成为真实数据训练可行的替代方案。 方法:我们提出了FoGS(用于生存分析的生成器滤波混合模型)——一个双层流水线,将合成数据构建重构为样本选择问题而非样本生成问题。候选池从四种架构不同的表格生成器中抽取,并由一个在真实数据上训练的七个生存模型组成的集成模型对每个样本进行评分,以恰当评分规则作为单个样本合理性的代理指标。外层循环针对留出的下游性能优化选择策略(生成器配额、评分器权重、随机补全以及基于事件时间和删失的分层平衡),内层循环则调优下游生存模型(XGBoost-Cox)。我们在16个公开数据集上,采用训练于合成数据、测试于真实数据的范式进行评估,以0–100尺度报告C指数和积分布里尔分数。 结果:FoGS在C指数上平均提升+2.17,在积分布里尔分数上平均提升+0.67,在16个数据集中有9个两项指标均改善,13个至少改善一项(单边Wilcoxon检验p=0.039和p=0.035)。在大多数队列上,它匹配或超越了真实数据训练的性能,且相对于未经滤波的采样,最近邻隐私裕度没有显著变化。 结论:在隐私受限的临床场景中,对异构生成器池进行样本滤波是真实数据训练的可行替代方案。 关键词:合成表格数据⋅\cdot损失引导滤波⋅\cdot生存分析⋅\cdot一致性指数⋅\cdot生成模型⋅\cdot超参数优化⋅\cdot积分布里尔分数 11footnotetext:通讯作者:[email protected]。 ## 1 引言 生存模型为肿瘤学、心脏病学、移植等领域以及其它专科中的临床决策提供指导,支持治疗分层、随访安排和临床试验设计[24 (https://arxiv.org/html/2607.00127#bib.bib43),15 (https://arxiv.org/html/2607.00127#bib.bib20)]。它们的输入是右删失的时间至事件数据:由协变量、观察时间和事件指示符组成的元组,其中对于研究结束时仍在观察中的受试者,事件时间仅为部分已知[6 (https://arxiv.org/html/2607.00127#bib.bib4),12 (https://arxiv.org/html/2607.00127#bib.bib7)]。生存模型的训练受到数据本身结构属性的约束:具有临床意义的事件仅能在多年的随访中累积,这导致队列规模较小,且隐私法规限制了跨机构的数据共享。这些约束使得整理足够大的训练队列成为在实践中部署生存模型最缓慢、最昂贵的步骤。 合成表格数据生成已被提出作为一种补救措施,其模型保真度随着为结构化数据开发的异构架构的不断改进而稳步提升。原则上,高质量的合成队列起到两个互补的作用:增强稀缺的真实数据训练集以提高下游模型的鲁棒性,以及在无需公开患者级记录的情况下实现跨机构的队列共享[27 (https://arxiv.org/html/2607.00127#bib.bib8)]。这两个作用是否可行,取决于当合成数据替代真实训练数据时,是否能保持真实数据可达到的下游任务性能。 然而,即使在大型数据集上,表格生成方法仍然不完美,而生化数据中典型的相对小型队列放大了这一问题。由于样本数量少,生成器无法学习到对底层总体分布的真实表示,生成的合成数据无法覆盖下游模型所依赖的数据流形区域。在生存生成[19 (https://arxiv.org/html/2607.00127#bib.bib1),20 (https://arxiv.org/html/2607.00127#bib.bib39)]以及更广泛的表格和图像领域[18 (https://arxiv.org/html/2607.00127#bib.bib60),21 (https://arxiv.org/html/2607.00127#bib.bib61)]中,使用单一生成模型进行训练于合成数据、测试于真实数据(TSTR)的评估始终低于在真实数据上训练的性能。要缩小这一差距,需要重新思考合成生存训练集的构建方式:不应将其视为单个生成器的输出,而应作为一个针对其服务的下游任务进行优化的选择问题。 我们引入了FoGS(用于生存分析的生成器滤波混合模型):一个双层流水线,将合成数据构建重构为样本选择问题,而非样本生成问题。从四种架构不同的表格生成器中抽取一个异构的合成样本池,并由一个在真实数据上训练的生存模型集成对每个样本进行评分。外层优化循环根据留出的下游性能调优选择策略(生成器配额、评分器权重、随机补全以及分层平衡),而内层循环则复现了从业者通常对结果合成数据集应用的标准化生存建模流程(图1 (https://arxiv.org/html/2607.00127#S3.F1))。这种嵌套设计确保了外层循环的信号反映了在标准实践中实际可获得的下游效用。在16个公开生存数据集上,FoGS在9个队列中提升了两项下游指标,在13个队列中至少提升了一项,在大多数数据集上匹配或超过了真实数据训练,支持在隐私受限的临床场景中使用合成数据作为真实队列的替代方案。 本文做出三项贡献。首先,我们引入了FoGS——据我们所知,这是首个专门针对生存分析优化合成数据构建的流水线,它将问题重新表述为在异构生成器池上的样本选择,并由每个样本的合理性信号驱动。其次,我们在16个公开生存数据集上对FoGS进行了基准测试,证明其在大多数队列上提升了下游性能。第三,我们识别出两种在该场景下控制合成数据选择的结构性现象:每个样本合理性与总体覆盖之间的权衡,以及一种数据集依赖性,即没有任何单一策略能在所有队列上占优。 表1:研究意义陈述 问题或难题 临床决策所需的生存模型需要大型训练队列,但事件是在多年中累积的,队列保持较小规模,且隐私规则限制跨机构的数据共享。 已知信息 表格生成模型可以产生合成队列,但针对小型生存数据训练的单个生成器产生的合成集,其训练于合成数据、测试于真实数据的效用低于真实数据训练。 本文贡献 FoGS将合成数据构建重新定义为对四个异构生成器池的样本选择,使用真实数据生存模型对每个样本进行评分,并根据下游效用调优选择策略。它在16个公开数据集中的大多数上匹配或超过了真实数据训练,且不降低最近邻隐私裕度。 受益人群 使用稀缺、隐私受限队列构建生存模型的临床研究人员和数据科学家,以及希望安全共享合成队列的机构。 ## 2 相关工作 ### 2.1 合成表格数据生成 表格数据生成已通过几种不同的方向进行研究:通过贝叶斯网络进行显式分解[3 (https://arxiv.org/html/2607.00127#bib.bib10)];在GAN家族架构中的对抗训练,包括ADS-GAN[27 (https://arxiv.org/html/2607.00127#bib.bib8)]和CTGAN[26 (https://arxiv.org/html/2607.00127#bib.bib11)];以及通过变分自编码器进行潜变量建模[14 (https://arxiv.org/html/2607.00127#bib.bib36),2 (https://arxiv.org/html/2607.00127#bib.bib13)]。最近,通过归一化流[7 (https://arxiv.org/html/2607.00127#bib.bib12)]的可逆变换、去噪扩散[22 (https://arxiv.org/html/2607.00127#bib.bib38),16 (https://arxiv.org/html/2607.00127#bib.bib6)]以及通过对抗随机森林的非参数密度估计[25 (https://arxiv.org/html/2607.00127#bib.bib9)]扩展了这一领域。各范式的质量稳步提升,然而没有单一架构能在表格结构上占据主导地位,每种架构捕捉了特征依赖的不同方面。FoGS利用这种碎片化特性,从跨越这些家族的四个生成器中汇集样本:贝叶斯网络[3 (https://arxiv.org/html/2607.00127#bib.bib10),23 (https://arxiv.org/html/2607.00127#bib.bib49)]、对抗随机森林[25 (https://arxiv.org/html/2607.00127#bib.bib9)]、TabDDPM[16 (https://arxiv.org/html/2607.00127#bib.bib6)]以及一种生存感知的CTGAN变体[19 (https://arxiv.org/html/2607.00127#bib.bib1)]。FoGS利用了它们互补的归纳偏差,而非承诺于某种单一架构。 ### 2.2 合成生存数据生成与效用评估 生存数据生成必须同时再现协变量和被删失的时间至事件信号,现有方法以两种不同方式处理删失。专用架构主要是基于GAN的,其中SurvivalGAN是典型实例[19 (https://arxiv.org/html/2607.00127#bib.bib1)]。这些模型显式处理删失:协变量由GAN组件生成,事件时间通过单独的生存头推导得出。而通用表格生成器则被改编用于生存数据,通过联合估计事件指示符、观察时间及协变量,将删失吸收进联合分布中,而非对其进行显式建模[20 (https://arxiv.org/html/2607.00127#bib.bib39)]。无论采用哪种策略,TSTR效用通常报告低于真实数据基线,而评估实践将效用视为事后质量控制测量[20 (https://arxiv.org/html/2607.00127#bib.bib39)]。FoGS与这两条线都不同:它既不引入新的生存专用生成器,也不将效用视为事后检查,而是组合了两种类型的生成器,并将合成数据集构建重新定义为在其汇集输出上进行策略调优的选择过程,TSTR效用被用作外层优化目标。 ## 3 方法 FoGS通过生成并选择最能服务于下游生存模型的样本来构建高效用合成生存训练集。我们将其表述为双层优化(图1 (https://arxiv.org/html/2607.00127#S3.F1)):外层搜索选择策略以最大化在真实数据上的下游效用,内层训练一个代表性下游模型以指导外层搜索。 参见图注 图1:FoGS流水线概览。阶段1(左)从四个生成器中抽取候选池,并使用在真实队列上训练的生存模型集成对每个样本进行评分。阶段2(右)在选择策略下过滤候选池并训练下游模型,双层优化由真实验证集上的反馈驱动。### 3.1 合成数据与生成器池 令Dr={ (xi,ti,δi) }i=1Nr表示真实训练划分,其中 xi 为特征,ti 为观察时间,δi 为事件指示符。Dr 保留不用作验证和测试划分,分别用于超参数调优和最终样本外评估。FoGS从一个生成器池 G 开始,其中每个生成器 g∈G 在 Dr 上训练,并定义一个针对合成实例的采样分布。从每个 g 中,我们抽取大小为 Ng=⌈κNr⌉ 的候选池 Dg,其中 κ≥1 控制候选池相对于真实队列的大小。并集 Dsynth=⋃g∈G Dg 即为候选集。在我们的实验中,生成器池由四种生成器实例化,这些生成器跨越了表格数据生成的主要范式——显式分解、对抗训练、去噪扩散和非参数密度估计——因此 Dsynth 不依赖于任何单个生成器的归纳偏差。G 中包含的生成器如下: - • *ARF* [25 (https://arxiv.org/html/2607.00127#bib.bib9)]:通过随机森林分类器的迭代对抗训练进行非参数密度估计,适用于混合连续和类别特征。 - • *贝叶斯网络* [3 (https://arxiv.org/html/2607.00127#bib.bib10),23 (https://arxiv.org/html/2607.00127#bib.bib49)]:使用爬山结构学习进行显式分解,提供可解释的因子化表示,原生支持离散变量。 - • *TabDDPM* [16 (https://arxiv.org/html/2607.00127#bib.bib6)]:去噪扩散,分别对类别特征和数值特征使用多项和高斯前向过程。 - • *SurvivalCTGAN*:CTGAN [26 (https://arxiv.org/html/2607.00127#bib.bib11)] 根据SurvivalGAN方法 [19 (https://arxiv.org/html/2607.00127#bib.bib1)] 改编以适用于删失生存数据,特征由GAN组件生成,事件时间通过生存头部推导得出。 ### 3.2 每个样本的合理性评分 在生成 Dsynth 之后,FoGS使用一组生存模型(定义为评分器)来评估每个合成样本的合理性。令 M 为评分器池。每个在 Dr 上训练的评分器 m∈M 为第 i 个合成样本分配两个每个样本的损失:积分布里尔分数(IBS)lm,IBS,i 和负对数似然(NLL)lm,NLL,i。IBS和NLL都是恰当评分规则 [8 (https://arxiv.org/html/2607.00127#bib.bib58),9 (https://arxiv.org/html/2607.00127#bib.bib59)],其每个样本的期望值在真实条件分布处达到最小。因此,被真实数据训练的评分器分配低损失的样本相对于真实总体是合理的。 在我们的实验中,评分器池由七个生存模型实例化——Cox [6 (https://arxiv.org/html/2607.00127#bib.bib4)]、DeepSurv [13 (https://arxiv.org/html/2607.00127#bib.bib5)]、DeepHit [17 (https://arxiv.org/html/2607.00127#bib.bib23)]、RSF [11 (https://arxiv.org/html/2607.00127#bib.bib21)]、FPBoost [4 (https://arxiv.org/html/2607.00127#bib.bib31)]、XGBoost-Cox [5 (https://arxiv.org/html/2607.00127#bib.bib56)] 以及前六个的加权集成——覆盖了线性、基于树和神经网络的生存方法。训练和超参数
相似文章
通过同质-异质分割的合成图像生成后策展
本文提出了一种与生成器无关的生成后策展方法,通过将真实类别拆分为规范的同质子集和无冗余的异质子集,并基于保真度-多样性准则对合成图像进行评分,从而选取信息丰富的合成图像子集。该方法持续优于现有的数据选择基线,并且在合成样本数量减少多达40%的情况下,仍能达到与真实数据相当的性能。
混合而非挑选:为何合成语料组合对时间序列基础模型预训练至关重要
本文系统评估了11种用于基础模型预训练的合成时间序列生成器,发现生成器的排名在不同架构下不稳定,但所有生成器的等权重混合结果与最佳单个生成器相当或更优。将这种混合与真实数据融合可得到最强的预训练语料,从而将合成预训练重新定义为语料组合问题而非生成器选择问题。
@cjzafir: 这是我的微调数据集生成流程:> Codex 5.5 作为编排器 > Deepseek v4 Pro 作为生成器 简而言之…
本文描述了一个微调数据集生成流程,使用 Codex 5.5 作为编排器,Deepseek v4 Pro 作为生成器,通过自主质量门控和迭代改进,以低成本生成高质量合成数据。
知道何时放弃:通过多阶段飞行中拒绝实现令牌高效的LLM合成数据生成
本文提出了多阶段飞行中拒绝(MSIFR),一种无需训练的框架,通过在中间检查点检测并终止低质量生成轨迹来减少基于LLM的合成数据生成中的令牌浪费。在五个模型和七个基准测试中,MSIFR作为独立方法可减少11%-77%的令牌消耗,与早期退出方法结合时最多减少78.2%,同时保持或提升准确率。
基于流生成模型的残差空间进化优化
介绍了一个结合流生成编辑和进化算法的框架,用于在残差空间中进行优化,支持使用不可微目标进行可控数据编辑。在MorphoMNIST和晶体数据上进行了验证。