从无监督子组到假设状态干预策略:观察性健康数据中选定子组方法的评估
摘要
本文评估了无监督子组方法与因果发现和政策评估相结合,用于观察性数据中的预算约束健康干预,发现在留出评估中没有单一方法始终优于其他方法。
arXiv:2607.26521v1 公告类型:新
摘要:传统的子组分析可能会产生不稳定且难以解释的结论,尤其是在观察性生物医学数据中,每个个体仅在一种暴露状态下被观察,真实的个体治疗效果不可得,且因果结构不确定。我们研究了仅基于治疗前特征构建的子组(不使用暴露、结果或估计的治疗效果信息)是否可以作为预算约束政策优先级的可解释单元。我们提出了一个框架,结合了因果发现指导的协变量选择、发现-评估样本分割、归纳无监督聚类、不确定性感知的子组选择以及留出双稳健政策评估。我们比较了K-means、硬聚类、成员权重和随机模糊C均值、贝叶斯高斯混合模型,以及监督因果森林衍生的CATE树比较器。在PIMA印第安人糖尿病数据集中,针对假设的肥胖到非肥胖以及血糖升高到降低的状态转变,以及在NHANES中针对终生吸烟史对比,在70%预算下评估了策略。最高的估计未门控效用为:使用贝叶斯GMM的BMI政策为0.799,使用硬或成员权重FCM的血糖政策为0.735,使用K-means的吸烟史政策为0.775。所有策略风险差异的配对95%置信区间包含零,并且在Holm调整后没有比较保持统计显著性。贝叶斯池化通常保留未门控分配,而经验伯恩斯坦门控更为保守。具有相似估计效用的政策仍可能优先考虑不同的个体。这些发现应被视为针对假设状态对比的依赖于假设的决策支持证据,而非干预益处的证明。
查看缓存全文
缓存时间: 2026/07/30 09:59
# 从无监督子组到假设性状态干预政策:观察性健康数据中选定子组划分方法的评估 来源:https://arxiv.org/html/2607.26521 Bülent Yener 伦斯勒理工学院,美国特洛伊 (邮箱: [email protected]) ###### 摘要 传统的子组分析可能得出不稳定且难以解释的结论。多重性、事后子组搜索以及子组内样本量小,使得明显的治疗效果异质性难以与抽样变异区分开来。这些挑战在完全观察性的生物医学数据集中更为严峻。每个个体仅在一个暴露状态下被观察,真实个体治疗效果不可得,且因果结构不确定。此外,临床上相关的状态(如肥胖或血糖升高)并非可直接分配的干预措施。而且,标准的硬分配规则通常会忽略固有的表型模糊性,未能考虑子组边界附近的聚类分配不确定性。因此,我们探究是否可以在不使用暴露、结果或估计治疗效果信息的情况下,仅由治疗前患者特征构建的子组,能够作为预算受限且具有不确定性意识的政策优先级排序的可解释单元。我们提出了一个端到端的框架,结合了集成因果发现与领域知识、发现-评估样本拆分、归纳式无监督聚类、具有不确定性意识的子组选择,以及留出的双重稳健策略评估。所发现的图仅被视为潜在因果结构,用于识别合理的治疗前协变量和调整变量,而非已确认的因果图。我们比较了 K-means、硬性、隶属度加权和随机模糊 C 均值 (FCM)、贝叶斯高斯混合模型 (GMM) 与一个基于监督因果森林的条件平均处理效应 (CATE) 树比较器。在 70% 干预预算下,使用无门控分配、经验 Bernstein (EB) 安全门控或层次贝叶斯池化对子组进行优先级排序。该框架在皮马印第安人糖尿病数据集 (PIMA) 中针对假设性的肥胖到非肥胖状态转变和血糖升高到降低状态转变(针对糖尿病风险)进行了评估,并在美国国家健康与营养调查 (NHANES) 中针对终生吸烟史对比(针对睡眠障碍)进行了评估。在代表性的留出评估中,使用贝叶斯 GMM 的体重指数 (BMI) 政策估计的最高无门控效用为 0.799,使用硬性或隶属度加权 FCM 的血糖政策为 0.735,使用 K-means 的吸烟史政策为 0.775。使用评估个体的共同重抽样样本进行了留出政策风险差异的配对自助法比较。所有配对的 95% 置信区间都包含零,并且在 Holm 调整后,所评估的子组政策之间没有比较保持统计学显著性。因此,获得最有利点估计的方法应被解释为描述性的点估计领先者,而非具有已确立的优越留出性能的政策。点估计领先方法的身份也因政策实验而异,没有证据表明单一子组划分算法具有持续优势。如预期所料,基于效果的构建使得监督式 CATE 树比较器产生了更大的组内效应同质性,但并未始终提供更高的留出政策效用。贝叶斯池化通常保留了无门控分配,而 EB 门控则更为保守,偶尔会产生无转变政策。具有相似估计效用的政策仍可能优先考虑不同的个体。这些结果表明,受因果约束、基于表型优先的子组可以为观察性政策优先级排序提供透明单元。然而,由于分析是观察性的,因果图不确定,干预措施是假设性的状态对比,并且识别依赖于可交换性、正性、一致性和正确的干扰模型估计。研究结果应被解释为依赖于假设的决策支持证据,而非干预益处的证明。未来的工作应将因果图的不确定性传播到整个流程中,研究临床指定且可直接实施的干预措施,并在外部、纵向和前瞻性队列中验证所得政策。 **关键词:** 无监督子组发现;假设性状态转变政策;双重稳健策略评估;因果发现;具有不确定性意识的子组选择;模糊聚类;贝叶斯高斯混合模型。 ## 引言 异质性治疗效果 (HTE) 分析研究干预措施的效果如何在个体或子组之间变化[8 (https://arxiv.org/html/2607.26521#bib.bib32),92 (https://arxiv.org/html/2607.26521#bib.bib36)]。最细粒度的估计量是个体治疗效果 (ITE),定义为个体在接受治疗和对照条件下的潜在结果之差。在观察性生物医学数据中,每个个体仅在一个暴露或风险因素状态下被观察,使得反事实和真实的 ITE 不可观测[45 (https://arxiv.org/html/2607.26521#bib.bib45)]。因此,需要真实个体效果的评估指标,如异质性效果估计的精度 (PEHE)、治疗效果均方误差 (MSE) 或个体级别的理想遗憾,通常仅限于模拟或半合成基准[44 (https://arxiv.org/html/2607.26521#bib.bib24),79 (https://arxiv.org/html/2607.26521#bib.bib44)]。一个更实用的估计量是条件平均处理效应 (CATE),它表示在给定观察到的协变量条件下,治疗或状态变化的平均效果[56 (https://arxiv.org/html/2607.26521#bib.bib48)]。在本研究中,采用面向 CATE 的估计来总结子组级别的效益,而非声称恢复了真实的个体效果。假设性的状态转变政策针对可修改的风险因素状态(包括肥胖、血糖升高和吸烟史)进行考虑。在固定预算下,这些政策优先考虑符合条件的子组,使其从不利状态转变为较低风险状态。决策主要在子组级别做出,只有当预算边界与某个子组相交时才应用部分分配。子组可以通过监督或无监督程序形成。监督式 HTE 方法,如虚拟双胞胎、因果树和因果森林,利用治疗和结果信息来估计异质性或定义子组[33 (https://arxiv.org/html/2607.26521#bib.bib35),8 (https://arxiv.org/html/2607.26521#bib.bib32),92 (https://arxiv.org/html/2607.26521#bib.bib36)]。相比之下,无监督子组发现仅使用治疗前协变量形成组,随后使用估计的效益进行政策排序。本研究调查这种基于表型的子组是否能够在观察性数据中支持有效且透明的干预政策。这一探究的动机来自于临床工作流程,其中患者在治疗前根据基线特征、疾病分期、影像学发现、分子谱或其他治疗前生物标志物进行分层。例如,肿瘤学决策经常参考治疗分配前测量的肿瘤或分子特征[59 (https://arxiv.org/html/2607.26521#bib.bib27),78 (https://arxiv.org/html/2607.26521#bib.bib28)]。本设置与指南定义的生物标志物分层不同,因为定义子组的变量是数据驱动的,而非已确立的临床生物标志物。在此背景下,术语“表型”指用于子组发现的治疗前协变量概况。传统的子组分析容易受到多重性、事后子组搜索、子组内样本量小以及效果估计不稳定的影响[42 (https://arxiv.org/html/2607.26521#bib.bib34)]。提出的框架通过以下方式解决其中一些问题:不使用结果或估计的治疗效果来定义子组,将政策构建与留出评估分开,并在评估前固定子组结构和排序。使用因果结构发现和因果领域推理[4 (https://arxiv.org/html/2607.26521#bib.bib71)]选择治疗前协变量,然后应用多种归纳聚类算法来构建可重复使用的子组。在符合资格的发现队列个体中总结基于模型的状态转变效益,并用于在政策预算内对子组进行排序。随后,在留出队列中使用干预特定的双重稳健估计器评估所得固定政策。在两层实施正式的多重性控制:经验 Bernstein 门控在每个聚类解决方案内对 K 个子组特定界限使用 Bonferroni 式调整,而配对政策风险比较在每个政策实验内使用 Holm 程序进行调整。为了解决子组级别效益估计的不确定性,将需要保守正下限的 EB 门控与一个层次贝叶斯池化门控进行比较,后者在考虑估计不确定性的同时跨子组借用信息。还采用了随机 FCM 硬化来将模糊聚类成员关系中的模糊性传播到最终分配中。这些程序解决了估计和成员关系不确定性的特定来源,但并未消除观察性分析中固有的因果识别假设或残余不确定性。主要的实证问题是子组划分方法的选择是否会实质性地改变政策表现或分配构成。比较跨 K-means、多种 FCM 变体、贝叶斯 GMM 和监督 CATE 树比较器的人群级别留出政策风险和效用、选定的子组、子组概况以及目标人员重叠。比较器评估了基于治疗效果信息构建的子组相对于基于表型优先聚类的子组是否能改善留出表现。鉴于分析是观察性的,且干预目标是假设性的状态对比,所有估计都应被解释为依赖于假设的决策支持证据,而非干预益处的明确证明。 ## 相关工作 人群平均处理效应总结了整个目标人群中的预期因果对比。然而,该指标可能会掩盖临床上不同患者子组之间平均效益的重要差异[53 (https://arxiv.org/html/2607.26521#bib.bib30)][24 (https://arxiv.org/html/2607.26521#bib.bib31)][42 (https://arxiv.org/html/2607.26521#bib.bib34)]。这一局限性推动了对异质性治疗效果估计、条件平均处理效应以及治疗响应子组识别的大量研究[8 (https://arxiv.org/html/2607.26521#bib.bib32)]。几种广泛使用的方法是监督式的,这意味着治疗和结果信息直接影响异质性的估计或由此产生的子组结构。Foster 等人[33 (https://arxiv.org/html/2607.26521#bib.bib35)]引入了虚拟双胞胎方法,该方法首先预测每个个体在治疗和对照条件下的反应。然后将预测的治疗对比用作第二阶段分类或回归模型的目标,以识别可能具有增强治疗效果的子组患者。Athey 和 Imbens[8 (https://arxiv.org/html/2607.26521#bib.bib32)]引入了因果树,该方法递归地对治疗前协变量空间进行分区,以识别具有不同估计治疗效果的区域。诚实估计将树构建与效果估计分离以减少自适应偏差。Wager 和 Athey[92 (https://arxiv.org/html/2607.26521#bib.bib36)]提出的因果森林通过使用树的集成扩展了递归分区,并提供灵活的非参数条件治疗效果估计。与旨在构建单个良好训练树的因果树方法相反,因果森林构建多个具有小叶子节点的深层树。Chernozhukov 等人[21 (https://arxiv.org/html/2607.26521#bib.bib38)]引入了按代理排序的分组平均处理效应 (GATES) 程序,该程序根据治疗效益的机器学习代理对个体进行排序,并使用样本拆分在结果影响组内估计平均处理效应。这些组由估计效应分数的排序定义,而非原始患者特征的相似性。Kim 等人[54 (https://arxiv.org/html/2607.26521#bib.bib39)]提出了因果 K-Means 聚类,这是一个用于识别具有异质性治疗效果子组的无监督框架,通过对未知的反事实回归函数(而非观察到的协变量)进行聚类。作者开发了一个简单的插件估计器和一个使用有效影响函数和交叉拟合的偏差校正半参数估计器。该框架适用于多治疗和多结果设置,并通过模拟和 PROPEL 慢性腰痛试验案例研究进行了演示。Wang 等人[95 (https://arxiv.org/html/2607.26521#bib.bib40)]从正交化的因果森林构建了一个学习的相似性核,并应用核化聚类来识别具有相似估计治疗响应性的个体。他们的程序使用 Robinson 分解对治疗和结果进行残差化处理,并使用森林衍生的权重来编码估计 CATE 表面上的局部相似性。然后将核化聚类应用于此相似性表示,并在结果聚类内总结治疗效果估计以获得聚类特定的平均效果。无监督的基于表型的子组划分也已在随机临床研究中得到应用。Bellavia 等人[13 (https://arxiv.org/html/2607.26521#bib.bib53)]提出了一种基于无监督表型的方法,用于评估随机临床试验中的治疗效果异质性。该方法将基于模型的聚类应用于基线患者特征,然后在所得表型内估计随机化治疗的效果。在 ENGAGE AF-TIMI 48 试验中,该方法识别出在估计对 edoxaban 相比华法林的反应方面存在差异的临床可区分患者组。与广义随机森林的比较突显了一个核心权衡:基于效果信息的分层产生了更强的治疗效果分离,而基线表型聚类产生的组更易于使用观察到的患者属性进行特征化。Sinha 等人[80 (https://arxiv.org/html/2607.26521#bib.bib55)]在三项随机 ARDS 试验中比较了多种监督和无监督子组划分算法,发现没有单一方法能在所有研究中一致地检测到治疗效果异质性。他们还观察到子组组成和 HTE 结论通常对算法选择、随机初始化和生物标志物包含敏感,这要求跨聚类方法、随机种子和选定人群重叠进行稳健性分析。Bh
相似文章
用于部分因果效应识别的最优实验
本文提出了“最大效力问题”,旨在选择受成本约束的实验,以最大程度地缩小部分因果效应的界限。作者提出了图形剪枝准则以减少搜索空间,并在NHANES健康数据集上展示了该方法的应用。
插补与聚类相结合:利用潜在子组结构进行缺失数据恢复
提出了CAGI,一个将聚类与生成对抗网络相结合的框架,通过利用潜在子组结构改进缺失数据插补,在基准数据集上取得了优越性能。
通过交互感知的Mixture-of-Experts理解结构化健康数据
本文研究了利用结构化健康记录的多层次视图,通过交互感知的Mixture-of-Experts进行中风后僵硬预测。尽管性能提升微乎其微,但路由归因揭示了不同视图间系统性的重要性差异,强调视图构建是实现可解释性的关键。
干预的幻象:你的LLM模拟实验其实是一项观察性研究
来自Google DeepMind和卡内基梅隆大学的这篇论文指出,由于用户漂移(模拟人群随干预措施而变化),LLM模拟实验实际上属于观察性研究。作者提出使用阴性对照结果来诊断混杂,并表明引出与情境相关的混杂因素可以减少偏差。
PPO-HSC:一种基于广域策略覆盖优化的探索性强化学习框架
PPO-HSC引入了一种高阶采样覆盖奖励,以鼓励在LLM的强化学习微调中探索多样化的推理模式,从而在数学和代码任务上提升解决方案的多样性和状态空间覆盖。