谁在尾部被遗漏?长尾胸片X光分类中的阈值化亚组漏诊
摘要
本文研究了长尾胸片X光分类中阈值化亚组漏诊的公平性问题,表明罕见标签公平性同时取决于发现、亚组和操作阈值,而不仅仅取决于标签频率或排名指标。
arXiv:2607.07717v1 公告类型:新
摘要:在胸片X光(CXR)分类中,可接受的排名性能仍可能使罕见阳性患者低于阈值,尤其是在亚组内。我们将这一部署前的公平性问题作为审计问题来研究:将长尾多标签CXR模型从分数转换为决策后,谁被遗漏了?在VinDr-CXR和MIMIC-CXR/CXR-LT上,我们使用诊断阶梯来分离类别级长尾损失、亚组感知加权、群体鲁棒性和阈值选择。在VinDr-CXR上,群体尾部加权结合尾部感知阈值将尾部假阴性率(FNR)从0.665降至0.269,性别最差亚组FNR从0.705降至0.157,年龄最差亚组FNR从0.822降至0.133,同时宏平均平均精度(macro-mAP)从0.611升至0.635。在MIMIC-CXR/CXR-LT上,相同的分数到阈值比较将尾部FNR从0.866降至0.741,并降低了性别、年龄、种族和保险方面的最差亚组FNR;然而,残余的漏诊阳性率仍然很高。VinDr上的配对Bootstrap对比支持阈值化FNR的降低,而GroupDRO参考运行表明,仅靠聚合群体鲁棒性并不能消除这种情况下的罕见亚组遗漏。该研究支持一个狭窄的审计主张:CXR中的罕见标签公平性同时取决于发现、亚组和操作阈值,而不仅仅取决于标签频率或排名指标。
查看缓存全文
缓存时间: 2026/07/10 06:10
# 长尾胸部X光分类中谁会被遗漏?阈值化亚组漏诊问题 来源:https://arxiv.org/html/2607.07717 11institutetext:越南胡志明市科技大学 22institutetext:越南胡志明市越南国家大学 33institutetext:VinUni-Illinois 智慧健康中心,VinUniversity,越南河内 44institutetext:美国宾夕法尼亚州匹兹堡卡内基梅隆大学 55institutetext:美国伊利诺伊州芝加哥西北大学 66institutetext:工程与计算机科学学院,VinUniversity,越南河内 Hai-Dang Nguyen, Dang P. M. Cao, Thanh-Huy Nguyen, Min Xu, Trung-Nghia Le, Ulas Bagci, Huy-Hieu Pham ###### 摘要 在胸部X光(CXR)分类任务中,即使排序性能可接受,仍可能将罕见阳性患者留在阈值以下,尤其是在亚组内。我们将此部署前的公平性问题作为一项审计问题来研究:当一个长尾多标签CXR模型从分数转换为决策后,谁被遗漏了?在VinDr-CXR和MIMIC-CXR/CXR-LT数据集上,我们使用一个诊断阶梯来分离类别级长尾损失、亚组感知权重、群体鲁棒性和阈值选择。在VinDr-CXR上,群体-尾部加权结合尾部感知阈值将尾部FNR从0.665降至0.269,性别最差亚组FNR从0.705降至0.157,年龄最差亚组FNR从0.822降至0.133,同时宏平均mAP从0.611提升至0.635。在MIMIC-CXR/CXR-LT上,相同的分数到阈值比较将尾部FNR从0.866降至0.741,并降低了性别、年龄、种族和保险方面的最差亚组FNR;然而,残留的漏诊率仍然较高。在VinDr上进行配对bootstrap对比分析支持阈值化FNR的降低,而GroupDRO参考运行表明,在此设置下,仅凭聚合群体鲁棒性并不能消除罕见亚组的漏诊。本研究支持一个狭窄的审计论断:CXR中罕见标签的公平性共同取决于发现类别、亚组和操作阈值,而非仅凭标签频率或排序指标。 ## 1 引言 一个CXR分诊模型最终通过阈值来发挥作用:只有当某个病例的分数超过操作点时,它才会被提交审查。这在长尾分布中尤为重要,因为罕见发现的支持正例有限,而特定亚组的正例可能更少。因此,一个模型可能有可接受的宏平均mAP,但同时将特定亚组中的罕见阳性病例留在阈值以下。公平性问题不仅在于罕见标签是否困难,还在于阈值化决策是否将漏诊集中在特定的类别-亚组单元格内。 我们将长尾CXR公平性作为一个面向部署的测量问题来研究。审计单元是应用特定类别阈值后,某个亚组内的罕见标签阳性病例。我们在VinDr-CXR上评估该单元(其中亚组元数据仅限于从DICOM提取的性别和年龄),以及在MIMIC-CXR/CXR-LT[6 (https://arxiv.org/html/2607.07717#bib.bib1),5 (https://arxiv.org/html/2607.07717#bib.bib14),8 (https://arxiv.org/html/2607.07717#bib.bib6)]上评估(其中与电子健康记录关联的元数据还支持种族和保险分析)。我们并非提出一个可部署的诊断系统或通用的公平性补救方案,而是将模型变体用作诊断探针。目标是定位漏诊在流程中的产生环节:类别不平衡、亚组支持、群体鲁棒训练,或者分数到决策的阈值。 现有的长尾方法,例如有效样本数重加权[1 (https://arxiv.org/html/2607.07717#bib.bib3)]和非对称损失[10 (https://arxiv.org/html/2607.07717#bib.bib4)],主要作用于类别层面。公平性方法,如机会均等[4 (https://arxiv.org/html/2607.07717#bib.bib5)]和GroupDRO[11 (https://arxiv.org/html/2607.07717#bib.bib9)],通常聚合群体进行考量,而医学影像公平性研究已记录了临床预测流程中人口统计学和电子健康记录驱动的偏差[3 (https://arxiv.org/html/2607.07717#bib.bib10),7 (https://arxiv.org/html/2607.07717#bib.bib11),12 (https://arxiv.org/html/2607.07717#bib.bib12)]。近期CXR工作进一步表明,局部公平的模型在分布偏移下可能不再保持公平[14 (https://arxiv.org/html/2607.07717#bib.bib13),2 (https://arxiv.org/html/2607.07717#bib.bib7)],而AI诊断报告指南则强调偏差、公平性和适用性[13 (https://arxiv.org/html/2607.07717#bib.bib8)]。我们的设置结合了这些关注点:相关的错误不仅仅是单一罕见类别或单一人口统计学群体,而是在阈值化后评估的稀有\(类别, 亚组\)阳性病例。 **贡献。** 我们做出四项贡献。首先,我们将阈值化类别-亚组漏诊定义为长尾CXR公平性的审计单元。其次,我们使用一个诊断阶梯来分离类别级损失、亚组感知权重、群体鲁棒性和阈值选择。第三,我们报告了亚组条件FNR、阳性支持度、每100个阳性中漏诊数以及bootstrap对比分析,以确保小样本数据的证据可解释。第四,在两个CXR队列中,我们展示了排序指标和聚合群体鲁棒性并不能决定阈值化后谁被遗漏;操作点会实质性地改变观察到的尾部危害。 ## 2 研究设计 **队列特定的可观察性。** 公平性论断受到每个队列中可用的亚组元数据和标签定义的限制。因此,我们将每个数据集保留在其原生标签空间、亚组定义和训练/验证/测试划分中,并根据该队列内训练集的频率定义尾部类别。这种设计避免了不确定的标签映射,并使所支持的公平性问题明确。MIMIC-CXR/CXR-LT是该审计的第二个队列内实例,而非映射标签的迁移实验。 **数据。** VinDr-CXR[9 (https://arxiv.org/html/2607.07717#bib.bib2)]包含15K张训练图像和15个标签,此处使用1,500张图像的测试集划分。亚组是从DICOM头文件中提取的性别和年龄;缺失或无效值将被保留用于统计,并在适当时从主要性别比较中排除。VinDr中不提供种族和保险信息,因此我们不会将美国电子健康记录的亚组定义投射到此数据集。MIMIC-CXR/CXR-LT[6 (https://arxiv.org/html/2607.07717#bib.bib1),5 (https://arxiv.org/html/2607.07717#bib.bib14),8 (https://arxiv.org/html/2607.07717#bib.bib6)]使用MIMIC-CXR图像集以及CXR-LT标签,并划分为78,946张图像的测试集;亚组轴包括性别、年龄组、种族和保险(来自可用元数据)。只有当元数据可用且临床可解释时,才会报告该轴。 表1:队列可观察性与尾部正例支持。尾部类别在每个队列内根据训练集频率定义;仅当存在队列元数据时才报告亚组轴。 **诊断阶梯。** 所有探针使用ConvNeXt-Tiny骨干网络和数据集特定的线性分类头,因此阶梯改变的是训练目标或阈值规则,而非架构。M1为BCE,M2使用非对称损失(ASL)[10 (https://arxiv.org/html/2607.07717#bib.bib4)],M3添加有效样本数类别加权[1 (https://arxiv.org/html/2607.07717#bib.bib3)]。M4是GroupDRO参考基线[11 (https://arxiv.org/html/2607.07717#bib.bib9)]。M5将ASL乘以基于训练计数的截断类别-亚组权重。M6重用M5分数,仅更改尾部类别的阈值。M1-M5使用验证F1阈值;对于M6,头部/中部类别保持F1阈值,而尾部类别阈值在满足最小精度下限τ=0.05的前提下最大化最差群体召回率。因此,M5和M6具有相同的排序分数、ECE和Brier分数;任何M5-M6之间的FNR变化都是由阈值中介的。 **终点与不确定性。** 排序由宏平均mAP和尾部mAP总结。阈值化漏诊由尾部FNR和每个可用亚组轴的最差群体尾部FNR总结。ECE和Brier分数描述校准度,每100个真阳性中漏诊数将FNR转化为临床可解释的单位。VinDr上的尾部类别FNR仅依赖于每个类别3-19个正例,因此点估计的分辨率较低。我们报告使用200次测试行重采样的独立bootstrap 95% CI,以及使用1,000次共享重采样的配对bootstrap对比分析,用于方法比较。 ## 3 实验与结果 ### 3.1 VinDr-CXR诊断阶梯 表2:VinDr-CXR测试结果及bootstrap 95% CI(在1,500张图像测试集上200次重采样)。M1-M5使用F1最优阈值;M6重用M5分数并采用尾部感知阈值。 表2 (https://arxiv.org/html/2607.07717#S3.T2) 报告了VinDr-CXR的主要测试集分析(1,500张图像测试集)。M1-M5的所有阈值均为每类的F1最优值,并在验证集上调优;M6使用相同的M5检查点,但将尾部类别的阈值目标替换为第2节 (https://arxiv.org/html/2607.07717#S2) 中描述的尾部感知校准规则。这分离了分数模型的变化(M1-M5)与移动操作点而不重新训练的效果(M6)。 ### 3.2 MIMIC-CXR/CXR-LT大规模队列审计 表3 (https://arxiv.org/html/2607.07717#S3.T3) 报告了MIMIC-CXR/CXR-LT上相同的阶梯。模式方向与VinDr一致,但幅度较小:M6相对于M5降低了所有报告亚组轴的尾部FNR和最差群体FNR,而宏平均mAP和尾部mAP不变,因为M6重用了M5分数。MIMIC绝对尾部FNR仍然很高,因此阈值化暴露并降低了部分漏诊率,而非解决了尾部问题。与M5 F1操作点相比,M6将MIMIC尾部FNR从0.866降至0.741,性别最差群体FNR从0.912降至0.795,年龄最差群体FNR从0.983降至0.873,种族最差群体FNR从0.945降至0.880,保险最差群体FNR从0.902降至0.819。跨队列最一致的模式是,在不变的分数模型上移动操作点对阈值化亚组FNR的改变大于类别级长尾变体的影响。MIMIC的操作点扫描表明,这种效应并非M5独有:在相同的τ=0.05精度下限下,尾部感知阈值降低了BCE(0.859至0.773)、ASL(0.864至0.731)、CB-ASL(0.851至0.732)和GroupDRO(0.888至0.806)的尾部FNR。MIMIC更丰富的亚组轴将审计扩展到性别和年龄之外,同时保持队列特定的可观察性,而非通用的公平性分类。 表3:MIMIC-CXR/CXR-LT测试结果(78,946张图像)。M1-M5使用F1最优阈值;M6重用M5分数并采用尾部感知阈值。FNR越低越好。 请参阅标题 图1:各队列中M5到M6的阈值效应。灰色标记显示带F1阈值的M5;彩色标记显示相同分数模型经尾部感知阈值化后。数字是每100个真阳性中漏诊数的绝对减少量。 #### 3.2.1 阶梯的诊断结果。 阶梯揭示了宏平均mAP单独无法显示的故障模式。在VinDr上,BCE基线达到宏平均mAP 0.611,但在阈值化后遗漏了大约三分之二的尾部阳性病例,在最差性别和年龄组中FNR更高。ASL改善了平均尾部行为,但未能可靠地保护最差群体,而CB-ASL留下了显著的年龄最差群体FNR。由于M6保留了M5分数并仅更改尾部阈值目标,M5-M6之间的降低隔离了分数到决策的步骤。从M1到M6,VinDr每100个尾部阳性中漏诊数从66.5降至26.9,最差性别亚组漏诊从70.5降至15.7,最差年龄亚组漏诊从82.2降至13.3。M6尾部FNR的独立bootstrap区间为[0.08, 0.40],与M1区间[0.51, 0.82]不重叠,尽管测试集较小,仍支持显著的降低。MIMIC在更大规模上显示了相同的定性阈值效应,但残留的漏诊率要高得多,强化了测量解释而非声称已解决缓解。 #### 3.2.2 尾部类别正例支持。 M6的总体提升并非均匀分布在疾病中。它主要由钙化(n_+=19,FNR从0.895降至0.158)、间质性肺病(n_+=16,0.375降至0.000)和实变(n_+=11,0.818降至0.091)驱动。气胸(n_+=7)变化不大,肺不张(n_+=3)低于1,500张图像测试集可支持稳定疾病级结论的分辨率。这种支持检查确保疾病级解释与实际可用阳性计数相关联。 #### 3.2.3 配对对比与参考基线。 配对bootstrap重采样使用跨方法的共享测试行索引,选择对比以隔离每个组件的贡献:M6 vs M1用于完整阶梯,M6 vs M5用于阈值化,M5 vs M3用于亚组感知训练相对于仅类别重新加权。表4 (https://arxiv.org/html/2607.07717#S3.T4) 报告了均值配对差异μ(A)-μ(B)、其95%区间以及方法A FNR低于方法B的经验概率。对于FNR指标,负值更优。 表4:VinDr-CXR上的配对bootstrap对比(n_boot=1,000,除年龄行外省略了一个简并重采样)。负FNR差异有利于第一种方法。 配对结果支持主要解释。M6相对于M1以及相对于相同分数的M5操作点,在所有三个FNR终点上均有改善,表明阈值目标占降低的很大一部分。M5相对于M3也改善了尾部FNR,表明亚组感知加权在校准前就有贡献,尽管年龄最差群体对比较弱。 M4 GroupDRO在表2 (https://arxiv.org/html/2607.07717#S3.T2) 和表3 (https://arxiv.org/html/2607.07717#S3.T3) 中作为群体鲁棒性参考而非直接阶梯层级包含。它在阈值化尾部或最差群体FNR上无法匹配M6。在MIMIC上,将相同的尾部感知规则应用于GroupDRO,在τ=0.05下将尾部FNR从0.888降至0.806,但在尾部FNR和所有报告的最差群体FNR终点上仍然比M6差。此参考并不否定群体鲁棒性的一般价值。它表明,聚合群体鲁棒性和阈值化罕见阳性召回是不同的审计维度。 #### 3.2.4 尾部感知消融、警报负担与种子稳定性。 M5/M6的比较隔离了在一个分数模型上阈值化的效果。将相同的尾部感知规则应用于M1-M3和M5,降低了跨分数模型的尾部FNR和最差群体FNR,表明该现象并非特定于一个有利的检查点。相关的论断更窄:阈值化亚组漏诊是排序指标无法揭示的部署阶段故障模式。 消融也揭示了减少漏诊的工作量代价。对于VinDr上的M5,默认F1操作点在尾部FNR为0.471时预测每100次研究有4.9个尾部阳性标签,而τ=0.05尾部感知点在尾部FNR为0.269时预测每100次研究有38.9个。更严格的下限τ=0.10将警报率降低至每100次研究18.2个,同时保持比F1操作点更低的尾部FNR(0.313)。在MIMIC上,相应的M5比较不那么显著,但仍然具有临床意义:F1阈值化在尾部FNR为0.866时预测每100次研究有6.4个尾部阳性标签;τ=0.05在尾部FNR为0.741时预测每100次研究有19.3个;τ=0.10在尾部FNR为0.811时预测每100次研究有7.1个。因此,操作点是一个临床政策选择,而非通用参数。
相似文章
基于稳健训练和弃权的公平且校准的毒性检测
本文研究了毒性分类中的公平性问题,涵盖三个维度:排序、校准和弃权。比较了经验风险最小化(ERM)、加权ERM和群体分布鲁棒优化(Group DRO)方法,并结合后处理干预措施,发现校准差异是一种隐蔽的公平性违反,且弃权本身也可能不公平。
反事实公平的图像分类器满足群体公平吗?——一项理论与实证研究
本文从理论和实证角度研究了图像分类中反事实公平(CF)与群体公平(GF)之间的关系,引入了新的CF评估数据集(CelebA-CF 和 LFW-CF)。研究发现,由于潜在属性与敏感属性相关,CF并不蕴含图像的GF,并提出了反事实知识蒸馏(CKD)以缓解这一问题。
选择性信号分类中的虚假安全感:对风险控制的边界紧密性与可交换性的审计
本文审计了信号域检测器中用于选择性分类的无分布风险控制方法的可靠性,发现朴素阈值法常常超出其声称的预算,并且可交换性违反导致证书失败。
算法公平性的统计与结构性方法
本博士论文批判了当前机器学习中的公平性度量方法,并提出统计假设检验和结构性分析来解决偏差问题,重点关注网络和层级上下文。
大型语言模型中的解释公平性:关于LLM在不同人口群体中如何证明决策的实证分析
本文提出了“解释公平性分类法”(Explanation Fairness Taxonomy, EFT),以分析大型语言模型(LLM)在不同人口群体中证明决策时的差异,研究发现尽管决策本身保持平衡,但在解释的质量和语调上仍存在显著偏差。