通道中的天花板:审计临床预测中的学习者差距与测量前沿

arXiv cs.AI 论文

摘要

本文引入了一个框架,用于审计临床预测模型,通过区分学习者效率低下和测量限制,并在多个队列上进行验证,以指导是改进模型还是数据收集。

arXiv:2609.01909v1 Announce Type: new 摘要:临床预测可能因两个不同原因而饱和:拟合的学习者可能未能提取可用信息,或者记录的变量可能施加了总体前沿。我们通过\emph{学习者差距}和\emph{测量通道天花板}来区分这些量。最优平衡精度由总变差分离表征,产生架构不变性、在替换污染下的精确部分识别结果、交叉拟合天花板估计器以及多模态决策改进的精确条件。我们添加了两个有限样本诊断,即标签置换乐观下限和欠拟合曲线,并在三个真实队列上验证了审计:UCI再入院($n=99{,}343$)、BRFSS糖尿病($n=253{,}680$)和NHANES HbA1c($n=10{,}219$)。精心调优的梯度提升在UCI和BRFSS中几乎达到了估计的前沿,而故意或实际缺陷的学习者保留了大的差距。NHANES在问卷和测量边际前沿之间产生了零差异,但有显著的联合互补增益,从而细化了客观模式必须占主导的简单主张。在所有队列中,适度的AUROC增益与显著更大的贝叶斯决策翻转率共存,几种架构估计了相似的前沿,而它们达到的平衡精度却大相径庭。PRISMA指导的104个临床任务综合显示,相同的通道级规律在超过18个疾病类别中重现:一个广泛但非普遍的结构化临床领域、跨模型家族的相同通道增益递减,以及当测量通道变化时更高的性能。该框架将饱和从经验观察转化为可审计的决策:当有余地时改进学习者;否则改进测量。
查看原文
查看缓存全文

缓存时间: 2026/09/03 05:58

# 天花板存在于通道中:临床预测中学习者差距与测量前沿的审计
来源:https://arxiv.org/html/2609.01909  
Nusrat Jahan, Snehasis Mukhopadhyay, Shiaofen Fang, Vijay R. Ramakrishnan

###### 摘要
临床预测可能因两个不同原因而达到饱和:拟合的学习者可能未能提取可用信息,或记录的变量可能构成了人群前沿。我们通过“学习者差距”和“测量通道上限”来区分这两个量。最优平衡精度由全变差分离表征,从而得出架构不变性、在替换污染下的精确部分识别结果、交叉拟合上限估计器以及多模态决策改进的精确条件。我们添加了两个有限样本诊断工具,即标签排列乐观性下限和欠拟合曲线,并在三个真实队列中验证了该审计:UCI再入院(n=99,343)、BRFSS糖尿病(n=253,680)和NHANES HbA1c(n=10,219)。经过良好调优的梯度提升在UCI和BRFSS中几乎达到估计的前沿,而有意或实际有缺陷的学习者则保留了较大的差距。NHANES显示问卷和测量边际前沿之间无差异,但存在显著的联合互补性增益,这修正了“客观模态必须占主导”的简单论断。在所有队列中,适度的AUROC增益与大幅更高的贝叶斯决策翻转率共存,并且几种架构估计的前沿相似,但其达到的平衡精度却存在显著差异。然后,一项PRISMA指导的104项临床任务综合分析表明,相同的通道级规律在超过18个疾病类别中重复出现:一个广泛但非普适的结构化临床区域、跨模型族的同通道增益递减,以及在测量通道改变时更高的性能。该框架将饱和从一个经验观察转变为一个可审计的决策:当仍有提升空间时改进学习者;当没有时则改进测量。

1美国印第安纳波利斯,印第安纳大学,卢迪信息、计算与工程学院,计算机科学系,邮箱:[email protected]  
2孟加拉国达卡,阿赫桑ullah科技大学,计算机科学系  
3美国印第安纳波利斯,普渡大学,计算机科学系  
4美国印第安纳波利斯,印第安纳大学医学院,耳鼻喉科–头颈外科

## 引言
增加模型容量和队列规模并不能保证临床预测性能相应提高。使用逻辑回归、随机森林、梯度提升、神经网络和大型语言模型的结构化记录研究经常报告AUROC值在一个广泛的区域,接近0.78–0.88(Shamout等2020;Elfanagely等2021;Ogink等2021;Liu等2025;Mușat等2024)。同一文献中也包含重要的反例:弱的管理或患者报告通道可能低于此区域,而影像学、心电图、基因组学和互补的多模态系统可能超过此区域(Khurshid等2022;Xie等2024;Makarious等2022;Dammu等2023)。这些观察结果通常被描述为一个模型缩放难题,但它们混淆了两个不同的对象。对于观测变量X,**测量通道上限**是从总体中X可达到的贝叶斯前沿。训练后的模型仅达到一个**已实现性能**;它们的差异就是**学习者差距**。更多数据、更好的优化和更丰富的架构可能缩小该差距。然而,它们无法增加固定通道前沿,而新的测量、重复管理、裁定标签或互补模态有可能实现这一增加。这种区分将实验问题从“哪个模型得分最高?”改为“该任务是否仍受学习者限制,还是记录的通道已成为限制因素?”

我们如图1所示将这一区分操作化:类别条件分离决定了固定通道前沿,而学习者差距衡量了剩余的可提取空间。我们从折外交叉拟合的等先验后验中估计前沿,并在信任它之前需要两项诊断。排列零审计量化了向上的插件偏差:随机标签的上限应为0.5。欠拟合曲线测试后验学习者在其训练比例增长时是否已稳定。这些诊断至关重要,因为灵活的估计器可能乐观地过于自信,而欠拟合的估计器可能产生向下偏差的下限。参见标题图1:学习者差距和测量前沿分解。扩展模型可以接近C_BA(X);改变观测通道可以使其移动。

该经验研究在两个互补尺度上进行。三个患者水平队列覆盖99,343、253,680和10,219个观测值,五种通道配置,分组和未分组的交叉拟合,管理记录、电话调查响应、问卷变量以及实验室或检查测量。这些队列共同提供了对所提框架在异质测量设置下的受控评估,使我们能够量化学习者提升空间、评估估计器可靠性,并隔离互补信息通道的贡献。然后,我们检查来自18个以上临床类别的104项任务级观察,以确定相同的区分——同通道增益递减和测量改变后的前沿转移——是否在更广泛的临床文献中重复出现。

我们的贡献是:
1.  **严格的通道前沿。** 我们证明最优平衡精度等于类别条件分布的全变差分离;架构不变性源于数据处理。
2.  **部分识别而非事后噪声拟合。** 在共享替换污染下,我们给出了一个精确上限和一个清晰的识别集:0.85的上限识别分离0.70,但仅意味着α∈[0,0.30]。
3.  **操作化的上限审计和添加模态的准则。** 一个交叉拟合后验估计器与一致性证明、标签排列乐观性下限和欠拟合曲线配对。正的条件互信息不足以保证硬分类增益;严格改进恰好发生在贝叶斯决策在正概率集上改变时,我们通过决策翻转率来衡量。
4.  **多尺度经验验证。** 我们在三个真实临床队列上评估了所提出的审计,这些队列包含99,343、253,680和10,219个观测值,跨越五种测量通道配置。我们用PRISMA指导的104项任务级观察综合分析对其进行补充,这些观察跨越18个以上临床类别,表明同通道增益递减和测量改变后前沿转移之间的相同区分在更广泛的临床文献中重复出现。

## 相关工作与范围
贝叶斯风险、二元假设检验和全变差为预测限制提供了决策理论基础(Nielsen 2014;Jiao等2019)。马尔可夫核收缩散度,Dobrushin系数量化全变差收缩(Polyanskiy和Wu 2015;Gaubert和Qu 2015)。污染模型在稳健统计中是经典的(Huber 1964)。Jiao、Han和Weissman研究基本限制的估计,而Tao等人判别式地估计全变差(Jiao等2019;Tao及其他2024)。我们的目标更窄且可操作:对应于临床硬决策规则的等先验后验泛函。我们将其与诊断工具配对,以确定有限样本估计是否可信,并使用所得数量在真实队列上分离学习者差距和通道上限。请注意,我们并未声称有一个适用于所有散度估计设置的新的通用估计器。精确理论涉及平衡精度和贝叶斯0-1风险。AUROC是一个排序泛函,原始精度取决于患病率,校准与两者都不同。因此,文献综合保留了报告的指标并保持描述性。真实队列审计分别报告AUROC和平衡精度,从不将它们视为可互换。

## 通道上限理论
令Y∈{0,1}具有患病率π,并令P_y = ℒ(X | Y=y)具有密度p_y,关于一个公共测度。定义:
κ_X := TV(P_0, P_1) = ½∫|p_1 − p_0| dμ,
BA(g) := ½{TPR(g) + TNR(g)}.
我们称κ_X为**有效通道可分性**。接下来,我们将展示理论结果的证明概要;完整证明在补充材料中提供。

###### 引理1(平衡精度-分离恒等式)。对于任何二元预测问题,
C_BA(X) := sup_g BA(g) = ½(1 + κ_X),
可通过等先验似然比规则1{p_1 ≥ p_0}达到。在患病率π下,R^⋆_π(X) = ∫min{πp_1, (1−π)p_0} dμ = ½ − ½∫|πp_1 − (1−π)p_0| dμ。
*证明概要。* 对于决策区域A,BA = ½ + ½{P_1(A) − P_0(A)};对A进行优化。原始风险恒等式源于min(a,b) = (a+b−|a−b|)/2。

###### 引理2(数据处理与架构不变性)。如果T是X的任何确定性或随机表示,即Y → X → T,则TV{ℒ(T | 0), ℒ(T | 1)} ≤ κ_X,
C_BA(T) ≤ C_BA(X),
R^⋆_π(T) ≥ R^⋆_π(X)。
*证明概要。* 全变差在马尔可夫核下收缩。对于原始风险,基于T的每个规则都是基于X的一个受限规则。

引理2建立了一个公共上界;它并未断言有限学习者都同样接近它。

### 污染和通用测量通道
令U表示具有类别分布Q_y的信息性潜在内容。一个共享替换通道以概率α返回与类别无关的内容R:P_y = (1−α)Q_y + αR。

###### 定理1(精确替换污染上限)。令τ = TV(Q_0, Q_1)。则κ_X = (1−α)τ,
C_BA(X) = ½{1 + (1−α)τ} ≤ 1 − α/2。
上界中的等式成立当且仅当τ = 1。此外,R^⋆_π(X) ≥ α min{π, 1−π}。
*证明概要。* 公共的αR分量在P_1 − P_0中抵消;对于原始风险,用其公共污染分量下界加权密度。

###### 命题1(清晰识别集)。如果上述模型成立且总体平衡精度上限为c∈[1/2,1],则在没有关于τ的外部知识的情况下,清晰识别集是I_α(c) = [0, 2(1−c)]。因此c = 0.85识别κ_X = 0.70,并且仅意味着α∈[0,0.30]。
*证明概要。* 平台识别乘积(1−α)τ = 2c−1。显示的区间中的每个α都是可行的,且τ = (2c−1)/(1−α) ≤ 1。因此,0.30是一个极限兼容值,而非估计的临床噪声率。

###### 定理2(Dobrushin通道界)。对于一个具有Dobrushin系数ϑ(W) = sup_{u,u′} TV{W(· | u), W(· | u′)}的公共报告核W(dx | u),κ_X ≤ ϑ(W) TV(Q_0, Q_1),
C_BA(X) ≤ ½{1 + ϑ(W) TV(Q_0, Q_1)}。
共享替换通道具有ϑ(W) = 1−α。
*证明概要。* 应用全变差的强数据处理不等式。一个类别依赖的通道W_y违反公共通道假设,可能创建或破坏表面分离。

### 估计固定通道前沿
令M = ½(P_0 + P_1)且η_eq(x) = p_1(x) / (p_0(x) + p_1(x))。

###### 命题2(后验表示)。
κ_X = E_{X∼M} |2η_eq(X) − 1|,
C_BA(X) = ½{1 + E_M |2η_eq(X) − 1|}。
*证明概要。* 将混合密度(p_0 + p_1)/2代入期望;分母抵消得到½∫|p_1 − p_0|。

在一个平衡样本中,将观测值划分为K折,在剩余折上拟合一个概率学习者,并收集折外交叉拟合预测η̂_{−k(i)}(X_i)。定义:
κ̂_CF = (1/n) ∑_{i=1}^n |2η̂_{−k(i)}(X_i) − 1|,
Ĉ^BA_CF = ½(1 + κ̂_CF)。

###### 命题3(交叉拟合审计的一致性)。如果每个折外交叉拟合后验估计器对L^1(M)一致且折大小发散,则κ̂_CF →_p κ_X且Ĉ^BA_CF →_p C_BA(X)。
*证明概要。* 映射a ↦ |2a−1|是Lipschitz连续的。

相似文章

临床访谈抑郁检测基准的多探针审计

arXiv cs.CL

本文通过四个互补探针对五个数据集(DAIC/E-DAIC、CMDC、ANDROIDS、MODMA和PDCH)中的临床访谈抑郁检测基准评估进行审计,发现标准评估协议可能高估模型性能,且排行榜排名缺乏稳定性。