一个分数,两个决策:在罕见疾病尾部的选择性预测

arXiv cs.LG 论文

摘要

本文分析了用于罕见疾病诊断的选择性预测系统,表明小型开源权重LLMs在超罕见疾病上召回率较低,并探讨了使用分数边际进行决策的局限性。

arXiv:2608.14683v1 公告类型:新 摘要:给定患者的临床发现,诊断系统对可能的疾病进行排名,并必须决定何时确认其第一次预测或推迟进行审查。这一决策通常通过对最高分数进行阈值处理来完成。对排序输出的选择性预测首先进行两项检查。第一,排名系统必须产生足够多的正确顶级排名预测,以使目标可行。在跨疾病流行率分层的2,000名患者记录中,八个小开源权重LLMs在超罕见疾病上的召回率@1最高为4.6%。在10%的覆盖率下,即使对其现有预测进行完美的置信度排名,选择性准确率也无法达到50%。更准确的模型通过相同的检查,表明这一限制是特定于情况的。第二,置信度信号必须与所做的决策相匹配。对于固定候选排名系统,前两名边际会取消跨候选共享的组件。在仅表型Exomiser上,它以29.0%的准确率选择10%的病例,而整体准确率为13.3%,同时最高分数没有提供可靠的门控。然而,这种抵消可能会移除检测候选列表是否包含答案所需的信息。SciFact检索和生物医学实体链接证实了这一区别。最后,我们证明仅未标记的分数无法确定切换到边际是否有帮助。
查看原文
查看缓存全文

缓存时间: 2026/08/18 10:24

# 罕见病尾部数据的选择性预测  
来源:https://arxiv.org/html/2608.14683  

## 一项评分,两种决策:罕见病尾部数据的选择性预测  
姜朝阳¹ 傅志忠³ 金润秀¹ 李子成⁴ 彭璇琪¹ 滕飞¹ 米嘉宏² 吴洪汉¹  
¹格拉斯哥大学健康与福祉学院,英国格拉斯哥  
²上海交通大学医学院附属上海市第六人民医院呼吸与危重医学科,中国上海  
³电子科技大学生命科学与技术学院,中国成都  
联系邮箱:[email protected], [email protected]  

###### 摘要  
给定患者的临床发现,诊断系统会对可能疾病进行排序,并必须决定何时采纳其首选预测或推迟诊断。该决策通常通过对最高分设定阈值实现。基于排序输出的选择性预测始于两项检查:首先,排序器必须产生足够多正确的高排名预测以使目标可行。在按疾病发病率分层的2,000份患者记录中,八个小型开源大语言模型在超罕见疾病上的Recall@1最高仅为4.6%。即使在10%的覆盖率下,其现有预测的完美置信度排序也无法达到50%的选择性准确率。更准确的模型通过了相同的检查,表明该限制具有特定情境性。其次,置信信号必须与决策匹配。对于固定候选排序器,前两名置信差可消除候选者共有的成分。在仅基于表型的Exomiser系统中,该差值在29.0%的准确率下选择了10%的病例,而整体准确率仅为13.3%,且最高分无法提供可靠的阈值。然而这种消除可能移除了检测候选列表是否包含答案所需的信息。SciFact检索和生物医学实体链接实验验证了这一区别。最后我们证明,仅凭无标签分数无法确定切换到置信差是否会有帮助。  

**一项评分,两种决策:罕见病尾部数据的选择性预测**  
姜朝阳¹ 傅志忠³ 金润秀¹ 李子成⁴ 彭璇琪¹ 滕飞¹ 米嘉宏² 吴洪汉¹††  
通讯作者。¹格拉斯哥大学健康与福祉学院,英国格拉斯哥  
²上海交通大学医学院附属上海市第六人民医院呼吸与危重医学科,中国上海  
³电子科技大学生命科学与技术学院,中国成都  
联系邮箱:[email protected], [email protected]  

参见标题  
图1:本文的三项主张中的两项;第一项可行性对应公式(1)和第5.2节。(a) 公式(3)将每个分数拆分为病例所有候选共有的层级和候选特定残差。我们发现正确性可从残差在领先者间留下的差距读取,而存在性需要层级信息,但差距已丢弃该信息,且根据公式(5),任何候选间的零和对比均无法恢复该信息(第5.6节)。(b) 两个具有相同无标签分数和基础准确率的联合定律产生相反符号的增益,因此这些分数的任何泛函都无法识别哪种门控更优(命题1)。  

## 1 引言  
罕见病诊断是一个排序问题。给定患者的表型(如癫痫发作或身材矮小等结构化发现),诊断系统必须对数千种可能疾病进行排序。大语言模型可将简短输入转化为广泛的鉴别诊断,这使其在超罕见病领域具有吸引力——那里最需要诊断支持。鉴别诊断仅在临床医生知道何时应信任系统首选建议时才有用。选择性预测通过在高置信度病例采纳首选预测,并将其余病例提交审查来处理此问题。在我们的设定中,这意味着在不隐藏其余鉴别诊断的情况下延迟对首选候选者的确认:自信的错误会导致不必要的检测和咨询,而过度弃权则使系统失去效用。对于两项不同决策——首选候选者是否正确以及任何正确候选者是否存在——常规方法都对同一最高分设定阈值。我们证明这两项决策需要不同的检查和信号。  

第一项检查是可行性。若预测器在比例为p的病例上正确,且系统回答比例为c的病例,即使完美置信度排序的选择性准确率也无法超过min(1, p/c)。高于此上限的目标无法通过对相同预测重新校准或重新评分实现,因为置信度可以重排正确答案但无法创造它们。该检查在分布尾部尤为重要,因为整体准确性会掩盖低得多的尾部准确性。对于通过检查的预测器,信号取决于决策。最高分可能包含病例层级成分(所有候选共享),而与次高者的差距可消除该成分。这有助于判断领先者是否正确,因为差距衡量其与最近替代方案的分离程度。但共享层级表示候选集是否适配输入(例如检索器无相关文档或提及在知识库中无条目),因此一次相减可能有助于正确性但损害存在性。其他候选间比较也无法恢复该信息:所有零和对比均精确消除层级,因此需要该信息的系统必须从竞争外部寻找。图1总结了这一区别,第3节对其进行形式化表述。  

我们在统一抽样的10,374份患者记录中测试此结论(按诊断的Orphanet发病率类别读取)。在八个小型开源大语言模型中,超罕见病Recall@1最高仅为4.6%,因此在10%覆盖率下,即使完美置信度也被限制在46%。五个医学专用模型中有两个在点估计和整体区间内达到50%目标,三个前沿配置达到15.8–22.4%,使上限不受约束,因此该限制仅针对低准确性预测器而非置信度本身。在此情境下,表型排序器(将患者发现与精选疾病特征进行比较)在我们的留源对照中是更强的起点。在仅基于表型的Exomiser系统中,最高分无法产生可用工作点,而差距在13.3%基础率下以29.0%准确率选择了10%的超罕见病例。从检索器中减去共享成分后,我们可通过事后温度调整重新计算其最高分门控,使其达到差距水平,从而测试机制而非推断机制。差距在SciFact检索和使用非标准化评分器的实体链接中也优于原始分数用于判断正确性。然后通过遮蔽相关候选分离两者:在SciFact上差距成为三项存在性信号中最差的,在实体链接中它从未成为最佳。最后我们证明,即使基础准确率固定,仅凭无标签分数也无法确定切换的增益。  

## 2 相关工作  
#### 选择性预测与延迟决策。  
校准和不确定性估计增强了固定一组top-1预测的置信度:它们从现有答案中选择而不改变其内容,因此所能达到的性能受公式(1)约束。延迟决策、级联和自适应检索工作在另一机制中,将病例路由至第二预测器并改变基础准确性。我们将神谕上限(可实现性能上界)解读为区分机制的检验标准。  

#### 排序输出的置信度。  
最高分、领先者间差距以及基于局部几何的信任分数是既定信号。减去每个输入的干扰因素(如查询长度、冒名群体、表型驱动诊断中的查询项数或使分数跨查询可比的标准化方法)也是常用方法。所有这些都通过移除共享层级来改善排序;而我们的问题是哪项决策仍需要该信息,公式(3)使此问题可检验。同时,Wagner (2026) 用两个内部大语言模型信号分离正确性和可回答性,Wang等 (2025) 基于单调链接下的前两名置信差门控检索。第3.3节表明该链接无法从无标签分数中选择;我们研究排序器已输出分数中的分离。  

#### 长尾知识。  
该文献通过语料频率定义稀有性;我们按Orphanet发病率分层。固定语料频率后,疾病间差异基本保持不变,但匹配对数量过少无法排除曝光解释而只能限制其影响(附录C.2)。  

#### 罕见病诊断。  
表型优先级排序器将疾病与精选特征进行排名;通用大语言模型落后于它们,专用或智能系统添加了训练、检索和工具但缺乏按发病率分层或去除污染的评估。一项元分析呼吁采用我们采用的按发病率分层设计。Elmofty和Leser (2026) 发现临界点取决于检索覆盖率(答案是否进入候选池);我们的p值询问预测器是否已将其置于首位,这决定了可行工作点(附录B)。  

## 3 排序输出的选择性预测  
选择性预测通常被表述为置信度分数的选择问题。对于排序输出,这个问题出现得太早:必须首先询问预测器是否产生了足够多正确的高排名答案以达到工作点,然后询问门控旨在证明什么——是领先候选正确还是候选集包含有效答案。后续三步包括:可行性检验、决策特定的分数分解,以及无标签分数可确定范围的限制。  

### 3.1 置信度估计前的可行性  
考虑N个病例。设y_i=1表示预测器在病例i的最高排名答案正确,否则为0,因此其基础准确率为p=(1/N)∑_i y_i。置信规则q选择一个被回答集合A_q,实现覆盖率为c=|A_q|/N(包含平局分数的影响),选择性准确率为Acc_sel(q,c)=(1/|A_q|)∑_{i∈A_q} y_i。被回答集合中正确预测的数量不能超过整个样本中的正确预测总数,也不能超过其病例数,因此∑_{i∈A_q} y_i ≤ min(|A_q|, ∑_{i=1}^N y_i)。两边除以|A_q|可得:Acc_sel(q,c) ≤ min(1, p/c)。(1) 这是选择性预测背后的标准神谕上限,本文将其用作可行性检验而非新界。如果部署要求在覆盖率c下达到选择性准确率τ,则公式(1)意味着必要条件p ≥ τc。(2) 当条件不满足时,任何不改变预测器答案的重新校准、不确定性估计器或置信度分数都无法达到目标,因为所需正确答案不存在以供选择。补救措施均属不同类别:更准确的预测器、更大的返回候选集或部署可承受的降低目标。当条件满足时,目标仅是可能实现,因为门控仍须将正确病例置于首位。对于top-k决策,同样论证适用,此时y_i重新定义为正确答案是否出现在top-k中,因此p变为Recall@k。我们通过...

相似文章

从结构化临床数据预测心血管风险的大语言模型

arXiv cs.CL

本文提出了一种混合框架,将结构化临床数据与LLM生成的叙述相结合,用于冠状动脉疾病预测,在变量提取方面实现了高保真度,并比较了机器学习模型与基于LLM的零样本和少样本分类。