校准虚拟筛选中的无声失败:边际共形预测对少数类覆盖不足,类条件修复方案恢复覆盖

arXiv cs.LG 论文

摘要

本文揭示了标准边际共形预测在不平衡虚拟筛选数据集中无法覆盖少数类,并展示了类条件(Mondrian)共形预测如何恢复每类覆盖。

arXiv:2607.06605v1 Announce Type: new 摘要:共形预测正在被用于药物发现,以对模型可靠性给出一个诚实的数值:选择错误率alpha,该方法返回包含真实标签且概率至少为1-alpha的预测集。我们表明,在不平衡数据集中,这一保证可能很危险。在四个数据集中,标准(边际)共形预测达到了全局90%的覆盖目标,但少数类却严重暴露:在血脑屏障渗透率上,少数类实际覆盖率降至64.8%,在临床试验毒性上降至4.2%,其中稀有类几乎被抛弃。该失败并不局限于单一模型:随机森林、图网络和冻结的化学语言模型都重现了该问题(每种情况下p<0.001),其严重程度与稀有标签的基线校准相关,而非模型架构。一个守恒恒等式解释了这一效应:少数类的短缺等于多数类的盈余乘以不平衡比,预测的差距在一点以内,并且排序了数据集间的严重程度。该失败在现实的支架拆分和第二个共形分数下依然存在,而聚合准确率和总体覆盖率仍然高得令人安心,这恰恰是它容易被忽视的原因。类条件(Mondrian)共形预测在每个数据集中消除了差距,使少数类覆盖率恢复目标,仅略微增加了预测集大小。我们将失败定位到通用的分子支架——在两个类别中都出现的普通苯环和吡啶核心——提出了一个单数值诊断,并通过成本模型表明,对受影响化合物进行弃权可以将筛选活动从净负效用转变为净正效用。我们的贡献是在真实化学数据上展示了这种已知的共形理论差距在不平衡下变得多么严重且隐蔽,并提出了一套实用的协议来恢复每类的可靠性。
查看原文
查看缓存全文

缓存时间: 2026/07/09 07:41

# 校准虚拟筛选中的寂静失败:边缘共形预测低估少数类,而类条件修复方法恢复其性能

来源:https://arxiv.org/html/2607.06605  
Mustafojon Tursunbadalov  
科学与技术学院,Champions College Prep,美国

###### 摘要

共形预测正被引入药物发现领域,作为一种为模型可靠性提供诚实数值的方法。其吸引力在于其保证:选择错误率α,该方法返回的预测集能以至少1−α的概率包含真实标签。我们表明,在筛选实际处理的不平衡数据集上,直接相信这一保证可能很危险。在四个数据集(包括一个从其余分析中保留的数据集)上,标准(边缘)共形预测达到了全局90%的覆盖目标,同时却使少数类严重暴露——在血脑屏障穿透任务上,少数类实际覆盖降至64.8%,在Tox21毒性终点任务上降至38.9%,在临床试验毒性任务上降至4.2%,其中稀有类几乎被完全放弃。该失败并非由单一模型造成:基于圆形指纹的随机森林、直接读取分子结构的图卷积网络、以及一个冻结的预训练化学语言模型都复现了该现象(每次测试中十个随机数据分割的p<0.001),且差距大小取决于模型在稀有标签上的校准程度,而非其架构。我们用一个守恒恒等式解释这一效应:由于整体覆盖率固定,少数类的不足等于多数类的过剩乘以不平衡比率,该关系预测的BBBP差距误差在1个百分点以内,并能按严重程度对所有四个数据集排序。该失败在现实的骨架分割和第二种共形分数(自适应预测集)下依然存在,且聚合准确性和整体覆盖率在整个过程中保持较高水平,这正是它容易被忽略的原因。类条件(Mondrian)共形预测在所有数据集上消除了差距,使少数类覆盖率回归目标值,而预测集大小仅略有增加。我们将边缘失败定位在少数几个通用分子骨架上——出现在两个类别中的简单苯环和吡啶核心——提出了一个单数值诊断指标(少数类覆盖差距),并通过一个成本模型(在不同假设下均稳健)表明,对受影响的化合物进行弃权可将筛选活动从负效用转换为正效用。边缘与条件之间的区别在共形文献中广为人知;我们的贡献在于展示在真实化学场景下,该区别在不平衡情况下变得多么严重和隐蔽,对其进行量化解释,并提出一个恢复每类可靠性的实用协议。

关键词:共形预测,不确定性量化,虚拟筛选,类别不平衡,选择性预测,分子性质预测

## 1 引言

一个筛选模型只有在其声称确信的情况下值得信赖时才有用。用于分子性质预测的现代分类器可以达到很高的聚合准确率,但单个准确率数字无法说明*哪些*预测值得信任。这一差距促使共形预测进入化学信息学领域。共形方法包裹现有分类器,对每个化合物返回一组标签,该标签集以用户选择的概率证明包含真实标签[1,2]。该保证是分布自由且有限样本的。它不需要模型正确的任何假设,只需校准集和测试集可交换。对于一个通常基于模型排名而投入昂贵湿实验资源的领域,这样的保证非常有价值。

但有一个容易被忽略的陷阱。标准保证是*边缘*的:覆盖率在整个测试分布上平均成立。它不承诺任何特定子组的情况。在平衡问题上,这一区别很少造成影响。但筛选问题几乎从不是平衡的。感兴趣的标签——毒性化合物、非穿透性候选物、活性命中物——通常是稀有类,而稀有类正是进行筛选活动的全部原因。一个通过在对常见类几乎完美而对稀有类悄无声息地差劲来保持整体承诺的方法,对于筛选而言,是在履行错误的承诺。

本文衡量了这种情况的严重程度,并表明它并非极端情况。在三个不平衡的MoleculeNet任务上,边缘共形预测达到了90%的整体目标,同时少数类覆盖率却低至38.9%。然后我们追问这一效应是否只是单一模型系列的伪像。结果是否定的。同样的崩溃出现在基于指纹的随机森林、图神经网络以及将分子视为文本字符串的预训练Transformer中——这三种分子表示方式在机制上几乎毫无共同之处。结果发现,崩溃的严重程度取决于基模型在稀有标签上的校准程度,而非其表示方式。这是关于校准步骤的结论,而非关于深度学习的。

在实践中,这一失败之所以危险,是因为它从宏观上看不见。整体覆盖率、整体准确率、ROC-AUC——团队通常检查的所有仪表盘数字——都保持良好,而少数类覆盖率却跌至谷底。一个信任共形保证(如宣传的那样)的从业者没有理由去进一步细查。

修复方法并非新提出,我们也未声称是自己的。类条件(Mondrian)共形预测为每个类别分别校准一个阈值[5],从而通过构造恢复每个组内的覆盖率。边缘与条件之间的差距是教科书式的共形理论[2]。我们的贡献在于实证和解释性的案例,表明这一教科书差距是虚拟筛选中的现实风险:我们在四个数据集(包括一个从其余分析中保留的数据集)上量化了它,展示了它在三种代表性分子学习范式上的一致性,用简单的分解解释了其大小,将其追溯到特定的化学子结构,并将其与决策成本模型联系起来,使实际利害关系具体化。我们的目标与其说是“这里有一种方法”,不如说是“这里有一个漏洞,这是其成因,这是如何发现它,以及如何弥补它”。

具体来说,本文提出五个主张,每个都有实验支持:

1. 在不平衡分子数据集上,边缘共形预测满足其全局覆盖率目标,同时却低估了少数类的覆盖率,且缺口随不平衡程度增长:从接近平衡的BACE上的0.6个百分点缺口,到高度不平衡的ClinTox上的近乎完全崩溃(4.2%覆盖率)。
2. 这种崩溃在三个无关的模型架构上以p<0.001复现,其严重性由基线少数类校准程度决定,而非架构。
3. 一个简单的覆盖率分解解释了该效应:少数类的不足等于多数类的过剩乘以不平衡比率。它直接来自加权覆盖率的定义,却预测了各数据集上测量的差距及其排序。
4. 标准聚合指标隐藏了该失败,我们通过选择性预测协议和成本分析予以证明,并且该失败在现实的骨架分割下依然存在。
5. 错误自信的少数类预测集中在少量常见、信息量低的骨架上,我们以化学案例研究的形式呈现。

## 2 相关工作

#### 共形预测及其条件变体。

该框架源自Vovk及其同事[1],他们建立了基于可交换性的覆盖率保证。Angelopoulos和Bates[2]的现代可理解处理现在是标准参考,它明确指出基本保证是边缘的,条件覆盖需要额外机制。两个评分函数对分类很重要。Sadinle等人的最小歧义集分类器(LAC)[3]使用1−p̂(y|x)并在给定覆盖率下产生最小集;自适应预测集[4]以大小为代价换取更好的条件行为。类条件校准,即Vovk的Mondrian分类学[5],按标签分割校准集并为每个标签计算单独的分位数,从而在类难分时以更大的集为代价提供*每类*覆盖率。我们的工作并未发明任何这些内容。我们使用LAC是因为它是常见的默认选项,并且因其小集使得边缘失败最为明显;我们使用Mondrian校准作为补救方法。

#### 化学信息学中的共形预测。

共形方法进入药物发现主要归功于Norinder、Carlsson及其同事的工作,他们将经典的应用域问题重新定义为覆盖率问题[13],并通过针对发现流程的综述[14]进行推广。那条工作线主要强调了共形预测*提供*的内容——有效集、可解释的置信度——而非默认公式在何处失效。不平衡问题在一般文献中偶有提及,但据我们所读,它尚未在标准分子基准上跨架构系统地测量,也未与决策成本相联系。这就是本文所占据的空间。

#### 校正是独立的维度。

人们容易假设校准不良的模型是原因,校准修复是治愈方法。Guo等人[12]表明现代网络往往过度自信,事后缩放有帮助。我们发现共形失败与普通校准误差仅松散相关:我们的基模型最多中度校准不良(预期校准误差约0.04–0.10),但边缘共形覆盖率仍然在少数类上崩溃。校准和条件覆盖是不同的属性,修复前者并不能修复后者。

#### 分子表示。

我们有意涵盖三个表示家族。圆形(ECFP风格)指纹[7]输入随机森林[8]。用PyTorch Geometric[10]构建的图卷积网络[9]从原子-键图学习。ChemBERTa,一个在数百万SMILES字符串[11]上预训练的RoBERTa风格Transformer,提供序列嵌入。它们在分子编码层面基本上没有共同点,这使得它们共同的失败具有信息量。

## 3 方法

### 3.1 数据集

我们使用来自MoleculeNet[6]的四个二分类任务,选择它们以覆盖广泛的类别不平衡范围(表1)。血脑屏障穿透(BBBP)[15]标记化合物是否能通过屏障;少数类是非穿透性化合物。BACE[16]标记β-分泌酶1抑制,接近平衡。从Tox21[17]中我们取SR-ARE应激反应端点。ClinTox提供CT-TOX端点(因毒性临床试验失败);这是我们使用的最不平衡的任务。与其它任务一样,它是一个MoleculeNet任务,因此它作为保留检查——在我们研究的其它地方未使用——而非来自独立数据源的外部验证。RDKit[18]无法解析的SMILES字符串被丢弃;表1中的计数是过滤后的,并且在给定数据集的每次实验中相同。

大多数实验使用随机训练/校准/测试分割,这保持了共形预测假设的可交换性。在第4.9节的稳健性检查中,我们改用骨架分割:分子按Bemis–Murcko骨架分组,整个组分配给单个分区,以便测试化合物携带训练和校准中未见过的骨架。骨架分割刻意打破可交换性,从而测试在现实分布偏移下的行为。

表1:解析后的数据集。“少数类比率”是较小类中化合物的比例。

| 数据集 | 化合物总数 | 少数类数量(比率) | 描述 |
|--------|------------|---------------------|------|
| BACE   | 1513       | 691 (0.457)         | β-分泌酶1抑制 |
| BBBP   | 2039       | 517 (0.254)         | 血脑屏障穿透 |
| Tox21  | 7831       | 1146 (0.146)        | SR-ARE应激反应 |
| ClinTox| 1478       | 92 (0.062)          | CT-TOX(临床试验毒性) |

### 3.2 模型与表示

对于主要的共形实验和所有跨数据集工作,我们使用随机森林[8](500棵树)在2048位摩根指纹(半径2)上,用RDKit的MorganGenerator计算。我们选择了随机森林,因为之前我们在BBBP上进行了四种标准分类器的分层五折交叉验证比较(第4.1节);它给出了最佳的AUC和有竞争力的平衡准确率,并且作为袋装集成,它开箱即用就能产生合理的概率估计。

在架构研究中,我们添加了另外两种表示。图网络是一个两层图卷积模型[9](GCNConv 32→64→64,均值池化,线性读出到两个类别),用PyTorch Geometric[10]实现,使用Adam优化器以学习率10^{-3}训练60个周期。原子特征是32维独热编码,包括元素、度数、氢原子数、杂化方式、芳香性和形式电荷。Transformer是ChemBERTa(DeepChem/ChemBERTa-77M-MTR)[11],用作冻结的特征提取器:我们对SMILES令牌上的最终隐藏状态进行均值池化为384维嵌入,并拟合逻辑回归头。冻结Transformer将表示与我们这边的任何调优选择隔离开。

### 3.3 共形预测

我们使用分割(归纳)共形预测。每个数据集被划分为一个正式训练集(50%)、一个校准集(25%)和一个测试集(25%)。基模型仅在训练分割上拟合。对于模型输出p̂(y|x),我们用LAC非一致性分数[3]对每个校准点进行评分

s_i = 1 - p̂(y_i | x_i)。(1)

对于目标覆盖率1-α,其中α=0.10,边缘阈值是共形分位数

q̂ = {s_i}的⌈(n+1)(1-α)⌉/n经验分位数,(2)

其中n是校准集大小,测试点的预测集为

C(x) = { y : p̂(y|x) ≥ 1 - q̂ }。(3)

式(2)中的有限样本修正…

相似文章

面向视觉与语言模型的经验贝叶斯共形预测

arXiv cs.LG

本文介绍了一种经验贝叶斯共形预测框架,该框架使用 r 值将评分变异性纳入非一致性得分中,从而提升排序稳定性并缩减集合大小,同时保持对视觉与语言模型的覆盖。