从初步筛选预测可量化性以优先安排剂量反应分析
摘要
本文提出了一个从初步筛选预测可量化性以在药物发现中优先安排剂量反应分析的框架,表明效力估计的可用性可以与生物活性区分开来。
arXiv:2608.26538v1 公告类型:新
摘要:高通量药物筛选依赖于低成本的初步检测来优先安排化合物进行更昂贵的剂量反应分析,最终量化其效力。当前的筛选策略主要关注识别在后续确认生物活性的化合物,隐含地假设确认的活性也会产生可用的效力估计。然而,筛选中确认的生物活性不一定能转化为可量化的效力,因为活性化合物仍可能无法产生可报告的剂量反应估计。因此,我们提出了一个框架,将可量化性建模为与生物活性不同的分诊目标,即后续测试是否会产生可用的效力估计。可量化性从先前的低成本筛选中高度可预测,大多数预测信息来源于观察到的筛选特征,而非分子结构。基于响应的预测器在先前未见的化学支架上保持稳健,并能跨未测试的检测机制家族泛化,而成功量化的概率随响应幅度和检测上下文显著变化。这些发现确立了实验可测量性(与生物活性不同)作为筛选结果的可预测属性,并表明可量化性感知的分诊可以改善昂贵的剂量反应分析能力的分配。
查看缓存全文
缓存时间: 2026/08/28 09:41
# 从初筛预测量化性以优先排序剂量-反应分析
来源:https://arxiv.org/html/2608.26538
###### 摘要
高通量药物筛选依赖低成本的初级检测来优先选择化合物进行更昂贵的剂量-反应分析,其中药效最终被量化。当前的筛选策略主要侧重于识别那些在后续实验中将确认生物活性的化合物,隐含地假设确认的活性也将产生可用的药效估计值。然而,筛选中确认的生物活性并不一定转化为可量化的药效,因为活性化合物仍可能无法产生可报告的剂量-反应估计值。因此,我们提出了一个量化性建模框架,即将后续测试是否会产生可用的药效估计值,与生物活性分开作为独立的分拣目标。量化性可以从之前的低成本筛选中强烈预测,其大部分预测信息来源于观察到的筛选特征而非分子结构。基于响应的预测因子在先前未见的化学骨架上保持稳健,并在保留的检测机制家族间泛化良好,而成功量化的概率随响应幅度和检测环境的不同而显著变化。这些发现确立了实验可测量性(区别于生物活性)作为筛选结果的一个可预测属性,并表明量化性感知的分拣可以提高昂贵剂量-反应分析能力的分配效率。
## 1 引言
在药物发现早期,化合物的药效是一个核心的评价指标。构效关系、选择性谱和研发决策通常依赖于从浓度-反应实验得出的药效估计值,通常报告为IC50、EC50或其对数形式如pXC50(Hughes等人, 2011 (https://arxiv.org/html/2608.26538#bib.bib1);Srinivasan and Lloyd, 2024 (https://arxiv.org/html/2608.26538#bib.bib2))。然而,获取这些值需要进行多浓度剂量-反应实验,其资源密集度远高于用于识别候选命中化合物的初筛。因此,高通量筛选活动通常作为多阶段或低保真度漏斗运行:对一个大型化合物集进行相对廉价的初筛,然后对选定的小型子集进行更高保真度的浓度-反应表征(Hughes等人, 2011 (https://arxiv.org/html/2608.26538#bib.bib1);Buterez等人, 2023 (https://arxiv.org/html/2608.26538#bib.bib3))。关键决策是将哪些化合物-检测对从筛选阶段提升到分析阶段。
这种提升决策通常是通过评估初始筛选信号是代表真正的生物活性、噪声还是检测干扰来做出的。因此,现有的命中分拣方法强调从化学或历史筛选信息中预测活性(Riniker等人, 2014 (https://arxiv.org/html/2608.26538#bib.bib4);Buterez等人, 2023 (https://arxiv.org/html/2608.26538#bib.bib3)),识别频繁命中者和检测干扰化合物(Baell and Holloway, 2010 (https://arxiv.org/html/2608.26538#bib.bib5);Dahlin等人, 2015 (https://arxiv.org/html/2608.26538#bib.bib6);Tan等人, 2024 (https://arxiv.org/html/2608.26538#bib.bib7)),以及区分可靠命中与实验变异性的重复性感知统计程序(Malo等人, 2010 (https://arxiv.org/html/2608.26538#bib.bib8))。尽管这些方法在方法论上存在显著差异,但它们都强调在昂贵的后续实验之前减少假阳性活性判断。这种框架隐含地假设,当被提升的配对最终无活性时,分析实验主要被浪费了。然而,在分析的此次筛选活动中,无活性仅解释了不到三分之二的不成功分析。在32,971个被提升的化合物-检测对中,有18,299个未产生报告的药效。其中,6,750个在11点剂量-反应实验中明显有活性,但仍然未能产生可拟合为可报告pXC50的曲线。换句话说,即使是完美的活性过滤器也无法阻止超过三分之一的不成功分析实验。
因此,问题并不总是筛选识别了假命中。在许多情况下,活性是真实的,但响应太弱或不完整,以至于后续的剂量-反应实验无法产生可靠的希尔拟合和可报告的pXC50。这一区别与既有的浓度-反应分析一致:可靠的中点估计要求实验数据充分定义反应转变,当浓度范围未能充分约束曲线的相关部分或渐近线时,不确定性可能变得很大(Sebaugh, 2011 (https://arxiv.org/html/2608.26538#bib.bib9);Shockley, 2015 (https://arxiv.org/html/2608.26538#bib.bib10))。这改变了分拣的目标。与其仅询问化合物-检测对是否有活性,更有用的问题是分析该配对是否真的会产生可量化的药效。如果失败是由响应幅度不足驱动的,那么警告信号可能已经存在于廉价的筛选测量中。因此,量化性可以在分析之前,使用作为标准筛选工作流一部分已经收集的数据来预测,而无需任何额外的实验。
在此,我们将量化性表述为分拣目标,并测试是否可以在剂量-反应分析之前从筛选数据中预测它。我们在EvE Bio化合物-检测矩阵的连续发布版本和五个检测机制家族中的32,971个被提升的化合物-检测对上评估了这种表述。得出三个结果。首先,量化性是可预测的,预测主要来自筛选曲线而非分子。从三点响应推导出的16个简单特征优于所有传统的筛选启发式方法。Morgan指纹排名也低于它们,并且在骨架不相交的保留评估中失去了大部分表观预测信号。其次,量化性主要由信号幅度驱动,但所需的阈值取决于检测形式。量化所需的幅度在不同检测形式之间存在显著差异,失败率范围从18.8%到81.6%。第三,我们在一个近似于常规实验室部署的防泄漏滚动设计下评估了该策略,其中每个发布版本仅使用时间上在其之前的版本进行预测。在此评估下,按预测的量化性对配对进行排序,显著减少了恢复大多数可报告药效所需的剂量-反应实验数量。筛查幅度与后续量化之间的相同关系也在外部数据集中独立观察到。
## 2 方法
### 2.1 研究设计与结果定义
我们分析了EvE Bio化合物-检测矩阵的连续发布版本,使用了已从三点筛选提升到11点剂量-反应实验的化合物-检测对。该分析包含32,971个被提升的配对,因此是基于历史提升策略的条件分析。主要的预测目标是*量化性*。对于每个被提升的配对$i$,
$$
y_{i}=
\begin{cases}
1 & \text{如果分析产生了可报告的药效(pXC50)} \\
0 & \text{否则}
\end{cases}
$$
被EvE Bio标记为“活性-已量化”的配对被赋予$y_{i}=1$;所有其他被提升的配对被赋予$y_{i}=0$。在描述性分析失败模式时,不可量化的配对进一步区分为分析期间无活性或有活性但缺乏可报告的希尔拟合。EvE Bio的“活性-差”整理标签仅用于表征有活性但不可量化的分析结果,未用作预测特征。预测变量仅限于在11点分析之前视为可用的信息。
### 2.2 筛选阶段特征表示
从三点筛选中,我们推导出16个响应特征,总结了信号幅度、响应形状和变异性:活性的均值、中位数、最大值、最小值、范围和标准差;最低和最高筛选浓度下的平均活性$\bar{a}(c_{\min})$和$\bar{a}(c_{\max})$;斜率代理$\bar{a}(c_{\max}) - \bar{a}(c_{\min})$;重复测量标准差的平均值和最大值;测量次数和独特浓度数;最大活性超过30%或50%的二元指标;以及报告的筛选最大值。分子结构由1,024位Morgan指纹(半径2)表示。历史筛选上下文包括六个化合物级别统计量(活性计数和比例、观察到的筛选幅度的平均值和最大值,以及该化合物被筛选过的独特靶点类别和机制家族数量)和三个检测级别统计量(活性计数、活性比例和观察到的平均幅度)。检测元数据将机制家族、靶点类别、模式、技术、筛选类别、提升原因和突变状态编码为虚拟变量。这些块共同构成了1,074特征的完整表示,记为$x_i$。在随机分割分析中,九个化合物和检测级别的历史特征是从完整的筛选矩阵计算得出的。在时间顺序评估中,它们按如下所述重新计算。
### 2.3 预测模型与比较分析
主要的多变量预测器是一个在$y_i$上训练的类别平衡随机森林(500棵树)。平均三点活性是主要的筛选启发式方法;最大三点活性和随机排名是额外的基线。在标准化值的全筛选阶段特征集上训练的类别平衡逻辑回归提供了线性比较器。还分别在仅16个三点特征或仅Morgan指纹上训练了孤立的随机森林。
为了排名连续信息源的贡献,特征组被嵌套地添加,从三点块开始,然后添加指纹、历史化合物和检测概况以及检测元数据。对于该消融分析以及骨架不相交评估,随机森林使用300棵树并进行类别平衡;孤立块通过五折分层交叉验证评估,嵌套模型通过三折分层交叉验证评估。靶点类别和筛选类别亚组分析使用梯度提升树在一个保留折上进行。比较了量化与活性但不可量化配对之间的分子量、LogP、氢键供体和受体数量、可旋转键数量和拓扑极性表面积。基于16,212块板上516,894个对照孔得出的板对照质量检测级别摘要,被测试作为额外的预测因子。
### 2.4 交叉验证与泛化分析
主要模型比较使用五折分层随机交叉验证,主要森林在每个折的全部训练部分上拟合。对相关化学系列之外的泛化能力通过五折Bemis-Murcko骨架不相交分割(787个骨架)进行评估,使得测试化合物与训练化合物不共享骨架。通过留一机制家族外评估来评估跨实验背景的迁移:依次保留五个检测机制家族中的每一个,并分别在仅指纹、指纹加三点块或指纹加三点块加机制家族指标上训练随机森林。
前瞻性使用通过防泄漏滚动评估进行近似。发布版本1-3提供初始训练历史。每个后续发布版本(4、5.1、6、7、8、9、10和11)仅使用早期版本中的被提升配对进行评分,在八个时间顺序测试窗口中产生30,120个配对。没有版本5.0。对于每个窗口,九个化合物和检测级别的历史特征是严格从测试发布之前的筛选结果重新计算的;未见过的化合物或检测接收训练历史先验。区分度AUROC使用直接量化性森林(500棵树)。预算下的召回率和保留率下的预算使用两阶段排序
$$
\hat{s}_i = \hat{P}(A_i = 1 \mid x_i) \, \hat{P}(y_i = 1 \mid A_i = 1, x_i),
$$
其中$A_i$表示在11点实验中的活性(每个阶段300棵树)。因为可报告的药效只出现在活性化合物中,这个乘积是$P(y_i = 1 \mid x_i)$的一个分解。与直接在$y_i$上训练的森林相比,它使五折AUROC变化了0.001,因此报告为操作性排序,而不是经过校准的概率或单独的方法论贡献。在每个发布版本内,按筛选最大活性排序是这些预算指标的比较器。预测被评估为发布版本内的排序,而不是固定的概率阈值。
### 2.5 性能与分析策略指标
设$\pi$是测试集中$n$个配对的排名(分数最高者在前),对于分析比例$f$,令$k = \lfloor fn \rfloor$。在预算$f$下的召回率是前$k$个中恢复的所有可量化配对的比例,
$$
\mathrm{Recall}@f = \frac{\sum_{i=1}^{k} y_{\pi(i)}}{\sum_{j=1}^{n} y_{j}},
$$
产率是同一前缀的精确度,
$$
\mathrm{Yield}@f = \frac{1}{k} \sum_{i=1}^{k} y_{\pi(i)}.
$$
我们报告Recall@50%($f=0.50$)和Yield@25%($f=0.25$)。保留所有可报告药效比例$r$所需的分析预算为
$$
B(r) = \min\left\{ \frac{k}{n}: \ \sum_{i=1}^{k} y_{\pi(i)} \geq r \sum_{j=1}^{n} y_{j} \right\},
$$
其中$r=0.90$是时间顺序分析的工作点。区分度也通过AUROC和AUPRC(交叉验证下的平均值±标准差)进行总结。预期校准误差和Brier分数
$$
\mathrm{BS} = \frac{1}{n} \sum_{i=1}^{n} (\hat{p}_{i} - y_{i})^{2}
$$
是根据提升集上两阶段折外预测概率计算的。
### 2.6 外部验证
外部验证使用美国EPA ToxCast/Tox21数据,来自invitroDB 4.3版本。分析限于43,242个匹配的化合物-终点对,这些对在361个终点上既有代表性的筛选测量值,也有后续的多浓度系列数据。由于其中42,479个配对(98.2%)仅在单个筛选浓度下测量,无法重建EvE Bio的16特征三点表示,因此未转移EvE训练的模型。筛选最大活性作为单浓度排序变量在五折随机交叉验证和终点保留评估下进行评估。此分析在独立平台上测试了幅度-量化性关联。它并非对EvE三点模型或从EvE Bio估计的分析预算减少的验证。
## 3 结果
### 3.1 量化性相似文章
黑箱药物-靶点相互作用预测模型的关注点:跨方法可解释性
一项研究对BridgeDPI药物-靶点相互作用模型进行了跨方法可解释性审计,结合基于梯度的归因和遮挡方法,揭示了模态主导性和伪影,为药物发现提供了可检验的假设。
药物毒性预测的提示工程分析
本文研究了使用大型语言模型进行药物毒性预测时提示工程的影响,发现LLM输出的自然方差超过了提示微调,而化学信息学特征提取则提升了模型性能。
用于多任务ADME性质预测的概率对比预训练
本文提出了一种用于分子图变换器的概率对比预训练框架,以改善药物发现中的多任务ADME性质预测,在三个基准上取得了显著提升。
TRAPS: 基于通路信息分层的治疗反应分析
本文提出了首个用于通路引导的治疗反应建模的统一基准,评估了三种生物学信息驱动的架构(BINN、GraphPath、PATH),在来自癌症基因组图谱的五个癌症队列上,对靶向治疗、放射治疗和生存结局进行多标签预测。
超越药物发现:纳米技术分子优化(NMO)基准
纳米技术分子优化(NMO)基准引入了基于物理的分子设计任务,取代了以药物发现为中心的指标,旨在推动纳米技术领域的科学发现。论文显示,先进方法在NMO上的表现不如更简单的方法,并提出了新的基准方法,包括一种新颖的表示方法和领域无关的预训练。