PETA:虚拟筛选中的参数高效测试时自适应

arXiv cs.LG 论文

摘要

PETA提出了一种参数高效的框架,用于虚拟筛选中的测试时自适应,仅在推理时更新LayerNorm参数以提高性能。

arXiv:2608.19906v1 公告类型:新 摘要:在虚拟筛选中,从庞大的化学库中准确排名针对目标蛋白口袋的活性配体仍然是一个核心挑战。DrugCLIP及其最新扩展通过将蛋白口袋和分子编码到共享的嵌入空间中,显著加速了这一过程。尽管如此,进一步的性能改进通常需要重新训练整个模型,带来巨大的计算开销,并使针对特定目标的定制效率低下。在这项工作中,我们将预训练虚拟筛选模型对单个口袋的专门化表述为一个测试时自适应问题,并提出了PETA,一个参数高效的框架,可在测试时直接适配预训练模型。给定目标口袋,PETA通过分子扩散和化学有效性过滤构建口袋特定的负样本,并通过嵌入空间混合将它们向从结构数据库检索到的参考配体移动,以创建更具挑战性的排名任务。然后,一个排名目标更加注重抑制可能污染顶级筛选结果的高分无效候选者,为轻量级自适应提供结构化监督。在不同基准测试中的实验表明,这种轻量级、口袋特定的自适应优于预训练和完全重新训练的基线,同时仅更新LayerNorm参数,这些参数约占整个模型的0.03%。
查看原文
查看缓存全文

缓存时间: 2026/08/21 10:30

# PETA:用于虚拟筛选的参数高效测试时适配
来源:https://arxiv.org/html/2608.19906
###### 摘要

从海量化学库中针对目标蛋白质口袋准确排名活性配体,仍是虚拟筛选领域的核心挑战。DrugCLIP及其近期扩展通过将蛋白质口袋和分子编码到一个共享嵌入空间中,显著加速了这一过程。尽管取得了这些进展,进一步的性能提升通常需要重新训练整个模型,这会带来巨大的计算开销,并使针对特定目标的定制变得低效。在本研究中,我们将在预训练虚拟筛选模型上针对单个口袋进行特化的问题,表述为一个测试时适配问题,并提出了PETA——一个参数高效框架,能在测试时直接适配预训练模型。针对给定的目标口袋,PETA通过分子扩散和化学有效性过滤构建口袋特异性的负样本,并通过嵌入空间混合进一步将这些负样本向从结构数据库检索到的参考配体移动,从而创造更具挑战性的排序任务。随后,一个排序目标函数更加侧重于抑制那些可能污染高排名筛选结果的高分无效候选项,为轻量级适配提供结构化监督。在多个基准测试上的实验表明,这种轻量级、针对口袋的适配方法,仅更新约占全模型0.03%的LayerNorm参数,其性能就优于预训练基线和全量重训练基线。

## 引言

化学合成的进步已将可访问的化学库扩展到包含数十亿种不同的化合物\(13 (https://arxiv.org/html/2608.19906#bib.bib24)\)。尽管这些库为发现新药候选物提供了巨大机会,但其规模使得详尽的实验筛选变得不切实际。虚拟筛选\(23 (https://arxiv.org/html/2608.19906#bib.bib25)\)通过计算优先排序有潜力的化合物以供实验验证来应对这一挑战,因此已成为药物发现早期阶段的重要工具。

现有的虚拟筛选方法大致可分为基于对接的方法和基于学习的方法。基于对接的方法\(1 (https://arxiv.org/html/2608.19906#bib.bib26);10 (https://arxiv.org/html/2608.19906#bib.bib5);29 (https://arxiv.org/html/2608.19906#bib.bib8)\)寻找分子与蛋白质口袋之间合理的结合构象,并使用打分函数估计它们的结合强度。对每个蛋白质-分子对进行重复的构象采样和打分,使得这些方法在大规模应用时计算成本高昂。相比之下,基于学习的方法用高效的神经网络推理替代了迭代的对接过程,直接从数据中预测结合构象、结合亲和力或蛋白质-配体兼容性。早期的基于学习的方法\(16 (https://arxiv.org/html/2608.19906#bib.bib27);25 (https://arxiv.org/html/2608.19906#bib.bib28)\)将虚拟筛选视为结合亲和力回归或蛋白质-配体相互作用分类,但它们对精心标注的亲和力数据以及可靠负样本的依赖,常常限制了其泛化能力和性能。最近,DrugCLIP\(10 (https://arxiv.org/html/2608.19906#bib.bib5)\)将虚拟筛选重新定义为一个检索问题,通过独立地将蛋白质口袋和分子编码到一个共享嵌入空间中,用高效的向量相似度搜索替代了成对模型推理,从而显著加速了大规模虚拟筛选。

参见说明图1:PETA实现了虚拟筛选的有效且参数高效的适配。遵循DrugCLIP确立的检索范式,近期的研究探索了增强监督和训练策略,以改善在下游未见实例上的虚拟筛选性能\(19 (https://arxiv.org/html/2608.19906#bib.bib7);8 (https://arxiv.org/html/2608.19906#bib.bib6);22 (https://arxiv.org/html/2608.19906#bib.bib17)\)。尽管这些方法有效,但它们通常需要重新运行整个训练流程,带来巨大的计算和数据处理成本。这引发了一个关键问题:现有预训练虚拟筛选模型能否在不进行全量模型重训练的情况下适配到新目标?

在本工作中,我们研究预训练虚拟筛选模型能否在测试时高效、有效地适配到未见的目标口袋。关键挑战在于如何为未见的目标口袋获得可靠的适配信号。为此,我们提出了PETA,一个参数高效的测试时适配框架,它仅更新预训练模型的LayerNorm参数,同时动态构建口袋特异性的监督信号。具体而言,PETA为目标口袋检索一个结构匹配的参考配体,并将其用作适配的正锚点。它进一步生成基于口袋条件的候选项,挖掘化学上无效的简单和困难负样本,并应用参考引导的嵌入插值来创建更具挑战性的局部比较。一个代价敏感的排序目标函数优先纠正高分的无效候选项,通过仅更新LayerNorm参数实现针对口袋的适配。PETA仅更新约0.03%的全模型参数。尽管更新量如此之轻量,但它达到了42.34的\(\text{EF}^{0.5\%}\),优于冻结的DrugCLIP(37.90)和全量重训练的BindCLIP(39.82),如图1所示(https://arxiv.org/html/2608.19906#Sx1.F1)。这些结果突显了筛选性能与适配效率之间的良好平衡。

我们的主要贡献总结如下:
- •我们提出了*虚拟筛选的测试时适配*(TTA-VS),它能够在推理时高效地将预训练虚拟筛选模型特化到每个未见的蛋白质口袋,而无需筛选库的结合标注或全量模型重训练。
- •我们提出了PETA,一个参数高效框架,它利用测试时可用的信息构建目标条件下的监督信号,同时仅更新模型的一小部分参数。
- •在多个基准测试上的实验表明,与预训练和全量重训练基线相比,PETA是有效且高效的。

## 相关工作

##### 药物虚拟筛选。

现有的虚拟筛选方法通常可分为基于对接的方法和基于学习的方法。基于对接的方法,如Glide-SP\(6 (https://arxiv.org/html/2608.19906#bib.bib9)\)、AutoDock Vina\(29 (https://arxiv.org/html/2608.19906#bib.bib8)\)和Surflex Dock\(9 (https://arxiv.org/html/2608.19906#bib.bib32)\),寻找小分子在目标口袋内的合理结合构象,并使用预定义的打分函数估计其结合强度。尽管这些方法适用性广,但它们需要对每个蛋白质-配体对进行重复的构象采样和姿态评估,使得大规模筛选计算成本高昂。

基于学习的方法通过用神经网络推理替代重复的构象搜索和基于物理的打分来提高筛选效率\(10 (https://arxiv.org/html/2608.19906#bib.bib5)\)。它们从实验测量的亲和力或结构导出的监督中学习蛋白质-配体相互作用模式,随后为筛选库中的化合物分配结合评分。然而,它们的性能仍受限于可用训练数据的质量和覆盖范围,因为实验解析的复合物、可靠的亲和力测量以及确认的非结合对获取成本高昂。

DrugCLIP\(10 (https://arxiv.org/html/2608.19906#bib.bib5)\)通过对比学习为蛋白质口袋和配体学习一个共享嵌入空间,缓解了部分局限性。虚拟筛选随后可以通过高效的嵌入相似度搜索完成,减少了对亲和力标注和重复成对模型推理的依赖。遵循这一检索范式,AANet\(34 (https://arxiv.org/html/2608.19906#bib.bib16)\)引入了三模态对齐和多空腔聚合,以支持基于apo和预测蛋白质结构的筛选。DrugHash\(8 (https://arxiv.org/html/2608.19906#bib.bib6)\)学习二进制表示以减少超大规模筛选的内存和检索成本,而BindCLIP\(19 (https://arxiv.org/html/2608.19906#bib.bib7)\)则结合了结合姿态生成和大规模困难负样本挖掘,以学习更具区分性的口袋-配体表示。

这些方法主要改善了离线训练期间的通用表示学习或检索效率。然而,一旦遇到新的目标口袋,其打分函数保持不变,除非使用修改后的目标或额外数据对模型进行重训练。相比之下,PETA实现了在训练后将预训练模型特化到每个未见的目标口袋。它在测试时从检索到的参考配体和基于口袋条件的负候选项构建口袋特异性的排序监督,同时仅更新一小部分模型参数。

##### 测试时适配。

测试时适配在推理过程中改进预训练模型,而无需标注目标域数据,并且已在图像分类、语义分割和多模态学习等领域被广泛研究\(30 (https://arxiv.org/html/2608.19906#bib.bib18);17 (https://arxiv.org/html/2608.19906#bib.bib19);4 (https://arxiv.org/html/2608.19906#bib.bib20);24 (https://arxiv.org/html/2608.19906#bib.bib21)\)。然而,传统的测试时适配方法不能直接迁移到虚拟筛选中。虚拟筛选需要为特定目标口袋对大量未标记的配体库进行排序,特别强调为实验验证选择排名最高的化合物,而非为单个测试样本预测标签。

Drug-TTA\(22 (https://arxiv.org/html/2608.19906#bib.bib17)\)是与本工作最相关的方法。它使用多个预定义的辅助目标对整个模型进行训练,然后在推理期间执行额外的逐实例优化。这需要在应用适配之前重新设计并重新运行训练流程。PETA则通过在测试时动态构建口袋特异性的排序监督,并仅更新其LayerNorm参数,来直接适配现有的预训练模型。

参见说明图2:PETA框架。(a)给定一个目标口袋,PETA从一个匹配的holo复合物中检索参考配体,构建基于口袋感知的负样本,并仅适配配体编码器的LayerNorm参数。(b)随后,适配后的模型用于对测试分子库进行虚拟筛选。

## 问题表述

给定一个目标结合口袋\(\mathbf{x}\)和一个分子筛选库\(\mathcal{M}=\{m\}_{i=1}^{N}\),虚拟筛选旨在根据候选配体与\(\mathbf{x}\)的预测结合兼容性对其进行排名,并找出最有可能的前\(K\)个化合物。在本文中,*配体*指筛选库中的任何分子,无论其是否被实验确认能与目标结合。

DrugCLIP通过将口袋和配体编码到一个共享的潜在空间中来执行虚拟筛选。设
\[
\mathbf{z}_{\mathbf{x}}=\mathcal{E}_{\mathbf{x}}(\theta_{\mathbf{x}},\mathbf{x}), \quad \mathbf{z}_{m}=\mathcal{E}_{m}(\theta_{m},m),
\]
(1)
其中\(\mathcal{E}_{\mathbf{x}}\)和\(\mathcal{E}_{m}\)分别表示口袋编码器和配体编码器。预测的结合分数定义为它们的余弦相似度:
\[
s_{\theta}(\mathbf{x},m)=\frac{\mathbf{z}_{\mathbf{x}}^{\top}\mathbf{z}_{m}}{\|\mathbf{z}_{\mathbf{x}}\|\,\|\mathbf{z}_{m}\|}, \quad \theta=\{\theta_{\mathbf{x}},\theta_{m}\}.
\]
(2)
分数越高,表示预测的口袋-配体兼容性越强。

尽管DrugCLIP是作为一个通用筛选模型进行训练的,但在未见或代表性不足的目标口袋上,其性能可能会下降\(22 (https://arxiv.org/html/2608.19906#bib.bib17)\)。现有方法通常通过添加额外的目标、数据集和全量模型重训练来解决这个问题,这成本高昂且不能直接将模型特化到每个新目标。因此,我们研究对未见口袋的测试时特化。主要挑战在于,如何在没有亲和力测量或筛选库结合标注的情况下,构建可靠的口袋特异性监督信号。

## 方法

在本节中,我们提出了PETA,一个针对未见蛋白质口袋虚拟筛选的参数高效测试时适配框架。PETA不是重训练整个虚拟筛选模型,而是通过在推理时为每个目标口袋构建口袋特异性的监督信号,并仅更新一小部分(≈0.03%)模型参数,来独立地适配预训练模型。图2(https://arxiv.org/html/2608.19906#Sx2.F2)展示了整体框架。

### 虚拟筛选的测试时适配

令\(s_{\theta_{0}}(\mathbf{x},m)\)表示一个具有预训练参数\(\theta_{0}\)的预训练虚拟筛选模型。在测试时,给定一个未见口袋\(\mathbf{x}^{u}\)和一个筛选库\(\mathcal{M}^{u}=\{m_{i}\}_{i=1}^{N}\),模型根据\(s_{\theta_{0}}(\mathbf{x}^{u},m_{i})\)对候选配体进行排名。

我们将*虚拟筛选的测试时适配*(TTA-VS)表述为:旨在将预训练模型\(s_{\theta_{0}}\)特化到一个未见口袋\(\mathbf{x}^{u}\),而无需筛选库的结合标注、额外的亲和力测量或全量模型微调。

##### 参考配体构建。

尽管预训练模型未见过\(\mathbf{x}^{u}\),但在大型结构数据库中可能可以获得涉及相同蛋白质靶点和结合位点的实验解析复合物111对于本研究评估的所有目标,参考配体均从PDBbind中检索,并已从筛选库中排除。\。因此,我们检索这样一个配体作为参考配体:
\[
r_{\mathbf{x}^{u}}=\operatorname{Retrieve}\left(\mathbf{x}^{u}; \mathcal{D}_{\mathrm{struct}}\right),
\]
(3)
其中\(\mathcal{D}_{\mathrm{struct}}\)表示一个结构数据库。

一种直接的适配策略是最大化目标口袋与参考配体之间的相似度:
\[
\mathcal{L}_{\mathrm{ref}}=-s_{\theta}\left(\mathbf{x}^{u},r_{\mathbf{x}^{u}}\right).
\]
(4)
然而,这种仅包含正样本的目标对于目标特异性适配提供的监督有限。它可能提高\(r_{\mathbf{x}^{u}}\)的分数,但无法抑制那些已经获得高分的假阳性候选项。一个自然的解决方案是用负候选项(特别是基于口袋感知的)\(\mathcal{G}_{\mathbf{x}^{u}}\)来增强参考配体,从而为适配提供更丰富的监督。信息性负候选项的构建将在以下小节中详细描述。

为了实现参数高效适配,虚拟筛选模型随后通过优化以下目标进行适配:

相似文章