基于自然语言引导的生成器无关的蛋白粘合剂设计短名单筛选方法
摘要
本文探讨了使用大型语言模型生成排名策略,从候选池中筛选蛋白粘合剂,在从头设计工作流中相较于基线方法显示出适度的性能提升。
arXiv:2608.20755v1 宣告类型:新
摘要:现代的从头设计工作流会生成大量候选蛋白粘合剂,但湿实验验证能力有限,使得筛选成为主要瓶颈。我们研究了LLMs能否从预先计算的结构置信度和界面质量代理分数生成多指标排名策略。我们并非提出新的蛋白粘合剂设计流程,而是专注于生成后粘合剂的筛选:使用一组共享的预先计算的代理分数,从已生成的粘合剂池中筛选出最终的前K个候选物。在10个靶标的留出数据集上,对五个采样的全局迭代gpt-4o策略的性能取平均,Recall@10达到0.589,相较于最强的单一特征固定基线Protenix binder ipTM(Recall@10为0.571)有适度提升。在由Nipah、RBX1和TREM2组成的3个靶标留出子集上,目标条件化的迭代gpt-5.4策略达到了最强的LLM性能,Recall@10为0.519,NDCG@10为0.583。这些结果表明,LLM生成的排名策略可以作为一个可解释的生成后决策层,用于结合异构代理指标,从大型候选池中优先排序粘合剂。
查看缓存全文
缓存时间: 2026/08/24 04:23
# 基于自然语言引导的生成器无关蛋白质结合物设计短名单筛选方法 来源:https://arxiv.org/html/2608.20755 **作者信息** Gyubok Lee 隶属机构:韩国科学技术院(KAIST)金在哲人工智能研究生院,韩国大田 通讯作者:[[email protected]](mailto:[email protected]) Jimin Seo 隶属机构:首尔大学电气与计算机工程系,韩国首尔 Kyunghoon Hur 隶属机构:韩国电子技术研究院(KETI),韩国城南 Edward Choi 隶属机构:韩国科学技术院(KAIST)金在哲人工智能研究生院,韩国大田 #### 摘要 现代从头设计流程可生成大量候选蛋白质结合物,但湿实验验证能力仍有限,导致短名单筛选成为主要瓶颈。本研究探讨大语言模型(LLM)能否从预计算的结构置信度与界面质量代理分数中生成多指标排序策略。我们不提出新的蛋白质结合物设计流程,而是聚焦于**生成后结合物短名单筛选**:利用共享的预计算代理分数面板,从已生成的结合物库中筛选最终的Top-K候选者。在包含10个靶标的留存测试集上,五种采样的全局迭代GPT-4策略平均性能达到0.589的Recall@10,相较于最强单特征固定基线(Protenix结合物ipTM的0.571 Recall@10)略有提升。在包含尼帕病毒、RBX1和TREM2的3靶标留存子集上,靶标条件迭代GPT-5.4策略达到最佳LLM性能,分别为0.519的Recall@10和0.583的NDCG@10。这些结果表明,LLM生成的排序策略可作为可解释的生成后决策层,用于融合异构代理指标以优先排序大型候选库中的结合物。 #### 关键词 蛋白质设计、大语言模型、结合物短名单筛选 ## 1 引言 近年来,从头蛋白质结合物设计流程常将RFdiffusion等生成式骨架模型、ProteinMPNN风格的序列设计器以及基于AlphaFold2或Boltz-2的结构预测过滤器结合使用。这些进展使得大规模候选物生成日益常规化,但实验验证能力仍受限。因此,短名单筛选已成为决定生成结合物转化为验证命中率效率的核心环节。 图1:生成后结合物短名单筛选任务概述。对于每个靶蛋白,上游设计工作流会预先生成固定的候选结合物库。随后通过AF2-Multimer、Boltz-2、Protenix/PXDesign以及Rosetta界面ΔG等界面描述符,为所有候选物计算共享的代理分数面板。短名单筛选方法(包括固定启发式规则、监督式机器学习模型、全局LLM策略和靶标条件LLM策略)对候选物排序,并返回Top-K短名单用于实验测试。全局LLM策略对所有留存靶标应用单一共享排序规则,而靶标条件LLM策略则生成靶标特异性排序规则。 常规实践是通过固定阈值、单分数排序或手动调优的结构预测置信度分数与界面代理指标组合来优先筛选或过滤候选物。典型示例包括BindCraft的固定AF2/Rosetta过滤器组、Adaptyv基于Boltz-2 ipSAE的计算选择以及PXDesign基于Protenix的置信度过滤器。这些工作流特定的过滤器对候选物筛选很重要,但并未完全解决最终选择问题:设计生成、过滤或从不同工作流收集后,仅有少数候选物能进行实验测试。近期一项针对3,766个实验测试的从头结合物的荟萃分析表明,界面焦点置信度指标(如ipSAE)和正交物理化学描述符可改善结合物选择,但预测性能仍因靶标而异。这些观察促使我们研究生成后短名单筛选场景:如何融合互补的代理分数,并测试排序规则应为全局性还是靶标条件性。 ## 2 相关工作 #### 结合物设计流程与候选物选择 现代结合物设计工作流常结合RFdiffusion骨架生成、ProteinMPNN式序列设计以及基于AF2等预测器的结构验证/过滤。现有系统通常通过工作流特定过滤器或排序规则实现候选物选择。例如BindCraft使用固定AF2置信度、Rosetta和界面质量过滤器;Adaptyv的尼帕病毒发布版采用Boltz-2 ipSAE排序结合社区投票与专家策划;PXDesign使用Protenix/AF2过滤并发布PXDesignBench用于标准化单体和结合物评估。这些流程表明预测器衍生的置信度和界面对结合物分选有用,但未解决固定候选库需短名单筛选时如何融合异构代理分数的问题。一项针对3,766个结合物的荟萃分析指出,基于ipSAE的分数优于常见界面置信度指标,Rosetta描述符提供互补信号,但预测性能仍依赖靶标。本研究具有互补性:不引入生成器或复现工作流特定过滤堆栈,而是研究基于多预测器家族固定代理分数的、生成器无关的异构候选库后处理短名单筛选层。 ## 3 问题设置 #### 短名单筛选即策略合成 对于靶蛋白$t$,给定包含$n_t$个设计的生成候选结合物库$\mathcal{C}_t$。每个候选物$c \in \mathcal{C}_t$具有在短名单筛选前计算的固定代理分数向量$\mathbf{x}_{t,c} \in \mathbb{R}^m$($m$为每个候选物共有特征数)。任务是在验证预算内选择大小为$K$的子集$S_t \subseteq \mathcal{C}_t$以最大化实验验证结合物的召回率。方法输出排序策略$\pi_t \in \Pi$,确定性执行器根据$\pi_t$为每个候选物评分并返回Top-K。在此框架中,基于指标的常规排序是特例:按单一分数(如Boltz-2 ipSAE)排序即为单特征策略。策略合成通过选择融合哪些代理分数及其权重来泛化此过程。 ## 4 数据集 ### 4.1 来源与划分 我们从八个公开来源或工作流发布中收集标记的结合物设计数据。仅当来源报告了测试设计的候选物级实验结果时才被纳入,使每个靶标构成一个回顾性短名单筛选场景:候选库固定,每个候选物具有结合物/非结合物标签。表1总结了靶标不重叠的开发集和留存集划分。开发集包含来自BoltzGen(从头结合物生成工作流与验证数据集)的11个靶标。10靶标留存集组合了独立工作流输出和公开验证发布(包括BindCraft重验证、pMHC微型结合物、尼帕病毒、RBX1、TREM2和合并EGFR挑战/重验证库),其标签在用于知识泄露审计的gpt-4o-2024-11-20截止日期后发布。另报告包含尼帕病毒、RBX1和TREM2的3靶标留存子集,其标签在gpt-5.4截止日期后发布。当相同生物靶标出现在多个发布中时,我们合并相应库并对完全相同的候选氨基酸序列去重。 ### 4.2 特征提取 每个候选物由表2总结的17个有效代理分数表示。Boltz-2 pDockQ2和ipSAE是基于Boltz-2预测复合物和置信度输出计算的界面质量/置信度代理分数;pDockQ2遵循相关文献方法,ipSAE采用基于PAE的蛋白质间评分方法。Rosetta InterfaceAnalyzer指标在Boltz-2靶侧MSA复合物上计算,用作几何、埋藏和能量代理分数(而非真实结合能)。Protenix/PXDesign特征提供复合物、结合物链及配对结合物-靶标置信度;Protenix ipTM式分数未假设数值校准。
相似文章
大规模数据集与基准:蛋白质-配体模型学习的是结合位点还是仅仅结合可能性?
介绍了InteractBind,一个用于细粒度评估蛋白质-配体模型的大规模数据集和基准,重点关注结合位点定位和非共价相互作用预测。评估了八个现有模型,发现尽管二元结合预测表现强劲,但结合位点定位能力有限。
针对靶向氨基酸组成的蛋白质序列生成的两阶段微调
本文提出了一种两阶段微调流程,结合领域自适应微调和强化学习,生成匹配所需氨基酸组成分布并保持序列质量的蛋白质序列。
DrugGen 2:一种疾病感知的语言模型,用于增强药物发现
DrugGen-2通过监督学习和强化学习(GRPO)微调GPT-2,在疾病本体和靶点蛋白质序列条件下生成小分子,实现了药物发现中更高的多样性和结合亲和力。
ShallowBench:评估面向浅口袋靶标的生成式药物设计模型
介绍了ShallowBench,一个精心整理的包含5,780个浅口袋蛋白质靶标的基准测试,用于评估针对如KRAS和MYC等具有挑战性的低口袋性靶标的生成式药物设计模型。
TourSynbio-Search:一种大语言模型驱动的蛋白质工程统一搜索方法智能体框架
本文介绍了TourSynbio-Search,一个由LLM驱动的智能体框架,用于跨文献和生物数据库的统一蛋白质工程搜索。该框架由TourSynbio-7B多模态模型驱动,包含PaperSearch和ProteinSearch两个组件。