TorchCraft:通过反转全原子结构预测器实现统一结合剂设计
摘要
TorchCraft 是一个统一的结合剂设计框架,它通过反转如 AlphaFold3 这样的全原子结构预测器来优化小型结合剂、VHHs、环肽和配体结合蛋白的序列,并在多种格式中进行了实验验证。
arXiv:2609.19770v1 公告类型:新
摘要:全原子结构预测器建模多样的分子相互作用,但将其学习到的结构先验用于结合剂设计仍然具有挑战性。在这里,我们介绍 TorchCraft,这是一个统一的结合剂设计框架,通过一个冻结的全原子预测器优化序列 logits。TorchFold 中实现,TorchCraft 在共享优化过程中结合了置信度、接触、几何和序列先验目标,适用于小型结合剂、框架条件化的 VHHs、环肽和配体结合蛋白。使用预训练的 AlphaFold 3 权重,TorchCraft 生成了具有实验测量结合的代表性小型结合剂和 VHHs,覆盖每种格式的四个靶点,无需事后序列重设计。计算基准进一步证明了该框架在环肽和配体条件化口袋设计中的适用性。TorchCraft 将预测器反转扩展到多种结合剂格式和分子上下文,提供了一个通用的框架来重用全原子结构先验进行设计。
查看缓存全文
缓存时间: 2026/09/18 09:24
# TorchCraft:通过反演全原子结构预测器实现统一的结合体设计 来源:https://arxiv.org/html/2609.19770 ###### 摘要 全原子结构预测器可对多样的分子相互作用建模,但如何将其学习到的结构先验知识用于结合体设计仍具挑战。本文提出 TorchCraft,一个统一的结合体设计框架,通过冻结的全原子预测器优化序列逻辑值。该框架基于 TorchFold 实现,结合置信度、接触、几何及序列先验目标,在共享优化流程中同时支持迷你结合体、框架限定的 VHH、环肽及配体结合蛋白的设计。利用预训练的 AlphaFold3 权重,TorchCraft 为四种靶点生成了具有实验验证结合活性的代表性迷你结合体和 VHH,无需事后序列重设计。计算基准测试进一步证明了该框架在环肽及配体限定口袋设计中的适用性。TorchCraft 将预测器反演扩展至多种结合体形式和分子环境,为全原子结构先验在设计中的重用提供了通用框架。 ## 1 引言 从头结合体设计旨在寻找能可靠折叠并特异性识别靶分子的序列[1](https://arxiv.org/html/2609.19770#bib.bib1)[,2](https://arxiv.org/html/2609.19770#bib.bib2)[,3](https://arxiv.org/html/2609.19770#bib.bib3)。结构预测的进步使得学习到的结构先验在此任务中日益重要。AlphaFold2 可对蛋白质结构及组装建模,而全原子预测器如 AlphaFold3 进一步支持核酸、小分子、离子及修饰残基的表征[4](https://arxiv.org/html/2609.19770#bib.bib4)[,5](https://arxiv.org/html/2609.19770#bib.bib5)[,6](https://arxiv.org/html/2609.19770#bib.bib6)[,7](https://arxiv.org/html/2609.19770#bib.bib7)。这些能力为在统一分子表示下指导结合体设计创造了可能,前提是预测器的输出能转化为有效的序列优化目标。 当前设计流程以不同方式组合结构生成、序列分配和评估。骨架生成方法(如 RFdiffusion)通常与 ProteinMPNN 或 LigandMPNN 结合,并辅以结构预测[8](https://arxiv.org/html/2609.19770#bib.bib8)[,9](https://arxiv.org/html/2609.19770#bib.bib9)[,10](https://arxiv.org/html/2609.19770#bib.bib10)[,11](https://arxiv.org/html/2609.19770#bib.bib11)[,12](https://arxiv.org/html/2609.19770#bib.bib12)[,13](https://arxiv.org/html/2609.19770#bib.bib13)。这些流程为序列与结构的探索提供了互补途径,其任务范围取决于各组件所支持的分子表示和约束。 预测器反演方法则直接针对预训练结构预测器的输出优化序列[14](https://arxiv.org/html/2609.19770#bib.bib14)[,15](https://arxiv.org/html/2609.19770#bib.bib15)。BindCraft 建立了基于 AF2 的实验验证有效的蛋白质结合体设计流程[16](https://arxiv.org/html/2609.19770#bib.bib16)。BoltzDesign 将全原子预测器反演扩展至更多分子环境,而 Germinal 则整合了抗体特异性目标和序列引导[17](https://arxiv.org/html/2609.19770#bib.bib17)[,18](https://arxiv.org/html/2609.19770#bib.bib18)。前向方法如 Protein Hunter 和 HalluDesign 通过交替进行结构幻觉和序列重设计(不反向传播通过预测器)提供了相关策略[19](https://arxiv.org/html/2609.19770#bib.bib19)[,20](https://arxiv.org/html/2609.19770#bib.bib20)。 这些进展促使我们进一步评估全原子预测器如何支持跨结合体形式和靶点化学环境的有效设计。一个实际问题是:共享的预测器反演框架能否在适应不同结合体形式和分子环境的同时,生成实验功能性的序列?回答此问题既需要任务特定约束(如固定抗体骨架或肽环化),也需要补充结构目标的序列级控制,以及超越优化中所用置信度分数的评估。 本文提出 TorchCraft,一个通过冻结的全原子结构预测器(基于 TorchFold 实现)优化序列逻辑值的结合体设计框架[21](https://arxiv.org/html/2609.19770#bib.bib21)。本文报告的所有设计(包括实验验证的结合体和计算基准测试)均使用预训练 AF3 权重生成。其贡献在于一个共享优化流程,包含任务特定的序列掩码、约束、先验和调度,并辅以实验验证的迷你结合体与 VHH 演示,以及环肽和小分子结合蛋白的计算扩展。 ## 2 结果 ### 2.1 TorchCraft 作为全原子幻觉框架 TorchCraft 将可编辑的结合体序列表示为可训练的逻辑值矩阵,并利用通过冻结预测器计算的设计目标梯度进行更新(图1 [https://arxiv.org/html/2609.19770#S2.F1])。每次迭代评估靶标–结合体系统,并调整序列以提升预测的结构兼容性、界面形成及任务特定的序列特性。优化从连续序列表征逐步推进到离散氨基酸分配,最终产出设计的序列及相应的预测全原子结构(图2 [https://arxiv.org/html/2609.19770#S2.F2]b)。全原子表示允许靶标环境包含蛋白质与非蛋白质成分。 本研究将该框架应用于迷你结合体、框架限定的 VHH、头尾相连及二硫键环化的环肽,以及围绕小分子配体设计的蛋白质。这些任务共享序列优化引擎,但使用不同的可编辑位置、损失项、分子约束和优化调度(补充表S1 [https://arxiv.org/html/2609.19770#A2.T1])。TorchCraft 采用 TorchFold 实现通过冻结预测器进行序列优化。计算优化(包括构象生成并行、梯度检查点、缓存及融合注意力机制)支持优化过程中的重复评估(附录A.3 [https://arxiv.org/html/2609.19770#A1.SS3])。 ### 2.2 针对蛋白质靶点的蛋白质结合体从头设计 我们针对 IFNAR2、IL-7Rα、PDGFRβ 和 PD-L1 设计了迷你结合体,使用补充表S2 [https://arxiv.org/html/2609.19770#A2.T2] 中指定的靶点结构、结合体长度范围和热点定义。每个靶点从3000个生成设计中筛选候选,使用附录A.2.2.1 [https://arxiv.org/html/2609.19770#A1.SS2.SSS2.P1] 中的过滤和排序流程。多浓度 BLI 测量在四个设计活动中均鉴定出结合体,代表性表观解离常数分别为 60.2、8.55、2.04 和 23.3 nM(图2 [https://arxiv.org/html/2609.19770#S2.F2]a)。实验测试的序列直接来自 TorchCraft,未经事后序列重设计。 分析设计的预测复合物显示出多样的结合构型,并与 PDB 比较中识别的相互作用存在差异(图2 [https://arxiv.org/html/2609.19770#S2.F2]c,d)。结构目标不直接约束与表达相关的所有序列特征,因此我们添加了氨基酸组成正则化项,将平均残基分布匹配至基于 ProteinMPNN 重设计样本估算的参考分布。该正则化改变了 TorchCraft 序列的组成(图2 [https://arxiv.org/html/2609.19770#S2.F2]e),并在12靶点基准测试中提高了 ESMFold 置信度(补充图S1 [https://arxiv.org/html/2609.19770#A3.F1]a)。在两个 PDGFRβ 迷你结合体设计活动中,引入组成正则化的轮次表现出比前一轮无正则化更高的表达量(补充图S1 [https://arxiv.org/html/2609.19770#A3.F1]b)。 随后我们在12个蛋白质靶点及 75、120、160、200 残基长度的结合体上,将 TorchCraft 与 BoltzGen 和 RFdiffusion 进行比较。使用 TorchScore(一种仅评分的 AF3 评估,针对提供坐标)评估设计(附录A.4.2 [https://arxiv.org/html/2609.19770#A1.SS4.SSS2])。计算通过率因靶点和结合体长度而异(图2 [https://arxiv.org/html/2609.19770#S2.F2]f)。原始 TorchCraft 设计在多个靶点上具有竞争力,而可选的 ProteinMPNN 对非界面残基的重设计进一步提升了多数设置下的通过率。由于评估使用了预测器衍生分数,我们还报告了 Rosetta 界面分数分布(补充图S2 [https://arxiv.org/html/2609.19770#A3.F2])。 ### 2.3 基于框架限定 CDR 优化的 VHH 从头设计 接下来我们将 TorchCraft 应用于 VHH 设计,固定预定义的框架序列同时优化三个 CDR。这将序列搜索限制于互补决定区形成区域,同时保留所选支架环境。针对 BHRF1、EFNA5、PDGFRβ 和 S100A4 使用补充表S3 [https://arxiv.org/html/2609.19770#A2.T3] 中的任务规格生成设计。BLI 测量在四个设计活动中均鉴定出结合体,代表性表观解离常数分别为 24.3、122、268 和 354 nM(图3 [https://arxiv.org/html/2609.19770#S2.F3]a)。这些序列未经事后序列重设计即进行测试。相应的预测复合物分析了其多样性及与 PDB 结合构型的差异(图3 [https://arxiv.org/html/2609.19770#S2.F3]g,h)。 无正则化的 VHH 优化产生的 CDR 序列其残基偏好与 SAbDab 参考集存在差异。为在设计过程中融入抗体序列约束,我们添加了基于 IgLM 的目标,分别针对 CDR1、CDR2 和 CDR3 进行评估[22](https://arxiv.org/html/2609.19770#bib.bib22)。对于每个 CDR,框架和其他 CDR 的当前序列为局部填充目标提供上下文(图3 [https://arxiv.org/html/2609.19770#S2.F3]b;算法3 [https://arxiv.org/html/2609.19770#algorithm3])。这将序列引导集中于可编辑区域。我们将此方法与本文评估的 Germinal 实现中使用的全序列引导进行了比较[18](https://arxiv.org/html/2609.19770#bib.bib18)。 CDR 限定的 IgLM 引导提高了 IgLM 似然度,并将位置特异性残基偏好转向 SAbDab 参考集中观察到的模式,尤其在 CDR1 和 CDR2 中(图3 [https://arxiv.org/html/2609.19770#S2.F3]c,d)。引导序列还表现出 TNP 可开发性相关谱的变化及更高的 OASis 人类同源性评分(图3 [https://arxiv.org/html/2609.19770#S2.F3]e,f)[23](https://arxiv.org/html/2609.19770#bib.bib23)[,24](https://arxiv.org/html/2609.19770#bib.bib24)。这些分析表明与所选序列参考分布的一致性提高。 我们在15个靶点和五个 VHH 框架上将 TorchCraft 与 RFantibody、BoltzGen 和 Germinal 进行比较(图3 [https://arxiv.org/html/2609.19770#S2.F3]i;补充图S5 [https://arxiv.org/html/2609.19770#A3.F5])[25](https://arxiv.org/html/2609.19770#bib.bib25)[,13](https://arxiv.org/html/2609.19770#bib.bib13)[,18](https://arxiv.org/html/2609.19770#bib.bib18)。设计采用附录A.4 [https://arxiv.org/html/2609.19770#A1.SS4] 中描述的联合 TorchScore-置信度和 ESM2-困惑度标准评估。TorchCraft 在多个靶点上实现了更高的计算通过率,在部分设置中可选的 AbMPNN 重设计进一步带来提升。Rosetta 界面分数分布为预测复合物提供了额外评估(补充图S3 [https://arxiv.org/html/2609.19770#A3.F3])。
相似文章
TD3B:用于别构结合物生成的过渡导向离散扩散
TD3B 是一种基于序列的生成框架,利用过渡导向离散扩散设计具有特定激动剂或拮抗剂行为的别构结合物。该论文引入了一种控制蛋白质状态方向性转变的方法,解决了基于静态结构的设计方法的局限性。
Chamaileon: 跨语境结合子设计中的语境化建模与混合采样
Chamaileon 提出了一个用于多靶点和多状态蛋白质结合子设计的框架,采用语境化的序列-结构联合建模和混合采样,实现了对不同构象景观和多靶点需求的适应性。
@akshat_b: https://x.com/akshat_b/status/2090430043302355096
Anthropic的Claude模型在设计结合剂方面取得了22-35%的成功率,作为药物发现的替代指标,超越了行业标准的10-15%。
结构蛋白质组学引导的共折叠模型
介绍了AIMS-Fold,一种推理时引导扩散框架,整合了交联质谱(XL-MS)和氢-氘交换(HDX-MS)数据,以改善针对诱导接近药物靶点的蛋白质共折叠预测。
基于自然语言引导的生成器无关的蛋白粘合剂设计短名单筛选方法
本文探讨了使用大型语言模型生成排名策略,从候选池中筛选蛋白粘合剂,在从头设计工作流中相较于基线方法显示出适度的性能提升。