折叠、推理与扩展:开源药物发现引擎

arXiv cs.AI 论文

摘要

介绍OpenDDE,一个开源的全原子生物分子基础模型,该模型利用共折叠作为药物发现的共享结构推理层,实现了高精度,并识别出用于进一步改进的缩放定律。

arXiv:2607.03787v1 Announce Type: new 摘要:精确建模生物分子相互作用是生物学和疗法发现中的核心瓶颈。在此,我们介绍开源药物发现引擎(OpenDDE),这是一个开源的全原子生物分子基础模型,将共折叠作为可扩展的AI驱动药物发现引擎的入口点。OpenDDE并非将结构预测视为孤立的终点,而是设计为一个共享的结构推理层,用于建模生物分子复合物中的序列-结构-功能关系,从而能够预测当前复杂结构,并为从头设计、亲和力估计、结构条件优化等提供基础。OpenDDE整合了全原子架构、原子潜在推理、推理优化和大规模数据处理方面的进展,在可重复且开放访问的框架内实现了IsoDDE级别的共折叠精度。我们还识别了共折叠模型的两个缩放定律方向,揭示了通过数据、模型、推理和训练缩放持续改进的实用途径。通过发布训练代码、推理流程、检查点和基准,OpenDDE旨在民主化前沿生物分子智能的获取,加速全球合作,并为下一代药物发现系统奠定开放基础,这些系统能够从预测分子结构转向设计、评分和优化针对人类健康的治疗候选分子。
查看原文
查看缓存全文

缓存时间: 2026/07/07 04:35

# 折叠、推理与扩展:面向开源药物发现引擎

来源:https://arxiv.org/html/2607.03787

摘要:精确建模生物分子相互作用是生物学与治疗发现的核心瓶颈。本文介绍开源药物发现引擎(OpenDDE),一个开源的全原子生物分子基础模型,以共折叠作为可扩展AI驱动药物发现引擎的切入点。OpenDDE并非将结构预测视为孤立终点,而是设计为共享的结构推理层,用于建模跨生物分子复合体的序列-结构-功能关系,支持当前复合体结构预测,同时为从头设计、亲和力估算、结构条件优化等提供基础。OpenDDE整合了全原子架构、原子潜在推理、推理优化和大规模数据处理等进展,在可复现且开放可及的框架内达到IsoDDE级别的共折叠精度。我们还为共折叠模型识别了两个缩放定律方向,揭示了通过数据、模型、推理和训练扩展实现持续改进的实际路径。通过发布训练代码、推理流程、检查点和基准,OpenDDE旨在民主化前沿生物分子智能的访问,加速全球合作,并为下一代药物发现系统奠定开放基础——这些系统能够从预测分子结构转向为人类健康设计、评分和优化治疗候选分子。GitHub: https://github.com/aurekaresearch/OpenDDE HuggingFace: https://huggingface.co/aurekaresearch/OpenDDE

![[无标题图片]](https://arxiv.org/html/2607.03787v1/x1.png)

## 概述

主要贡献:
1. **生物分子词元上的原子级潜在推理**。我们将潜在推理融入生物分子建模,使模型能够在全原子结构生成之前精炼局部几何、化学环境和跨分子界面的表示。
2. **以折叠为中心的可扩展药物发现引擎基础**。OpenDDE当前聚焦结构预测,但其统一架构设计为支持未来的从头分子设计、亲和力预测和其他结构条件化模块。
3. **缩放定律与数据蒸馏**。我们研究了沿模型参数和数据轴的缩放方向,并修订了针对单体和多聚体结构的蒸馏策略,以提升鲁棒性、泛化能力和训练效率。

表征蛋白质、核酸、小分子配体及其他细胞组分之间的生物分子相互作用,是理解生物机制以及通过治疗干预调节疾病相关过程的基础[1](https://arxiv.org/html/2607.03787#bib.bib1), [2](https://arxiv.org/html/2607.03787#bib.bib2)。能够以实验级精度预测这些相互作用的计算机模型,将为可扩展且可靠的药物发现提供结构基础。

AlphaFold2[3](https://arxiv.org/html/2607.03787#bib.bib3)通过实现许多蛋白质单体的近实验级精度,彻底改变了蛋白质结构预测。AlphaFold3[4](https://arxiv.org/html/2607.03787#bib.bib4)将这一范式扩展到包含蛋白质、核酸、小分子、离子和修饰残基的复合体的联合原子级建模。更广泛地说,AlphaFold风格和结构条件化模型已成为表位预测、结合体设计[5](https://arxiv.org/html/2607.03787#bib.bib5), [6](https://arxiv.org/html/2607.03787#bib.bib6), [7](https://arxiv.org/html/2607.03787#bib.bib7)、虚拟筛选[8](https://arxiv.org/html/2607.03787#bib.bib8), [9](https://arxiv.org/html/2607.03787#bib.bib9)、构象采样[10](https://arxiv.org/html/2607.03787#bib.bib10), [11](https://arxiv.org/html/2607.03787#bib.bib11)以及加速或解释实验工作流程[12](https://arxiv.org/html/2607.03787#bib.bib12)的可复用引擎。最近推出的IsoDDE进一步表明,共折叠可以作为AI药物发现引擎的核心,在蛋白质-配体泛化、抗体-抗原界面预测、口袋识别和结合亲和力估计方面取得报告中的提升。然而,最具能力的系统仍然是封闭的,限制了可复现性、独立验证和社区驱动的扩展。与此同时,共折叠精度的增量改进开始放缓[13](https://arxiv.org/html/2607.03787#bib.bib13),这为该领域提出了一个核心问题:当前的词元化、数据整理、模型架构和推理流程是否正在接近实际瓶颈,以及下一个缩放方向应该来自何处?

在本文中,我们介绍OpenDDE,据我们所知这是首个达到IsoDDE级别共折叠精度的Apache许可全原子生成式基础模型。基于近期的开源共折叠系统(如Protenix-v1和OpenFold3),OpenDDE引入了三项推进,将共折叠范式扩展到预训练和后训练两个阶段:

在以下章节中,我们介绍OpenDDE的模型架构、训练、推理和缩放定律,然后针对多种生物分子复合体预测任务,对开源和封闭折叠系统进行基准测试。OpenDDE的表现与最先进的封闭模型相当,并在抗体-抗原泛化基准上显著优于现有模型。

作为一项持续发展的项目,OpenDDE及其仓库将定期更新,包含我们团队和更广泛社区的贡献。我们以Apache-2.0许可证发布检查点、代码、推理流程和基准,使社区能够大规模探索、精炼和部署生物智能。除了强大的共折叠性能,OpenDDE还提供了一个开放平台,用于研究折叠、推理和扩展如何推动生物分子智能的进步。

## 1 性能

### 1.1 结构预测结果

参见图注 图2:跨PXMeter-AB、FoldBench-AB和2026ARK-AB的抗体-抗原结构预测性能。结果以DockQ成功率报告,分解为可接受、中等和高精度预测。左图:基于排名的选择。右图:基于神谕的选择。

**对抗体-抗原数据集进行基准测试**(图2)。抗体-抗原复合体为基于结构的发现提供了严格的测试,因为其治疗相关性伴随着对灵活且化学多样结合界面进行精确建模的难度。图2将OpenDDE与AlphaFold3[4]、Chai-1[14]、Boltz-1[15]、OpenFold3[16]、Protenix-v1[17]和ESMFold2[18]在三个抗体-抗原基准集上进行了比较。成功率按界面质量分解,使用DockQ阈值区分可接受、中等质量和高质量预测。OpenDDE在所有评估基准上取得了最高的总体成功率,在PXMeter-AB上达到51.0%,在FoldBench-AB上达到70.0%,在2026ARK-AB基准上达到66.4%。

这些结果显著优于最强基线,包括PXMeter-AB和FoldBench-AB上的ESMFold2,以及2026ARK-AB上的ESMFold2/Protenix-v1。重要的是,改进并不局限于低阈值恢复:OpenDDE持续增加了中等和高DockQ界面的比例,表明对抗体-抗原几何结构的建模得到了改善,而不仅仅是产生勉强可接受的复合体。这些结果共同表明,OpenDDE为抗体-抗原共折叠提供了强大的开源基础,并将更广泛的治疗靶点带入实际有用的精度范围。

**新生物系统的结构预测**(图2)。我们通过整理2026ARK-AB基准,遵循PXMeter[19]的数据协议,考察OpenDDE在新发布抗体-抗原结构上的表现。该基准包含164个PDB复合体,对应159个独特的抗体-抗原界面簇,其整理目的是评估模型对近期、低同源性系统(先前发布模型无法获取)的预测性能。抗体-抗原界面通过残基级空间接近度定义,并使用SAbDab[20]进行注释。我们使用结构质量、复合体大小、链完整性和界面几何的标准过滤器保留高质量生物组装体。蛋白质实体使用MMseqs2 easy-cluster聚类,最小序列同一性阈值40%,比对覆盖率要求80%,每个界面簇定义为两个相互作用实体簇的无序对。

在这个最新基准上,OpenDDE取得了最高总体成功率,正确预测了66.4%的界面(DockQ > 0.23)。它优于ESMFold2(51.0%)、Protenix-v1(50.0%)、OpenFold3(21.9%)、Boltz-1(25.0%)和Chai-1(16.7%)。OpenDDE在高精度区域也表现出明显优势,很大一部分复合体达到DockQ > 0.8。这些结果证明了OpenDDE预测新发布抗体-抗原界面的强大能力,并表明对新兴生物系统具有更好的泛化能力。

参见图注 图3:DockQ在PXMeter-AB、FoldBench-AB和2026ARK-AB上的累积分布。每条曲线显示了Chai-1、OpenFold3、Protenix-v1和OpenDDE的排名第一预测达到DockQ≥x轴阈值的目标比例;曲线越靠近右上角性能越好。

**新模型容量**(图2)。我们在神谕选择设置下评估模型容量,即从每个模型生成的候选中选择最佳预测。这种设置近似了模型在排名或置信度估计不是限制因素时的最大可达性能,因此反映了其采样容量的上限。如图2所示,OpenDDE在所有抗体-抗原基准上取得了最高的神谕选择成功率,在PXMeter-AB上达到65.9%,在FoldBench-AB上达到81.9%,在2026ARK-AB上达到80.1%。这些结果显著超过了对应的非神谕基准性能,表明即使排名第一的预测并非总是最优,OpenDDE仍经常生成高质量的抗体-抗原构象。神谕增益较大,表明OpenDDE对抗体-抗原界面具有强大的潜在建模能力,并且置信度估计或候选选择的进一步改进可以将这种能力转化为更高的实际预测精度。

**DockQ成功率曲线**(图3)。DockQ成功率曲线提供了界面预测质量的阈值扫描视图。对于每个DockQ截止值,曲线报告预测界面超过该质量阈值的目标比例,因此在x轴范围内保持较高值的曲线表明在从可接受到高质量预测的整个范围内性能更佳。在PXMeter-AB、FoldBench-AB和2026ARK-AB上,OpenDDE始终保持最高曲线,表明其优势不局限于单个DockQ阈值。在中等到高质量区域,差距尤为明显,随着截止值变得严格,OpenDDE仍保留更大比例的成功预测。这表明OpenDDE既改进了粗略界面恢复,也提高了高保真度抗体-抗原对接精度,产生了更多具有准确结合几何结构的预测,而不仅仅是增加低阈值成功。

### 1.2 生物分子基础模型中的缩放定律

参见图注 图4:生物分子基础模型中的缩放定律。左图:模型性能作为估计训练词元数的函数,计算为训练步数×GPU数量(批大小)×裁剪词元数。右图:模型性能作为估计训练成本的函数,计算为估计训练词元数×可训练模型参数。我们在生物分子基础模型中观察到清晰的缩放趋势。为了研究这一趋势,我们将OpenDDE与AlphaFold3[4]、Protenix-v1[17]、Protenix-v2[21]、SeedFold[22]和ESMFold2[18]在抗体-抗原结构预测上进行比较(图4)。我们使用两种训练规模的估计。第一种是估计训练词元数,计算为训练步数×GPU数量(批大小)×裁剪词元数。¹¹对于OpenDDE,估计为400×(10k×384+60k×384+15k×544+15k×544+10k×768)≈2.04×10^10。第二种是估计训练成本,计算为估计训练词元数×可训练模型参数。²²对于OpenDDE,估计为2.04×10^10×655M≈1.33×10^19。

**缩放定律的证据**(图4)。缩放定律曲线显示训练规模与Ab-Ag性能之间存在明确的正相关关系。随着估计训练计算量的增加,模型性能从较低规模的模型(如Protenix-v1和AlphaFold3)向更高性能的模型(如Protenix-v2和OpenDDE)提升。该趋势平滑且呈亚线性,类似于在大语言模型中观察到的缩放行为:早期规模增加产生相对大的增益,而后期增益随着曲线接近IsoDDE参考水平而变得更加平缓。

OpenDDE位于曲线的高规模、高性能端,在比较的模型中实现了最佳的Ab-Ag性能,并缩小了与IsoDDE的差距。剩余差距表明,进一步扩展可能继续提升性能,但收益递减。各个模型之间的偏差也表明,规模本身并不能完全决定性能;架构、数据质量和训练策略很可能影响每个模型相对于整体缩放趋势的位置。

**进入缩放时代**(图4)。在这些模型和性能之间,结果随着数据规模和有效计算规模而改进。这一观察表明,生物分子结构建模正在进入与(大)语言模型同样的缩放机制:更大的有效训练语料库、更大规模的模型和更多的计算可以系统地转化为更强的生物推理和结构预测能力。

### 1.3 测试时缩放

参见图注 图5:在FoldBench-AB和2026ARK-AB上的测试时缩放。上图:DockQ>0.8的基于排名的选择。

相似文章

结构蛋白质组学引导的共折叠模型

arXiv cs.LG

介绍了AIMS-Fold,一种推理时引导扩散框架,整合了交联质谱(XL-MS)和氢-氘交换(HDX-MS)数据,以改善针对诱导接近药物靶点的蛋白质共折叠预测。

通过口袋条件扩散和属性感知优化生成可开发的3D分子

arXiv cs.LG

本文介绍了一种新颖的基于扩散的生成模型,用于基于结构的药物设计。该模型解耦了口袋和配体的表示学习,并融入了多尺度相互作用信号和属性感知优化,以生成具有更强结合亲和力和更优ADMET属性的可开发3D分子。