Vilya-1:一种用于大环结构预测与设计的全原子基础模型
摘要
Vilya-1是一种深度学习模型,用于预测大环结构及其性质。它采用全原子表示来采样构象并预测可开发性,在几何精度上相比现有方法有显著提升。
arXiv:2607.09998v1 公告类型:新
摘要:大环肽是一类日益重要的治疗方式,但现有用于建模其结构和性质的计算方法在范围上有限,且不能很好地泛化到合成可及的化学空间。在这项工作中,我们引入了Vilya-1,这是一个深度学习模型,解决了大环设计中的两个核心挑战:在任意化学结构中采样生物学相关的构象,以及预测关键的可开发性质(如膜通透性)。Vilya-1采用统一的原子级表示,并在涵盖多种拓扑结构和化学类别的异构结构数据集上进行训练。在一系列由标准和非标准残基组成的大环分子中,Vilya-1在几何精度上相对于基于物理的方法、共折叠网络和深度学习构象生成器有显著提升,同时保持了广泛的化学覆盖范围,甚至延伸至小分子。Vilya-1还支持生成式应用,能够设计具有定制化学、结构和性质特征的新型大环分子。综上所述,这些能力使Vilya-1成为加速下一代大环治疗药物开发的基础模型。
查看缓存全文
缓存时间: 2026/07/14 04:15
# Vilya-1:用于大环结构预测与设计的全原子基础模型 来源:https://arxiv.org/html/2607.09998 ###### 摘要 大环肽是一类日益重要的治疗模式,但现有计算模型在结构和性质预测方面范围有限,难以在合成可及的化学空间中良好泛化。本文提出 Vilya-1,一个深度学习模型,针对大环设计中的两大核心挑战:跨越任意化学结构采样生物学相关的构象,以及预测膜通透性等关键成药性质。Vilya-1 采用统一的全部原子表示,并在涵盖多样拓扑结构和化学类别的异构结构数据集上训练。在一系列由标准氨基酸与非标准残基组成的广泛大环分子中,Vilya-1 的几何精度显著优于基于物理的方法、共折叠网络及深度学习构象生成器,同时保持广泛的化学覆盖范围,可延伸至小分子。Vilya-1 还支持生成式应用,能够设计具有定制化学、结构与性质特征的新型大环。综合这些能力,Vilya-1 作为基础模型,有望加速下一代大环疗法的开发。 ## 1 引言 大环肽治疗药物能够结合传统上不可成药的蛋白质表面,同时保留小分子的多项药理学优势,尤其是进入细胞内区室的能力及口服给药的潜力 [17 (https://arxiv.org/html/2607.09998#bib.bib43),58 (https://arxiv.org/html/2607.09998#bib.bib44)]。从头设计研究表明,由标准氨基酸组成的大环可在原子级别精度下进行工程改造,从而极大扩展了天然界之外的支架类型 [4 (https://arxiv.org/html/2607.09998#bib.bib6),52 (https://arxiv.org/html/2607.09998#bib.bib2),60 (https://arxiv.org/html/2607.09998#bib.bib4)]。最近,计算流程已扩展到化学多样化的大环骨架与非肽类大环寡酰胺 [55 (https://arxiv.org/html/2607.09998#bib.bib5)]。这种化学多样性为大环靶向细胞内和细胞外蛋白质-蛋白质相互作用等挑战性靶点提供了可能。 这些进展突显了准确模拟大环可能采用的低能构象状态的重要性,因为这些状态控制着靶点结合、通透性及其他类药性质。然而,至今构象采样通常依赖于针对特定化学结构的定制化计算流程。为了释放大环的治疗潜力,必须开发能够在合成可及化学空间内泛化、并准确捕获生物学相关低能状态的计算方法。 > 参见图注 图1:Vilya-1 的药效构象预测与采样效率。A)Vilya-1 预测的若干药效大环示例,精度达到亚埃级别,以环 RMSD 衡量。Vilya-1 生成的结构(绿色)与 PDB 中对应的实验 X 射线结构(灰色)叠合。B)Vilya-1 在环肽 X 射线结构上的采样效率,与其他现有方法对比。C)在标准和非标准环肽的溶液 NMR 结构上的表现。D)在受体结合构象的环肽上的表现,Vilya-1 相较其他方法成功率更高。E)Vilya-1 架构示意图。对于面板 A–D,每个分子用每种方法(包括 Vilya-1)生成 100 个构象。面板 A 中,生成的构象还按置信度排序,报告前 5 个中的最佳环 RMSD 模型,模仿 CASP 竞赛设置 [45 (https://arxiv.org/html/2607.09998#bib.bib61)]。面板 B–D 中的结果仅反映构象采样性能,不涉及评分或基于置信度的排序。 现有预测大环肽结构的方法主要来源于蛋白质结构预测工具或小分子构象生成器。两者对于化学多样性的环状系统都有重要局限性。通用的结构预测网络(如 Boltz-2 和 RosettaFold3 (RF3))[48 (https://arxiv.org/html/2607.09998#bib.bib8),10 (https://arxiv.org/html/2607.09998#bib.bib9)] 原则上可以建模大环,但实际上无法很好地泛化到非标准化学结构,且通常无法为可能缺乏单一确定基态的大环生成足够多样的构象集合。尽管存在针对含非标准氨基酸的大环肽结构数据微调共折叠网络的例子,但这些方法尚未在其训练集所代表的窄化学范围之外展示出稳健的泛化能力 [40 (https://arxiv.org/html/2607.09998#bib.bib39),9 (https://arxiv.org/html/2607.09998#bib.bib40),61 (https://arxiv.org/html/2607.09998#bib.bib41),42 (https://arxiv.org/html/2607.09998#bib.bib42)]。小分子构象生成器设计用于多样性,但通常无法泛化到具有环约束的更大、更灵活的分子。基于物理的方法(如分子动力学或随机采样)能够建模非常复杂的大环,但效率低下,且在大环尺寸较大时精度往往下降 [56 (https://arxiv.org/html/2607.09998#bib.bib55),28 (https://arxiv.org/html/2607.09998#bib.bib60),12 (https://arxiv.org/html/2607.09998#bib.bib56)]。这一差距促使开发专门用于建模大环构象景观的新方法。 本文提出 Vilya-1,一个用于生成大环构象的深度学习模型。Vilya-1 采用统一的全部原子表示,不区分肽类与小分子化学结构,使得单个架构能够容纳大环设计中遇到的广泛化学类型。这种表示简化了分子结构数据集的使用,并让模型能够学习支配聚合物和非聚合物分子的通用结构原理。Vilya-1 在广泛的内外部结构数据集上训练,覆盖多样的拓扑结构、化学类别和分子大小。在一系列基准测试中,Vilya-1 在采样实验观测到的大环结构方面显著优于现有方法,环重建成功率(环 RMSD < 1 Å)几乎是领先基于物理方法的两倍,并显著超过共折叠网络,特别是对于含有非标准氨基酸或非肽片段的分子。 我们展示了准确结构采样在三个实际应用中的效用:(i) 作为下游性质预测的基础模型,(ii) 作为构象景观分析的采样器,(iii) 作为设计新拓扑结构的预言机。作为性质预测模型,Vilya-1 能够从内部化验数据中学习,预测实现口服生物利用度的关键类药性质。Vilya-1 生成的构象景观对蛋白质靶点的结合具有预测能力,尽管模型并未针对结合物判别进行训练。最后,作为生成式流程的一部分,Vilya-1 能够将较大大环中的基序支架转移到较小的环中,这是药物类大环在命中优化中的重要问题。综合这些结果,Vilya-1 是一个通用模型,能够在实际药物发现活动中辅助大环肽设计与优化的所有阶段。 ## 2 方法 ### 2.1 Vilya-1 架构 该架构借鉴了将大型 Transformer 模型扩展到生物分子建模问题的现有工作 [1 (https://arxiv.org/html/2607.09998#bib.bib10),2 (https://arxiv.org/html/2607.09998#bib.bib1),18 (https://arxiv.org/html/2607.09998#bib.bib11)]。模型输入包含分子的完整化学描述,分为三种模态:(i) 原子级标量特征,(ii) 成对标量特征,(iii) 原子级向量特征。借助专用的 NVIDIA cuEquivariance 内核,核心架构基于 [31 (https://arxiv.org/html/2607.09998#bib.bib12)] 引入的组件构建:三角形注意力与乘法、以及带有成对偏差的注意力。模型最后将最终嵌入直接投影到 3D 空间中的坐标。 > 参见图注 图2:Vilya-1 架构示意图。模型架构和噪声过程组件以绿色标示,特征嵌入和输入以灰色标示。 该模型与流行的蛋白质-配体共折叠架构有三个主要区别。首先,扩散过程运行在单一统一的 Transformer 架构中。由于我们的目标是显式建模构象集合,我们假设拥有独立的主干模块和扩散模块可能会减少采样坐标结构的多样性。其次,由于我们要建模广泛多样的非标准化学结构,我们将所有分子输入嵌入到单个重原子级别。虽然将标准残基中的原子显式分组到单一嵌入中在计算上高效,但这限制了网络的通用性。最后,我们只输入描述输入分子化学结构的特征,省略辅助特征(如分子类型、原子名称或位置编码)。我们认为,仅使用化学相关特征将使模型不太可能记忆训练数据,并且更可能泛化到新分子。 我们在 Vilya-1 架构上扩展了两个下游模型:一个置信度模型和一个性质预测模型。这两个下游模型共享构象生成模型的架构,并从其权重进行微调。性质模型和置信度模型都接受与基础模型相同的特征,同时额外接受生成的构象结构。 ### 2.2 训练 #### 构象生成器 模型在公开可用的小分子和肽晶体结构数据以及计算生成的大环肽结构上联合训练。主要损失是基于扩散的损失,用于在给定化学输入特征、当前噪声水平和含噪坐标的情况下重建坐标。我们发现引入两个辅助损失是有用的:一个类似于 [1 (https://arxiv.org/html/2607.09998#bib.bib10)] 的成对距离直方图损失,以及一个鼓励四面体中心正确手性的附加损失。 #### 置信度估计 置信度模型训练用于预测生成构象与真实结构之间的改进版框架对齐点误差 (FAPE) [33 (https://arxiv.org/html/2607.09998#bib.bib13),2 (https://arxiv.org/html/2607.09998#bib.bib1)]。 #### 性质预测 性质预测模型训练用于从生成的构象中联合预测多个物理化学性质。预测标签包括内部测量的性质——通透性、以色谱 LogD 测量的疏水性、以及动力学溶解度——以及一个计算性质:直接从输入构象导出的 3D 极性表面积。根据每个标签的性质,预测任务设定为回归或 sigmoid 回归。性质预测的训练和评估数据来自两个来源:(i) Vilya 发现项目中收集的内部数据集,(ii) 从已发表的化验测量中汇编的外部可用通透性数据集。被动通透性主要使用平行人工膜通透性测定 (PAMPA) 的数据进行建模。外部 PAMPA 数据集包含约 11,500 个独特测量值,收集自环肽膜通透性数据库 [38 (https://arxiv.org/html/2607.09998#bib.bib14)]、非肽大环膜通透性数据库 [14 (https://arxiv.org/html/2607.09998#bib.bib15)] 以及其他数据库和已发表研究 [32 (https://arxiv.org/html/2607.09998#bib.bib16),26 (https://arxiv.org/html/2607.09998#bib.bib17),41 (https://arxiv.org/html/2607.09998#bib.bib18),54 (https://arxiv.org/html/2607.09998#bib.bib57)]。额外的辅助预测任务仅使用 Vilya 生成的专有数据进行训练,包括 Madin-Darby 犬肾 (MDCK) 测定中测量的通透性、色谱 LogD 和动力学溶解度。计算性质——3D 极性表面积——从预测构象实时计算,并作为辅助目标,促进分子几何结构与预测性质之间的一致性耦合。数据分割采用基于时间的分割(对于内部数据,模拟性质预测的真实使用场景 [36 (https://arxiv.org/html/2607.09998#bib.bib59)])和基于支架的分割(对于外部数据)。 ### 2.3 大环结构预测的评估集 #### 小分子验证集 我们从剑桥结构数据库 (CSD) 中收集了 7,192 个有机小分子结构作为验证集,涵盖 3–96 个重原子 [21 (https://arxiv.org/html/2607.09998#bib.bib20)]。这些实验确定的几何结构用于在化学多样化的非肽系统上评估性能。 #### 大环验证集 我们整理了来自 CSD 的 200 个含酰胺的大环分子,要求环上原子数 ≥ 12 且至少有三个酰胺基团。所有选定结构的 CSD 标识符见补充材料。该集合是超参数调整和模型选择的主要资源。 #### 大环测试集(X 射线结构) 我们编译了一个包含 66 个具有 X 射线结构的环肽的测试集,来源有三个:53 个来自近期文献 [5 (https://arxiv.org/html/2607.09998#bib.bib19),55 (https://arxiv.org/html/2607.09998#bib.bib5),51 (https://arxiv.org/html/2607.09998#bib.bib3)]、5 个内部配体单独结构、以及 8 个来自蛋白质数据库 (PDB) 的额外大环。这些肽的尺寸范围从 3 到 17 个氨基酸残基。 #### 大环测试集(NMR 结构) 我们建立了一个独立的基准,包含 260 个 NMR 导出的结构,这些结构来自环肽数据库中的条目,条件为残基数 ≤ 16、至少一个大环系统、且具有 NMR 确定的坐标。使用基于 Biotite 和 RDKit 的流程 [34 (https://arxiv.org/html/2607.09998#bib.bib62),35 (https://arxiv.org/html/2607.09998#bib.bib63)] 对结构进行清洗和标准化,确保没有自由基电子,且化合价、形式电荷和氢原子计数一致。最终集合进一步分为全标准子集(86 个分子)和非标准子集(174 个分子)。选定分子的 PDB ID 见补充材料。 #### PDB 衍生的结合态小分子结构 为了在配体-蛋白质复合物上评估性能,我们使用 Platinum Diverse 数据集,这是一个高质量的蛋白质结合配体构象集合,包含 2,859 个从 PDB 中提取的结构,专门设计用于评估构象集合生成器 [15 (https://arxiv.org/html/2607.09998#bib.bib21)]。
相似文章
InternVLA-A1.5: 统一理解、潜在预见与行动以实现组合泛化
InternVLA-A1.5 将预训练的视觉语言模型与潜在空间中的未来预测相结合,以实现具有组合泛化和长视界执行能力的高效机器人操作,在模拟基准测试中取得了最先进的结果。
MIT工程师依据运动而非仅依据形状设计蛋白质
MIT研究人员开发了名为VibeGen的AI模型,该模型基于蛋白质的动态运动和力学特性进行设计,而非仅依赖静态结构。这种方法能够创造出具有特定振动和弯曲行为的蛋白质,推动了生成式AI在科学领域的发展。
从基础到应用:在实践中改进VLA模型
本文介绍了LingBot-VLA 2.0,它通过改进跨任务和具身形态的泛化能力、将动作空间扩展至全身自由度,并引入预测动力学建模以提升时间推理能力,从而增强了用于机器人技术的VLA基础模型。
@askalphaxiv: "原子语言模型理解并生成材料" 大多数材料AI仍然将晶体和语言分开处理…
本文介绍了一种原子语言模型,它集成了3D原子编码器、Qwen大语言模型和扩散晶体生成器,原生处理多模态材料数据,实现了最先进的晶体结构预测和从头生成。
ChemVA:推动大型语言模型对化学反应图的理解
ChemVA 是一个框架,旨在解决大型语言模型理解化学反应图时的视觉和语义瓶颈,实现了92%的结构识别准确率,并在九个大型语言模型上持续提升约20个百分点。