Fraglingo:通过连接感知自回归片段生成进行分子设计
摘要
Fraglingo引入了一种连接感知的自回归模型,用于分子设计,该模型通过在连续潜空间中联合预测片段身份和连接来生成分子,增强了属性控制和灵活性。
查看缓存全文
缓存时间: 2026/09/15 08:55
# Fraglingo:基于连接感知自回归片段生成的分子设计 来源:https://arxiv.org/html/2609.13519 作者:Thao Nguyen、Jeonghwan Kim、Zhenhailong Wang、Heng Ji 单位: 西贝尔计算与数据科学学院 伊利诺伊大学厄巴纳-香槟分校 美国伊利诺伊州厄巴纳市,邮编61801 邮箱:[[email protected]](mailto:[email protected]), [[email protected]](mailto:[email protected]), [[email protected]](mailto:[email protected]), [[email protected]](mailto:[email protected]) ###### 摘要 分子设计在生成过程能够模拟化学家实际进行的编辑操作时最为高效:如延伸骨架、替换取代基,或在指定连接位点修饰骨架并同时优化分子性质。基于片段的分子设计天然契合这一工作流程,但现有方法通常将生成过程分解为两个独立步骤:首先从固定词汇表中选择一个片段,然后预测所选片段应如何连接。这种表述将生成限制于固定片段词汇表,并使连接预测变得不必要地间接。 本文提出 **Fraglingo**,一种基于片段的自回归分子生成器,它在连续潜空间中联合预测片段身份及其连接方式。具体而言,Fraglingo预测一个 **连接感知片段嵌入**,并通过潜空间搜索检索最近邻片段。为编码连接上下文,我们引入一种 **通配符锚定读出机制**,从活跃连接位点的视角表征正在生长的分子和候选片段,使得单次潜预测能够同时确定附加哪个片段以及新键应形成的位置。由于预测在连续嵌入空间而非固定片段标识符上进行,Fraglingo允许在推理时引入更大的片段库而无需重新训练。这种基于检索的表述为分子生成、骨架生成、骨架修饰和分子优化提供了统一的生成基元。 在可控性质条件基准测试中,Fraglingo实现了比同等训练基线更强的联合性质控制能力,同时保持了具有竞争力的有效性、唯一性和新颖性。此外,它能够泛化到比训练时使用的片段库大4倍的库,而无需重新训练。 ## 1 引言 分子设计是一个受约束的结构化生成问题:一个有用的模型应提出有效的化学结构、满足目标性质、在需要时保留骨架,并在化学上有意义的层面上进行编辑。近期的分子生成器包括基于SMILES(Weininger, 1988)或SELFIES(Krenn et al., 2020)字符串的序列模型、基于原子和键的图生成器,以及在分子图上运行的扩散或流模型(Segler et al., 2018; Gómez-Bombarelli et al., 2018; Ross et al., 2022; Shi et al., 2020; Hoogeboom et al., 2022)。这些表示具有表现力,但其决策层次通常低于药物化学设计中所使用的操作。一个语法错误就可能使SMILES样本无效,而逐原子的图生成可能需要很长的轨迹才能出现可识别的母核。 相比之下,基于片段的生成提供了一种更自然的表述。药物化学家通过片段级操作进行推理——添加、替换、延伸或修饰母核,而非通过孤立的原子或语法符号(Hajduk and Greer, 2007; Kirsch et al., 2019)——片段将分子构建转变为一系列更大的、化学上可解释的编辑。然而,标准的片段生成表述遗留了两个未解决的问题(Jin et al., 2020; Kong et al., 2022; Yue et al., 2024)。首先,将片段选择视为离散分类将生成接口绑定到固定的片段词汇表:在推理时,模型只能直接选择训练时输出词汇表中表示的片段。更关键的是,片段选择必须指定两侧的连接几何:正在生长的分子上哪个开放位点正在被延伸,以及检索到的片段上哪个点与其连接(图1)。一个正在生长的分子通常同时携带多个开放的通配符,而基于全局分子状态条件化的片段嵌入并不能说明下一个片段应附加到哪个位点。这种模糊性并非偶然;它是非对称部分结构的固有特性,而这恰恰是全局条件失效的地方。 我们提出 **Fraglingo**,通过统一设计解决这两个挑战。它将分子分解为片段,并通过 **下一个片段预测** 来生成它们,反复在开放连接点附加一个片段。该框架与分割方案无关;在本文中,我们主要使用BRICS(Degen et al., 2008)作为分割方案,并使用BFE(Nguyen and Ji, 2026)进行消融实验以评估分割方法的影响。 与以往的片段生成器不同,Fraglingo用 **连接感知连续潜检索** 替代了分类头:模型不预测片段标识符,而是预测一个以活跃连接位点为条件的下一个片段的嵌入,并通过在由相同编码器产生的片段嵌入表中进行最近邻查找来解码。由于预测在连续嵌入空间而非固定类别上进行,片段表可以在训练后扩展,而无需重新训练模型。 为解决连接模糊性,Fraglingo引入了 **通配符锚定读出机制**,该机制从活跃通配符的视角编码正在生长的分子和每个候选片段。因此,预测的嵌入从连接位点的视角捕捉正在生长的分子,使检索能够回答哪个片段最适合特定连接位点这一局部问题。性质条件进一步引导生成朝向所需的分子属性。总之,连接感知的连续检索提供了一个平滑、开放的预测空间,而通配符锚定读出则提供了准确片段选择所需的连接特异性。单个检索基元则统一了通常由独立模型处理的四项分子设计任务:分子生成、分子优化、骨架生成和骨架修饰。分子和骨架通过片段组装自回归生成,骨架通过为指定连接位点检索分支进行修饰,分子则通过以参考分子为条件替换选定片段进行优化。 在所有任务中,生成都在片段级别运行,同时共享相同的连续检索架构。由于预测器从不固定于一组输出类别,它与片段库的大小解耦,允许在比训练时使用的库更大的库上进行推理。 总之,我们的贡献是: - • **用于连接感知生成的通配符锚定读出**。我们引入了一种以活跃连接位点为锚的图读出机制,为每个通配符提供独特的、位点特定的表示。这显式地将正在生长的分子与连接点耦合,并解决了当存在多个开放位点时出现的模糊性,从而能够联合预测添加 *什么* 片段以及 *在何处* 连接它。 - • **用于下一个片段预测的连续潜检索**。我们将片段生成表述为在学习的嵌入空间中的检索。在每一步,模型预测下一个片段的嵌入,并通过最近邻搜索解码,允许化学上相似的片段共享表示,并实现无需重新训练即可在推理时扩展片段库。 - • **用于四项分子设计任务的统一检索基元**。Fraglingo将四项分子设计任务,包括分子生成、骨架生成、骨架修饰和分子优化,统一在单一片段检索框架内。 图1:两个具有模糊连接性的片段可能的分子组装方式。 ## 2 相关工作 早期的分子生成器将分子表示为SMILES字符串或分子图。基于SMILES的方法将分子设计表述为使用循环网络(Segler et al., 2018)、变分自编码器(Gómez-Bombarelli et al., 2018)或Transformer语言模型(Ross et al., 2022)的序列生成,而基于图的方法则通过自回归、流或扩散过程直接生成原子和键(Shi et al., 2020; Hoogeboom et al., 2022)。尽管这些方法在表示和架构上不同,但它们共享一个共同的原子级生成范式,要求模型在生成原子或键时仅隐式地发现化学上有意义的片段。 基于片段的方法通过操作更大的化学单元更接近药物化学。HierVAE(Jin et al., 2020)、JT-VAE(Jin et al., 2018)、PS-VAE(Kong et al., 2022)、MoLeR(Maziarz et al., 2022)和FragGPT(Yue et al., 2024)都依赖于固定的片段词汇表,在组装成分子之前预测离散的片段身份。最近的工作探索了替代的片段表示,包括t-SMILES(Wu et al., 2024)的层次化片段语言和SynCoGen(Rekesh et al., 2025)中面向合成的构建块表示。然而,这些方法继续从固定词汇表生成离散片段或构建块身份,限制了词汇表扩展和对未见片段的泛化能力。 Fraglingo则用连续潜检索取代了片段分类,实现了无需重新训练即可在推理时扩展片段库,同时从活跃通配符的视角检索片段,使片段选择直接以连接位点为条件。 ## 3 基于潜空间自回归片段生成的分子设计 本节首先介绍Fraglingo使用的通用生成基元,然后解释如何将该基元应用于分子生成、分子优化、骨架生成和骨架修饰。详细的模型设计、训练目标和配置选择见附录E。 ### 3.1 分子/骨架生成 图2:Fraglingo在四项分子设计任务中的训练和推理概览。所示架构说明了无条件生成,为清晰起见省略了GNN编码器和查询投影器;详细架构见图8。 我们将分子生成建模为一个顺序片段组装过程。BRICS分解打断具有合成意义的键,并为每个被打断的键标记通配符连接原子,从而将分子转化为片段 $\{F_1, \ldots, F_T\}$。组装从一个盖帽片段(只有一个通配符的片段)开始,并以广度优先顺序扩展片段树。在每一步 $t$,模型观察具有指定活跃连接点的部分组装体 $G_t$,并预测下一个应附加哪个片段 $F_{t+1}$。骨架生成使用相同的表述,但训练分子是Murcko骨架(Bemis and Murcko, 1996)而非完整的修饰分子。 模型由四个组件构成: (i) 一个共享的图编码器 $\phi$(FragmentGPS)将当前部分组装体和候选片段映射到 $d=256$ 维嵌入中。FragmentGPS是一个6层的GPS网络(Rampášek et al., 2022),其中每一层将GINE风格的局部消息传递与全局多头自注意力相结合,后接带有残差连接和LayerNorm的前馈块(图8)。 (ii) **通配符锚定读出** 使这些表示对连接位点具有特异性。FragmentGPS计算图中原子的隐藏表示后,指定通配符的隐藏状态被用作对真实原子隐藏状态的注意力查询。产生的注意力加权摘要即为图嵌入。对于部分组装体 $G_t$,设 $w_t$ 表示要延伸的活跃通配符。我们定义 $e_1 = \phi(G_t, w_t)$,其中 $e_1$ 从 $w_t$ 的视角总结分子上下文。直观地说,$e_1$ 代表了这个问题:哪个片段与这个特定连接位点兼容?相同的机制用于编码候选片段 $f_{t+1}$。设 $w_{t+1}$ 表示候选片段将通过其连接的通配符。其连接条件化嵌入为 $e_2 = \phi(f_{t+1}, w_{t+1})$。因此,部分组装体和候选片段都是从形成新键的两个位点的视角来表示的。这一区分对于具有多个通配符的非对称片段很重要。同一个片段可以为每个指定的连接位点产生 *不同的嵌入*。因此,检索同时指定了选择哪个片段以及该片段的哪个连接位点应形成化学键。一个全局池化的嵌入会将这些替代方案压缩成一个表示,无法区分它们。 (iii) 性质条件将此局部上下文引导至所需的分子属性。在我们的实验中,我们以七个使用RDKit(Landrum, 2006)计算的分子性质(logP, MW, QED, TPSA, HBD, HBA, RotBonds)为条件。它们的值被投影到 $d$ 维嵌入空间,并添加到上下文嵌入中:$e_1^{\text{cond}} = e_1 + W_p \mathbf{p} + \mathbf{b}_p$。训练期间,以0.2的概率将性质置零,从而允许在推理时进行无分类器引导。 (iv) 一个两层的MLP投影器 $f$($\text{MLP}_{\text{Mapper}}$, $d \rightarrow 4d \rightarrow d$, GELU)将 $e_1^{\text{cond}}$ 映射到 $\hat{z} = f(e_1^{\text{cond}})$。模型使用InfoNCE(Oord et al., 2018)进行训练,使 $\hat{z}$ 与正确下一个片段的嵌入 $e_2 = \phi(F_{t+1})$ 对齐。
相似文章
通过口袋条件扩散和属性感知优化生成可开发的3D分子
本文介绍了一种新颖的基于扩散的生成模型,用于基于结构的药物设计。该模型解耦了口袋和配体的表示学习,并融入了多尺度相互作用信号和属性感知优化,以生成具有更强结合亲和力和更优ADMET属性的可开发3D分子。
可控分子生成基础模型
提出CoMole,一种基于基序感知图扩散和强化学习的可控分子生成基础模型,在材料和药物发现基准测试中实现了卓越的可控性。
语言模型碎片整合:基于可解释性的词汇扩展方法
# 基于可解释性的词汇扩展方法 来源:[https://arxiv.org/html/2604.16656](https://arxiv.org/html/2604.16656) ## 语言模型碎片整合:基于可解释性的词汇扩展方法 Maitrey Mehta¹, Nishant Subramani², Zhichao Xu¹, Ashim Gupta¹, Vivek Srikumar¹ 1 Kahlert School of Computing, University of Utah 2 Language Technologies Institute, Carnegie Mellon University {maitrey,svivek}@cs.utah.edu ###### 摘要 所有语言生而平等;但在词元化方面,某些语言更为平等。词元是当代大语言模型访问成本和延迟的隐藏货币。然而,许多使用非拉丁文字书写的语言却面临着糟糕的“汇率”:大语言模型需要用数倍的词元来编码与英语相同的信息。我们的分析表明,这个被称为“词元过度碎片化”的问题在现代开源大语言模型中依然存在。标准解决方案是词汇扩展,即添加模型词汇库中缺失的目标语言词汇。在这项工作中,我们全面研究并推进基于可解释性的词汇扩展这一新研究方向。我们聚焦于词汇扩展过程中的两个核心决策:应该添加哪些词汇?以及如何初始化它们对应的输入和输出嵌入? 首先,我们质疑使用基于频率的方法来选择待添加候选词汇的传统做法(这一决策长期以来被视为理所当然),并证明基于可解释性的方法能够提供更优的性能-词元效率权衡。其次,我们通过展示对于多种非拉丁文字语言相较于基线初始化方法取得的大幅提升(约20分),加强了基于可解释性的嵌入初始化的可行性。我们发现了“子词去词元化”现象,即模型在多层网络中逐步将碎片化的子词词元合并为更大的子词。基于对这一现象的分析,我们提出了FragMend,以进一步突破基于可解释性的扩展的效率上限。我们通过与强基线方法的比较验证了FragMend的有效性,并对其设计选择进行了广泛分析。
Sesame: 通过空间密度图条件的结构感知分子生成
本文介绍了Sesame,一个基于扩散的分子生成模型,该模型通过空间密度图对部分分子结构和蛋白质口袋进行条件化,从而实现从头生成和片段条件的先导化合物优化,用于药物设计。
MDForge:稀疏模拟器反馈下的智能体分子动力学流程设计
MDForge 是一个 LLM 智能体,可自动化设计用于主客体结合自由能计算的分子动力学流程,取得了与人类专家相当的结果,并发现了一种新型高亲和力结合物。