多粒度理由引导的分子大语言模型用于性质预测
摘要
本文介绍了MR-MoL,一种多粒度理由引导的分子大语言模型,它通过暴露GNN生成的子结构归因信息,在MoleculeNet基准上改进分子性质预测。
arXiv:2608.10480v1 公告类型:新
摘要:大语言模型(LLMs)被广泛应用于化学任务中,例如为药物发现奠定基础的分子性质预测。分子大语言模型通过多种模态来表示分子,特别是1D SMILES序列或2D分子图。这两种方式都隐式编码分子信息,因此各个子结构的贡献仍然不透明。检索和增强方法可从外部来源添加上下文,然而化学家推理所依据的线索是驱动性质升高或降低的内部子结构。我们提出了MR-MoL,一种多粒度理由引导的分子大语言模型,它直接提供这一证据。经过微调的GNN通过掩蔽对每个子结构进行评分,最具影响力的子结构被序列化为一个带排名的、带有方向标签的理由,大语言模型在读取SMILES序列和分子图的同时也会读取该理由。该理由涵盖三个粒度层级:Murcko骨架及其侧链、BRICS片段和官能团。据我们所知,这是首次将GNN衍生的归因信息暴露给大语言模型作为性质预测证据的方法。在八个MoleculeNet任务上,MR-MoL在通用模型中取得了最佳总体结果,并缩小了与针对每个任务调优的专家模型之间的差距。五项诊断进一步证实,模型确实读取了理由,而不仅仅是从其存在中获益。理由的方向、排名和子结构都会影响预测,且其归因信息再现了已知的结构-性质关系。
查看缓存全文
缓存时间: 2026/08/12 08:24
# 多粒度依据引导的分子大语言模型用于性质预测 来源:https://arxiv.org/html/2608.10480 ###### 摘要 大语言模型 \(LLMs\) 被广泛应用于化学任务,例如为药物发现奠定基础的分子性质预测。分子大语言模型通过多种模态来表示分子,最典型的是1D SMILES序列或2D分子图。这两种方式都隐式地编码分子信息,因此单个子结构的贡献仍然不透明。检索和增强方法虽能添加上下文,但都来自外部来源。然而,化学家所依据的线索,是那些推动性质升高或降低的内部子结构。我们提出MR-MoL,一种多粒度依据引导的分子大语言模型,直接提供这种证据。一个微调后的GNN通过掩蔽对每个子结构进行评分,最具影响的子结构被序列化为一个排好序、带方向标签的依据列表,LLM将其与SMILES序列和分子图一起读取。该依据跨越三个粒度层次:带侧链的Murcko骨架、BRICS片段以及官能团。据我们所知,这是第一种将GNN导出的归因作为性质预测证据提供给LLM的方法。在八个MoleculeNet任务上,MR-MoL在通用模型中取得了最佳总体结果,并缩小了与针对每个任务调优的专家模型之间的差距。五项诊断实验进一步证实,模型确实读取了依据,而不仅仅是受益于它的存在。依据的方向、排序和子结构都会影响预测,且其归因能够重现已知的结构-性质关系。代码——https://github.com/skku-aihclab/MR-MoL ## 引言 分子性质预测是药物发现、毒性筛选和溶解性设计的基础。用于该任务的深度学习模型传统上直接操作于多种分子表示:2D分子图(Xia et al.2023 (https://arxiv.org/html/2608.10480#bib.bib45); Wang et al.2022 (https://arxiv.org/html/2608.10480#bib.bib40); Liu et al.2022 (https://arxiv.org/html/2608.10480#bib.bib25))、1D简化分子输入线性规范(SMILES)序列(Ross et al.2022 (https://arxiv.org/html/2608.10480#bib.bib36); Chithrananda, Grand, and Ramsundar2020 (https://arxiv.org/html/2608.10480#bib.bib5))以及3D构象(Zhou et al.2023 (https://arxiv.org/html/2608.10480#bib.bib54); Schütt et al.2018 (https://arxiv.org/html/2608.10480#bib.bib38))。这类模型在MoleculeNet(Wu et al.2018 (https://arxiv.org/html/2608.10480#bib.bib43))等标准化基准上仍然是最强预测器之一,但通常需要针对每个任务进行训练或微调。 近年来,大语言模型 \(LLMs\) 已被应用于分子性质预测。将LLM应用于分子,首先需要将其表示转化为模型可以消费的形式,目前出现了两条路线。第一条路线保持完全文本化。分子被序列化为字符串,并以文本词元的形式输入LLM(Yu et al.2024 (https://arxiv.org/html/2608.10480#bib.bib48); Fang et al.2024 (https://arxiv.org/html/2608.10480#bib.bib8))。第二条路线附加一个图编码器,并通过投影器与LLM对齐,使分子以连续嵌入的形式进入提示。其中一些模型针对每个任务进行微调(Liu et al.2023 (https://arxiv.org/html/2608.10480#bib.bib27); Chen et al.2024 (https://arxiv.org/html/2608.10480#bib.bib4)),而另一些模型则在许多化学任务上共享同一个模型(Park et al.2024 (https://arxiv.org/html/2608.10480#bib.bib32); Kim, Lee, and Hwang2026 (https://arxiv.org/html/2608.10480#bib.bib18))。 然而,这些分子大语言模型留下了一个共同的空白。由于2D图和1D SMILES表示等模态隐式地编码分子信息,分子子结构的贡献仍然不透明(Wellawatte et al.2023 (https://arxiv.org/html/2608.10480#bib.bib42); Jiménez-Luna, Grisoni, and Schneider2020 (https://arxiv.org/html/2608.10480#bib.bib16); Wu et al.2023 (https://arxiv.org/html/2608.10480#bib.bib44))。向提示中添加检索或知识图谱可以在分子层面提供额外上下文(Xian et al.2025 (https://arxiv.org/html/2608.10480#bib.bib46); Lee et al.2026 (https://arxiv.org/html/2608.10480#bib.bib21)),但没有任何一条通道以模型可读的形式揭示当前分子子结构的重要性。而在实践中,这正是化学家所依赖的证据,即一个使性质升高或降低的官能团或片段。 受这一空白启发,我们为LLM配备了针对输入分子的显式、逐子结构证据。我们提出MR-MoL,一种多粒度依据引导的分子大语言模型。其思想很简单。我们让一个微调后的图神经网络(GNN)对每个子结构对其预测的贡献进行评分(Wu et al.2023 (https://arxiv.org/html/2608.10480#bib.bib44)),并将其作为依据提供给LLM:一个排序的、带方向标签的列表,指示每个子结构使GNN的预测升高还是降低。我们将其序列化为文本,因此LLM可以直接将其与SMILES序列和分子图表示一起读取。具体而言,我们从三个不同结构粒度的视角提取依据:Murcko骨架及其侧链(Bemis and Murcko1996 (https://arxiv.org/html/2608.10480#bib.bib2))、逆合成驱动的BRICS片段(Degen et al.2008 (https://arxiv.org/html/2608.10480#bib.bib6))以及具有化学名称的官能团。该设计支持两个主张。第一,依据应能提升预测性能,因为结构线索已知在分子性质预测中很重要(Fang et al.2023 (https://arxiv.org/html/2608.10480#bib.bib9); Zhang et al.2021 (https://arxiv.org/html/2608.10480#bib.bib50); Wu et al.2023 (https://arxiv.org/html/2608.10480#bib.bib44))。第二,LLM应将依据作为带有方向和排序的证据来使用,而非当作惰性填充。我们针对七个专家模型(包括五个基于GNN的模型和两个按任务微调的分子大语言模型)以及五个跨任务共享一个模型的通用分子大语言模型来评估第一个主张。我们用五项诊断实验检验第二个主张,其中包括四个行为干预实验(编辑依据)以及一项化学检查(验证其归因能否重现已知的结构-性质关系)。我们的贡献如下。 - •我们提出了MR-MoL,一个用于性质预测的多任务分子大语言模型。据我们所知,它是第一个将GNN导出的归因作为证据馈入提示的模型。 - •基于子结构掩蔽,我们构建了一个依据,将逐子结构归因分解为三个互补视角,并以带方向标签、排序的文本证据形式呈现。 - •我们在八个MoleculeNet任务上进行了消融实验来评估MR-MoL,并设计了诊断实验,表明依据起到了有效证据的作用。 ## 相关工作 #### 指令微调的分子语言模型。 越来越多的分子大语言模型在分子-文本对上接受指令微调,以遵循自然语言任务描述(Wei et al.2022 (https://arxiv.org/html/2608.10480#bib.bib41); Ouyang et al.2022 (https://arxiv.org/html/2608.10480#bib.bib31))。LlaSMol(Yu et al.2024 (https://arxiv.org/html/2608.10480#bib.bib48))和nach0(Livne et al.2024 (https://arxiv.org/html/2608.10480#bib.bib28))在大型化学指令语料库上微调LLM,将分子表示为SMILES序列。分子仅通过文本提示到达LLM。另一类方法附加一个模态特定编码器,并通过投影器与LLM对齐。MolCA(Liu et al.2023 (https://arxiv.org/html/2608.10480#bib.bib27))、LLaMo(Park et al.2024 (https://arxiv.org/html/2608.10480#bib.bib32))和InstructMol(Cao et al.2025 (https://arxiv.org/html/2608.10480#bib.bib3))将分子图投影到LLM中,而其他方法则用2D图像(Liu et al.2024a (https://arxiv.org/html/2608.10480#bib.bib24))、层次化基序级图词元(Chen et al.2024 (https://arxiv.org/html/2608.10480#bib.bib4))或3D构象(Li et al.2024 (https://arxiv.org/html/2608.10480#bib.bib23); Kim, Lee, and Hwang2026 (https://arxiv.org/html/2608.10480#bib.bib18))来丰富这一表示。无论分子信息以文本还是投影词元的形式进入,这两条路径都不能让子结构级信号对模型可读。 #### 分子GNN与可解释性。 GNN将分子视为原子和键构成的图,通过相邻原子之间的消息传递来学习表示(Scarselli et al.2008 (https://arxiv.org/html/2608.10480#bib.bib37); Gilmer et al.2017 (https://arxiv.org/html/2608.10480#bib.bib10))。为了学习可跨任务迁移的表示,自监督预训练已成为主导方法(Hu\* et al.2020 (https://arxiv.org/html/2608.10480#bib.bib14); Wang et al.2022 (https://arxiv.org/html/2608.10480#bib.bib40); Liu et al.2022 (https://arxiv.org/html/2608.10480#bib.bib25))。这类预训练GNN是强预测器,但单个子结构的影响仍隐藏在其表示中。为了将其揭示出来,有一系列并行研究将预测归因于子图,其中GNNExplainer(Ying et al.2019 (https://arxiv.org/html/2608.10480#bib.bib47))对单个节点和边进行排序,SubgraphX(Yuan et al.2021 (https://arxiv.org/html/2608.10480#bib.bib49))对整个连通子图进行评分。沿用Wu等(2023 (https://arxiv.org/html/2608.10480#bib.bib44))的方法,我们采用子结构掩蔽,即根据移除某片段时预测的变化程度对其评分。这种可解释性被广泛视为连接黑盒预测器与人类可理解化学的关键(Jiménez-Luna, Grisoni, and Schneider2020 (https://arxiv.org/html/2608.10480#bib.bib16); Wellawatte et al.2023 (https://arxiv.org/html/2608.10480#bib.bib42))。 #### 知识增强的分子预测。 另一条独立的工作线用辅助知识增强性质预测。例如,LLM-MPP(Jin et al.2025 (https://arxiv.org/html/2608.10480#bib.bib17))和MolProphecy(Zhao et al.2025 (https://arxiv.org/html/2608.10480#bib.bib52))对LLM生成的描述或化学知识进行编码,并将其与分子特征融合。其他方法侧重于检索支持证据;MolRAG(Xian et al.2025 (https://arxiv.org/html/2608.10480#bib.bib46))利用相似分子,而CLADD(Lee et al.2026 (https://arxiv.org/html/2608.10480#bib.bib21))采用协作式LLM智能体查询知识库。另外,KANO(Fang et al.2023 (https://arxiv.org/html/2608.10480#bib.bib9))通过将图对比学习与官能团知识图谱耦合,在GNN中构建化学先验。在这些方法中,所提供的证据是外部或整体的,而非指明特定子结构如何影响目标性质。 ## 方法 MR-MoL接收四个输入:任务指令II、1D SMILES序列SS、2D分子图GG以及多粒度依据RR。输出YY是任务的答案,以文本形式生成。两条互补的信息路径将信息馈入LLM。图嵌入路径通过GNN编码器和投影器将GG转换为分子词元。依据路径对微调后的GNN进行子结构掩蔽,并将最具影响的子结构序列化为排序项。LLM以指令、SMILES序列、分子词元和依据为条件,生成输出YY,如图1 (https://arxiv.org/html/2608.10480#Sx3.F1)所示。我们分两个阶段训练MR-MoL。阶段1对图嵌入路径执行分子图-语言对齐。阶段2对性质预测执行多任务、依据引导的指令微调。参见图注 图1:MR-MoL概述。图嵌入路径通过图编码器和投影器编码2D分子图,得到分子词元。依据路径对源预测器应用子结构掩蔽,根据归因对子结构进行评分。得分最高的子结构构成多粒度依据的条目,与指令、SMILES和分子词元一起提供给LLM,模型生成任务的答案。### 分子图-语言对齐 用于图-语言对齐的投影器模块遵循Q-Former设计(Li et al.2023 (https://arxiv.org/html/2608.10480#bib.bib22)),该设计已被用于在LLM中嵌入分子图。我们用预训练于分子-文本数据的权重初始化GNN编码器和Q-Former(Liu et al.2023 (https://arxiv.org/html/2608.10480#bib.bib27)),然后在阶段1中用新加入的线性投影进行训练,以将分子词元与我们的LLM的嵌入空间对齐。给定G=\(V,E\)G=\(V,E\),参数为φ\\phi的编码器EφE\_\{\\phi\}生成原子级特征: HG=Eφ\(G\),HG∈RN×dg,H\_\{G\}=E\_\{\\phi\}\(G\),\\qquad H\_\{G\}\\in\\mathbb\{R\}^\{N\\times d\_\{g\}\},\(1\)其中NN是原子数,dgd\_\{g\}是图隐藏维度。参数为ψ\\psi的Q-Former使用KK个可学习查询Q∈RK×dqQ\\in\\mathbb\{R\}^\{K\\times d\_\{q\}\},并对HGH\_\{G\}进行交叉注意力,其中dqd\_\{q\}是Q-Former隐藏维度: Z=QFormerψ\(Q,HG\),Z∈RK×dq\.Z=\\mathrm\{QFormer\}\_\{\\psi\}\(Q,H\_\{G\}\),\\qquad Z\\in\\mathbb\{R\}^\{K\\times d\_\{q\}\}\.\(2\)然后,线性投影Wp∈Rdq×dlW\_\{p\}\\in\\mathbb\{R\}^\{d\_\{q\}\\times d\_\{\\ell\}\}将查询嵌入ZZ映射到LLM隐藏维度dld\_\{\\ell\}: M=ZWp,M∈RK×dl\.M=ZW\_\{p\},\\qquad M\\in\\mathbb\{R\}^\{K\\times d\_\{\\ell\}\}\.\(3\)这些分子词元MM被插入LLM输入序列中。 ### 排序的多粒度依据 依据是由微调GNN生成的任务条件化文本证据。我们将分子分解为候选子结构,根据其归因对每个子结构进行评分(Wu et al.2023 (https://arxiv.org/html/2608.10480#bib.bib44)),并将得分最高的子结构序列化为排序文本。 #### 多粒度分解。 对于每个分子,我们将结构分解为三个粒度,每个粒度对应一个视角。Murcko视角通过Murcko分解(Bemis and Murcko1996 (https://arxiv.org/html/2608.10480#bib.bib2))将分子拆分为骨架和侧链。BRICS视角提供带有连接信息的逆合成驱动片段(Degen et al.2008 (https://arxiv.org/html/2608.10480#bib.bib6))。官能团视角列出诸如酰胺和羰基等具有化学名称的局部基序。这三个视角相互补充,涵盖从分子骨架到局部基序的结构粒度范围。 #### 归因与排序。 设ftf\_\{t\}表示任务tt的微调源预测器,其输出ft\(G\)f\_\{t\}\(G\)是分类任务的阳性类别得分或回归任务的预测值。设U\(G\)\\mathcal\{U\}\(G\)为从三个视角汇集的候选子结构,以下标jj索引。对于每个子结构uj∈U\(G\)u\_\{j\}\\in\\mathcal\{U\}\(G\),归因定义为 at,j=ft\(G\)−ft\(G∖uj\),a\_\{t,j\}=f\_\{t\}\(G\)\-f\_\{t\}\(G\\setminus u\_\{j\}\),\(4\)其中G∖ujG\\setminus u\_\{j\}是掩蔽了uju\_\{j\}后的图。正的at,ja\_\{t,j\}意味着移除uju\_\{j\}会降低预测,因此该子结构推动预测升高;负的at,ja\_\{t,j\}则相反。我们按\|at,j\|\|a\_\{t,j\}\|对每个分子内的子结构进行排序,并保留前五个,即那些对源预测产生最大变化的子结构。 #### 序列化。 依据RR将前五个子结构列为排序相似文章
利用基于图的工具改进小型语言模型中的分子性质预测
本文提出了一种上下文增强提示框架,利用图神经网络专家模型提供预测提示和解释性子图,以改进小型语言模型中的分子性质预测。在MUTAG和Tox21上的实验显示,与仅使用SMILES的基线相比,准确率提升高达74%。
MOLAR:从噪声标签中学习多模态分子表征
MOLAR提出了一种噪声感知框架,通过将干净属性推理与观测到的标签噪声分离,从噪声标签中学习多模态分子表征,在分子基准测试中优于基线方法。
自然语言推断的多粒度推理
提出了一种多粒度推理网络(MGRN),该网络显式利用层次语义特征进行自然语言推断,在多个基准测试中优于强基线模型。
从残差到推理:基于LLM的表格数据机制推断
介绍了多智能体残差上下文学习(MARICL),这是一种智能体框架,利用LLM智能体分析基础模型在表格数据上的残差,假设缺失的结构,并通过文本梯度优化产生显式的修正项。在九个基准测试中,MARICL持续优于其基础模型,并在无细胞蛋白质预测中展示了机制泛化能力。
GLACIER: 一种用于分子性质预测的多模态学生-教师基础模型
本文介绍了GLACIER,一种多模态学生-教师基础模型,它整合了分子图、SMILES字符串和物理化学描述符,以高效预测分子性质。它利用Finsler几何感知融合以及来自更大教师模型(MiniMol、MolFormer)的知识蒸馏,以轻量级架构实现高性能。