MolEmb:多模态大型语言模型可以成为强大的分子嵌入模型

arXiv cs.AI 论文

摘要

本文介绍了MolEmb,这是一个轻量级框架,它调整多模态大型语言模型以实现通用的分子嵌入,支持上下文感知的表示和跨模态检索,同时还提出了一个诊断基准MolCAR。

arXiv:2608.23646v1 公告类型:新 摘要:分子嵌入模型可以作为计算化学和药物发现的基础基础设施,其中可重用的向量表示支持属性预测、虚拟筛选和检索。大多数分子编码器是围绕单一分子视图构建的专家模型,生成无条件的向量,没有语言接口来改变表示。我们探究多模态大型语言模型(MLLMs)——其原生处理图像、文本和符号输入——是否能够作为\emph{通用分子嵌入模型},生成同时基于分子特征和自然语言语义上下文的嵌入表示。我们引入了\textbf{MolEmb},一个轻量级框架,通过使用双向对比目标在共享嵌入空间中对齐分子特征与文本描述,从而调整MLLMs。由此产生的嵌入模型在分子属性预测方面具有竞争力,并支持在同一空间中的跨模态分子-文本检索。我们进一步引入了\textbf{MolCAR},一个用于上下文感知检索的诊断基准,并发现上下文感知分子嵌入主要是监督数据的一个属性。这些结果表明,MLLMs不仅仅是化学助手或生成器,而是通往通用分子嵌入模型的一种可行且可扩展的途径。
查看原文
查看缓存全文

缓存时间: 2026/08/26 09:11

# MolEmb:多模态大语言模型可作为强大的分子嵌入模型  
来源:https://arxiv.org/html/2608.23646  
Xinjian Zhao§\lx@sectionsign¶, Xiangru Jian♢\diamondsuit, Yaoyao Xu§\lx@sectionsign¶, Xiaozhuang Song§\lx@sectionsign¶, Wei Pang§\lx@sectionsign, Lei Bai ¶, Tianshu Yu§\lx@sectionsign¶  

###### 摘要  
分子嵌入模型可作为计算化学与药物发现的基础架构,通过可复用的向量表示支持属性预测、虚拟筛选与检索。大多数分子编码器是围绕单一分子视图构建的专用模型,其生成的无条件向量缺乏语言接口以调整表示。我们提出问题:多模态大语言模型(MLLMs)能否作为**通用分子嵌入模型**?这类模型能原生处理图像、文本和符号输入,并生成同时基于分子特征与自然语言语义条件的嵌入。我们提出MolEmb,一个轻量级框架,通过双向对比目标将分子特征与文本描述对齐到共享嵌入空间,从而适配MLLMs。所得到的嵌入模型在分子属性预测任务中具有竞争力,并支持同一空间内的跨模态分子-文本检索。我们进一步引入MolCAR,一个用于诊断上下文感知检索的基准,并发现上下文感知分子嵌入主要取决于监督数据的属性。这些结果表明,MLLMs不仅是化学助手或生成器,更是通向通用分子嵌入模型的可行且可扩展的路径。  

## 1 引言  
分子结构决定了物理化学性质与相互作用,涵盖溶解度、反应性到结合亲和力与毒性等39 (https://arxiv.org/html/2608.23646#bib.bib53);40 (https://arxiv.org/html/2608.23646#bib.bib48);31 (https://arxiv.org/html/2608.23646#bib.bib52);8 (https://arxiv.org/html/2608.23646#bib.bib54);13 (https://arxiv.org/html/2608.23646#bib.bib51)。随着深度学习在分子建模中日益核心化,学习得到的分子表示已成为属性预测、虚拟筛选、相似性搜索和检索增强科学推理的通用接口15 (https://arxiv.org/html/2608.23646#bib.bib35);9 (https://arxiv.org/html/2608.23646#bib.bib34);44 (https://arxiv.org/html/2608.23646#bib.bib40);50 (https://arxiv.org/html/2608.23646#bib.bib36)。分子嵌入模型可作为这些工作流的基础架构。我们使用该术语指代提供稳定、可复用嵌入的模型,其理念类似于自然语言处理和信息检索中的嵌入模型,而非仅作为特定任务预测流水线的中间状态。该领域主要通过基于分子图、SMILES字符串或分子几何结构的专用编码器产生此类嵌入14 (https://arxiv.org/html/2608.23646#bib.bib23);51 (https://arxiv.org/html/2608.23646#bib.bib25);7 (https://arxiv.org/html/2608.23646#bib.bib39)。这些编码器非常有效,尤其在分子预测任务中,但其表示接口通常是预先固定的:单一分子视图被编码为单一无条件向量。这引发了一个不同的嵌入模型问题:分子表示能否通过可复用接口暴露,且其输入能根据分子视图和语义上下文变化?为精确回答此问题,我们研究所谓的**通用分子嵌入模型**。此处**通用**强调超越传统可复用向量视图的两个特性:首先,多视图输入——分子可通过互补形式描述,如2D图示、SMILES字符串、构象体和文本注释,灵活的模型应接受给定工作流中可用的视图;其次,语义条件化——科学工作流常对同一分子施加不同的任务视角和领域预期,针对毒性的查询应强调与针对溶解度查询不同的分子证据。我们在第3节(https://arxiv.org/html/2608.23646#S3)中形式化此对象。  

MLLMs1 (https://arxiv.org/html/2608.23646#bib.bib31);4 (https://arxiv.org/html/2608.23646#bib.bib32);12 (https://arxiv.org/html/2608.23646#bib.bib38)是此类模型的天然候选者。它们处理异构输入(如图像、文本和符号输入),可通过自然语言接收语义上下文,且其隐藏状态可聚合为固定长度嵌入。这种结构性契合正逢其时,因为更广泛的基础模型社区已开始将生成骨干网络视为嵌入模型。LLM2Vec(5 (https://arxiv.org/html/2608.23646#bib.bib9))和VLM2Vec(20 (https://arxiv.org/html/2608.23646#bib.bib1))表明,生成骨干网络可适配用于检索和表示学习。这一转变在工业级基础模型系统中也可见:如Qwen3-VL-Embedding(24 (https://arxiv.org/html/2608.23646#bib.bib3))和Gemini Embedding(21 (https://arxiv.org/html/2608.23646#bib.bib11))等模型家族提供了嵌入导向的变体,DeepSeek-OCR 2则探索了语言模型模块作为视觉编码器(38 (https://arxiv.org/html/2608.23646#bib.bib30))。这些发展共同表明,基础模型不仅被用作生成器,也日益被用作可复用的表示骨干。然而,在化学及更广泛的MLLMs科学应用中,主导范式仍是生成式:解释、描述、多模态推理或直接预测23 (https://arxiv.org/html/2608.23646#bib.bib13);35 (https://arxiv.org/html/2608.23646#bib.bib27);29 (https://arxiv.org/html/2608.23646#bib.bib37);22 (https://arxiv.org/html/2608.23646#bib.bib33);52 (https://arxiv.org/html/2608.23646#bib.bib41)。这些能力虽有价值,但许多分子工作流所需的稳定向量接口仍未得到充分探索。因此我们追问:MLLMs能否不仅作为化学助手或生成器,还能作为通用分子嵌入模型的基础?  

我们通过*MolEmb*研究此问题——这是一个将MLLMs适配为分子嵌入模型的轻量级框架。每个分子由包含2D图示和规范SMILES字符串的多视图特征表示,语义上下文在需要时通过文本指令提供。我们从MLLMs中提取固定长度表示,并将分子特征与文本描述对齐到共享嵌入空间。对于分子学习,此路径具有吸引力,因为它允许分子嵌入模型共享现代基础模型的骨干和接口,从而原则上受益于多模态预训练、科学领域数据、推理基础设施和嵌入导向训练的进展。图1(https://arxiv.org/html/2608.23646#S2.F1)总结了此路径及下文评估的嵌入中心工作流。  

我们沿三个轴评估此路径:首先,直接适配的MLLMs在回归和分类基准上为**分子预测**提供了有竞争力的表示;其次,分子-文本对比对齐将同一骨干网络转变为**跨模态检索**的可复用嵌入模型,表明该表示可支持基于嵌入的匹配而非仅预测;第三,我们引入MolCAR诊断上下文感知检索,并使用MolCAR-Train证明任务结构化监督可在嵌入空间中诱导上下文感知结构。这些结果共同表明,MLLMs不仅是化学助手或生成器,更是通向通用分子嵌入模型的可行且可扩展的路径。  

我们的贡献包括:  
- • 我们通过**分子嵌入模型**的视角框架化分子表示学习,强调嵌入作为可复用产出而非仅预测流水线的中间状态,并将目标对象形式化为**通用分子嵌入模型**。  
- • 我们用MolEmb实例化此视角——一个基于MLLMs的轻量级框架,通过将多视图分子特征与文本描述对齐到共享嵌入空间来产生可复用的分子嵌入。  
- • 我们评估MLLMs到嵌入的路径在分子预测、跨模态检索和上下文感知检索中的表现,既展示其实际可行性,也证明上下文感知分子嵌入主要取决于监督数据的属性。  

## 2 相关工作  
**分子表示学习**:分子表示学习已通过图、序列和几何编码器被广泛研究。图神经网络直接编码原子和键,并通过自监督目标(如属性掩码、上下文预测和图对比学习)得到增强(19 (https://arxiv.org/html/2608.23646#bib.bib18);46 (https://arxiv.org/html/2608.23646#bib.bib19);37 (https://arxiv.org/html/2608.23646#bib.bib20);25 (https://arxiv.org/html/2608.23646#bib.bib8);53 (https://arxiv.org/html/2608.23646#bib.bib26))。基于序列的分子语言模型则将SMILES字符串视为化学文本,通过掩码语言或序列到序列目标实现可扩展的Transformer预训练(11 (https://arxiv.org/html/2608.23646#bib.bib21);2 (https://arxiv.org/html/2608.23646#bib.bib17);14 (https://arxiv.org/html/2608.23646#bib.bib23))。另一互补路线整合分子几何,利用构象体、距离或坐标去噪捕获空间分子结构(28 (https://arxiv.org/html/2608.23646#bib.bib24);51 (https://arxiv.org/html/2608.23646#bib.bib25))。超越这些分子视图,近期工作还探索基于视觉的编码器,从渲染的分子图或图可视化中学习,表明视觉表示可捕获有用的结构和化学模式(10 (https://arxiv.org/html/2608.23646#bib.bib6);48 (https://arxiv.org/html/2608.23646#bib.bib7))。这些专用编码器在属性预测中表现强劲,但通常与固定分子视图绑定,生成无条件嵌入,难以根据自然语言任务语义调整表示。  

**从生成模型到嵌入模型**:近期工作日益表明,强大的生成骨干网络可被重新利用为高质量嵌入模型(5 (https://arxiv.org/html/2608.23646#bib.bib9);20 (https://arxiv.org/html/2608.23646#bib.bib1);47 (https://arxiv.org/html/2608.23646#bib.bib2);24 (https://arxiv.org/html/2608.23646#bib.bib3);21 (https://arxiv.org/html/2608.23646#bib.bib11);16 (https://arxiv.org/html/2608.23646#bib.bib16);6 (https://arxiv.org/html/2608.23646#bib.bib10))。在纯文本设置中,LLM2Vec和NV-Embed等方法表明解码器风格语言模型可适配为具有竞争力的文本嵌入模型,用于检索和表示学习(5 (https://arxiv.org/html/2608.23646#bib.bib9))。在多模态设置中,VLM2Vec同样表明视觉语言模型可转换为指令引导的嵌入模型,用于多模态检索(20 (https://arxiv.org/html/2608.23646#bib.bib1))。这一趋势也反映在商业模型家族中,如Qwen嵌入系列(47 (https://arxiv.org/html/2608.23646#bib.bib2);24 (https://arxiv.org/html/2608.23646#bib.bib3))和Google的Gemini嵌入模型(21 (https://arxiv.org/html/2608.23646#bib.bib11))。这些结果表明,生成和嵌入不应被视为不相交的模型家族:强大的生成骨干网络经过适当适配后,通常可作为强大嵌入模型的基础。更多关于化学及更广泛科学领域中多模态基础模型的相关工作见附录B(https://arxiv.org/html/2608.23646#A2)。  

参见标题图1:从专用编码器到通用分子嵌入模型。(A) MLLM到嵌入的路径将分子表示从固定视图的专用编码器转向基于MLLM的嵌入接口,该接口接受多视图分子特征和自然语言任务指令。(B) MolEmb通过分子-文本对比对齐,使用轻量级LoRA模块适配预训练MLLM实例化此路径;EOS隐藏状态用作分子嵌入。(C) 由此产生的可复用嵌入接口通过改变任务指令支持属性预测、跨模态分子-文本检索和上下文感知嵌入。  

## 3 通用分子嵌入模型  
### 3.1 定义  
标准分子编码器通常将分子在固定输入表示下映射到单一无条件向量。这一抽象在专用预测任务中非常有效,但使分子表示的两个方面隐式化:首先,分子天然是多视图对象——同一底层分子可能通过2D图示、符号字符串或其他互补注释观察到;其次,分子最有用的表示不一定是无条件的——同一分子在不同语义上下文中可能需要不同的嵌入。  

受此视角启发,我们研究所谓的**通用分子嵌入模型**,它将分子特征与语义上下文映射到共享嵌入空间中的向量表示。  

###### 定义1(通用分子嵌入模型)  
设 \(\mathcal{M}\) 为分子集合,在选定的规范化方案下标识。设 \(K\) 为可能的分子视图类型数量。对于每种视图类型 \(k\),令 \(\mathcal{V}_k\) 表示相应的视图空间(如2D图示、符号字符串、构象体或其他分子特定注释)。我们将分子特征空间定义为:  
\[ \mathcal{V} = \prod_{k=1}^K \bigl( \mathcal{V}_k \cup \{\varnothing_k\} \bigr) \quad (1) \]  
其中 \(\varnothing_k\) 表示视图类型 \(k\) 不可用。分子特征映射 \(\mathcal{P}: \mathcal{M} \to \mathcal{V}\) 将每个分子 \(m \in \mathcal{M}\) 映射到其可用视图 \(\mathcal{P}(m)\)。令 \(\mathcal{C}\) 为允许的语义上下文集合,\(d\) 为嵌入维度。**通用分子嵌入模型**是参数化映射 \(E_{\theta}: \mathcal{V} \times \mathcal{C} \to \mathbb{R}^d\),其中 \(\theta \in \Theta\),\(\Theta\) 表示参数空间。对于每个分子 \(m \in \mathcal{M}\) 和上下文 \(c \in \mathcal{C}\),我们写作 \(\mathbf{z}_c(m) := E_{\theta}(\mathcal{P}(m), c) \in \mathbb{R}^d\)。  
\[ \mathbf{z}_c(m) := E_{\theta}(\mathcal{P}(m), c) \in \mathbb{R}^d \quad (2) \]  

###### 定义2(上下文感知嵌入族)  
给定通用分子嵌入模型 \(E_{\theta}\),分子 \(m\) 的**上下文感知嵌入族**为 \(\mathcal{Z}(m) := \{\mathbf{z}_c(m): c \in \mathcal{C}\}\)。  

定义1–2分离了标准分子表示学习中常纠缠的三个角色:分子身份 \(m\) 指定底层分子,特征 \(\mathcal{P}(m)\) 指定该分子的可用观测,上下文 \(c\) 指定表示形成的语义视角。多视图输入通过 \(\mathcal{P}(m)\) 捕获,语义条件化通过 \(c\) 实现,而公共下游接口通过共享陪域 \(\mathbb{R}^d\) 提供。

相似文章

MOLAR:从噪声标签中学习多模态分子表征

arXiv cs.LG

MOLAR提出了一种噪声感知框架,通过将干净属性推理与观测到的标签噪声分离,从噪声标签中学习多模态分子表征,在分子基准测试中优于基线方法。

利用基于图的工具改进小型语言模型中的分子性质预测

arXiv cs.AI

本文提出了一种上下文增强提示框架,利用图神经网络专家模型提供预测提示和解释性子图,以改进小型语言模型中的分子性质预测。在MUTAG和Tox21上的实验显示,与仅使用SMILES的基线相比,准确率提升高达74%。