GraphNOSE: 嗅觉中的图Transformer

arXiv cs.LG 论文

摘要

GraphNOSE是一个开源图Transformer框架,能够从分子结构预测多标签嗅觉描述符,以更少的参数实现优于现有方法的性能,并提升对分布外化合物的泛化能力。

arXiv:2609.05694v1 公告类型:新 摘要:从分子结构预测嗅觉品质是化学信息学中的一个开放问题。虽然线性模型可以将分子特征与嗅觉描述符联系起来,但在外推到新颖化学支架、极端分子质量或复杂嗅觉混合物时往往会失败。为此,我们引入了GraphNOSE,一个开源图Transformer框架,能够从简化分子输入线性系统(SMILES)字符串预测单分子和二元混合物的多标签嗅觉描述符。通过在基于Transformer的图架构中整合位置和结构编码,GraphNOSE在参数比标准图神经网络(GNN)基线少六倍的情况下实现了强劲性能,同时平均ROC曲线下面积(AUROC)比线性模型、分子语言模型嵌入、分子指纹和基线GNN高出4.52%(p < 0.01)。GraphNOSE在分布外化合物(OODs)上实现了84%的AUROC。这超过了当前嗅觉OOD的最新GNN(Open-POM:81%,p < 0.001),并识别了线性模型经验性失败的条件。最后,我们应用XAI(可解释AI)方法来识别哪些子结构和分子特征驱动嗅觉预测,产生与化学直觉一致且基于模型学习表示的见解。总之,这些结果确立了GraphNOSE作为一个可扩展且可解释的嗅觉预测架构,能够泛化到当前感知数据库中代表性不足的结构差异化合物。
查看原文
查看缓存全文

缓存时间: 2026/09/10 08:23

# GraphNOSE:基于嗅觉的图Transformer模型  
来源:https://arxiv.org/html/2609.05694  

###### 摘要  
从分子结构预测嗅觉特性是化学信息学中的一个开放性问题。尽管线性模型能将分子特征与气味描述符关联,但在外推至新型化学骨架、极端分子量或复杂气味混合物时往往失效。为此,我们提出了GraphNOSE——一个开源的图Transformer框架,可从简化分子线性输入规范(SMILES)字符串中预测单分子及二元混合物的多标签气味描述符。通过在基于Transformer的图架构中整合位置与结构编码,GraphNOSE以比标准图神经网络(GNN)基线少六倍的参数量实现了优异性能,并在平均受试者工作特征曲线下面积(AUROC)指标上持续优于线性模型、分子语言模型嵌入、分子指纹及基线GNN,平均领先4.52%(p < 0.01)。GraphNOSE在分布外化合物(OODs)上达到84%的AUROC,超越了当前嗅觉领域OOD预测的最优GNN(OpenPOM:81%,p < 0.001),并明确了线性模型经验性失效的条件。最后,我们应用可解释人工智能(XAI)方法识别驱动气味预测的亚结构与分子特征,所得洞察与化学直觉一致,且根植于模型学习到的表征。综上,这些结果确立了GraphNOSE作为可扩展且可解释的嗅觉预测架构的地位,能泛化至现有感知数据库中代表性不足的结构差异化合物。  

###### 关键词  
美国化学会、LaTeX  
††作者单位:这些作者对本研究贡献均等。  
††单位:CSIR-中央科学仪器组织,Sector 30-C,昌迪加尔-160030,印度  
††单位:科学与创新研究学院(AcSIR),加济阿巴德-201002,印度  
††单位:高等教育部,喜马偕尔邦,西姆拉-171001,印度  
††邮箱:[email protected]  
††作者单位:这些作者对本研究贡献均等。  
††单位:印度科学教育与研究院博帕尔分校(IISERB),中央邦-462066,印度  
††单位:莫奈尔化学感官中心,美国宾夕法尼亚州费城 19104  
††单位:宾夕法尼亚大学耳鼻喉科头颈外科,美国宾夕法尼亚州费城 19104  
††邮箱:[email protected]  
††单位:CSIR-中央科学仪器组织,Sector 30-C,昌迪加尔-160030,印度  
††单位:科学与创新研究学院(AcSIR),加济阿巴德-201002,印度  
††缩写:IR、NMR、UV  
缩写列表:1-Weisfeiler-Lehman(1-WL)同构测试、分子中原子定域-离域矩阵(AIMLDM)、受试者工作特征曲线下面积(AUROC)、化学双向编码器表示Transformer(ChemBERTa)、欧洲分子生物学实验室化学数据库(ChEMBL)、物理化学偏差评分(\(D_{\text{phys}}\))、分子几何集成数据集(GEOM)、图卷积网络(GCN)、图同构网络(GIN)、带边特征的图同构网络(GINE)、图神经网络(GNN)、通用强大可扩展架构(GPS)、图位置与结构编码器(GPSE)、采用线性Transformer的GraphNOSE模型(\(\text{GraphNOSE}_{\text{lin}}\))、采用标准二次复杂度自注意力的GraphNOSE模型(\(\text{GraphNOSE}_{\text{trans}}\))、策展的GoodScents-Leffingwell数据集(GS-LF)、图Transformer(GT)、核密度估计(KDE)、K近邻(KNN)、拉普拉斯位置编码(LapPE)、有限内存Broyden-Fletcher-Goldfarb-Shanno算法(LBFGS)、电子定域-离域矩阵(LDM)、\(\text{DMPNN}+\text{LDM}\)(\(\text{LDM}_{\text{DMPNN}}\))、\(\text{GCN}+\text{LDM}\)(\(\text{LDM}_{\text{GCN}}\))、分子访问系统(MACCS)、特征中位绝对偏差(\(\text{MAD}_{i}\))、多层感知机(MLP)、分子语言Transformer(MolFormer)、消息传递神经网络(MPNN)、分布外(OOD)、POM的开源对应模型(OpenPOM)、主嗅觉图(POM)、位置与结构编码(PSE)、受试者工作特征曲线(ROC)、随机游走结构编码(RWSE)、简化分子线性输入规范(SMILES)、拓扑极性表面积(TPSA)、可解释人工智能(XAI)  

## 1 引言  
从分子结构预测人类嗅觉感知仍是化学信息学中一个开放且具有挑战性的问题。嗅觉在人类生存与繁衍中起着关键作用,影响生理调节(Tarumi et al., 2026)、摄食行为(Boone et al., 2021)与社会择偶选择(Blazing & Franks, 2020),并支撑着价值数十亿美元的食品、香精香料产业(Chen et al., 2023)。将物理化学特性转化为感知空间在嗅觉中尤为复杂:结构相似的分子可能引发质性不同的气味,揭示了分子结构与感知气味之间的脱节(Sell, 2006)(见补充材料图S1)。  
尽管如此,线性机器学习方法仍能将分子特征与气味描述符关联(Schicker et al., 2023; Keller et al., 2017),并在主要由孤立官能团(如醛类或硫醇)主导的气味分子预测中表现出强大的预测能力(Sanchez-Lengeling et al., 2019)。虽然这类模型能达到合理的性能上限(≈80% AUROC)(Lee et al., 2023),但它们无法预测与训练集物理化学特性不同的分子。例如,线性分类器在评估结构新颖的分子(尤其是具有极端分子重量的分子)时性能显著下降(Lee et al., 2023; Schicker et al., 2023)。此外,这些模型无法泛化至训练期间未见过的混合物(Ravia et al., 2020),限制了其在生态气味刺激(Arctander, 2017; Kumar et al., 2018; Garg et al., 2018; Ruddigkeit et al., 2014; Hastings et al., 2016; Sharma et al., 2022)中的应用。  
克服这些预测局限性的另一个复合瓶颈是公开可用嗅觉数据库的碎片化与标准化缺失(Parma et al., 2026)。结合化学特征与气味描述符的数据集通常规模较小,分子数量常在\(10^{2}\)到\(10^{3}\)量级(Hamel et al., 2024),而其他机器学习领域常用数百万样本(Deng et al., 2009)。即便存在聚合努力,如整合多源嗅觉数据的Pyrfume库(Hamel et al., 2024; Arctander, 2017; Kumar et al., 2018; Garg et al., 2018; Ruddigkeit et al., 2014; Hastings et al., 2016; Sharma et al., 2022),其标注仍稀疏且不一致,尤其在人类感知描述符与功能化学基团标签方面。尽管如此,Pyrfume通过DREAM嗅觉挑战等倡议(Keller et al., 2017; Satarifard et al., 2025),催化了在共享基准上评估的预测模型开发。这些努力借助预定义的高维分子特征表示(即化学指纹)(Moriwaki et al., 2018; Morgan, 1965),使首批模型能系统映射化学结构至感知空间,从而促进气味描述符的监督学习。  
然而,尽管这些聚合仓库显著增加了可用于模型训练的气味剂-标签对数量,它们仍缺乏捕捉气味感知生态效度的关键维度,尤其是刺激强度。气味质量并非分子结构的静态属性,而是随浓度变化——某些分子在不同浓度范围表现出质性感知转变。例如,呋喃酮在低浓度下被描述为草莓样气味,高浓度下则呈焦糖样气味(Zabetakis et al., 1999)。因此,作为与浓度无关的固定标签的描述符,对当前预测模型施加了根本限制,使其无法解释嗅觉感知的动态与上下文依赖特性(Keller et al., 2017; Lee et al., 2023; Hamel et al., 2024)。  
为克服基于指纹的气味预测局限,研究者最初用质谱数据增强结构描述符(Nozaki & Nakamoto, 2016),随后该领域从预定义化学特征转向学习表征,即深度神经网络直接从数据中发现结构-气味映射(Zhou et al., 2025)。基于图的方法(如消息传递神经网络,MPNNs)将分子表示为原子(节点)和键(边)(Gilmer et al., 2017),在分子属性预测中展示了强大预测能力。通过迭代消息传递,原子与其邻居交换信息,整合学习的分子表征以捕获结构特征与非线性关系,从而实现对药物效力、毒性及受体结合等属性更准确的预测(Li et al., 2022),涵盖量子化学(Gilmer et al., 2017)与药物发现(Wang et al., 2025)等多个领域。这一转变意义重大:预定义指纹记录孤立化学子结构的存在,而图方法保留精确的分子拓扑结构。通过让原子迭代交换信息,模型动态学习特定几何排列,同时显式融入局部节点与边特征(如形式电荷、价态及结构度)。  
在计算嗅觉学中,图模型最突出的应用是主嗅觉图(POM)(Lee et al., 2023)及其开源对应模型OpenPOM(Barsainyan et al., 2023a)。这些模型成功将单分子的二维分子图直接映射至潜在感知维度。尽管近期框架如PharmaGNN(Liu et al., 2026)整合了静态药效团特征以捕获三维空间对齐,但所有单分子方法对实际应用仍严重不足,因其无法扩展至多组分气味混合物。  
MPNNs擅长捕获局部化学环境(如影响反应性的官能团与键合模式),但受限于有限的感受野:信息仅在相邻原子间传播,需多层才能将信息传递至分子远端部分(Rampášek et al., 2022)。具有全局感受野的深度学习架构通过让每个元素在单步中关注其他所有元素,直接解决这一聚合瓶颈。此类模型在捕获长程依赖(即序列或空间中相隔较远的元素间关系,如代词与其前文指代名词,或蛋白质序列中相距较远但在折叠后相邻的两个残基)方面已被证明强大(Vaswani et al., 2017; Jumper et al., 2021)。全局架构(尤其是图Transformer,GTs)(Dwivedi & Bresson, 2020; Ying et al., 2021)尚未应用于结构-气味预测,尽管气味描述符依赖于分子整体几何与拓扑结构而非孤立官能团(Amoore et al., 1964)。即使微小的结构变异(如官能团间精确距离或碳链特定支化)也能决定受体结合并引发不同感知结果(Uchida et al., 2000)。例如,酯的羰基位置比官能团本身更能决定其激活哪些嗅觉受体(Poivet et al., 2018)。同样,分子可能仅在环上单个取代基位置上存在差异(如香芹酚与百里香酚),却可能分别触发牛至与百里香的截然不同气味。这种特异性强调了气味预测依赖于特征在整个分子中的空间分布,而非仅其存在性。通过将局部原子特征整合为单一全局结构,GTs直接模拟了生物嗅觉系统将受体信号整合至大脑的过程(Blazing & Franks, 2020)。这种空间感知对于预测单分子与混合物气味的标签都至关重要。传统GTs允许每个...

相似文章

图原生强化学习通过概念重组实现可追溯的科学假设生成

arXiv cs.AI

本文介绍了Graph-PRefLexOR,这是一系列图原生推理模型,通过组相对策略优化(GRPO)进行微调,以通过显式推理阶段生成可追溯的科学假设。该方法在推理可追溯性方面相比基础模型实现了40-65%的提升,并展示了增强的语义多样性和概念重组。

X-LogSMask:面向图结构数据的扩展Transformer

arXiv cs.LG

X-LogSMask 提出了一种用于图Transformer的对数结构掩码,将图拓扑直接注入注意力logits中,在20个基准测试中的13个上实现了最先进的性能,同时保持了可解释性和多跳信息传播。