LatentFlow:分子图神经网络中潜在空间分析的可视化分析系统
摘要
LatentFlow是一个用于分析分子图神经网络中潜在空间的可视化分析系统,帮助科学家理解分子嵌入聚类如何随层和模型状态演变。
arXiv:2607.21941v1 公告类型:新
摘要:化学家和材料科学家越来越多地使用机器学习模型(如图神经网络)来预测分子的性质及其反应结果。除了预测性能之外,理解这些模型如何在内部潜在空间(即分子嵌入)中组织化学信息至关重要。分析潜在空间有助于诊断模型行为,并评估学习到的嵌入是否以反映有意义化学关系的方式组织。遗憾的是,现有方法对跨层和不同模型状态(如训练轮次、模型配置和输入数据)的潜在空间分析支持有限,使得难以理解这些潜在空间在整个模型中如何演变或与化学概念的关系。我们提出了LatentFlow,这是一个与领域专家合作开发的可视化分析系统,用于分析分子GNN中的潜在空间。LatentFlow将嵌入分组到聚类中,并通过使用改进的桑基图跟踪这些聚类如何随层和模型状态变化,支持对潜在空间的探索。为了支持解释,LatentFlow将这些聚类与代表性分子及其共享子结构相关联,并允许科学家引入自己的领域知识,与潜在空间中的模式进行比较。我们通过两个案例研究评估了LatentFlow。结果表明,LatentFlow帮助科学家理解潜在空间的演变,识别有意义的分子模式,并更好地解释模型行为。
查看缓存全文
缓存时间: 2026/07/27 07:43
# 分子图神经网络潜在空间的可视分析 **来源:** https://arxiv.org/html/2607.21941 \\onlineid 0\\vgtccategoryResearch\\vgtcpapertypeapplication\\authorfooterShiyi Liu, Jiaqing Chen, Rostyslav Hnatyshyn, and Ross Maciejewski 任职于亚利桑那州立大学。电子邮件:[email protected]; [email protected]; [email protected]; [email protected]; Nicholas Hadler 任职于加州大学伯克利分校。电子邮件:[email protected] Michael W. Mahoney 任职于 ICSI、LBNL 和加州大学伯克利分校。电子邮件:[email protected] Talita Perciano 和 Gunther Weber 任职于劳伦斯伯克利国家实验室。电子邮件:[email protected] 和 [email protected] John F. Hartwig 任职于加州大学伯克利分校和劳伦斯伯克利国家实验室。电子邮件:[email protected]。 \\authororcidJiaqing Chen0009-0002-9395-0277\\authororcidNicholas Hadler0000-0002-9167-5227\\authororcidRostyslav Hnatyshyn0009-0006-0510-1152\\authororcidMichael W. Mahoney0000-0001-7920-4652 \\authororcidTalita Perciano0000-0002-2388-1803\\authororcidJohn F. Hartwig0000-0002-4157-468X\\authororcidGunther H. Weber0000-0002-1794-1398\\authororcidRoss Maciejewski0000-0001-8803-6355 ###### 摘要 化学家和材料科学家越来越多地使用机器学习模型(如图神经网络 GNN)来预测分子性质及其反应结果。除了预测性能之外,理解这些模型如何在其潜在空间(即分子的嵌入)中内部组织化学信息至关重要。分析潜在空间有助于诊断模型行为,并评估学习到的嵌入是否以反映有意义化学关系的方式组织。不幸的是,现有方法在分析跨层和跨不同模型状态(如训练轮次、模型配置和输入数据)的潜在空间方面支持有限,使得难以理解这些潜在空间如何在模型中演变或与化学概念相关联。我们提出了**LatentFlow**,一个与领域专家合作开发的可视分析系统,用于分析分子 GNN 中的潜在空间。**LatentFlow** 将嵌入分组为聚类,并通过修改的桑基图跟踪这些聚类跨层和模型状态的变化,从而支持潜在空间的探索。为了支持解释,**LatentFlow** 将这些聚类与代表性分子及其共享子结构联系起来,并允许科学家引入自己的领域知识,与潜在空间中发现的特征进行比较。我们通过两个案例研究评估了 **LatentFlow**。结果表明,**LatentFlow** 帮助科学家理解潜在空间如何演变,识别有意义的分子模式,并更好地解释模型行为。 ###### 关键词: 可视分析、潜在空间、化学与材料科学、图神经网络。 \\teaser![[无标题图片]](https://arxiv.org/html/2607.21941v1/x1.png) 通过协调视图分析分子 GNN 潜在空间的 *LatentFlow* 界面。(A) 修改的桑基图显示两个模型状态维度上的聚类变化。(B) 水平桑基图 (B1) 和垂直桑基图 (B2) 揭示沿单个维度的详细过渡。(C) 散点图将嵌入投影到二维空间,观察分子如何分布和分离。(D) 聚类成员视图显示所选聚类中的分子,便于直接检查。(E) Top-k 面板总结聚类级结构,包括 k 值选择器 (E1)、预测分布 (E2)、子结构 (E3) 和代表性分子 (E4)。(F) 结构编辑器允许专家查询子结构并在视图中高亮匹配的分子。(G) 控制面板提供数据集选择、聚类配置和协调交互的控制。 ## 1 引言 在化学和材料科学中,机器学习模型,尤其是图神经网络(GNN),被广泛用于研究分子性质和化学反应[3 (https://arxiv.org/html/2607.21941#bib.bib12),49 (https://arxiv.org/html/2607.21941#bib.bib22),53 (https://arxiv.org/html/2607.21941#bib.bib24)]。通过直接在分子结构的图表示上操作,GNN 在分子性质预测[16 (https://arxiv.org/html/2607.21941#bib.bib19),23 (https://arxiv.org/html/2607.21941#bib.bib125)]、反应结果预测[54 (https://arxiv.org/html/2607.21941#bib.bib126)]、毒性筛选[42 (https://arxiv.org/html/2607.21941#bib.bib127),43 (https://arxiv.org/html/2607.21941#bib.bib128)]和材料发现[10 (https://arxiv.org/html/2607.21941#bib.bib129)]等任务中取得了最先进的性能。尽管取得了这些成功,分子机器学习模型通常对为什么会做出特定预测提供的洞察有限。因此,研究人员分析 GNN 学习到的内部表示,以更好地理解它们如何编码和组织化学信息。在学习过程中,每一层将其输入转换为一组嵌入,这些嵌入共同定义了一个特定层的**潜在空间**。这些潜在空间通常被投影到低维空间中并进行聚类,以揭示涌现的模式[2 (https://arxiv.org/html/2607.21941#bib.bib1),7 (https://arxiv.org/html/2607.21941#bib.bib14),8 (https://arxiv.org/html/2607.21941#bib.bib2)]。然而,仍然难以确定哪些结构模式在不同层中被表示,化学上有意义的结构-性质关系何时出现,以及这些模式如何在训练过程中演变、重组或退化[1 (https://arxiv.org/html/2607.21941#bib.bib13),35 (https://arxiv.org/html/2607.21941#bib.bib130)]。因此,跟踪潜在空间的演变可以揭示化学信息如何在模型内部发展,并帮助专家识别最终驱动其预测的因素。 我们确定了理解分子表示如何在分子 GNN 的潜在空间中被学习和组织时的三个关键挑战:(i) 追踪跨多个潜在空间的变化;(ii) 在大型潜在空间中识别有意义的模式;(iii) 将潜在空间与化学知识相关联。首先,跨潜在空间追踪变化很困难,因为嵌入随**层**和**模型状态**而变化[32 (https://arxiv.org/html/2607.21941#bib.bib72)]。**模型状态**指训练轮次、模型配置和输入数据。现有的用于追踪过渡的可视化沿单一维度进行,难以跟踪分子如何跨多个维度被重新组织。其次,潜在空间的规模使得识别有意义的模式变得困难,因为需要手动检查大量的点。第三,将潜在空间与化学知识相关联仍然具有挑战性。嵌入以数字形式编码分子结构,但不一定对应于化学概念,从而模糊了观察到的分子组织背后的驱动因素[27 (https://arxiv.org/html/2607.21941#bib.bib44),45 (https://arxiv.org/html/2607.21941#bib.bib123)]。 在本文中,我们提出 LatentFlow (Abstract (https://arxiv.org/html/2607.21941#abstract1)),一个可视分析系统,用于探索分子 GNN 中的潜在空间如何随网络层和模型状态演变。LatentFlow 帮助计算化学家识别学习到的分子表示中编码的化学上有意义的模式。该系统与领域专家紧密合作开发,遵循从概览到详细检查的多级可视分析工作流。**LatentFlow** 在每个潜在空间中根据分子的嵌入对其进行分组。为了支持跟踪这些聚类如何变化,我们引入了一个交互式修改的桑基图,该图揭示了当聚类跨层和模型状态分裂、合并或持续时嵌入之间的过渡。交互式过滤和汇总可视化减少了视觉杂乱,同时保留了聚类过渡中的关键结构模式。**LatentFlow** 通过将聚类与分子结构、子结构和相似性度量联系起来,将模型输出与领域知识连接起来,使专家能够以化学术语解释结果。专家还可以通过定义子结构或标签引入自己的领域知识,并将其与潜在空间中模型学习到的模式进行比较。我们的贡献总结如下: - • 我们开发了 **LatentFlow**,一个交互式可视分析系统,使化学家能够探索从高维潜在空间一直到单个分子的级别。 - • 我们提出了一种修改的桑基图设计,使专家能够探索大型潜在空间,发现有趣的分子聚类模式,并跟踪这些聚类如何分裂、合并、稳定或崩溃。 - • 我们通过两个案例研究验证了我们的方法,展示了 **LatentFlow** 在理解模型行为以及将模型动态与化学上有意义的模式联系起来方面的有效性。 ## 2 相关工作 **LatentFlow** 的设计与神经网络表示分析、机器学习模型的可视可解释性以及化学专用可视化相关。在本节中,我们首先回顾研究人员如何研究潜在空间以理解深度神经网络的内部学习过程(第 2.1 节 (https://arxiv.org/html/2607.21941#S2.SS1));然后描述为了使这些不透明模型可解释而开发的可视分析系统(第 2.2 节 (https://arxiv.org/html/2607.21941#S2.SS2));最后,我们回顾了应用于化学的可视分析方法,将我们的工作置于更广泛的可解释科学机器学习和人在回路化学信息学领域中(第 2.3 节 (https://arxiv.org/html/2607.21941#S2.SS3))。 ### 2.1 深度神经网络中的潜在空间 深度神经网络学习将原始输入映射到潜在空间的变换,即高维嵌入,使相似的数据点彼此靠近[5 (https://arxiv.org/html/2607.21941#bib.bib30),20 (https://arxiv.org/html/2607.21941#bib.bib109)]。这些嵌入作为下游任务(如性质预测和分类)的输入特征,同时也通过距离为相似性概念提供基础。研究人员经常检查潜在空间以理解特征如何被学习并跨层发展[47 (https://arxiv.org/html/2607.21941#bib.bib49)]。一种常见的方法使用基于相似性的度量,表明尽管初始化不同,模型可能收敛到结构相似的嵌入[46 (https://arxiv.org/html/2607.21941#bib.bib71),32 (https://arxiv.org/html/2607.21941#bib.bib72)]。降维[24 (https://arxiv.org/html/2607.21941#bib.bib117)]支持检查嵌入分布,并可以揭示训练和优化问题,如嵌入坍缩,其中嵌入位于低维子空间中,使得不同的输入难以区分。聚类和基于距离的方法描述了数据点如何在潜在空间中组织。嵌入通常形成与语义或功能模式对齐的结构化组[5 (https://arxiv.org/html/2607.21941#bib.bib30)]。大多数现有方法仍然依赖于聚合相似性度量或静态可视化,使得难以检查分子组如何形成、演变以及跨层和模型状态重组。 ### 2.2 模型潜在空间的可视分析 除了静态投影外,交互式方法也用于探索和分析潜在空间。许多可视分析系统促进了潜在空间的探索,以帮助专家解释和诊断神经网络行为。为了解释这些高维空间,许多先前的方法依赖于降维来获得嵌入的低维表示。诸如 PCA[39 (https://arxiv.org/html/2607.21941#bib.bib87)]、t-SNE[57 (https://arxiv.org/html/2607.21941#bib.bib88)] 和 UMAP[40 (https://arxiv.org/html/2607.21941#bib.bib89)] 等技术将这些嵌入投影到二维或三维空间中,其中散点图仍然是主要的可视化形式[25 (https://arxiv.org/html/2607.21941#bib.bib86)]。这些方法通常要么强调投影中点之间的空间排列[55 (https://arxiv.org/html/2607.21941#bib.bib90)],要么将投影与已知标签或性质联系起来[56 (https://arxiv.org/html/2607.21941#bib.bib91),13 (https://arxiv.org/html/2607.21941#bib.bib92)]。这使得专家能够检查潜在空间中嵌入的分布,包括聚类结构、分离和密度模式;通过将聚类成员编码为颜色来支持比较[56 (https://arxiv.org/html/2607.21941#bib.bib91),13 (https://arxiv.org/html/2607.21941#bib.bib92)]。像 WizMap[58 (https://arxiv.org/html/2607.21941#bib.bib93)] 这样的系统进一步将这些基于散点图的可视化扩展到数百万个数据点的嵌入。EmbeddingVis[36 (https://arxiv.org/html/2607.21941#bib.bib95)] 提供协调视图,检查数据点之间的关系如何保留在嵌入空间中。潜在空间制图[37 (https://arxiv.org/html/2607.21941#bib.bib85)] 使专家能够通过定义对应于数据中有意义变化的方向来探索潜在空间,并比较嵌入沿这些方向的变化。CorGIE[38 (https://arxiv.org/html/2607.21941#bib.bib97)] 将原始图结构与嵌入空间连接起来,使专家能够看到每个节点在潜在空间中的位置。 尽管取得了这些进展,先前的工作主要孤立地或通过成对比较来分析嵌入空间。据我们所知,现有的方法均未明确建模表示结构如何随模型层和模型状态变化。为了弥补这一差距,我们引入了一个修改的桑基图,该图表示分子在聚类之间的过渡,并支持跨两个维度的可视分析。 ### 2.3 化学信息学的可视分析 可视化在分析化学数据方面一直扮演着重要角色。早期关于可视化学习到的化学嵌入的工作探索了局部采样策略,例如检查示例分子周围的邻域以评估嵌入的一致性[17 (https://arxiv.org/html/2607.21941#bib.bib98)]。扩展工作沿预训练嵌入的主成分进行采样[59 (https://arxiv.org/html/2607.21941#bib.bib99)],或在潜在空间中沿随机正交方向遍历[33 (https://arxiv.org/html/2607.21941#bib.bib100)],提供了关于嵌入平滑度和结构组织的定性洞察。 基于投影分析,已经开发了许多交互式系统来支持化学数据分析。例如,InVADo[52 (https://arxiv.org/html/2607.21941#bib.bib107)] 专注于分子对接数据的交互式可视分析,通过针对基于结构的药物发现任务定制的协调视图,支持专家检查对接姿势、相互作用模式和结合亲和力。诸如 TMAP[44 (https://arxiv.org/html/2607.21941#bib.bib101)] 等可扩展投影技术增强了邻域保持,使得能够可视化大型分子描述符数据集。更全面的平台,包括 PUMA[19 (https://arxiv.org/html/2607.21941#bib.bib102)] 和 DataWarrior[51 (https://arxiv.org/html/2607.21941#bib.bib105)],集成了多
相似文章
LatentVerse:一种理解多模态潜在表示中共享和模态特定信息的框架
LatentVerse 是一个框架,提供基于网络的可视化分析平台和命令行界面,用于分析多模态潜在表示,实现将嵌入分解为共享和模态特定组件,特别适用于生物医学应用。
深度之梦由此而成:可视化扩散模型中的单义特征
本文介绍了潜在空间优化可视化(LVO),这是一种机械可解释性技术,利用稀疏自编码器来可视化 Stable Diffusion 1.5 等扩散模型中的单义特征。
用于少步生成的潜核离散流映射
本文介绍了潜核离散流映射(LKF),一种用于离散扩散模型的流映射核,通过共享潜变量捕捉位置之间的相关性,无需蒸馏即可实现少步生成,并改善了文本生成的困惑度。
基于混合潜空间建模的结构连接组获取变异无监督学习
本文提出了一种无监督框架,通过混合潜空间建模来模拟结构连接组中与获取相关的变异,利用架构退火编码器输出消除了手动容量调优的需求。
@r_de_santi: 生成模型无法发现它们无法触及的东西。我们很高兴推出 ActFlow:一个持续预训练方案…
本文介绍了 ActFlow,这是一种持续预训练方案,旨在扩展流模型和扩散模型的有效设计空间,从而实现分布外生成建模,并为科学发现提供可进化的搜索空间。