通用视觉与交叉注意力用于反应产率预测
摘要
本文提出了一种用于反应产率预测的双模态视觉交叉注意力架构,将表格化物理有机数据与二维分子拓扑结构相融合,并展示了通用计算机视觉骨干网络能够超越纯基于量子计算的基线模型。
arXiv:2608.00776v1 公告类型:新
摘要:传统的反应产率预测受限于缺乏显式空间信息的一维量子描述符。为解决这一问题,提出了一种双模态视觉交叉注意力架构,将表格化物理有机数据与二维分子拓扑结构相融合。值得注意的是,研究表明,仅处理简单二维骨架结构的通用计算机视觉骨干网络,其性能就能独立超越纯基于量子计算的基线模型。通过协同两种模态,最优交叉注意力框架实现了优于传统方法的预测精度(测试RMSE = 5.27%)。通过机制探测,观察到主动的、描述符引导的空间查询行为,有效地将宏观位阻识别卸载到视觉通路。此外,网络学习到一种动态化学层级结构,高度优先处理关键位阻瓶颈(如芳基卤化物)。同时,利用残差跳跃连接来保护非空间电子参数在融合过程中免受破坏性衰减。总体而言,这项工作为通过深度视觉学习增强物理化学提供了一种可扩展且高度可解释的蓝图。
查看缓存全文
缓存时间: 2026/08/04 07:43
# 用于反应产率预测的通用视觉与交叉注意力
来源:https://arxiv.org/html/2608.00776
Qiwei Han杜克大学化学系,美国北卡罗来纳州达勒姆市 27708佐治亚理工学院计算机科学系,美国佐治亚州亚特兰大市 30332
###### 摘要
传统的反应产率预测受限于缺乏显式空间信息的一维量子描述符。为弥补这一缺口,本文提出了一种双模态视觉交叉注意力(Vision Cross-Attention)架构,将表格形式的物理有机数据与二维分子拓扑结构相融合。值得注意的是,我们证明了仅处理简单二维骨架结构的通用计算机视觉主干网络,其表现能够独立超越纯基于量子力学的基线模型。通过协同融合这两种模态,最优的交叉注意力框架取得了优于传统方法的预测精度(测试集 RMSE = 5.27%)。通过机制探针分析,我们观察到网络能够依据描述符主动进行空间查询,从而有效地将宏观位阻识别任务卸载给视觉通路。此外,该网络学习到了一种动态的化学层级结构,高度优先关注关键的位阻瓶颈(如芳基卤化物)。同时,残差跳跃连接被用于保护非空间电子参数,避免其在融合过程中遭到破坏性衰减。总的来说,本研究为将深度视觉学习增强物理化学提供了一种可扩展且高度可解释的蓝图。
## 1 引言
高通量实验(HTE)与机器学习(ML)的融合已经从根本上升级了预测性合成化学的格局[1 (https://arxiv.org/html/2608.00776#bib.bib1),20 (https://arxiv.org/html/2608.00776#bib.bib2),27 (https://arxiv.org/html/2608.00776#bib.bib3),5 (https://arxiv.org/html/2608.00776#bib.bib4)]。在硅基(in silico)条件下准确预测反应产率的能力为反应优化提供了一种范式转变,使研究人员能够虚拟筛选庞大的组合化学空间,同时大幅减少与经验性实验操作相关的时间、成本和材料浪费[26 (https://arxiv.org/html/2608.00776#bib.bib5),25 (https://arxiv.org/html/2608.00776#bib.bib6)]。
从历史上看,最先进的产率预测模型严重依赖显式的一维分子表示,例如 Morgan 指纹、反应驱动指纹(DRFP)或显式计算的量子力学(QM)描述符[21 (https://arxiv.org/html/2608.00776#bib.bib7),33 (https://arxiv.org/html/2608.00776#bib.bib8),23 (https://arxiv.org/html/2608.00776#bib.bib9),24 (https://arxiv.org/html/2608.00776#bib.bib10)]。Doyle、Sigman 等人的开创性工作表明,将分子特征(如 HOMO/LUMO 能级、偶极矩和 Sterimol 参数)拼接成表格数据集,再与随机森林或多层感知机(MLP)等算法配合,可以产生高度准确的预测模型[1 (https://arxiv.org/html/2608.00776#bib.bib1),8 (https://arxiv.org/html/2608.00776#bib.bib11)]。然而,这种传统的表格化方法存在两个显著的瓶颈。首先,显式计算高水平的密度泛函理论(DFT)描述符对于数百万个理论筛选候选物而言,计算成本高得令人望而却步[10 (https://arxiv.org/html/2608.00776#bib.bib12)]。其次,压缩的一维数值数组往往难以整体性地捕捉决定反应混合物中过渡态反应性的复杂二维和三维空间位阻环境以及拓扑重叠[17 (https://arxiv.org/html/2608.00776#bib.bib13),32 (https://arxiv.org/html/2608.00776#bib.bib14)]。
为了绕过 QM 描述符的计算开销,近期化学深度学习领域的进展越来越转向隐式空间表示,其中最突出的是通过计算机视觉实现[28 (https://arxiv.org/html/2608.00776#bib.bib15),22 (https://arxiv.org/html/2608.00776#bib.bib16)]。受卷积神经网络(CNN)在图像识别领域成功的启发,研究人员已经证明,直接处理二维骨架分子结构图的网络(如 Chemception)能够成功提取化学启发式信息——例如芳香性、空间位阻和官能团存在情况——而无需先验的物理计算[9 (https://arxiv.org/html/2608.00776#bib.bib17),18 (https://arxiv.org/html/2608.00776#bib.bib18),16 (https://arxiv.org/html/2608.00776#bib.bib19)]。虽然这些纯视觉方法提供了非凡的计算可扩展性,但它们天生缺乏表格数据所提供的显式量子物理精度(例如精确的原子电荷),在预测高度敏感的催化产率时往往导致信息上限[15 (https://arxiv.org/html/2608.00776#bib.bib20),4 (https://arxiv.org/html/2608.00776#bib.bib21)]。
因此,化学人工智能的下一个前沿在于能够弥合隐式空间拓扑(视觉)与显式物理参数(表格数据)之间差距的多模态架构[11 (https://arxiv.org/html/2608.00776#bib.bib22)]。为了最大化这种多模态协同效应,以往的研究广泛探索了交叉注意力机制,证明其是融合异质数据类型的一个极有前景的方向[29 (https://arxiv.org/html/2608.00776#bib.bib23),14 (https://arxiv.org/html/2608.00776#bib.bib24),12 (https://arxiv.org/html/2608.00776#bib.bib25)]。通过允许一种模态动态查询另一种模态的局部特征,这些基于注意力的架构在复杂的多模态任务中持续取得了最先进的性能,使其成为将一维物理性质与二维化学结构对齐的理论上理想的方法。
在本工作中,我们引入了一种双模态架构,将显式的表格 QM 数据与高质量的二维分子图像协同结合,以预测高通量反应产率。具体而言,我们试图确定一个开箱即用、完全不含特定化学领域预训练的通用视觉主干网络(ResNet-18)是否能够提取足够的拓扑信息,从而与显式计算的物理描述符相抗衡。此外,我们进行了一项严格的架构消融研究,以探究多模态融合的潜在机制,直接比较动态交叉注意力与显式向量拼接(Simple Concat)。
值得注意的是,我们的结果表明,处理高质量二维反应拓扑结构的通用视觉模型显著优于以计算成本高昂的量子力学描述符为基础的纯表格 MLP 基线(RMSE 为 5.60% 对比 6.79%)。通过我们最优的视觉交叉注意力框架统一这些模态,我们成功地弥合了二维拓扑与一维物理参数之间的鸿沟,取得了优于传统方法的预测精度(测试集 RMSE = 5.27%)。
除了顶层的预测精度之外,我们还进行了一项机制分析,以理解这种多模态方法的内部逻辑。我们的发现表明,交叉注意力机制并非被动地汇集视觉数据,而是基于表格描述符主动查询二维图像,从而使其能够高效地映射宏观空间位阻环境。此外,分析注意力权重揭示出该网络建立了一种学得的化学层级结构。它表现出高度目标化的空间路由,优先关注关键的位阻瓶颈(如芳基卤化物),同时弱化非关键组分的拓扑信息。最后,我们观察到一个“残差瓶颈”,强调跳跃连接在数学上是必要的,用以在融合过程中保留纯粹的非空间量子参数。总体而言,该框架为以通用计算机视觉增强显式物理化学提供了一种高度可解释、计算高效的蓝图。
## 2 计算方法
参见图1:双模态视觉交叉注意力架构。通过通用 ResNet-18 主干网络提取的二维空间拓扑结构,被一维物理有机描述符主动查询,以动态地语境化宏观反应空间。一条残差跳跃连接显式绕过了空间注意力瓶颈,在最终产率预测之前保持严格的量子化学严谨性。
### 2.1 数据集划分与模态生成
我们使用了由 Doyle 实验室开发的基准数据集 `rxnpredict`[1 (https://arxiv.org/html/2608.00776#bib.bib1)],该数据集将高通量反应产率与严格计算的表格物理有机描述符(例如 HOMO/LUMO 能级、偶极矩和 Sterimol 参数)对应起来。为确保评估的严谨性,数据集被随机划分为 70:30 的训练集和留出测试集,并使用固定的随机种子以保证所有架构消融实验的严格可重复性。
为支撑双模态架构,每个反应被解析为两种不同的表示:
- • 表格描述符:显式的一维物理有机特征被提取,并使用仅在训练集上拟合的零均值、单位方差标准化方法进行归一化,以防止数据泄漏。
- • 二维视觉拓扑:我们使用 RDKit[19 (https://arxiv.org/html/2608.00776#bib.bib26)] 为每个反应组分(具体为添加剂、芳基卤化物、碱和配体)生成标准的二维骨架结构图像。图像被统一标准化为 224×224 像素的分辨率,转换为 RGB 张量,并使用标准的 ImageNet 参数进行归一化。为确保网络学习的是固有的化学拓扑结构,而非复合网格的任意布局,这些组分被独立渲染和处理为图像,在训练过程中通过一个唯一的复合键(实验板、行和列)进行对齐。
### 2.2 模态编码器
为处理多模态输入,我们在模态融合之前采用了不同的神经网络路径进行特征提取。
表格通路:经过缩放的物理有机描述符被送入一个前馈多层感知机(MLP),以生成一个稠密的、维度对齐的表格嵌入,大小为 d=256。
视觉通路:为提取二维空间特征,我们特意使用了一个仅在 ImageNet 上预训练的通用 ResNet-18 卷积神经网络[13 (https://arxiv.org/html/2608.00776#bib.bib27)]。虽然领域特定模型是为物理化学量身定制的,但该主干网络是为通用计算机视觉而设计,并且在预训练期间并未专门接触过分子。我们假设该网络能够仅从线角结构图的几何排列中隐式地学习二维空间位阻和拓扑重叠。为隔离交叉注意力的学习动态,卷积主干网络的参数被完全冻结。四个反应物图像被独立处理,并沿着序列维度堆叠,得到一个离散的视觉嵌入矩阵 \(X_{vis}\in\mathbb{R}^{4\times d_{k}}\),使下游融合机制能够独立地与每个特定试剂进行交互。
### 2.3 架构消融与融合策略
为严格研究特征融合的潜在机制,我们系统评估了两种不同的数学方法,用于桥接显式的一维表格数据与隐式的二维视觉嵌入:显式拼接方法(Simple Concat)和动态查询方法(Cross-Attention)。
策略 A:简单拼接融合(基线) 在 Simple Concat 架构中,我们绕过了复杂的空间路由,转而采用一种化学上盲目的、全局平均的拓扑状态。组分视觉嵌入 \(X_{vis}\) 通过一个无加权的均值池化操作进行压缩:
\[
X_{pool}=\frac{1}{4}\sum_{j=1}^{4}X_{vis,j} \quad (1)
\]
这个平均后的视觉状态随后与原始表格描述符 \(X_{tab}\) 显式拼接,并直接传递给预测头:
\[
X_{fused}=\text{Concat}(X_{pool},X_{tab}) \quad (2)
\]
策略 B:多头交叉注意力融合(冠军方案) 为测试动态的、描述符引导的空间加权是否能超越僵化的全局平均,我们设计了一种多头视觉交叉注意力架构(图1 (https://arxiv.org/html/2608.00776#S2.F1))。在标准的注意力范式中,相关性得分通过查询(\(Q\))和键(\(K\))的点积计算,经缩放后与值(\(V\))相乘[29 (https://arxiv.org/html/2608.00776#bib.bib23)]。
在我们提出的架构中,经过缩放的物理有机表格描述符(\(X_{tab}\))充当中心锚点(查询),而由通用 ResNet-18 主干网络提取的二维视觉嵌入(\(X_{vis}\))充当键和值。这显式地允许量子数学主动搜索视觉拓扑。为使网络能够同时监控不同的拓扑特征,我们通过多头交叉注意力执行空间路由,使用 \(h=8\) 个独立头。对于每个头 \(i\in\{1,\dots,h\}\),我们使用可学习的权重矩阵 \(W_{Q,i}\)、\(W_{K,i}\) 和 \(W_{V,i}\) 计算到共享潜在维度 \(d_{k}=256\) 的投影:
\[
\begin{aligned}
Q_{i} &= X_{tab}W_{Q,i} \quad (3) \\
K_{i} &= X_{vis}W_{K,i} \quad (4) \\
V_{i} &= X_{vis}W_{V,i} \quad (5)
\end{aligned}
\]
随后,每个独立头的交叉注意力通过计算显式表格查询与隐式视觉键之间的缩放点积来实现,生成动态的空间路由权重:
\[
\text{head}_{i}=\text{softmax}\left(\frac{Q_{i}K_{i}^{T}}{\sqrt{d_{k}}}\right)V_{i} \quad (6)
\]
所有 \(h=8\) 个头的输出随后被拼接,并通过一个最终的输出权重矩阵 \(W^{O}\) 进行投影,以产生统一的、视觉语境化的嵌入 \(X_{attn}\):
\[
X_{attn}=\text{Concat}(\text{head}_{1},\dots,\text{head}_{h})W^{O} \quad (7)
\]
至关重要的是,为防止这种空间注意力机制成为纯粹非空间参数(例如电子态或偶极矩)的破坏性信息瓶颈,我们实现了一条残差跳跃连接[13 (https://arxiv.org/html/2608.00776#bib.bib27)]。多头注意力模块的语境化输出(\(X_{attn}\))直接与原始、未修改的表格特征(\(X_{tab}\))拼接,以保护严密的量子化学信息:
\[
X_{fused}=\text{Concat}(X_{attn},X_{tab}) \quad (8)
\]
最后,对于这两种架构策略,这个融合后的表示都会通过一个多层感知机(MLP)预测头,以输出连续的反应产率预测 \(\hat{y}\):
\[
\hat{y}=\text{MLP}(X_{fused}) \quad (9)
\]
### 2.4 训练协议与可解释性指标
所有网络均使用 PyTorch 实现,并以均方误差(MSE)损失函数训练以预测连续反应产率(%)。优化由 AdamW 优化器驱动(批大小 = 32,初始学习率 = \(1\times 10^{-3}\),权重衰减 = \(1\times 10^{-4}\)),学习率通过带热重启的余弦退火调度器动态调节。模型训练 500 个 epoch,并采用严格的检查点机制以保留特定 ne相似文章
ChemVA:推动大型语言模型对化学反应图的理解
ChemVA 是一个框架,旨在解决大型语言模型理解化学反应图时的视觉和语义瓶颈,实现了92%的结构识别准确率,并在九个大型语言模型上持续提升约20个百分点。
物理约束MCMC与化学信息高斯过程协同用于反应网络发现
本文提出了PC-MCMC-CIGP,这是一种灰盒工作流,结合了spike-and-slab拓扑采样、物理约束和化学信息高斯过程用于反应网络发现。该方法在苯乙烯环氧化反应中提高了产率,并在氢-溴基准测试中区分了基本反应路径与欺骗性拟合。
视觉作为统一多模态生成
本文介绍 SenseNova-Vision,一个统一的多模态模型,将计算机视觉任务表述为生成问题,在多种视觉任务上实现了与专用系统相当的性能。它引入了一个大规模指令-响应语料库,并公开发布模型和数据集。
基于图神经网络、深度交叉网络和SMILES嵌入的多模态分子表示学习
本文提出了一种三分支模块化融合神经网络,整合了3D几何结构、SMILES嵌入和物理化学描述符用于分子性质预测,在QM9数据集上以不到一百万个参数实现了20.6%的误差降低。
用于多任务ADME性质预测的概率对比预训练
本文提出了一种用于分子图变换器的概率对比预训练框架,以改善药物发现中的多任务ADME性质预测,在三个基准上取得了显著提升。