为何多层消息传递有效:图神经网络原子间势能的完备性理论
摘要
本文提供了一种完备性理论,证明图神经网络中的多层消息传递能够实现对原子间势能的普适近似,从而为机器学习势能中的常见架构实践提供了理论依据。
arXiv:2609.00528v1 Announce Type: new
摘要:我们证明了超图神经网络(Hypergraph Neural Network),一种具有三体消息传递的不变架构,是势能面的普适近似器。我们的主要贡献是提出了一个多层完备性理论。我们表明,在满足构型通用性、重叠条件和连通性条件的前提下,$L$ 层基于稀疏截断图的消息传递可以达到与访问完整 $L$-跳邻域相同的表示能力。这为使用每层截断小于物理相互作用范围的多层消息传递的常见实践提供了首个严格的理论依据,这种设置被几乎所有基于图神经网络的实用机器学习原子间势能所采用。作为直接推论,我们表明 DPA3 和 CHGNet 架构都继承了普适近似性质。
查看缓存全文
缓存时间: 2026/09/02 06:15
# 图神经网络原子间势的完备性理论 来源:https://arxiv.org/html/2609.00528 ## 多层消息传递为何有效:图神经网络原子间势的完备性理论 明平兵††感谢:中国科学院数学与系统科学研究院计算数学与科学工程计算国家重点实验室,北京中关村东路55号,邮编100190 \(\)\。王涵††感谢:北京应用物理与计算数学研究所计算物理国家重点实验室,北京丰浩东路2号,邮编100094,中华人民共和国,以及北京大学工程学院高能量密度物理科学研究中心,北京100871,中华人民共和国 \(\)\。电子邮箱:[[email protected]](mailto:[email protected]) ###### 摘要 我们证明了超图神经网络——一种具有3体消息传递的不变架构——是势能面的通用近似器。我们的主要贡献是提出了一个*多层完备性理论*。我们证明,只要构型满足一般性条件、重叠条件和连通性条件,在基于稀疏截断图的L层消息传递,可以达到与访问完整L跳邻域相同的表示能力。这为常见实践提供了首个严格证明:使用多层消息传递且每层截断半径小于物理相互作用范围,是有效的。这种设置被几乎所有实用的图神经网络机器学习原子间势所采用。作为直接推论,我们证明DPA3和CHGNet架构都继承了通用近似性。 ###### 关键词 机器学习原子间势,图神经网络,超图神经网络,通用近似性 ††页眉标题:图神经网络原子间势的完备性理论 / P. Ming and H. Wang ###### MSC 68T07, 68R10, 41A65, 92E10 ## 1 引言 机器学习原子间势(MLIPs)[6 (https://arxiv.org/html/2609.00528#bib.bib6), 2 (https://arxiv.org/html/2609.00528#bib.bib2), 42 (https://arxiv.org/html/2609.00528#bib.bib42)]已成为计算化学和材料科学中的必备工具,使得分子动力学模拟能够以远低于量子力学计算的成本,达到接近量子力学的精度。其应用范围从药物发现[37 (https://arxiv.org/html/2609.00528#bib.bib37)]和催化[21 (https://arxiv.org/html/2609.00528#bib.bib21)]到材料设计[9 (https://arxiv.org/html/2609.00528#bib.bib9)]和相图探索[38 (https://arxiv.org/html/2609.00528#bib.bib38)]。原子尺度基础模型[41 (https://arxiv.org/html/2609.00528#bib.bib41), 3 (https://arxiv.org/html/2609.00528#bib.bib3), 24 (https://arxiv.org/html/2609.00528#bib.bib24), 10 (https://arxiv.org/html/2609.00528#bib.bib10)]的最新进展进一步扩展了MLIPs的范围,使其能够覆盖元素周期表的大部分,成为通用势函数。这引出了一个基本问题:基于多层图神经网络的MLIP,能否在严格保持所需物理对称性和连续性约束的同时,近似任意势能面?这个问题的答案至关重要,因为它决定了这类模型的预测精度是内在地受限于架构设计,还是最终仅依赖于训练数据和优化过程。一个密切相关的概念是*完备性*。如果一个模型对于任何两个不通过对称性相关的局部环境能产生不同的输出,即只有当两个环境通过旋转、反射以及同种原子的置换相关联时才产生相同输出,则称该模型是完备的。完备性是通用近似的必要条件,但它是否也是充分条件,则是另一个将在本文中探讨的问题。该概念由Bartók等人[1 (https://arxiv.org/html/2609.00528#bib.bib1)]在不变表示的背景下引入,并被Pozdnyakov等人[29 (https://arxiv.org/html/2609.00528#bib.bib29)]聚焦,他们证明了广泛使用的3体表示(如SOAP功率谱)是*不完备的*,因为存在几何上不同的局部环境却共享相同的成对距离和三体角集合。因此,不完备性对近似精度施加了无法克服的理论上限,无论训练数据如何。后续的不完备性研究揭示了问题的广度。Pozdnyakov和Ceriotti[27 (https://arxiv.org/html/2609.00528#bib.bib27)]证明了仅基于距离的图神经网络(如SchNet[30 (https://arxiv.org/html/2609.00528#bib.bib30)])即使具有任意深度和非线性,对于三维点云也是不完备的,因此角度信息不仅是辅助的,而且是*必要的*。Cen等人[8 (https://arxiv.org/html/2609.00528#bib.bib8)]表明,对于特定张量度数l(例如l=1在所有对称图上失效),具有固定张量度数l的等变图神经网络在对称结构上会退化为零,这证明了低度等变特征也是不充分的。 已经开发了几种实现完备性的方法。原子团簇展开(ACE)[14 (https://arxiv.org/html/2609.00528#bib.bib14), 15 (https://arxiv.org/html/2609.00528#bib.bib15)]和矩张量势(MTP)[32 (https://arxiv.org/html/2609.00528#bib.bib32)]为不变函数构建了可系统改进的多项式基。这些是*线性*模型,其基函数密度直接带来通用近似性。等变消息传递架构,如Tensor Field Networks[34 (https://arxiv.org/html/2609.00528#bib.bib34)]、NequIP[5 (https://arxiv.org/html/2609.00528#bib.bib5)]、PaiNN[31 (https://arxiv.org/html/2609.00528#bib.bib31)]、SEGNN[7 (https://arxiv.org/html/2609.00528#bib.bib7)]和等变Transformer[33 (https://arxiv.org/html/2609.00528#bib.bib33)],使用E(3)等变卷积来传播矢量和张量特征,实现了高数据效率,但没有形式上的完备性保证。基于此,MACE[4 (https://arxiv.org/html/2609.00528#bib.bib4)]通过在GNN框架内构建ACE基函数来实现完备性:2体等变特征的张量积通过对Clebsch-Gordan系数进行对称化,构建出(ν+1)体特征,这在数学上等价于ACE基,因此完备性直接从ACE理论得出。另一种方法处理*不变*标量特征(即距离和键角),并使用非线性网络。属于此类的模型包括DimeNet[17 (https://arxiv.org/html/2609.00528#bib.bib17)]、GemNet[16 (https://arxiv.org/html/2609.00528#bib.bib16)]、SphereNet[23 (https://arxiv.org/html/2609.00528#bib.bib23)]、ALIGNN[11 (https://arxiv.org/html/2609.00528#bib.bib11)]、M3GNet[9 (https://arxiv.org/html/2609.00528#bib.bib9)]、CHGNet[13 (https://arxiv.org/html/2609.00528#bib.bib13)]和DPA3[41 (https://arxiv.org/html/2609.00528#bib.bib41)]。最后,坐标系方法从邻居对构建局部参考系,并在对称化之前应用非线性函数:Nigam等人[25 (https://arxiv.org/html/2609.00528#bib.bib25)]提出了3中心-1邻居表示,而Pozdnyakov和Ceriotti[28 (https://arxiv.org/html/2609.00528#bib.bib28)]引入了等变坐标系集合(ECSE)。在理论方面,几个基础结果支撑了对模型表达能力的分析。DeepSets通用性定理[40 (https://arxiv.org/html/2609.00528#bib.bib40), 36 (https://arxiv.org/html/2609.00528#bib.bib36), 18 (https://arxiv.org/html/2609.00528#bib.bib18)]确立了φ∘(∑j g)是置换不变函数的通用近似器。Villar等人[35 (https://arxiv.org/html/2609.00528#bib.bib35)]证明了任何在平移、旋转、反射和置换下不变的函数,都可以表示为位移矢量格拉姆矩阵的置换不变函数,这一结果被称为“标量是通用的”定理。Li等人[22 (https://arxiv.org/html/2609.00528#bib.bib22)]证明了几种不变图神经网络架构(如DimeNet、SphereNet和GemNet)在全连接图上达到了E(3)完备性。Joshi等人[20 (https://arxiv.org/html/2609.00528#bib.bib20)]引入了几何Weisfeiler-Leman测试,涵盖了不变和等变模型,并证明了模型类内成对可区分性与通用近似性之间的等价性。 尽管取得了这些进展,仍存在显著差距。Villar等人[35 (https://arxiv.org/html/2609.00528#bib.bib35)]和Li等人[22 (https://arxiv.org/html/2609.00528#bib.bib22)]的完备性结果仅针对*全连接*图建立;对于实践中常用的稀疏、基于截断的图,完备性仍是一个开放问题。Villar等人描述了不变函数*必须*具有的形式,但并未证明任何特定架构确实能够近似它们。Nigam等人[25 (https://arxiv.org/html/2609.00528#bib.bib25)]指出了正确的几何洞见,即在求和之前应用非线性的3中心特征可以实现完备性,但他们的论证是作为证明草图而非严格推导提出的。Joshi等人[20 (https://arxiv.org/html/2609.00528#bib.bib20)]的“可区分性–通用近似定理(UAT)等价性”是基于*函数类*操作的,它只要求对于每一对局部环境,该类中存在某个函数能够区分它们。这与具有固定权重的*单一*模型的完备性在概念上是不同的。此外,据我们所知,所有现有理论分析都在单个截断邻域内进行。然而,在实践中,多层消息传递将感受野从每层的截断半径r_c扩展到更大的物理相互作用范围R_c > r_c,而这种扩展范围对完备性的影响尚未得到解决。 我们通过引入超图神经网络(HGNN)——一种不变的3体架构——并证明HGNN的以下多层完备性定理,来填补这些空白。**主要结果(见定理26 (https://arxiv.org/html/2609.00528#Thmtheorem26))**:*在满足重叠和连通性条件的一般构型上,并且当L足够大使得L跳邻域覆盖物理相互作用范围R_c时,L层HGNN是范围R_c内势能面的通用近似器。* 上述结果通过多层消息传递,将完备性从每层的截断半径r_c扩展到了物理范围R_c,这是先前工作未涉及的场景。该证明基于*稀疏的*截断图进行,为HGNN提供了严格的连续近似保证,并描述了一个*单一的*固定权重表示,而非一个函数类。除此之外,HGNN作为一个*参考理论架构*:任何能够模拟HGNN的实用架构都将继承其通用近似性质。我们通过DPA3和CHGNet明确展示了这一推论,即推论27 (https://arxiv.org/html/2609.00528#Thmtheorem27)和推论29 (https://arxiv.org/html/2609.00528#Thmtheorem29)。证明还揭示了一个关键的架构要求:消息函数必须是多层感知器(MLPs)[12 (https://arxiv.org/html/2609.00528#bib.bib12), 19 (https://arxiv.org/html/2609.00528#bib.bib19)],而不是单个线性层,以确保所需的表达能力。 本文结构如下:第2节 (https://arxiv.org/html/2609.00528#S2)介绍势能面的性质、对称性框架以及本文考虑的基于GNN的原子间势架构,即HGNN、ALIGNN、CHGNet、DPA3。第3节 (https://arxiv.org/html/2609.00528#S3)证明完备性–通用近似定理(UAT)的等价性,并通过格拉姆矩阵重构建立完备表示的存在性。第4节 (https://arxiv.org/html/2609.00528#S4)证明HGNN可以近似完备表示。第5节 (https://arxiv.org/html/2609.00528#S5)陈述通用近似定理(UAT)并推导DPA3和CHGNet的推论,模拟证明见补充材料。第6节 (https://arxiv.org/html/2609.00528#S6)讨论其意义、假设、局限性和开放问题。 ### 2.1 势能面与目标函数类 考虑一个包含N个原子的系统,原子类型z_i ∈ Z = {1, ..., T},且位置r_i ∈ R³两两不同。记B_r = {r ∈ R³: ||r|| < r}为半径r的球。原子间势能V由总能量的广延性(P1)、原子环境的局部性(P2)、旋转/平移/反射不变性(P3)、平滑性(P4)以及置换等变性所刻画(定义1 (https://arxiv.org/html/2609.00528#Thmtheorem1))。具体来说,我们要求: **(P1) 广延性**: 总势能V是所有原子能量贡献ε_i的和:V = Σ_i ε_i。 **(P2) 局部性**: 存在一个固定的物理截断半径R_c > 0,使得每个原子的能量贡献ε_i仅依赖于原子i的R_c范围内的原子:ε_i = ε(D_i^{(R_c)})。 **(P3) 不变性**: 势能V在平移、旋转、反射和同种原子置换下不变。 **(P4) 平滑性**: 函数ε关于邻居位置至少是C^k (k≥2)光滑的,包括在相互作用范围边界处(邻居进入和离开环境时)。由于ε是C^k,因此力是C^{k-1},海森矩阵是C^{k-2}。要求k≥2使得这三者都连续。 广延性和局部性将问题从一个3N维构型空间上的函数,简化到一个具有有界维度的局部环境空间上的函数。我们现在形式化这个空间。 ###### 定义2(环境空间)。对于固定的截断半径r > 0,以及类型签名(z_0, z),其中z_0 ∈ Z,z ∈ Z_{≤n}^n = {(z_1, ..., z_n) ∈ Z^n : z_1 ≤ ... ≤ z_n},且n ≤ M,*层*E_{z_0, z}^{(r)}是局部环境(定义1 (https://arxiv.org/html/2609.00528#Thmtheorem1))在截断r内的邻居有序列表的集合,其中心类型为z_0,且第k个邻居的类型为z_k。由于类型由签名固定,这样的列表由其位移向量元组确定,记为D = (Δr_1, ..., Δr_n) ∈ (B_r \ {0})^n ⊂ R^{3n}。(6) 每个这样的元组都会出现,因此该层是R^{3n}的一个开子集,并继承其欧几里得度量、标准拓扑和C^∞微分结构。类型签名(z_0, z)是索引数据而非集合数据,因此即使维度相同,不同签名的层也是不相交的。具有截断r的*环境空间*是所有中心类型和邻居组合的无交并: E^{(r)} = ⨆_{z_0 ∈ Z} ⨆_{n=0}^M ⨆_{z ∈ Z_{≤n}^n} E_{z_0, z}^{(r)}。(7) 当截断为默认r_c时,我们写E ≡ E^{(r_c)},且E_{z_0, z} ≡ E_{z_0, z}^{(r_c)}。每层上的欧几里得度量为: d(D, D') = (∑_{k=1}^n ||Δr_k - Δr_k'||^2)^{1/2}, D, D' ∈ E_{z_0, z}^{(r)}。
相似文章
通过通用层方程统一图神经网络
本文引入了一个通用层方程,将图神经网络统一为七个组件,从而实现架构比较、理论分析,并对过平滑和表达能力等问题提供见解。
广义神经元
本文探讨了深度学习中的通用近似定理,分析了使用 ReLU 激活函数时单个神经元和神经网络层的表示能力。
探究图神经网络消息传递在回归场景中的效能
本文研究了多种图神经网络消息传递层在回归场景中的效能,发现深度卷积GNN(尤其是GEN)的表现优于基于注意力机制的GNN。
Designing a Good Virtual Node: Addressable and Cardinality-Preserving Global Memory for Message Passing Architectures
This paper introduces addressable and cardinality-preserving global memory for message-passing neural networks via cross-attention slots, addressing the finite-capacity bottleneck of virtual nodes and improving performance on multiplicity-aware tasks.
图神经网络随机特征的普适性与近似率
本文证明,具有随机节点特征的图神经网络可以普适地近似有向图上的置换不变或等变函数,并为可微函数提供了近似率界限。