门控循环单元中的乘积单元改进核质量预测

arXiv cs.LG 论文

摘要

本文提出了一种新颖的复值门控循环单元(GRU)架构,结合乘法乘积单元(AM-PU-GRU),用于预测核质量,在原子质量评估数据集上实现了最先进的插值和外推精度。

arXiv:2606.06866v1 公告类型:新 摘要:利用机器学习预测原子核质量可以补充理论模型,并推动对核图表中未知区域的探索。我们提出了一种基于门控循环单元(GRU)的机器学习技术,该技术通过利用长程依赖关系在核质量预测中展示了竞争性能。通过在循环单元内集成乘法交互和乘积单元变换,我们报告了核质量预测的显著改进。计算在复域中进行,以联合捕捉幅度和相位动态。对于基于原子质量评估(AME2016和AME2020)的插值和时序外推任务,复值加性-乘法乘积单元门控循环单元(AM-PU-GRU)模型始终取得最低的预测误差,插值均方根误差为0.227 ± 0.004 MeV,外推均方根误差为0.179 ± 0.015 MeV。这些结果超越了其他最先进的机器学习模型,也优于实值GRU基线和乘积单元消融变体,同时对于不同的理论先验(包括WS4和SEMF)保持鲁棒性。我们的发现将复值乘积单元循环网络确立为基于序列的核质量预测的新基准。
查看原文
查看缓存全文

缓存时间: 2026/06/08 09:18

# 门控循环单元中的乘积单元改进原子核质量预测
来源:https://arxiv.org/html/2606.06866
11institutetext:科布伦茨应用科学大学数学、信息学与技术系,Joseph\-Rovan\-Allee 2, 53424 雷马根,德国
11email:dellen@hs\-koblenz\.de22institutetext:慕尼黑工业大学,慕尼黑,德国33institutetext:马德拉大学数学系,大学城,丰沙尔,9020\-105,葡萄牙44institutetext:圣路易斯华盛顿大学物理系,1 Brookings Drive, St\. Louis, 63130, MO, USA###### 摘要

利用机器学习预测原子核质量可以补充理论模型,并推进对核素图中未知领域的探索。我们提出了一种基于门控循环单元(GRU)的机器学习技术,该技术通过利用长程依赖性,在原子核质量预测中展现了有竞争力的性能。通过在循环单元中集成乘法交互和乘积单元变换,我们报告了原子核质量预测的显著改进。计算在复数域中进行,以联合捕获幅度和相位动力学。对于基于原子质量评估(AME2016和AME2020)的内插和时间外推任务,复数加性-乘性乘积单元门控循环单元(AM-PU-GRU)模型始终实现最低的预测误差,内插均方根误差为0.227±\\pm0.004 MeV,外推均方根误差为0.179±\\pm0.015 MeV。这些结果超越了其他最先进的机器学习模型,也优于实值GRU基线和乘积单元消融变体,同时对不同的理论先验(包括WS4和SEMF)保持鲁棒性。我们的发现将复值乘积单元循环网络确立为基于序列的原子核质量预测的新基准。

## 1引言

准确预测原子核质量是核物理学中的一个基本问题,对核结构理论、核合成路径以及核能和天体物理学的应用具有重要意义。诸如AME2016\[9 (https://arxiv.org/html/2606.06866#bib.bib17),10 (https://arxiv.org/html/2606.06866#bib.bib18)\]和AME2020\[6 (https://arxiv.org/html/2606.06866#bib.bib19),21 (https://arxiv.org/html/2606.06866#bib.bib20)\]等实验评估为许多核素提供了精确测量,但核素图的大片区域仍然无法触及。这激发了能够在已知区域进行内插并对未知核素进行外推的理论和数据驱动方法。

传统的质量模型,例如魏茨泽克-斯凯尔姆模型(第4版)(WS4)\[22 (https://arxiv.org/html/2606.06866#bib.bib16)\],通过物理动机的参数化实现了高精度,但在未探索区域的预测能力有限\[8 (https://arxiv.org/html/2606.06866#bib.bib6)\]。与此同时,机器学习方法已经出现以补充原子核质量预测,特别是循环神经网络(RNN)\[8 (https://arxiv.org/html/2606.06866#bib.bib6)\]、门控循环单元(GRU)\[1 (https://arxiv.org/html/2606.06866#bib.bib21),8 (https://arxiv.org/html/2606.06866#bib.bib6)\]和混合密度网络(MDN)\[18 (https://arxiv.org/html/2606.06866#bib.bib10),17 (https://arxiv.org/html/2606.06866#bib.bib8),12 (https://arxiv.org/html/2606.06866#bib.bib1)\]在实验已知区域内实现了强大的内插精度,有时可与基于物理的模型相媲美。这些方法受益于其直接从数据中学习复杂非线性关系的能力,并且已被证明在拥有足够实验测量时可以减少预测误差。然而,这些架构中的许多在外推能力上仍然有限,因为它们主要依赖于加性表示,并且难以捕捉原子核质量系统学中固有的高阶非线性依赖性。

乘积单元(PU)\[4 (https://arxiv.org/html/2606.06866#bib.bib22),11 (https://arxiv.org/html/2606.06866#bib.bib23),3 (https://arxiv.org/html/2606.06866#bib.bib12),2 (https://arxiv.org/html/2606.06866#bib.bib5),13 (https://arxiv.org/html/2606.06866#bib.bib13),15 (https://arxiv.org/html/2606.06866#bib.bib15),14 (https://arxiv.org/html/2606.06866#bib.bib24)\]的机器学习方法被引入作为基于求和公式的替代方案,实现了乘法交互,从而提供了多项式和幂律关系的紧凑表示。最近,复值PU扩展\[2 (https://arxiv.org/html/2606.06866#bib.bib5),13 (https://arxiv.org/html/2606.06866#bib.bib13)\]已被探索,使得能够联合建模幅度和相位动力学。

在这些进展的基础上,我们提出了用于原子核质量预测的复值GRU扩展。通过将乘法交互和乘积单元变换集成到循环框架中,我们获得了两种新颖的架构:乘法交互乘积单元GRU(MI-PU-GRU)和加性-乘性乘积单元GRU(AM-PU-GRU)。

接下来,我们基于AME2016和AME2020,针对内插和时间外推评估这些架构,并与实值基线、消融实验和先验信息设置进行比较。复数AM-PU-GRU模型在两项任务上都实现了最低误差,为基于序列的原子核质量预测设立了新基准。

## 2相关工作

乘积单元(PU)被引入作为神经网络中基于求和神经元的替代方案。PU不是计算加权和然后进行非线性激活,而是通过将每个输入提升到一个可学习的指数并取其乘积来建模乘法交互,公式如下:

y=∏i=1nxiwi=exp⁡(∑i=1nwilog⁡|xi|)。y=\\prod\_\{i=1\}^\{n\}x\_\{i\}^\{w\_\{i\}\}=\\exp\\left\(\\sum\_\{i=1\}^\{n\}w\_\{i\}\\log\|x\_\{i\}\|\\right\)。\(1\)该公式显著增强了神经网络的表达能力,使得能够紧凑地表示多项式、幂律和有理关系。因此,基于PU的架构已被证明可以改善科学预测任务(如图像分类和函数逼近)中的外推能力\[3 (https://arxiv.org/html/2606.06866#bib.bib12),2 (https://arxiv.org/html/2606.06866#bib.bib5)\]。

最近,针对具有幅度和相位的信号,探索了复值PU网络。在公式 (1 (https://arxiv.org/html/2606.06866#S2.E1))中,复数扩展将log⁡|xi|\\log\|x\_\{i\}\|与arg⁡(xi)\\arg\(x\_\{i\}\)结合到指数中,通过指数映射引入了幅度缩放和相位旋转。这种更丰富的归纳偏置改善了MRI重建和原子核质量预测的鲁棒性\[2 (https://arxiv.org/html/2606.06866#bib.bib5),13 (https://arxiv.org/html/2606.06866#bib.bib13),14 (https://arxiv.org/html/2606.06866#bib.bib24)\]。

## 3方法

### 3.1基线:门控循环单元

GRU是一种循环神经网络变体,旨在通过缓解梯度消失问题来捕捉长程依赖性。引入了两种门控机制:更新门和重置门,它们调节每个循环单元内的信息流和记忆更新。

给定输入向量xt∈Rdx\_\{t\}\\in\\mathbb\{R\}^\{d\}和上一时间步tt的隐藏状态ht−1∈RHh\_\{t\-1\}\\in\\mathbb\{R\}^\{H\},GRU按如下方式计算更新门zt∈RHz\_\{t\}\\in\\mathbb\{R\}^\{H\}、重置门rt∈RHr\_\{t\}\\in\\mathbb\{R\}^\{H\}、候选隐藏状态h~t∈RH\\tilde\{h\}\_\{t\}\\in\\mathbb\{R\}^\{H\}和新隐藏状态ht∈RHh\_\{t\}\\in\\mathbb\{R\}^\{H\}:

zt\\displaystyle z\_\{t\}=σ(Wzxt+Uzht−1)\\displaystyle=\\sigma\(W\_\{z\}x\_\{t\}\+U\_\{z\}h\_\{t\-1\}\)更新门\(2\)rt\\displaystyle r\_\{t\}=σ(Wrxt+Urht−1)\\displaystyle=\\sigma\(W\_\{r\}x\_\{t\}\+U\_\{r\}h\_\{t\-1\}\)重置门\(3\)h~t\\displaystyle\\tilde\{h\}\_\{t\}=tanh⁡(Whxt+Uh(rt⊙ht−1))\\displaystyle=\\tanh\(W\_\{h\}x\_\{t\}\+U\_\{h\}\(r\_\{t\}\\odot h\_\{t\-1\}\)\)候选隐藏状态\(4\)ht\\displaystyle h\_\{t\}=(1−zt)⊙ht−1+zt⊙h~t\\displaystyle=\(1\-z\_\{t\}\)\\odot h\_\{t\-1\}\+z\_\{t\}\\odot\\tilde\{h\}\_\{t\}新隐藏状态。\\displaystyle\\text\{新隐藏状态\}。\(5\)这里,σ(⋅)\\sigma\(\\cdot\)表示sigmoid激活函数,tanh⁡(⋅)\\tanh\(\\cdot\)是双曲正切函数,⊙\\odot代表逐元素乘法。可学习参数满足W{z,r,h}∈RH×dW\_\{\\\{z,r,h\\\}\}\\in\\mathbb\{R\}^\{H\\times d\}和U{z,r,h}∈RH×HU\_\{\\\{z,r,h\\\}\}\\in\\mathbb\{R\}^\{H\\times H\}。我们的实现中使用了偏置项,但为了符号简洁省略。

参见图注图1:标准GRU单元的计算图。图1 (https://arxiv.org/html/2606.06866#S3.F1)展示了标准GRU单元的内部结构。该图与上述方程一致:输入xtx\_\{t\}和上一隐藏状态ht−1h\_\{t\-1\}共同用于计算重置门rtr\_\{t\}和更新门ztz\_\{t\}。重置门rtr\_\{t\}控制ht−1h\_\{t\-1\}对候选激活h~t\\tilde\{h\}\_\{t\}的贡献程度。最终隐藏状态hth\_\{t\}计算为ht−1h\_\{t\-1\}和h~t\\tilde\{h\}\_\{t\}的凸组合,由更新门ztz\_\{t\}控制。模型参数通过与更新门、重置门和候选隐藏状态相关的权重矩阵定义。

### 3.2乘法交互乘积单元GRU(MI-PU-GRU)

为了增强GRU的非线性建模能力,我们引入了MI-PU-GRU单元,它包含两个主要创新:乘法交互(MI)分支和候选状态计算中的乘积单元(PU)变换。图2 (https://arxiv.org/html/2606.06866#S3.F2)展示了MI-PU-GRU的计算图。

参见图注图2:MI-PU-GRU单元的计算图。MI-PU-GRU情况保持标准GRU的门控结构,但修改了候选隐藏状态h~t\\tilde\{h\}\_\{t\},如下所示:

zt\\displaystyle z\_\{t\}=σ(Wzxt+Uzht−1)\\displaystyle=\\sigma\(W\_\{z\}x\_\{t\}\+U\_\{z\}h\_\{t\-1\}\)更新门\(6\)rt\\displaystyle r\_\{t\}=σ(Wrxt+Urht−1)\\displaystyle=\\sigma\(W\_\{r\}x\_\{t\}\+U\_\{r\}h\_\{t\-1\}\)重置门\(7\)MIt\\displaystyle\\text\{MI\}\_\{t\}=MI(xt,rt⊙ht−1)\\displaystyle=\\text\{MI\}\(x\_\{t\},r\_\{t\}\\odot h\_\{t\-1\}\)乘法交互\(8\)h~t\\displaystyle\\tilde\{h\}\_\{t\}=PU([xt,rt⊙ht−1,MIt])\\displaystyle=\\text\{PU\}\(\[x\_\{t\},r\_\{t\}\\odot h\_\{t\-1\},\\text\{MI\}\_\{t\}\]\)PU变换候选\(9\)ht\\displaystyle h\_\{t\}=(1−zt)⊙ht−1+zt⊙h~t\\displaystyle=\(1\-z\_\{t\}\)\\odot h\_\{t\-1\}\+z\_\{t\}\\odot\\tilde\{h\}\_\{t\}新隐藏状态。\\displaystyle\\text\{新隐藏状态\}。\(10\)MI项使用输入和隐藏表示之间的逐元素指数交互计算:

MI(x,h)=exp⁡((Wmix)⊙(Umih)+bmi),\\text\{MI\}\(x,h\)=\\exp\\left\(\(W\_\{\\text\{mi\}\}x\)\\odot\(U\_\{\\text\{mi\}\}h\)\+b\_\{\\text\{mi\}\}\\right\),\(11\)其中WmiW\_\{\\text\{mi\}\}和UmiU\_\{\\text\{mi\}\}是可学习的投影矩阵,bmib\_\{\\text\{mi\}\}是偏置项。MI分支计算输入xtx\_\{t\}和重置门控的上一状态rt⊙ht−1r\_\{t\}\\odot h\_\{t\-1\}之间的逐元素指数交互,产生乘法表示MIt\\text\{MI\}\_\{t\}。指数函数确保输出严格为正,这对于后续的PU变换是必要的。该表示与xtx\_\{t\}和rt⊙ht−1r\_\{t\}\\odot h\_\{t\-1\}一起被输入到乘积单元(PU)变换中:

PU(x)=exp⁡(Wpu⋅log⁡(max⁡(x,softplus(θ)+10−7))+bpu),\\begin\{split\}\\mathrm\{PU\}\(x\)=\\exp\\Big\(W\_\{\\mathrm\{pu\}\}\\cdot\\log\\\!\\big\(\\max\(x,\\,\\mathrm\{softplus\}\(\\theta\)\+10^\{\-7\}\)\\big\)\+b\_\{\\mathrm\{pu\}\}\\Big\),\\end\{split\}\(12\)其中θ\\theta是一个可学习的阈值,确保对数的数值稳定性。

与标准GRU相比,MI-PU-GRU通过引入高阶乘法特征交互和基于PU的非线性变换,显著增强了模型的表达能力。

### 3.3加性-乘性乘积单元GRU(AM-PU-GRU)

AM-PU-GRU架构进一步扩展了MI-PU-GRU策略,通过显式建模加性和乘性两条候选路径。它引入了一个可学习的融合门来自适应地组合这两个贡献,从而统一了传统GRU风格线性度和基于PU的乘法表达能力的优势。图3 (https://arxiv.org/html/2606.06866#S3.F3)展示了双路径候选计算和融合。整体更新方程如下:

zt\\displaystyle z\_\{t\}=σ(Wzxt+Uzht−1)\\displaystyle=\\sigma\(W\_\{z\}x\_\{t\}\+U\_\{z\}h\_\{t\-1\}\)更新门\(13\)rt\\displaystyle r\_\{t\}=σ(Wrxt+Urht−1)\\displaystyle=\\sigma\(W\_\{r\}x\_\{t\}\+U\_\{r\}h\_\{t\-1\}\)重置门\(14\)gt\\displaystyle g\_\{t\}=σ(Wgxt+Ught−1)\\displaystyle=\\sigma\(W\_\{g\}x\_\{t\}\+U\_\{g\}h\_\{t\-1\}\)融合门\(15\)hadd\\displaystyle h\_\{\\text\{add\}\}=tanh⁡(Waddxt+Uadd(rt⊙ht−1))\\displaystyle=\\tanh\(W\_\{\\text\{add\}\}x\_\{t\}\+U\_\{\\text\{add\}\}\(r\_\{t\}\\odot h\_\{t\-1\}\)\)加性候选\(16\)MIt\\displaystyle\\text\{MI\}\_\{t\}=MI(xt,rt⊙ht−1)\\displaystyle=\\text\{MI\}\(x\_\{t\},r\_\{t\}\\odot h\_\{t\-1\}\)乘法交互\(17\)hmul\\displaystyle h\_\{\\text\{mul\}\}=PU([xt,rt⊙ht−1,MIt])\\displaystyle=\\text\{PU\}\(\[x\_\{t\},r\_\{t\}\\odot h\_\{t\-1\},\\text\{MI\}\_\{t\}\]\)乘性候选\(18\)h~t\\displaystyle\\tilde\{h\}\_\{t\}=gt⊙hmul+(1−gt)⊙hadd\\displaystyle=g\_\{t\}\\odot h\_\{\\text\{mul\}\}\+\(1\-g\_\{t\}\)\\odot h\_\{\\text\{add\}\}融合候选状态\(19\)ht\\displaystyle h\_\{t\}=(1−zt)⊙ht−1+zt⊙h~t\\displaystyle=\(1\-z\_\{t\}\)\\odot h\_\{t\-1\}\+z\_\{t\}\\odot\\tilde\{h\}\_\{t\}新隐藏状态。\\displaystyle\\text\{新隐藏状态\}。\(20\)这里,加性候选路径保留了GRU风格的公式,而乘性候选则使用MI和PU模块构建。融合门gtg\_\{t\}动态地平衡这两个组件。这种门控机制使模型能够根据时间上下文灵活地在线性和非线性动态之间适应。

参见图注图3:AM-PU-GRU单元的计算图。与MI-PU-GRU相比,AM-PU-GRU架构通过在每个时间步学习加性或乘性动态是否更合适,引入了额外的灵活性和可解释性。

### 3.4复值MI-PU-GRU

为了将MI-PU-GRU扩展到复数域,我们采用了完全复值公式。所有可学习的权重、隐藏状态和中间激活都是复值的。实值输入xt∈Rdx\_\{t\}\\in\\mathbb\{R\}^\{d\}通过零虚部扩展x~t=xt+i0∈Cd\\tilde\{x\}\_\{t\}=x\_\{t\}\+\\mathrm\{i\}0\\in\\mathbb\{C\}^\{d\}嵌入到复数向量空间中,且隐藏状态满足ht−1∈CHh\_\{t\-1\}\\in\\mathbb\{C\}^\{H\}。

更新门和重置门保持实值以确保稳定且可解释的门控;具体来说,我们将sigmoid函数应用于复数预激活的实部,得到zt,rt∈RHz\_\{t\},r\_\{t\}\\in\\mathbb\{R\}^\{H\}:

zt\\displaystyle z\_\{t\}=σ(R⁡(Wzx~t+Uzht−1)),\\displaystyle=\\sigma\\\!\\left\(\\Re\\\!\\left\(W\_\{z\}\\tilde\{x\}\_\{t\}\+U\_\{z\}h\_\{t\-1\}\\right\)\\right\),\(21\)rt\\displaystyle r\_\{t\}

相似文章