基于梯度优化与多组注意力神经网络架构的逆向临界实验设计

arXiv cs.LG 论文

摘要

MIT研究人员提出了一种利用深度神经网络进行核临界实验逆向设计的方法,该方法采用新颖的多组注意力池化架构和基于梯度的优化策略,以最大化中子相似性系数。该方法被应用于验证HALEU燃料运输容器,在三种目标构型下均取得了较高的相似性评分。

arXiv:2606.04033v1 公告类型:新论文 摘要:先进核反应堆设计和燃料概念的验证需要与目标技术具有高度中子相似性的临界实验。中子相似性通过相关系数 $c_k$ 来量化,该系数反映了核数据不确定性所引起的 $k_\text{eff}$ 共同偏差。通常,实验需满足 $c_k\geq0.9$ 才能被认为与目标技术具有足够的相似性。本文提出了一种临界实验逆向设计方法,利用深度神经网络代理模型和非参数梯度优化来生成使 $c_k$ 最大化的实验几何构型。 该深度神经网络基于 OpenMC 计算的网格化临界实验几何灵敏度向量进行训练。模型架构将 U-Net 卷积编码-解码器与新颖的多组注意力池化层相结合,后者专为捕捉灵敏度的不同空间依赖关系而设计。实验表明,多组注意力池化在性能上优于传统池化方法,且具有可解释的内部行为。代理模型的可微分性使得可以对完整组合设计空间进行梯度优化,通过直接改变几何网格中每个位置的材料分配来最大化 $c_k$。 该方法被应用于对搭载 HALEU 燃料的 TN-Americas TN-LC 运输容器进行验证,该容器现有临界实验覆盖有限。优化过程针对三种目标构型分别生成了 $c_k$ 评分为 0.97757、0.81324 和 0.93276 的实验几何构型。本研究展示了深度学习与梯度优化在加速先进核技术发展方面的潜力。
查看原文
查看缓存全文

缓存时间: 2026/06/05 02:18

# 基于梯度优化与多群注意力神经网络架构的逆向临界实验设计

来源:https://arxiv.org/html/2606.04033

###### 摘要

先进核反应堆设计与燃料概念的验证需要与目标技术具有高度中子学相似性的临界实验。中子学相似性由相关系数 $c_k$ 量化,该系数反映了核数据不确定性在 $k_{\text{eff}}$ 中引发的共同偏差。通常,实验与目标技术之间需满足 $c_k \geq 0.9$ 才能被认为具有足够的相似性。本文提出了一种临界实验逆向设计方法,利用深度神经网络代理模型和非参数梯度优化方法,生成能最大化 $c_k$ 的实验几何构型。

基于 OpenMC 计算的网格化临界实验几何构型灵敏度向量,训练了一个深度神经网络。该模型架构将 U-Net 卷积编码器-解码器与一种新颖的多群注意力池化层相结合,后者的引入旨在捕捉灵敏度的不同空间依赖关系。实验表明,多群注意力池化在性能上优于传统池化方法,且具有可解释的内部行为。代理模型的可微性使得能够对完整组合设计空间进行基于梯度的优化,通过直接改变几何网格中每个位置的材料分配来最大化 $c_k$。

该方法应用于含 HALEU 燃料的 TN-Americas TN-LC 运输容器的验证,该容器目前缺乏足够的临界实验覆盖。优化流程所产生的实验几何构型,在三种关注构型下分别达到了 $c_k$ 分数 0.97757、0.81324 和 0.93276。该方法展示了深度学习与梯度优化在加速先进核技术发展方面的潜力。

###### 关键词:

临界实验,注意力机制,深度学习,可微代理模型,HALEU,逆向设计

††期刊:Annals of Nuclear Energy
所属机构:麻省理工学院核科学与工程系,地址:60 Vassar St.,剑桥市,邮编 02139,马萨诸塞州,美国

## 1 引言

在 AI 数据中心的快速扩张、国内再工业化以及日益增长的能源独立需求的共同驱动下,公共和私营部门纷纷转向核能以满足本世纪的能源需求 \[6\]\[29\]\[7\]。核能行业的复苏推动了大量先进反应堆设计、燃料与材料方案的涌现。临界实验在支撑这些技术的验证和最终部署方面发挥着核心作用。

临界(或临界性)实验是由裂变材料组成的低功率组件,旨在精确测量和验证核系统的中子学特性,而无需进行昂贵且困难的全尺寸示范 \[28\]。国家临界实验研究中心(NCERC)利用多套临界装置支持各类应用的临界实验。NCERC 的 Comet \[27\] 和 Planet \[24\] 垂直提升装置已被用于开展多种临界实验。两套装置均为通用重型垂直提升装置,由两个垂直叠放的平台组成,每个平台包含一个次临界裂变构型,通过移动平台相互靠近或远离来控制反应性。历史上,零功率反应堆(ZPR)和零功率钚/物理反应堆(ZPPR)设施是在阿贡国家实验室于 1955 年至 1990 年间运行的一系列 HST 临界实验设施 \[13\]。ZPR/ZPPR 的临界实验设计方法通过使用可互换材料管网格,在单一装置中实现了多种实验。先进反应堆设计的需求表明,有必要建造一种新型临界实验装置,以支持先进燃料、几何构型和材料成分。爱达荷国家实验室的系统物理先进反应堆临界装置(SPARC)项目是一个拟建的临界实验设施,将满足这一需求。与 Comet 和 Planet 的垂直提升机制不同,SPARC 将采用水平分台(HST)机构,能够支持质量达 24,000 kg、每维长度约 2.0 m 的临界组件。SPARC 对于先进反应堆设计和燃料概念的验证与部署至关重要 \[35\]。

为了获得有效结果,临界实验的中子学特性必须与全尺寸系统相似。具体而言,全尺寸系统中各截面相关的不确定性应被临界实验所涵盖,以使两个系统中的计算偏差以相似方式呈现。这种相似性可通过第 2 节所述的相关系数 $c_k$ 来衡量。若临界实验与全尺寸系统的 $c_k$ 较高,则实验中观测到的中子学特性可安全地迁移至全尺寸系统。在实验设计方面,Maldonado 等人 \[16\] 依靠 $c_k$ 值指导概念型 Snowflake 微型反应堆临界实验的设计。当实验设计与 Snowflake 之间的相关系数趋近于 1 时,由截面不确定性引起的 $k_{\text{eff}}$ 计算偏差趋近于商业技术所对应的偏差。该工作展示了 $c_k$ 作为实验设计客观相似性指标的应用。此外,Walters 和 Roskoff \[31\] 同时利用 $k_{\text{eff}}$ 对截面的灵敏度和反应性,评估了一座 30 MWt 石墨慢化试验反应堆与临界实验之间的相似性。

许多先进反应堆设计需要使用高丰度低浓缩铀(HALEU)作为燃料,这将需要安全的运输解决方案。TN Americas TN-LC 容器 \[4\] 最初为运输中高燃耗乏核燃料(SNF)组件而开发,目前正被考虑用于先进反应堆所需 HALEU 的未来运输。若选用该方案,则需要进行严格的核临界安全评估,以确保在所有可能情景下(包括水侵入容器和/或内部 $\text{UO}_2$ 罐的情况)保持次临界状态。Eidelpes 等人 \[4\] 利用相关系数识别与 TN-LC 具有高 $c_k$ 的基准临界实验,以支持 TN-LC 的中子学分析。Hall 等人 \[5\] 认为 $c_k \geq 0.9$ 的两个系统具有相似性,而 Eidelpes 等人则要求对 $c_k \leq 0.8$ 的情况在次临界裕量中施加 $k_{\text{eff}}$ 惩罚。研究发现,Case 1 有 130 个实验满足 $c_k \geq 0.8$,但没有满足 $c_k \geq 0.9$ 的实验,Case 2 则没有满足 $c_k \geq 0.8$ 的实验。这表明设计新实验的必要性。

机器学习技术已被探索用于优化临界实验设计。其中一种技术是约束贝叶斯优化(CBO),它在维持目标函数概率模型的同时,有策略地选择实验构型进行评估,在执行设计空间物理约束的同时最小化昂贵评估的次数。Branco-Ketcher 等人 \[2\] 将 CBO 应用于 TerraPower 熔盐氯化物反应堆实验(MCRE)临界实验设计,在满足 Comet 装置物理限制的同时,同步最大化 $c_k$ 和对关注反应的灵敏度。针对降低中间能量 Pu-239 核数据不确定性的目标,Kleedtke 等人 \[9\] 使用粒子群优化方法调整实验构型,使 $k_{\text{eff}}$ 的中子注量率和对总裂变截面的灵敏度在 1 keV 至 600 keV 能量范围内均达到最大。考虑到在优化过程中对每个候选模型进行蒙特卡罗评估的极高潜在计算成本,采用了参数有限的简化模型。解决这一计算成本问题的另一种方法是使用能够快速近似目标函数的代理模型。

在核工程领域,用于替代高计算成本全阶模型评估的代理模型已得到广泛应用。Whyte 和 Parks \[32\] 评估了两种代理模型,用于优化小型压水堆中 36 个组件的布局设计。这两种基于深度学习的代理模型随后被嵌入 NSGA-II \[3\] 多目标优化器中。另有一项两部分研究 \[25, 26\] 在满足安全相关量约束的同时,优化了热管微型反应堆的平准化电力成本。随后应用了先进的基于强化学习的多目标优化方法,以更全面的方式处理这些约束。在上述两种情况下,神经网络均被用作代理模型。一个重要的实践是在优化流程结束时重新引入全阶模型,专门评估代理模型在所发现最优解上的准确性。总体而言,这种做法相当普遍 \[21, 23, 17\],有助于缓解代理模型不准确性带来的缺陷。

就代理模型本身的方法而言,中子输运计算具有非线性特征,因此难以用简单的代理方法精确建模。然而,近年来深度学习 \[11\] 的进步产生了能够近似复杂函数的架构,涵盖从蛋白质折叠 \[36\] 到流体动力学 \[10\] 等多个领域,使深度神经网络成为中子学代理建模的有力候选。多种深度学习技术可用于构建强大的中子学代理模型。卷积层是卷积神经网络(CNN)的核心组件,在从多维输入中提取空间和几何信息方面具有突出优势,这使其在过去数十年的图像处理模型中无处不在 \[12\]。注意力机制是大型语言模型兴起背后的主要架构进步,能够同时学习输入所有组成部分之间的关系,以捕捉长程效应 \[30\]。当这些组件结合在单一神经网络中时,可提供一种强大而有前景的方法,以远低于完整蒙特卡罗输运模拟的时间代价捕捉复杂几何构型的中子学行为。

深度神经网络是可微对象,这意味着它们可与基于梯度的优化方法结合使用 \[18\]。基于梯度的优化方法在机器学习领域已经验证了强大的优化能力,并在优化空间维度增加时具有良好的可扩展性 \[34\]。反向传播 \[8\] 可用于计算目标相对于输入每个分量的梯度。随后利用梯度更新输入,使其朝着最大化或最小化(取决于问题的表述方式)目标的方向变化。在核系统设计方面,Pevey 等人 \[20\] 使用梯度方法优化简化堆芯几何构型的中子学特性。若能构建中子学灵敏度剖面的可微代理模型,则基于梯度的优化方法可应用于临界实验设计。

本文利用深度神经网络代理模型的可微性,对体素化实验几何构型中材料分配的完整组合空间进行 $c_k$ 的基于梯度优化。首先在 OpenMC 中构建目标技术的模型,并用于计算各关注情景下的目标灵敏度剖面。随后利用程序化生成的材料构型数据集,训练代理神经网络以预测任意几何构型的灵敏度。代理模型采用一种新颖的异构神经网络架构,旨在训练过程中促进对底层输运物理的归纳偏置。训练完成后,代理模型与基于梯度的优化方法结合使用,生成能够针对 OpenMC 生成的任意输入灵敏度剖面最大化 $c_k$ 的实验几何构型。

## 2 方法论

### 2.1 应用场景

TN Americas TN-LC 运输容器 \[4\] 最初为运输中高燃耗乏核燃料(SNF)组件而开发,目前正被考虑用于先进反应堆所需 HALEU 的未来运输。若选用该用途,则需要进行严格的临界安全评估,以确保在所有可能情景下(包括水侵入容器和/或内部 $\text{UO}_2$ 罐的事件)保持次临界状态。具有高 $c_k$ 的临界实验数据可用于辅助该分析。实验与目标系统之间的中子学相似性可由相关系数 $c_k$ 量化,该系数代表两个系统所共享的核数据诱导不确定性的比例 \[16\]。通过将各关注反应的灵敏度向量 $s \in \mathbb{R}^G$ 组合成单一向量 $S \in \mathbb{R}^{RG}$(包含 $R$ 个反应和 $G$ 个离散能群)来构建灵敏度剖面。相关系数定义为

$$c_k = \frac{S_{\mathrm{TARGET}}^{\top} C_{XX} S}{\sqrt{\left(S_{\mathrm{TARGET}}^{\top} C_{XX} S_{\mathrm{TARGET}}\right)\left(S^{\top} C_{XX} S\right)}} \tag{1}$$

其中 $S_{\mathrm{TARGET}}$ 为……

相似文章

基于稀疏查询特征梯度优化的导向生成

arXiv cs.LG

本文介绍了Prototype-Based Sparse Steering方法,该方法将稀疏自编码器应用于大语言模型的注意力查询激活,然后在推理过程中使用梯度优化来引导生成朝向目标行为。该方法在一个逻辑规划任务和一个风格化教育领域中得到了验证,展示了可解释且解耦的控制能力。

输入凸神经网络训练的一种提升方法

arXiv cs.LG

提出了一种用于训练输入凸神经网络(ICNN)的“提升”方法,该方法使用无约束的超网络生成非负的层间权重,从而软化损失景观并避免梯度衰减,相比投影梯度下降和softplus重参数化,实现了更低的测试损失。

上下文优化下的检索增强生成:从梯度下降视角

arXiv cs.CL

本文研究检索增强生成作为上下文优化过程,表明线性自注意力可以在统一的RAG目标上实现梯度下降。它提出了一种轻量级方法,适用于冻结的RAG大语言模型,通过预测上下文条件的更新,在多个问答基准上提升了性能。

Aletheia:基于梯度引导的层选择方法,实现跨架构的高效LoRA微调

arXiv cs.CL

Aletheia 提出了一种基于梯度引导的层选择方法,用于高效的 LoRA 微调。该方法通过轻量级梯度探针识别与任务相关的 Transformer 层,并选择性地应用适配器,在 14 个模型上实现了 15%-28% 的训练加速,同时保持了在 MMLU、GSM8K 和 HumanEval 基准测试中的下游性能。