基于多头注意力的特征提取器与Soft Actor-Critic结合的增材制造孔隙率预测及工艺参数优化

arXiv cs.AI 论文

摘要

本文提出了一种新颖的架构,将多头注意力与Soft Actor-Critic算法相结合,用于增材制造中的孔隙率预测和工艺参数优化,相比标准强化学习方法实现了更快的收敛速度和更高的奖励值。

arXiv:2606.20087v1 Announce Type: new 摘要:增材制造工艺优化需要精确的参数控制以最小化孔隙率等缺陷。传统的使用离散动作空间的强化学习方法收敛缓慢且易陷入局部最优,限制了其在精密制造任务中的有效性。本研究通过采用连续动作空间并结合一种新颖的架构来解决这些限制,该架构将多头注意力机制与Soft Actor-Critic(SAC)算法集成。基于注意力的特征提取器增强了代理捕捉低维输入特征中细微变化的能力,从而在具有局部极小值的价值空间中实现更有效的探索-利用平衡。我们通过激光粉末床熔融中的孔隙率预测和工艺参数优化验证了我们的方法,证明了相比标准RL方法(包括DQN、PPO、TD3和vanilla SAC)更快的收敛速度和更高的最终奖励值。所提出的方法在14个回合内达到了322.79的收敛值,超越了现有方法,同时在训练过程中保持稳定性。
查看原文
查看缓存全文

缓存时间: 2026/06/20 14:35

# 基于多头注意力的特征提取器与Soft Actor-Critic的集成用于增材制造中的孔隙率预测和工艺参数优化
来源:https://arxiv.org/html/2606.20087
Kianoush Aqabakeehttps://orcid.org/0009-0008-0450-5360Kianoush Aqabakee 隶属于德黑兰理工大学(Tehran Polytechnic)电气工程系和机械工程系,伊朗德黑兰。邮箱:[email protected]。Leonardo Stellahttps://orcid.org/0000-0002-2670-9873Leonardo Stella 隶属于英国伯明翰大学计算机科学学院,邮编 B15 2TT。邮箱:[email protected]。

###### 摘要

增材制造工艺优化需要精确的参数控制,以最大程度地减少孔隙率等缺陷。传统的强化学习(RL)方法采用离散动作空间,存在收敛速度慢且容易陷入局部最优的问题,限制了其在精密制造任务中的有效性。本研究通过使用连续动作空间并结合一种新颖的架构来解决这些局限性,该架构将多头注意力机制与Soft Actor-Critic(SAC)算法集成。基于注意力的特征提取器增强了智能体捕捉低维输入特征中细微变化的能力,从而在具有局部最小值的值空间中实现更有效的探索-利用平衡。我们在激光粉末床熔融过程中的孔隙率预测和工艺参数优化上验证了我们的方法,结果表明,与标准的RL方法(包括DQN、PPO、TD3和原始SAC)相比,我们的方法收敛更快,最终奖励值更高。所提出的方法在14个回合内达到了322.79的收敛值,在保持训练稳定性的同时优于现有方法。¹¹¹GitHub仓库 (https://github.com/KianoushAqabakee/RL-based-Additive-Manufacturing-Optimization)

## I引言

近年来,金属增材制造(AM)在各个行业获得了显著的发展[20 (https://arxiv.org/html/2606.20087#bib.bib22)],例如航空航天[27 (https://arxiv.org/html/2606.20087#bib.bib18)]、建筑与施工[31 (https://arxiv.org/html/2606.20087#bib.bib19),17 (https://arxiv.org/html/2606.20087#bib.bib20)],以及生物医学应用[30 (https://arxiv.org/html/2606.20087#bib.bib21),12 (https://arxiv.org/html/2606.20087#bib.bib23)]。该技术具有众多优势,包括节省材料、降低原型制造成本,以及能够制造复杂或高度定制的部件。尽管有这些好处,但阻碍金属增材制造更广泛采用的主要挑战之一是确保生产的一致性[9 (https://arxiv.org/html/2606.20087#bib.bib15)]。这个问题源于所涉及的复杂物理过程、增材制造系统的多样性以及所使用的金属粉末和合金的选择[24 (https://arxiv.org/html/2606.20087#bib.bib16)]。这导致人们对探索先进的优化方法[23 (https://arxiv.org/html/2606.20087#bib.bib11),7 (https://arxiv.org/html/2606.20087#bib.bib13)]以增强增材制造系统的过程控制并提高其可靠性产生了越来越浓厚的兴趣[6 (https://arxiv.org/html/2606.20087#bib.bib17),26 (https://arxiv.org/html/2606.20087#bib.bib24)]。研究人员越来越多地转向数据驱动和机器学习方法来优化金属增材制造工艺,以应对这些挑战。

用于优化任务的传统计算智能方法,如基于回归的技术和集成学习[22 (https://arxiv.org/html/2606.20087#bib.bib7),15 (https://arxiv.org/html/2606.20087#bib.bib8)],受到需要大量数据集的限制,这使得它们在增材制造等应用中既耗时又耗费资源。在[23 (https://arxiv.org/html/2606.20087#bib.bib11)]中,引入了一种基于级联前向神经网络(NN)的数据驱动方法,用于预测316L不锈钢激光丝材增材制造中的工艺窗口和基本轨迹几何形状。此外,在[16 (https://arxiv.org/html/2606.20087#bib.bib12)]中,利用卷积神经网络(CNN)从熔池图像中预测激光功率值,突显了数据驱动方法在增材制造图像处理中的更广泛应用。在[7 (https://arxiv.org/html/2606.20087#bib.bib13)]中,提出了一种自动参数选择方法,利用从物理信息神经网络(PINN)模拟中得出的工艺特征来优化激光粉末床熔融(L-PBF),同时避免了重复进行有限元方法(FEM)模拟的需要。类似地,[18 (https://arxiv.org/html/2606.20087#bib.bib14)]介绍了一种ANN-SOA方法,通过研究铣削速度、层厚和取向对表面粗糙度的影响,来优化L-PBF中的金属3D打印。

此外,启发式优化方法虽然有用,但往往收敛缓慢并且容易陷入局部最优,限制了其在复杂、高维问题中的有效性。这些局限性凸显了对更动态方法的需求。强化学习已成为一种强大的替代方案,能够通过直接从与环境的交互中学习来优化复杂过程,例如自动驾驶[1 (https://arxiv.org/html/2606.20087#bib.bib5)]、机器人技术[2 (https://arxiv.org/html/2606.20087#bib.bib6)]、电池充电管理[14 (https://arxiv.org/html/2606.20087#bib.bib9),3 (https://arxiv.org/html/2606.20087#bib.bib30)]和增材制造[10 (https://arxiv.org/html/2606.20087#bib.bib1)],而无需大量预先存在的数据集。

近年来,强化学习在优化复杂系统(包括材料科学应用)方面展现出了巨大潜力。例如,强化学习已被应用于工艺参数估计,使得能够在各种部件几何形状中调整制造策略,而无需重复进行数据收集和模型重新训练,从而提高效率和成本效益[8 (https://arxiv.org/html/2606.20087#bib.bib29)]。此外,强化学习已被集成到自动沉积路径规划中,通过在电弧增材制造中动态调整焊接参数以适应复杂几何形状,从而增强了适应性[21 (https://arxiv.org/html/2606.20087#bib.bib10)]。强化学习在该领域的另一个关键应用是优化加工路径以实现材料所需的微观结构特性。特别是,[10 (https://arxiv.org/html/2606.20087#bib.bib1)]探讨了如何使用强化学习来控制加工条件并优化材料最终的力学性能。由于该研究中实现的RL智能体使用离散动作空间,因此本研究也采用了这一方式。相比之下,使用连续动作空间允许我们通过选择微小的参数变化来包含更多特征。连续动作空间提供的这些细微特征使我们能够增强生产过程。例如,在[5 (https://arxiv.org/html/2606.20087#bib.bib31)]中,印刷产品的分区厚度可以变化。图1 (https://arxiv.org/html/2606.20087#S1.F1)展示了该研究中的一个改编示例,说明了如何应用该方法来定制印刷产品。此策略有助于定制印刷产品。

参见图注图1:生产中3D打印产品的不同分区厚度表征。在这一基础上,本文旨在分析最常用的强化学习方法,并提出一种改进的算法,以进一步推动强化学习驱动的优化在材料处理中的应用。本文的贡献如下:

1. 1. 从多个角度对各种强化学习方法进行了比较分析,以突出它们在此特定应用中的潜在优势。
2. 2. 提出将多头注意力机制与最佳候选选择策略相结合,以在探索与利用之间实现最佳平衡,并针对本研究的价值空间进行定制。

本文的其余部分结构如下:第二部分 (https://arxiv.org/html/2606.20087#S2)详细介绍了优化公式和奖励函数的组成部分。第三部分 (https://arxiv.org/html/2606.20087#S3)分析了相关的价值空间,随后介绍了所提出的方法。第四部分 (https://arxiv.org/html/2606.20087#S4)报告了实现结果并评估了其性能。最后,第五部分 (https://arxiv.org/html/2606.20087#S5)对本文进行了总结,并概述了未来研究的可能方向。

## II预备知识

在本强化学习案例中,主要目标是确定能够产生具有改进力学性能的材料的加工路径。环境由材料微观结构的状态表征,智能体的动作代表与加工参数相关的决策。本研究中使用的奖励函数改编自[10 (https://arxiv.org/html/2606.20087#bib.bib1)],详细说明如下:

### II-A奖励函数

强化学习框架中使用的奖励函数由[10 (https://arxiv.org/html/2606.20087#bib.bib1)]设计,用于根据每个加工步骤对材料目标力学性能的贡献来评估其效果。

奖励函数 \(R(\hat{\pi}_1, \hat{\pi}_2, \text{VED})\) 根据材料的微观结构和力学性能来评估所选动作的有效性。该函数基于Eagar-Tsai热模型构建如下:

\[
R(\hat{\pi}_1, \hat{\pi}_2, \text{VED}) = \frac{5}{1+e^{-6\hat{\pi}_1-0.8}} + \frac{5}{1+e^{-12\hat{\pi}_2-0.75}} \tag{1}
\]
\[
- \frac{2}{1+e^{17-0.1\text{VED}}} - 2 - \frac{2}{1+e^{5-0.1\text{VED}}},
\]

其中:

- \(\hat{\pi}_1\):与微观结构或工艺条件第一个方面相关的参数,例如相分数或加工温度。其计算方式如下:
  \[
  \pi_1 = \frac{\pi d w}{2 h p}, \tag{2}
  \]
  其中 \(d, w, h, p\) 分别为熔池深度、熔池宽度、扫描间距和粉末厚度。
- \(\hat{\pi}_2\):与微观结构或工艺条件第二个方面相关的参数,可能代表另一个相分数或与时间相关的因素。其计算方式如下:
  \[
  \pi_2 = \frac{\gamma d}{v_x \mu \sigma}, \tag{3}
  \]
  其中 \(\gamma, v_x, \mu, \sigma\) 分别为表面张力、水平回流速度、动力粘度和激光光斑偏差。
- VED:一个变量,可能代表体积能量密度(VED)或其他影响微观结构发展的能量相关指标[4 (https://arxiv.org/html/2606.20087#bib.bib2)]。

奖励函数由两个主要部分组成:

1. 1. 前两项 \(\frac{5}{1+e^{-6\hat{\pi}_1-0.8}}\) 和 \(\frac{5}{1+e^{-12\hat{\pi}_2-0.75}}\) 模拟了参数 \(\hat{\pi}_1\) 和 \(\hat{\pi}_2\) 达到期望值所带来的好处,当这些参数接近最优值时,奖励更高。
2. 2. 最后两项 \(-\frac{2}{1+e^{17-0.1\text{VED}}}\) 和 \(-\frac{2}{1+e^{5-0.1\text{VED}}}\) 在能量密度 VED 偏离期望值时施加惩罚。这些项确保能量输入保持在最佳范围内,从而阻止过多或不足的能量使用。

该奖励函数鼓励强化学习智能体在考虑能量消耗的同时优化微观结构参数,引导学习过程朝着期望的材料属性和高效加工条件前进。

在下一阶段,将分析常见的强化学习方法,并根据问题特征对其进行分类,突出它们的优缺点。

## III方法论

### III-A价值空间

确定最适合此任务的方法的关键因素之一是价值空间的形状。由于任务是分回合的,价值空间可以如图2 (https://arxiv.org/html/2606.20087#S3.F2)所示进行可视化。

参见图注\(a\)每回合累积奖励
参见图注\(b\)每回合累积奖励
参见图注\(c\)每回合累积奖励

图2:与奖励函数1 (https://arxiv.org/html/2606.20087#S2.E1)相关的价值空间。生成了三个等高线图来分析基于不同动作参数的回报空间。在图2(a) (https://arxiv.org/html/2606.20087#S3.F2.sf1)中,激光功率保持恒定,显示了扫描速度和扫描间距对回报的影响。图2(b) (https://arxiv.org/html/2606.20087#S3.F2.sf2)固定了扫描速度,说明了激光功率与扫描间距之间的相互作用。最后,图2(c) (https://arxiv.org/html/2606.20087#S3.F2.sf3)展示了固定扫描间距下的回报空间,显示了激光功率和扫描速度的联合影响。这些图表全面展示了状态值如何塑造回报景观。

提供的图表显示,价值空间似乎具有平滑的拓扑结构,带有小的局部最小值。因此,找到全局最优解可能不需要高探索率,较低的探索水平可能就足够了。

接下来,我们将检查各种深度强化学习方法,从不同角度分析每种方法在特定特征方面的优缺点。

### III-B深度强化学习算法的特点

在本节中,我们分析四种选定的深度强化学习(DRL)算法的特点:Deep Q-Network(DQN)[19 (https://arxiv.org/html/2606.20087#bib.bib25)]、Twin Delayed Deep Deterministic Policy Gradient(TD3)[11 (https://arxiv.org/html/2606.20087#bib.bib26)]、Proximal Policy Optimization(PPO)[25 (https://arxiv.org/html/2606.20087#bib.bib27)]和Soft Actor-Critic(SAC)[13 (https://arxiv.org/html/2606.20087#bib.bib28)]。

强化学习中的离散动作空间降低了优化复杂性,但可能会忽略解空间中的细微差别。因此,我们还探索了连续强化学习方法,以确定哪种方法能提供更好的性能。

通过检查它们的探索-利用策略、策略类型和收敛行为,我们旨在为给定任务确定最合适的方法。

#### III-B1探索与利用

选定的算法采用了不同的策略来平衡探索和利用。DQN利用随时间衰减的 \(\epsilon\)-贪婪方法,逐渐从探索转向利用。相比之下,PPO使用裁剪目标来限制策略变化,在这两个方面之间取得平衡。SAC优化了最大熵,本质上促进了多样化的探索,同时关注高奖励,从而保持了动态平衡。

#### III-B2随机策略和确定性策略

算法也可以通过其策略来区分。DQN和TD3使用确定性策略;然而,DQN直接基于Q值近似选择动作,没有策略模型,而TD3在Actor-Critic框架内采用确定性策略。另一方面,PPO和SAC都采用随机

相似文章

多头注意力残差

Hugging Face Daily Papers

介绍了多头注意力残差(MHAR),它将路由查询重塑为逐子空间头,使每个特征子空间通过自己的 softmax 读取深度历史。在基于 Nemotron 的语料库上从头训练,MHAR 在 100M 到 1B 规模上相比标准 Transformer 持续改善验证损失,并提升训练中期的下游准确率。