物理信息神经网络在单自由度直升机系统安全强化学习中的应用
摘要
本文作为一项进展中研究,提出将可微物理模型嵌入PPO策略损失函数,以惩罚强化学习中预期的安全违规行为,并在模拟的单自由度直升机系统上进行评估。物理信息软正则化在保持可靠目标跟踪的同时,显著减少了约束违反。
arXiv:2607.03125v1 公告类型:新
摘要:深度强化学习(DRL)为工业信息物理系统(ICPS)提供了强大的控制能力,但其“黑箱”探索过程可能违反严格的硬件安全限制。通常,这些约束通过复杂的奖励塑造来管理。在这篇进展中研究中,我们直接将可微物理模型嵌入近端策略优化(PPO)的策略损失函数。通过在训练过程中模拟短时域的未来轨迹,策略会因预期安全违规而受到惩罚,且该惩罚独立于任务奖励信号。在具有严格俯仰约束的模拟单自由度直升机测试平台上进行评估,我们的物理信息软正则化在保持可靠目标跟踪的同时,显著减少了约束违反。
查看缓存全文
缓存时间: 2026/07/07 04:41
# 将物理信息神经网络集成到安全强化学习中用于单自由度直升机系统 来源:https://arxiv.org/html/2607.03125 RL - 强化学习 PPO - 近端策略优化 DRL - 深度强化学习 MDP - 马尔可夫决策过程 MPC - 模型预测控制 1-DoF - 单自由度 LQR - 线性二次型调节器 LQI - 线性二次型积分调节器 LTI - 线性时不变 SB3 - Stable Baselines3 TRPO - 信任区域策略优化 ICPS - 工业信息物理系统 CPS - 信息物理系统 PID - 比例-积分-微分 PINN - 物理信息神经网络 CMDP - 约束马尔可夫决策过程 CBF - 控制障碍函数 RK4 - 四阶龙格-库塔法 ODE - 常微分方程 ReLU - 修正线性单元 11institutetext:约瑟夫·雷塞尔智能与安全工业自动化中心,萨尔茨堡应用科学大学,奥地利萨尔茨堡 22institutetext:巴黎·洛德隆萨尔茨堡大学,奥地利萨尔茨堡 22email:[email protected] ###### 摘要 深度强化学习\(DRL\)为工业信息物理系统\(ICPS\)提供了强大的控制能力,但其“黑箱”探索机制可能违反严格的硬件安全限制。通常,这些约束通过复杂的奖励塑形来管理。在这篇进行中的工作中,我们将一个可微分的物理模型直接嵌入到近端策略优化\(PPO\)的Actor损失函数中。通过在训练过程中模拟短时域的未来轨迹,策略会因预期安全违规而受到惩罚,且这一惩罚独立于任务奖励信号。在具有严格俯仰约束的模拟单自由度直升机测试平台上评估,我们的物理信息软正则化在保持可靠目标跟踪的同时,显著减少了约束违规次数。 ## 1 引言 ICPS将物理过程与计算控制相结合,支撑着现代制造和智能生产。RL在优化这些复杂环境方面已显示出显著成功,提供了在数学建模困难场景下的数据驱动解决方案[4](https://arxiv.org/html/2607.03125#bib.bib5)。然而,标准强化学习(RL)的一个主要限制是其“黑箱”探索策略,这可能导致现实机电系统中不可逆的硬件损坏。目标系统是Quanser Aero 2^1,这是一个适合通过驱动两个转子来控制横杆角度θ的机电实验室测试平台,详见[7](https://arxiv.org/html/2607.03125#bib.bib29)。传统上,RL中的安全约束完全编码在奖励定义中,导致复杂且脆弱的奖励塑形[3](https://arxiv.org/html/2607.03125#bib.bib7)。其他安全RL范式依赖于约束马尔可夫决策过程(CMDP)[1](https://arxiv.org/html/2607.03125#bib.bib1)、控制障碍函数(CBF)[2](https://arxiv.org/html/2607.03125#bib.bib2)或离线模型预测控制(MPC)投影[9](https://arxiv.org/html/2607.03125#bib.bib48)。为了实现具有前瞻性且计算开销不大的安全控制,我们提出将可微分物理模型直接嵌入到近端策略优化(PPO)算法的损失函数中。该方法通过可微分仿真[6](https://arxiv.org/html/2607.03125#bib.bib3)惩罚预测的未来违规,从而在安全约束条件下调节Actor网络。这项进行中工作的科学价值在于展示了与主要任务奖励信号解耦的约束满足性,为安全RL部署提供了可扩展的机制。 ## 2 方法论 我们的基础算法是PPO[11](https://arxiv.org/html/2607.03125#bib.bib4),因其性能稳定且支持连续动作空间而被选用。为了嵌入物理预见性,系统动力学通过描述Quanser Aero 2的已知微分方程进行建模。我们通过自回归展开机制集成物理信息神经网络(PINN)。该双路径架构(同时在环境中评估动作以获得任务奖励,并在可微分物理模型中评估动作以实现安全约束)的概述如图1所示。 s_t Actor π_θ 物理模型 (RK4) 环境 安全性损失 L_Safety PPO损失 L_PPO Σ x_t a_t a_t θ^(1...H) r_t, s_{t+1} ⋅ λ 组合梯度反向传播 图1: 架构概述:动作同时在环境和可微分物理模型中进行评估。任务目标损失(L_PPO)和前瞻性安全惩罚(L_Safety,由λ缩放)组合成总损失,其梯度反向传播以更新策略。 - • **前瞻时域**:我们预测未来0.3秒(10 Hz下3步)。这平衡了捕捉系统惯性的需求与长期仿真的计算成本。 - • **系统动力学 vs. RL观测**:对于每个时间步t,我们将智能体的完整观测状态s_t与用于安全预测的物理状态x_t区分开来。当PPO智能体观测增强状态[8](https://arxiv.org/html/2607.03125#bib.bib64)时,可微分物理模型严格隔离单自由度(1-DoF) Quanser Aero 2系统状态:x = [θ, θ̇, ω_0, ω_1]^T(俯仰角、俯仰角速度、内部电机角速度)。我们使用这些核心变量在PyTorch中原生初始化非线性连续时间动力学ẋ = f(x, u)。训练期间,x_t作为特权信息直接从模拟器中提取,并使用预测状态作为输入,对当前策略进行动作采样。 - • **数值积分**:我们采用四阶龙格-库塔(RK4)积分方法,每个环境步执行5个微步,确保准确的轨迹仿真。 **安全约束定义**:为严格测试该机制,我们施加人工俯仰角度限制±30°。同时训练智能体跟踪±40°的目标信号。虽然这与标准操作相矛盾,但这种极端配置有效展示了算法在任务奖励最大化前提下优先保证安全边界的能力。 **损失修正**:标准PPO Actor损失通过从可微分物理模型导出的安全惩罚进行增强,形式为 L = L_PPO + λ ⋅ L_Safety,其中λ为权重因子。由于数值RK4积分完全由可追踪的张量运算构建,计算图记录了每个仿真步骤。因此,通过链式法则,来自预期安全违规的梯度通过展开的微分方程反向传播到Actor网络。为计算L_Safety,我们在预测时域H=3步内展开系统动力学。令θ^(h)表示通过可微分RK4积分器仿真的第h个时域步的预测俯仰角。安全惩罚充当软正则化器,依赖修正线性单元(ReLU)严格惩罚当绝对预测俯仰角超过预定义安全极限θ_max=30°时的策略。归一化安全损失定义为: L_Safety = (1/H) * Σ_{h=1}^H max(0, |θ^(h)| / θ_max - 1) (1) 由于该公式完全由可微分张量运算组成,所得梯度能将预期的未来约束违规正确映射回Actor网络当前的行动分布。 ## 3 实验设置与结果 我们在模拟的Quanser Aero 2系统上评估我们的方法,采用1-DoF配置。底层系统动力学和基础RL问题公式已在先前研究中建立[7](https://arxiv.org/html/2607.03125#bib.bib29),环境通过标准Gym API框架使用Python-Simulink接口[10](https://arxiv.org/html/2607.03125#bib.bib28)访问。我们测试了三种主要配置,每种运行10个随机种子以确保统计显著性: - *朴素基线* (λ=0), - *PINN平衡* (λ=150), - *PINN过度惩罚* (λ=1000)。 惩罚权重λ凭经验选择;所有10个种子的严格统计评估和λ帕累托扫描留待未来工作。 **训练稳定性**:所有配置均成功收敛。我们观察到,由于目标冲突(跟踪40°目标与停在30°),更高λ配置的值损失自然增加,但策略损失在所有配置中保持相当。 **性能权衡与安全性**:评估结果(见图2)突出了目标跟踪与约束满足之间的明确权衡。*朴素基线*通过准确跟踪40°目标获得高任务奖励,但严重违反了30°安全阈值。*PINN过度惩罚*模型表现出很少的安全违规,但总体跟踪迟缓,即使在安全区域内也无法动态适应。*PINN平衡*配置展示了λ的合适选择。它积极跟踪参考信号,并大致学会了减速以尊重30°阈值。尽管在突然、极端的设定点变化期间仍可能发生短暂的瞬态违规,但与基线相比,它大幅减少了预测和实际的俯仰违规。 参见图注 图2: 仿真评估剖面展示了目标跟踪与约束满足之间的权衡。*朴素基线*忽略30°安全阈值,*PINN过度惩罚*难以跟踪信号,而*PINN平衡*成功遵守约束,同时保持强大的跟踪性能。 ## 4 结论与未来工作 在这篇进行中的工作中,我们证明了将可微分物理模型嵌入到PPO Actor损失函数中,为工业信息物理系统(ICPS)提供了一种可扩展且有效的软前瞻性安全正则化机制。该方法实现了前瞻性约束满足,并减轻了对复杂、任务特定奖励塑形的需求。正在进行和未来的研究将重点将经过PINN训练的智能体直接从仿真转移到物理Quanser Aero 2硬件上。除了零样本迁移,我们计划直接在真实硬件上进行进一步微调以缩小仿真与现实差距。由于此阶段依赖静态常微分方程(ODE)模型可能会引入系统误差,这种微调应与主动参数识别相结合。基于我们近期关于该测试平台参数识别方法的工作[5](https://arxiv.org/html/2607.03125#bib.bib65),我们计划动态更新可微分物理模型的参数以匹配观测到的真实世界轨迹。最后,我们旨在用反应性安全机制(如安全屏蔽或CBF)补充我们的前瞻性训练损失,该机制充当实时执行过滤器。预测性损失在训练期间平滑地引导策略走向安全行为,而反应性架构约束将在部署期间直接干预,如果前向仿真预测到即将发生的俯仰违规,则立即覆盖提议的动作。 ### 致谢。 本研究得到克里斯蒂安·多普勒研究协会(CDG)通过约瑟夫·雷塞尔智能与安全工业自动化中心、相应的萨尔茨堡州WISS合作项目以及欧洲Interreg项目BA0100172 AI4GREEN的财政支持。在准备本工作期间,作者使用了AI工具进行语言编辑和格式协助。 ## 参考文献 - [1] E. Altman (2021) 约束马尔可夫决策过程。Routledge。引用自:§1 (https://arxiv.org/html/2607.03125#S1.p1.1)。 - [2] A. D. Ames, S. Coogan, M. Egerstedt, G. Notomista, K. Sreenath, and P. Tabuada (2019) 控制障碍函数:理论与应用。载于《2019年第18届欧洲控制会议(ECC)》,第3420–3431页。引用自:§1 (https://arxiv.org/html/2607.03125#S1.p1.1)。 - [3] J. Garcıa and F. Fernández (2015) 安全强化学习综述。《机器学习研究杂志》16(1),第1437–1480页。引用自:§1 (https://arxiv.org/html/2607.03125#S1.p1.1)。 - [4] J. Kober, J. A. Bagnell, and J. Peters (2013) 机器人强化学习综述。《国际机器人研究杂志》32(11),第1238–1274页。引用自:§1 (https://arxiv.org/html/2607.03125#S1.p1.1)。 - [5] J. Langschwert, G. Schäfer, J. Rehrl, S. Huber, and S. Hirlaender (2026) 用于机电系统参数识别最优实验设计的强化学习。载于《数据库与专家系统应用——DEXA 2026研讨会》,计算机与信息科学通信系列,奥地利格拉茨。注:已投稿。引用自:§4 (https://arxiv.org/html/2607.03125#S4.p1.1)。 - [6] M. Raissi, P. Perdikaris, and G. E. Karniadakis (2019) 物理信息神经网络:用于求解涉及非线性偏微分方程的正反问题的深度学习框架。《计算物理学杂志》378,第686–707页。引用自:§1 (https://arxiv.org/html/2607.03125#S1.p1.1)。 - [7] G. Schäfer, J. Rehrl, S. Huber, and S. Hirlaender (2024-08) 模
相似文章
具有可学习损失平衡和迁移学习的物理信息神经网络
本文提出了一种自监督物理信息神经网络(PINN)框架,该框架通过可学习的混合神经元自适应地平衡基于物理和数据驱动的损失,并结合迁移学习以提高数据稀缺情况下的效率。该框架在仅有87个数据点的液态金属微型散热器CFD数据上进行了验证,误差低于8%。
CSPO:面向安全强化学习的约束敏感策略优化
本文提出约束敏感策略优化(CSPO),一种用于安全强化学习的一阶原始-对偶方法,该方法融合局部约束灵敏度以改善安全恢复并减少安全边界附近的振荡,在导航和运动基准上实现了更高的约束回报。
面向对抗性航天器接近操作中自适应安全关键控制的记忆高效元强化学习
本文研究了记忆高效元强化学习架构在对抗性航天器接近操作中用于自适应安全关键控制的性能,发现与LSTM和GRU相比,使用PPO的状态空间模型(如Mamba)在任务完成度、安全性和燃料节约方面表现更优。
利用学习到的机载风估计的模拟大气湍流中小型四旋翼的风感知强化学习控制
本文提出了一种两阶段学习流水线,使用注意力增强的门控循环网络从机载运动学中估计风速,然后利用该估计值在强化学习控制器中提升四旋翼在湍流风下的轨迹跟踪性能,相比基线将跟踪误差降低了48%。
面向轨迹跟踪的预期强化学习
本文提出了一种预测性深度强化学习公式,通过将未来参考视界加入状态空间,实现轨迹跟踪的预期控制。仿真结果显示误差显著降低,但零样本迁移到物理硬件时暴露了仿真与现实的差距。