大气再入期间航天器姿态控制的深度强化学习
摘要
本文探讨了深度强化学习在航天器高超声速再入期间姿态控制中的应用。研究表明,最先进的强化学习和混合控制器能够优于采用增益调度的传统PID控制器,尤其是在使用动力学随机化来增强鲁棒性和泛化能力时。
arXiv:2606.31291v1 公告类型:新
摘要: 深度强化学习通过更有效地处理非线性动力学、不确定性和故障情况,相比传统姿态控制方法,具有更自适应、更精确、更鲁棒地解决姿态控制问题的潜力。我们探索了强化学习在航天器再入姿态控制中的应用。一个带有增益调度的行业标准比例-积分-微分控制器作为无模型强化学习和结合这两种方法的混合控制器的强基线。我们在强化学习框架中形式化了该应用,以应用连续、离策略强化学习。最先进的强化学习在该领域达到了与传统控制方法相当的性能。然而,其分布外泛化能力不足。因此,我们使用动力学随机化在训练过程中引入具有挑战性的任务变化,并在预定义的操作包络内强制泛化。最后,我们通过应用特定指标评估获得的最佳基于强化学习的控制器,以显示其在操作包络内相比传统控制器的优越性能,即混合控制器能够更好地跟踪攻角,并且在质量、惯性张量和襟翼执行器带宽变化下具有更强的鲁棒性。
查看缓存全文
缓存时间: 2026/07/01 05:35
# 深度强化学习在航天器再入大气层姿态控制中的应用 来源: https://arxiv.org/html/2606.31291 深度强化学习在航天器再入大气层姿态控制中的应用 Alexander Fabisch, Melvin Laux, Mariela De Lucas Álvarez, Edoardo Caroselli, Julian Theis **关键词:** 姿态控制,航天器再入,连续无模型强化学习,任务调度,分布外泛化 **摘要** 深度强化学习通过更有效地处理非线性动力学、不确定性和故障情况,相比传统姿态控制方法,有潜力以更自适应、更精确和更鲁棒的方式解决姿态控制问题。我们探索了强化学习(RL)在航天器再入姿态控制中的应用。一个采用增益调度的工业标准比例-积分-微分控制器作为无模型RL和结合这两种方法的混合控制器的强基线。我们在RL框架中将该应用形式化,以应用连续的离策略RL。最先进的RL在该领域达到了与传统控制方法相当的性能。然而,其分布外泛化能力不足。因此,我们使用动力学随机化在训练过程中引入具有挑战性的任务变化,并在预定义的操作包络内强制泛化。最后,我们使用应用特定指标评估获得的最佳基于RL的控制器,以显示其在操作包络内相比传统控制器的优越性能,即混合控制器能够更好地跟踪攻角,并且在质量、惯性张量和襟翼执行器带宽变化下更加鲁棒。 **贡献** 1. 我们将用于连续控制的最先进深度强化学习算法应用于航天器高超音速再入过程中的姿态控制问题。这是一个需要针对变化的大气条件进行增益调度的挑战性跟踪问题。我们设计了一个简单有效的用于姿态控制的奖励函数,并发现MR.Q在没有任务特定调整的情况下表现出色。 **背景:** 我们应用现有的强化学习算法(例如,MR.Q (fujimoto2025_mrq))。在该应用领域中,存在使用较早算法、评估不够全面或奖励函数更复杂的先前工作(例如,elkins_adaptive_2020)。 2. 尽管最佳学习控制器在标称条件下表现优于行业标准基线控制器,我们探索了将基线控制器与强化学习相结合的混合控制架构,并将其与纯强化学习进行比较,以增强分布外泛化能力。 **背景:** liu_attitude_2022 提出了一个类似的混合控制器,将强化学习集成到传统控制器中。与这项工作相比,我们使用最先进的算法,并明确研究了学习控制器的泛化性和鲁棒性。 3. 为了明确提高鲁棒性和泛化能力,我们比较了动态随机化和任务调度方法在该姿态控制问题中的强化学习应用,并确定了最佳训练策略。我们发现,与基线控制器相比,所得策略显著提高了鲁棒性。 **背景:** 均匀动态随机化已成功用于机器人的各种应用(Antonova2017; Peng2018; Tan2018; OpenAI2020)。在深度强化学习(Cho2024)和上下文策略搜索(Fabisch2014)的背景下也已经提出了任务调度方法。 ###### 摘要 深度强化学习通过更有效地处理非线性动力学、不确定性和故障情况,相比传统姿态控制方法,有潜力以更自适应、更精确和更鲁棒的方式解决姿态控制问题。我们探索了强化学习(RL)在航天器再入姿态控制中的应用。一个采用增益调度的工业标准比例-积分-微分控制器作为无模型RL和结合这两种方法的混合控制器的强基线。我们在RL框架中将该应用形式化,以应用连续的离策略RL。最先进的RL在该领域达到了与传统控制方法相当的性能。然而,其分布外泛化能力不足。因此,我们使用动力学随机化在训练过程中引入具有挑战性的任务变化,并在预定义的操作包络内强制泛化。最后,我们使用应用特定指标评估获得的最佳基于RL的控制器,以显示其在操作包络内相比传统控制器的优越性能,即混合控制器能够更好地跟踪攻角,并且在质量、惯性张量和襟翼执行器带宽变化下更加鲁棒。 ## 1 引言 [图1:高超音速再入飞行器示意图] 用于连续控制的深度强化学习(例如,lillicrap_continuous_2019)有潜力更容易地处理非线性动力学和故障情况,并且相比其他姿态控制方法(参见,例如,elkins_autonomous_2020; bernini_reinforcement_2024; liu_attitude_2022)对不可预见条件更具鲁棒性和适应性。然而,将RL引入安全关键的姿态控制系统,需要对空间级软件的验证与确认(V&V)进行根本性转变。传统的制导、导航和控制的V&V依赖于确定性和可形式验证的控制律,例如比例-积分-微分(PID)控制器。对于这些控制律,系统的行为可以通过形式化分析和明确定义的极端情况的详尽模拟进行审计。深度RL的核心挑战在于分布外泛化和学习策略的不透明性。它是一个黑箱,使得在整个状态空间和参数包络内形式化证明其稳定性和性能变得不可行。虽然可解释人工智能在推进深度RL决策过程的透明度方面取得了进展(Li2025; Goel2025; Luss2023),但其在安全关键控制应用中的集成尚未完全建立。我们提出使用混合控制设计(例如,残差RL,Johannink2019)来缓解黑箱问题。我们专门讨论如图1所示的高超音速再入飞行器的姿态控制。这类航天器将人员和货物从太空返回,因此是未来载人航天、行星探索以及建立地外资源开采经济(例如月球采矿)的关键技术。我们一方面尝试用RL替代经典控制工程,减少专家的工作量,另一方面尝试将PID控制与基于RL的控制相结合,形成一种更有效处理环境动力学和故障情况下的挑战性变化的混合控制器。我们比较了三种不同类型的控制器。(1) 基线控制器:先前的解决方案是一个PID控制器……
相似文章
面向对抗性航天器接近操作中自适应安全关键控制的记忆高效元强化学习
本文研究了记忆高效元强化学习架构在对抗性航天器接近操作中用于自适应安全关键控制的性能,发现与LSTM和GRU相比,使用PPO的状态空间模型(如Mamba)在任务完成度、安全性和燃料节约方面表现更优。
面向轨迹跟踪的预期强化学习
本文提出了一种预测性深度强化学习公式,通过将未来参考视界加入状态空间,实现轨迹跟踪的预期控制。仿真结果显示误差显著降低,但零样本迁移到物理硬件时暴露了仿真与现实的差距。
利用学习到的机载风估计的模拟大气湍流中小型四旋翼的风感知强化学习控制
本文提出了一种两阶段学习流水线,使用注意力增强的门控循环网络从机载运动学中估计风速,然后利用该估计值在强化学习控制器中提升四旋翼在湍流风下的轨迹跟踪性能,相比基线将跟踪误差降低了48%。
物理信息神经网络在单自由度直升机系统安全强化学习中的应用
本文作为一项进展中研究,提出将可微物理模型嵌入PPO策略损失函数,以惩罚强化学习中预期的安全违规行为,并在模拟的单自由度直升机系统上进行评估。物理信息软正则化在保持可靠目标跟踪的同时,显著减少了约束违反。
预测潜在世界模型的闭环性能:LunarLander中非马尔可夫奖励下MPC和基于模型的强化学习的离线检查点选择
本文通过提出离线诊断方法来解决基于模型的强化学习中的目标失配问题,以预测潜在世界模型的闭环性能。在LunarLander-v3上,奖励可观性分数(ROF)和复合分数(CROF)能够选择出生成强大MPC和基于模型的强化学习策略的检查点,同时大幅减少与真实环境的交互次数。