基于多智能体强化学习的空中走廊降级监视下的冲突解决
摘要
本文提出了一种基于深度Q网络的多智能体强化学习框架,用于在降级监视条件下运行的异构小型无人机和电动垂直起降飞机之间进行分散式冲突解决,并在90种交通密度和间隔阈值组合中评估策略。
arXiv:2607.20547v1 公告类型:新
摘要:安全的先进空中交通运行要求飞机在监视信息存在噪声、延迟、不完整或暂时不可用时保持间隔。本研究开发了一种基于深度Q网络的多智能体强化学习框架,用于在结构化三维走廊内运行的异构小型无人机和电动垂直起降飞机之间进行分散式冲突解决。针对这两类飞机分别训练策略,使用局部观察和包含保持航向、转弯、垂直机动、降落和速度控制的14动作空间。仿真中包含了飞机特定动力学、能量使用、走廊约束、观测噪声、通信延迟、信息丢失、风干扰、执行器不确定性和模型不确定性。在90种交通密度和最小间隔阈值的组合中评估训练后的策略。间隔丢失的频率和持续时间通常随交通密度和间隔要求而增加,尽管大多数事件在1秒内得到解决。在安全条件下,智能体大约79%的时间保持运动。在冲突期间,转弯占行动的33%,其次是保持运动占29%,速度控制占25%,垂直机动占13%。六种帕累托最优配置揭示了安全性与走廊容量之间的权衡。该框架支持在降级监视条件下对更安全的先进空中交通冲突解决策略进行基于仿真的评估。
查看缓存全文
缓存时间: 2026/07/24 05:11
# 降级监视条件下空中走廊冲突消解的多智能体强化学习方法 **来源:** https://arxiv.org/html/2607.20547 Esrat Farhana Dulia¹¹¹研究生助理,航空与工程学院,[email protected],Syed Arbab Mohd Shihab¹²²²助理教授,航空与工程学院,[email protected],Caleb Adams¹³³³研究生助理,航空与工程学院,[email protected],以及 Ruben Del Rosario¹⁴⁴⁴主任,先进空中交通中心,教授,航空与工程学院,[email protected] ###### 摘要 安全的高级空中交通运行要求航空器在监视信息存在噪声、延迟、不完整或暂时不可用时保持间隔。本研究开发了一种基于深度Q网络的多智能体强化学习框架,用于在结构化三维走廊内运行的异构小型无人机和电动垂直起降航空器之间进行分布式冲突消解。针对两类航空器,利用局部观测和包含保持航向、转弯、垂直机动、降落和速度控制的14维动作空间,分别训练了独立的策略。仿真中融入了航空器特定的动力学、能量消耗、走廊约束、观测噪声、通信延迟、信息丢失、风扰动、执行器不确定性及模型不确定性。训练后的策略在90种交通密度与最小间隔阈值的组合下进行了评估。丧失间隔的频率和持续时间通常随交通密度和间隔要求的增加而增加,但大多数事件在1秒内得以解决。在安全条件下,智能体约79%的时间保持其运动状态。冲突期间,转弯动作占33%,其次是保持运动占29%,速度控制占25%,垂直机动占13%。六种帕累托最优配置揭示了安全性与走廊容量之间的权衡。该框架支持在降级监视条件下对更安全的先进空中交通冲突消解策略进行基于仿真的评估。 ## 1 引言 ### 1.1 先进空中交通运行与降级监视 先进空中交通有望通过改善交通可达性、缩短出行时间、支持应急响应以及提供更可持续的出行服务,带来显著的经济、社会和环境效益[Dulia2021AAM, DelRosario2021Infrastructure, open_framework_standards, Calhoun2023OpenFramework]。为实现这些运行,学界已在先进空中交通生态系统的关键方面开展了大量研究,包括空中交通管理[FAA2020]、运行概念[thipphavong2018urban]、市场分析[hasan2018urban]、基础设施投资规划[dulia2024building, dulia2024negotiate]、运行规划[Dulia2025LowNoiseUAV, dulia2025dynamic]以及供应链规划[dulia2024integrated]。尽管取得这些进展,在降级监视条件下确保航空器安全间隔仍是大规模先进空中交通部署面临的重要挑战。 将这些航空器安全地整合到共享空域系统中,需要通信、导航、监视、自动化、信息交换和交通管理服务[faa2023uamconops, stouffer2020cns]。在这些服务中,监视至关重要,因为航空器需要关于附近交通的准确及时信息来估计相对运动、检测潜在冲突,并判断是否需要进行机动[kochenderfer2012acasx]。在正常运行条件下,此类信息预期来自地面和机载监视源的组合。信息交换中心预期将收集到的数据进行整合、处理并分发给航空器和交通管理服务[dulia2024surveillance]。通过结合多个来源的信息,监视系统预期能提供更广泛的覆盖范围和更完整的航空器位置、速度、航向及轨迹估计。 这种监视支持水平将依赖于地面传感器、通信链路、信息交换中心、电力系统及其他支撑基础设施的持续运行。这些组件的故障或中断会降低地面交通信息的可用性和可靠性。当地面信息变得有限或不可用时,航空器将需要更加依赖机载监视来观测附近交通。然而,机载传感器提供的局部视野更为受限,并受到测量误差、有限感知范围、视线遮挡、环境条件、信号干扰、通信延迟、信息丢失、漏检、虚警以及传感器特定精度限制的影响。因此,地面系统中断与机载传感器不确定性的结合,会降低航空器可获取的监视信息的准确性、及时性、完整性和可用性[dulia20263r, dulia2024surveillance, hespanha2007networked, sinopoli2004kalman]。 在这种降级监视环境中,航空器可能接收到不准确的位置估计、过时的运动信息、不完整的周围交通观测,甚至在遭遇的部分时段内完全没有观测。这些限制可能导致错误的间隔估计,减少可供反应的时间,并妨碍及时的冲突检测[sinopoli2004kalman, zhang2020robustdrl, agarwal2021delayedobservations]。因此,当监视信息不确定、延迟、不完整或暂时不可用时,机载冲突消解能力对于支持安全机动是必要的。 ### 1.2 多航空器冲突消解 除了监视限制外,先进空中交通中的冲突消解还因异构航空器的存在而复杂化。小型无人机和电动垂直起降航空器具有不同的速度、高度范围、机动能力、任务需求和能量限制[thipphavong2018uam, bauranov2021airspace]。当这些航空器在同一运输网络中运行时,其运行差异会影响冲突发展的速度、可用的反应时间以及能安全执行的机动动作。因此,保持安全运行需要足够的间隔、定义明确的运行区域以及对周围交通的及时响应[kuchar2000review]。当多架航空器同时相互作用时,问题变得更加复杂,因为冲突消解并非每架航空器独立的决策。一架航空器选择的机动动作会改变其相对于附近交通的相对位置和运动,并可能减少其他航空器可用的机动选择[lai2021multiagent, brittain2021autonomous]。因此,解决一次遭遇的行动可能会引发新的冲突,加剧另一遭遇,或将冲突转移给邻近航空器。 在降级监视条件下,这些相互作用更难管理,因为每架航空器必须利用不确定、延迟、不完整或暂时不可用的信息来协调其响应。有效的局部决策因此必须同时考虑当前冲突以及每次机动对多架周围航空器的影响。 ### 1.3 研究目标与贡献 为应对这些挑战,本研究开发了一种基于深度Q网络的多智能体强化学习模型,用于降级监视环境下的分布式冲突消解。小型无人机和电动垂直起降航空器被表示为结构化三维仿真环境中的自主智能体,该环境包含独立高度层、定向交通流、巡航车道和超车道。仿真环境在不同航空器密度和最小间隔阈值下生成交通场景。每个智能体观测自身的运行状态以及关于附近航空器的可用信息,并选择一个离散机动动作。降级监视通过观测噪声、通信延迟、信息丢失以及邻居信息不可用来表示。模型还融入了风扰动、执行器不确定性、模型不确定性、航空器特定运动约束、走廊边界、最小间隔要求以及依赖机动的能量消耗。 为无人机和电动垂直起降智能体分别训练了独立的深度Q网络策略,以考虑它们在速度、高度层、机动限制和能量特性方面的差异。智能体被训练用以保持安全间隔、避免碰撞、保持在走廊内、遵循指定交通方向以及减少不必要的机动。训练后的策略在生成的交通场景中进行评估,以检查安全性能以及在安全和丧失间隔状态下使用保持、速度控制、转弯和垂直动作的情况。该模型提供了在监视信息不准确、延迟、不完整或不可用时航空器层面的冲突消解能力。结果有助于评估航空器密度、间隔要求以及降级观测如何影响先进空中交通运行中的冲突消解性能。 ## 2 文献综述 航空器冲突检测与消解传统上通过几何方法、基于规则的逻辑、速度障碍技术、优化模型、力场方法以及马尔可夫决策过程形式化来处理[kuchar2000review, fiorini1998velocity, kochenderfer2012acasx]。这些方法通过识别潜在冲突并确定合适的规避机动,为间隔保障奠定了基础。然而,其中许多方法依赖于准确的交通信息、预定义的遭遇规则或集中式协调。它们在密集的多航空器环境中的应用变得更加困难,因为一架航空器选择的机动会立即改变周围航空器的相对运动和可用响应。 为了在冲突发生前减少冲突,多项研究侧重于战略轨迹规划。Dai等人[dai2021conflictfree]开发了一种考虑静态和动态空域冲突的四维路径规划方法,而Tang等人[tang2021automated]提出了一种用于高密度城市空中交通运行的自动化飞行规划框架。这些方法可以减少规划中的冲突并改善交通组织。然而,当航空器偏离规划轨迹,或当不确定的运行条件在起飞后改变遭遇时,战术性的机载冲突消解仍然是必需的。 强化学习提供了一种不同的方法,允许航空器通过与仿真环境的反复交互来学习机动选择策略。Mnih等人[mnih2015dqn]引入的深度Q网络通过神经网络、经验回放和目标网络,将Q学习扩展到高维观测和离散动作空间。多智能体强化学习将此过程扩展到多个智能体同时决策的环境。这与航空器冲突消解相关,因为一架航空器的行为会影响附近航空器的观测、风险和可用动作。同时,多智能体强化学习引入了非平稳性,因为一个智能体观测到的环境会随着其他智能体策略的演变而变化[lowe2017multiagent]。 基于这些发展,多项研究将多智能体强化学习应用于航空器间隔与冲突管理。Brittain等人[brittain2021autonomous]开发了一种深度多智能体强化学习模型,用于高密度随机空域中的自主间隔保障,并表明分布式策略可以在无需集中控制器持续战术干预的情况下支持冲突消解。他们后来的分布式框架处理涉及可变数量航空器(而非固定的成对结构)的遭遇[brittain2021onetoany]。Isufaj等人[isufaj2022multi]使用图卷积强化学习进行多无人机冲突消解,并证明多航空器冲突并不能总是分解为独立的成对遭遇。Huang等人[huang2023strategic]开发了一种循环多智能体强化学习模型,用于不确定性下城市空中交通运行中的战略冲突管理,而Deniz和Wang[deniz2024autonomous]将深度多智能体强化学习应用于三维空域中电动垂直起降航空器之间的自主冲突消解。Deniz和Wang[deniz2024coordination]的一项相关研究考察了结构化高密度先进空中交通运行中的航空器协调。这些研究共同证明了多智能体强化学习在多个航空器做出相互依赖决策的环境中的潜力。 其他基于学习的研究考察了利用局部可用观测的分布式控制。Waltz等人[waltz2024selforganized]开发了一种自组织的电动垂直起降进场系统,其中每架航空器遵循共享策略并利用局部信息选择动作。他们的仿真还检验了对传感器噪声和变化的进场交通模式的鲁棒性。这项工作支持了在完整全局交通信息不可用时的分布式决策,尽管其侧重于进场管理,与结构化走廊内的航路冲突消解有所不同。 除了学习方法,运行空域的设计直接影响冲突频率和消解复杂度。结构化空域概念利用走廊、航路、高度层和定向交通流来组织低空运行。Thipphavong等人[thipphavong2018uam]将结构化程序和交通管理概念确定为城市空中交通运行的重要组成部分。Bauranov和Rakas[bauranov2021airspace]综述了基于走廊、高度层、扇区和航路的空域设计,而Doole等人[doole2021constrained]考察了大规模无人机运行的垂直和水平交通组织。结构的影响随着交通需求的增加而变得更加重要。Wang等人[wang2021trafficassignment]表明,密集的城市空中交通运行需要能够考虑网络组织和拥堵的交通分配方法。他们的发现表明,空域设计影响交通需求的集中位置以及可能发生冲突的地点。类似地,Taye等人[taye2024safe]提出了一种实时轨迹规划框架,可根据交通状况的变化更新航空器轨迹。这些研究支持使用结构化走廊来评估车道合规性、交通交互以及战术性冲突消解动作。 即使在有组织的空域内,冲突消解的有效性也取决于航空器可获得的监视信息质量。Sinopoli等人[sinopoli2004kalman]展示了间歇性观测如何影响不可靠通信信道上的状态估计,而Hespanha等人[hespanha2007networked]考察了网络化控制系统中通信延迟和数据包丢失的影响。在扰动或延迟观测下的强化学习研究也表明,测量误差和陈旧信息可能导致糟糕的动作选择[zhang2020robustdrl, ramstedt2021randomdelays, agarwal2021delayedobservations]。这个问题与先进空中交通直接相关,因为冲突检测既取决于跟踪质量,也取决于遭遇几何。Dai等人...
相似文章
基于强化学习的时延容忍网络中无人机飞行与机会路由联合优化
本文提出了JUROR,一种基于强化学习的框架,在集中训练与分散执行的模式下,联合优化时延容忍网络中的无人机飞行路径和分散式机会路由。
基于分层冲突感知观测的滑行路径规划值分解强化学习框架
本文介绍了 CaTR,这是一个用于实时多机滑行道路径规划的值分解强化学习框架,它利用分层前瞻性交通表示来平衡安全性与效率。
面向行人行为不确定性的安全自动驾驶的多智能体强化学习
本文提出了一种多智能体强化学习框架,该框架同时训练自动驾驶车辆和具有个性驱动乱穿马路行为的行人,与单智能体方法相比,碰撞率降低了30%,并展示了更真实的交互场景。
可扩展的约束多智能体强化学习:通过状态增强与一致性实现可分离动力学
本文提出了一种分布式方法,用于约束多智能体强化学习,该方法采用状态增强策略学习和对偶变量上的邻居间一致性,以在满足全局资源约束的同时实现智能体数量线性扩展。在智能电网需求响应上的实验表明,一致性协调对可行性至关重要:与集中式训练方法不同,它能够扩展到数千个智能体。
基于约束流形控制的安全且可泛化的分层多智能体强化学习
本文提出了一种分层多智能体强化学习框架,该框架通过低层的约束流形强制执行硬安全约束,同时通过高层策略学习实现有效协调,提供了理论上的安全保障,并实现了近乎完美的安全率和良好的泛化能力。