通过Transformer揭示UTM安全关键场景
摘要
本研究论文提出了一种基于Transformer的强化学习框架,用于自动生成无人交通管理(UTM)系统的安全关键测试场景,在漏洞发现效率上比专家引导测试提高了8倍。
arXiv:2606.31114v1 Announce Type: new
摘要:无人交通管理(UTM)系统是基于云计算的平台,旨在远程管理和协调多架飞行器。UTM系统是安全关键的,不能容忍碰撞或相撞等故障。为了揭示潜在漏洞,既没有最优的故障暴露演示,也没有明确的奖励信号。此外,UTM的自愈能力引入了关键故障的“长尾效应”。我们提议将UTM漏洞发现建模为一个适合基于Transformer的RL架构的序列建模问题。我们的方法利用注意力机制直接建模系统状态之间的关系,并预测最优动作。我们的框架引入了一个Policy Model来生成目标测试场景,以及一个Action Sampler来强制执行领域约束。我们使用基于风险的奖励函数来指导探索。通过一项700小时模拟研究的广泛评估,我们证明与专家引导测试相比,漏洞发现效率提高了8倍。它还发现了传统方法遗漏的关键边缘案例。
查看缓存全文
缓存时间: 2026/07/01 05:37
# 揭示 UTM 安全关键场景的 Transformer 方法 来源:https://arxiv.org/html/2606.31114 胡泽堂 清华大学 & Bill Zeng¹ ¹冒烟测试指对UTM系统进行基本功能测试,通常在新构建或版本发布后作为初始测试执行。美团 & 王超² 清华大学 & 施振鹏² 清华大学 & 张倩 美团 & 丁文博 清华大学 通讯作者:[email protected] (https://arxiv.org/html/2606.31114v1/[email protected]) ###### 摘要 无人机交通管理(UTM)系统是基于云的平台,用于远程管理和协调多架飞行器。UTM 系统是安全关键的,不能容忍诸如碰撞或坠毁等失效。为了揭示潜在漏洞,既不存在最优的失效暴露演示,也没有明确的奖励信号。此外,UTM 的自愈能力引入了关键失效的“长尾效应”。我们提出将 UTM 漏洞发现建模为一个序列建模问题,可采用基于 Transformer 的强化学习架构。我们的方法利用注意力机制直接建模系统状态之间的关系,并预测最优动作。该框架包含一个策略模型(生成有针对性的测试场景)和一个动作采样器(施加领域约束)。我们使用基于风险的奖励函数来引导探索。通过 700 小时仿真研究的广泛评估,我们展示了相比专家引导测试,漏洞发现效率提升了 8 倍。该方法还发现了传统方法遗漏的关键边缘案例。 *关键词*:无人机交通管理 · 安全关键测试 · 决策 Transformer · 离线强化学习 · 场景生成 ## 1 引言 低空经济的快速兴起要求建立稳健的无人机交通管理(UTM)系统(FAA, 2023 (https://arxiv.org/html/2606.31114#bib.bib97))。UTM 在航空器间执行集中交通管控。UTM 中的大部分系统失效是不可容忍的,例如坠毁、碰撞、空域违规(Kopardekar, 2014 (https://arxiv.org/html/2606.31114#bib.bib100); Kopardekar 等人, 2016 (https://arxiv.org/html/2606.31114#bib.bib88)),因此,在 UTM 迭代和部署过程中发现潜在的漏洞场景至关重要。在此语境下,场景被定义为由 UTM 系统管理的智能体的运行轨迹片段和环境信息(Tian 等人, 2022 (https://arxiv.org/html/2606.31114#bib.bib50); Zhong 等人, 2021 (https://arxiv.org/html/2606.31114#bib.bib40))。 参见图注 Figure 1: 被测系统(SUT)在无人机系统交通管理(UTM)中的运行环境概览。 UTM 系统在城市、郊区和农村等多种环境中运行。每种环境都带来不同的挑战,例如城市地区的高密度空中交通和农村地区有限的基础设施,需要强大的管理和协调策略。在这些多样化场景中快速检测故障对于维护安全、防止实际部署中的灾难性失效至关重要。 UTM 具备自愈功能(L. Gladence 等人, 2021 (https://arxiv.org/html/2606.31114#bib.bib61))。该功能有助于自动防止系统失效。然而,这给测试带来了挑战。大多数历史数据仅包含安全的运行轨迹。由此引入了“长尾效应”的挑战。此外,这些边缘案例往往源于微妙的多智能体运行时交互(Wedad Alawad 等人, 2023 (https://arxiv.org/html/2606.31114#bib.bib63)),而非简单的组件失效,因此缺乏最优演示或明确的奖励信号。为解决这些挑战,我们将 UTM 漏洞发现重新表述为一个序列建模问题,适用于基于现代 Transformer 的强化学习架构(Chen 等人, 2021 (https://arxiv.org/html/2606.31114#bib.bib1)),详见第 3.5 节。我们的方法利用 Transformer 强大的注意力机制(Vaswani 等人, 2017 (https://arxiv.org/html/2606.31114#bib.bib45))在隐空间中直接建模系统状态、动作(异常扰动)与结果之间的关系(Lee 等人, 2022 (https://arxiv.org/html/2606.31114#bib.bib14)),并直接预测动作。这使得我们能够生成有针对性的测试场景,同时避免分布障碍(Fu 等人, 2024 (https://arxiv.org/html/2606.31114#bib.bib30))和专家演示数据短缺的问题(Bhargava 等人, 2023a (https://arxiv.org/html/2606.31114#bib.bib116))。我们的框架包含两个关键组件:策略模型(PM)学习基于历史运行数据和实时系统状态生成有针对性的测试场景;动作采样器(AS)施加领域约束以确保物理合理性。PM 通过其注意力机制捕获复杂的时间依赖性和智能体间交互,从而识别可能导致系统漏洞的模式。我们在一个大型仿真环境中评估该方法,跨越 700 小时的测试,涵盖多种运行场景。结果表明,与专家引导利用相比,我们的框架在漏洞发现上实现了超过 8 倍的效率提升,同时发现了传统方法未能检测到的关键边缘案例。这一测试效率和效果的显著提升展示了基于 Transformer 的方法在通过智能场景生成加固关键任务系统方面的潜力。 ## 2 相关工作 ### 2.1 关键任务系统测试 测试自主系统,特别是在复杂动态环境中运行的 UTM 系统和自动驾驶车辆,需要在多样且具有挑战性的场景下进行全面评估。尽管这些领域在具体应用上可能不同,但它们在场景生成方面面临共同的挑战:需要高效探索庞大的参数空间、识别安全关键案例并保持场景的合理性。在自动驾驶场景生成领域,研究者提出了多种方法来生成具有挑战性的测试场景。O’Kelly 等人 (2019 (https://arxiv.org/html/2606.31114#bib.bib109)) 提出了一种基于 GAIL 和交叉熵采样的稀有事件仿真的可扩展测试框架。Ding 等人 (2020 (https://arxiv.org/html/2606.31114#bib.bib106)) 将场景生成形式化为强化学习问题,提出了一种自适应编辑框架,通过顺序编辑操作(例如添加或修改智能体)构建安全关键场景。在其后续工作中,Ding 等人 (2024 (https://arxiv.org/html/2606.31114#bib.bib107)) 进一步探索了检索增强生成(RAG)方法,通过检索和组合现有场景的特征来生成新场景,实现了更好的可控性。Liu 等人 (2024 (https://arxiv.org/html/2606.31114#bib.bib108)) 提出了一种基于强化学习的编辑框架,支持更灵活的场景构建。 ### 2.2 基于强化学习的场景生成 从历史数据中学习生成合理的轨迹是行为预测和场景生成的基础。逆强化学习(IRL)的早期工作(Ng 和 Russell, 2000 (https://arxiv.org/html/2606.31114#bib.bib114))旨在从专家演示中恢复潜在的奖励函数,其中最大熵逆强化学习(Ziebart 等人, 2008 (https://arxiv.org/html/2606.31114#bib.bib115))提供了一个概率框架,解决了专家行为模糊性的问题。为扩展到高维问题,GAIL (Ho 和 Ermon, 2016 (https://arxiv.org/html/2606.31114#bib.bib112)) 及其变体如 AIRL (Fu 等人, 2018 (https://arxiv.org/html/2606.31114#bib.bib111)) 采用对抗训练,通过显式恢复奖励来直接学习策略。最近,基于 Transformer 的方法通过将序列决策制定重新表述为序列建模问题,展示了有前景的结果。Decision Transformer (Chen 等人, 2021 (https://arxiv.org/html/2606.31114#bib.bib1)) 表明,通过以期望回报为条件的自回归预测可以实现轨迹生成,而 Trajectory Transformer (Janner 等人, 2021 (https://arxiv.org/html/2606.31114#bib.bib113)) 将状态和动作都视为统一序列模型中的标记。这些方法提供了不同的轨迹建模视角:IRL 方法侧重于理解底层决策制定过程(Arora 和 Doshi, 2020 (https://arxiv.org/html/2606.31114#bib.bib110)),而基于 Transformer 的方法利用注意力机制捕获行为模式中的长程依赖关系。它们的互补优势表明,结合两种框架可以更有效地进行轨迹和场景生成。在本工作中,我们混合了 IRL 中学习世界特征而非专家行为的创新思想,以及 Transformer 架构在隐空间中的能力,以拓展 UTM 测试场景生成的边界。 ## 3 问题分析 ### 3.1 UTM 特性 UTM 是一个确保多架无人机在共享空域中安全高效运行的系统(Kopardekar, 2014 (https://arxiv.org/html/2606.31114#bib.bib100)),无需人类空中交通管制员直接管理每架无人机。详细概念进一步见附录 A。UTM 系统需要同时处理多架无人机的高维数据输入,以及碰撞检测和航线优化。现代 UTM 漏洞发现的目标要求主动生成触发失效的序列。然而,学习必须从一个以安全轨迹为主的数据集出发,其中仅包含零星且可能次优的失效示例。这带来了独特的不平衡学习挑战。给定 N 架无人机,UTM 系统根据其内部协议演化,生成运行轨迹 \(\boldsymbol{\tau}=\{\mathbf{s}_t,\mathbf{a}_t\}_{t=1}^T\),其中每个状态 \(\mathbf{s}_t=\{\mathbf{o}_i^t\}_{i=1}^N\) 封装了包括无人机状态在内的系统观测,每个动作 \(\mathbf{a}_t=\{a_i^t\}_{i=1}^N\) 表示通过经典压力测试方法周期性注入的异常信号。令 \(\mathcal{P}_{\text{safe}}\) 表示正常运行分布,\(\mathcal{P}_{\text{crit}}\) 表示关键失效分布。由于其内置的自愈功能,被测 UTM 系统通常保持 \(\mathbb{P}(\boldsymbol{\tau}\in\mathcal{P}_{\text{safe}})\gg\mathbb{P}(\boldsymbol{\tau}\in\mathcal{P}_{\text{crit}})\)。 ### 3.2 场景定义 在 UTM 运行环境中,我们将场景定义为系统轨迹的一个有限片段,它捕获了受管实体的时间演化和空间交互。形式上,场景 \(\xi\) 可以表示为轨迹 \(\boldsymbol{\tau}\) 中状态-动作对的子序列,即 \(\xi=\{\mathbf{s}_t,\mathbf{a}_t\}_{t=k}^{k+\Delta}\),其中 \(k\) 表示起始时间步,\(\Delta\) 表示场景持续时间。 ### 3.3 UTM 场景发现:马尔可夫决策过程 对于场景生成,存在三种主要的先前方法:基于策略的动态演化(O’Kelly 等人, 2019 (https://arxiv.org/html/2606.31114#bib.bib109))、基于迭代的编辑(Ding 等人, 2020 (https://arxiv.org/html/2606.31114#bib.bib106); Liu 等人, 2024 (https://arxiv.org/html/2606.31114#bib.bib108))和基于模板的一次生成(Ding 等人, 2024 (https://arxiv.org/html/2606.31114#bib.bib107))。每种方法都有其独特优势:动态演化方法产生自然的交互但控制有限,迭代编辑提供精确的场景控制但可能导致机械的生成过程,而基于模板的方法在生成效率与多样性之间进行权衡。鉴于 UTM 系统的时不变特性,状态转换自然形成一个马尔可夫决策过程(MDP)。状态之间的转换动力学尤其值得研究。在此框架下,诱导漏洞的场景发现可以形式化为一个 MDP \(\mathcal{M}=(\mathcal{S},\mathcal{A},\mathcal{P},r,\gamma)\),其中状态空间 \(\mathcal{S}\) 捕获系统配置,动作空间 \(\mathcal{A}\) 表示可能的扰动,\(\mathcal{P}\) 表示转换动力学,\(r\) 是奖励函数,\(\gamma\) 是折扣因子。然而,这种形式化带来了源于 UTM 系统特征和技术约束的独特挑战。首先,UTM 系统的集中式特性引入了高维状态空间,包含了多架无人机之间复杂的相互依赖关系。系统的复杂性因需要在管理局部交互的同时保持全局一致性而进一步加剧,导致可能场景的组合爆炸。此外,场景发现的技术内禀性引入了额外的挑战。关键场景的分布呈现出显著的长尾效应,诱导漏洞的状态仅占据状态空间的一小部分,即 \(\mathbb{P}(\mathbf{s}\in\mathcal{S}_{\text{crit}})\ll\mathbb{P}(\mathbf{s}\in\mathcal{S}_{\text{safe}})\)。这种分布不平衡因关键场景中缺乏专家行为数据而加剧,因为大多数运行数据来自安全系统状态。因此,传统的模仿学习方法或直接的策略优化方法对于有效的场景发现变得不足。该 MDP 中的转换动力学 \(\mathcal{P}\) 需要不仅捕获系统的物理演化,还要捕获进入关键场景的概率。正式地,对于任何状态 \(\mathbf{s}_t\) 和动作 \(\mathbf{a}_t\),我们定义转换概率为: \[ \mathcal{P}(\mathbf{s}_{t+1}|\mathbf{s}_t,\mathbf{a}_t)=\begin{cases} p_{\text{safe}}(\mathbf{s}_{t+1}|\mathbf{s}_t,\mathbf{a}_t) & \text{if }\mathbf{s}_{t+1}\in\mathcal{S}_{\text{safe}}\\ p_{\text{crit}}(\mathbf{s}_{t+1}|\mathbf{s}_t,\mathbf{a}_t) & \text{if }\mathbf{s}_{t+1}\in\mathcal{S}_{\text{crit}} \end{cases} \tag{1} \] 其中 \(p_{\text{safe}}\) 和 \(p_{\text{crit}}\) 分别表示安全区域和关键区域中的转换动力学。 ### 3.4 强化学习形式化 在我们的漏洞发现任务中,诱导系统不稳定的场景被赋予更高的奖励,引导探索朝向潜在的失效模式。形式化
相似文章
基于强化学习的智能体Transformer可证明地学会搜索
本文从理论上研究了基于Transformer的策略如何从随机树环境中的强化学习训练动态中获得搜索能力。研究表明,一个双头Transformer可以实现深度优先搜索,并且在深度分阶段课程下,这种机制会自然地从稀疏奖励信号中涌现。
基于真实世界故障记录的自动驾驶系统测试场景生成
本文提出了一种模块化的LLM流水线,利用历史故障记录(例如NHTSA碰撞数据)生成多样化的自动驾驶系统测试场景,从而在有限的测试预算内实现有效的故障发现。
Transformer Transformer: 面向运动条件机器人协同设计的统一模型
Transformer Transformer是一种统一模型,能够根据给定的操作演示生成优化的完整机器人本体,该模型使用在RoboTokens和Dynamics Self-Guidance上训练的扩散变换器。
GRU、LSTM和Transformer编码器在自动驾驶系统分类中的敏感性分析
本文评估了GRU、LSTM和Transformer编码器模型在基于车辆远程信息处理数据对2级自动驾驶系统进行分类时的性能,并引入了一个模拟真实数据损坏的鲁棒性评估框架。
Transformer语言模型中情境建模与心理化的发育轨迹
本文研究了Transformer语言模型在不同训练阶段中情境建模与心理化能力的涌现,发现错误信念任务的表现依赖于模型大小和训练量,在预训练后期才出现,并且在非事实性动词下表现出脆弱性。