GRU、LSTM和Transformer编码器在自动驾驶系统分类中的敏感性分析

arXiv cs.LG 论文

摘要

本文评估了GRU、LSTM和Transformer编码器模型在基于车辆远程信息处理数据对2级自动驾驶系统进行分类时的性能,并引入了一个模拟真实数据损坏的鲁棒性评估框架。

arXiv:2607.28665v1 公告类型:新 摘要:自动驾驶系统(ADS)正变得无处不在。未来的软件定义汽车(SDV)可能能够运行多个自动驾驶系统,包括原生的和售后市场的,例如Comma.ai的Openpilot。独立验证哪个自动驾驶系统处于活动状态的监控系统对于安全监控、法规合规、保险评估和异常检测至关重要。在本文中,我们首先评估了三种基于序列的分类模型的有效性:门控循环单元(GRU)、长短期记忆(LSTM)网络和Transformer编码器模型,仅使用车辆远程信息处理数据来识别2级自动驾驶系统:Comma Openpilot、Tesla Autopilot、Cadillac Super Cruise以及手动驾驶。在干净数据上训练时,所有三个模型都实现了强大的干净数据性能,宏F1分数分别为0.92(GRU)、0.90(LSTM)和0.93(Transformer编码器模型);威胁匹配训练产生的宏F1为0.904-0.916,仅有轻微的干净数据损失。其次,我们引入了一个模块化的鲁棒性评估框架,通过五个严重级别(L1-L5)的五种损坏类型来模拟真实的远程信息处理降级。连续通道使用带有累积漂移的加性高斯白噪声、相关跨通道噪声和时间抖动进行扰动。二元事件信号会受到突发丢失、延迟转换、虚假切换以及由通信错误引起的跨特征不一致性的影响。鲁棒性使用宏F1来衡量,宏F1对每个类别赋予相同的权重,适用于不平衡的多分类评估。我们的评估揭示了明显的故障模式差异:事件级损坏仅使宏F1略有下降(在L5时大于等于0.87),而时间抖动使GRU、LSTM和Transformer编码器模型的宏F1降至0.44-0.50。
查看原文
查看缓存全文

缓存时间: 2026/08/03 07:30

# GRU、LSTM 与 Transformer 编码器在自动驾驶系统分类中的敏感性分析
来源:https://arxiv.org/html/2607.28665

###### 摘要

自动驾驶系统(\(ADSs\))正变得越来越普遍。未来的软件定义汽车(\(SDVs\))可能能够运行多个自动驾驶系统,既有原生系统,也有后装系统,例如 Comma.ai 的 Openpilot。独立验证哪个自动驾驶系统处于活动状态的监控系统,对于安全监控、法规合规、保险评估和异常检测至关重要。

本文首先评估了三种基于序列的分类模型——门控循环单元(GRU)、长短期记忆(LSTM)网络和 Transformer 编码器模型——在仅使用车辆遥测数据识别 L2 级自动驾驶系统方面的有效性:Comma Openpilot、Tesla Autopilot 和 Cadillac Super Cruise,以及人工驾驶。在干净数据上训练时,所有三种模型在干净数据上均表现优异,宏 F1 分数分别为 0.92(GRU)、0.90(LSTM)和 0.93(Transformer 编码器模型);威胁匹配训练可达到 0.904–0.916 的宏 F1,仅带来微小的干净数据性能损失。其次,我们引入了一个模块化鲁棒性评估框架,通过五个严重程度级别(L1L1–L5L5)的五类扰动族来模拟真实的遥测数据退化。连续通道使用带有累积漂移的加性高斯白噪声、相关跨通道噪声和时间抖动进行扰动。二进制事件信号则受到突发丢失、延迟转换、虚假切换以及由通信错误启发的跨特征不一致性的影响。鲁棒性使用宏 F1 度量,该指标对每个类别赋予相同权重,适用于不平衡的多分类评估。我们的评估揭示了明显的失效模式分化:事件级扰动仅使宏 F1 轻微下降(在 L5L5 时 ≥\geq0.87),而时间抖动则使 GRU、LSTM 和 Transformer 编码器模型的宏 F1 骤降至 0.44–0.50。

## I. 引言

自动驾驶和半自动驾驶车辆的快速部署导致了自动驾驶系统(\(ADSs\))的日益多样化,每个系统都实现了不同的控制算法、传感器融合流水线和决策策略。Tesla Autopilot[1](https://arxiv.org/html/2607.28665#bib.bib1) 和 Cadillac Super Cruise[2](https://arxiv.org/html/2607.28665#bib.bib2) 等商用系统依赖于专有软件栈,而 Comma.ai 的 Openpilot[3](https://arxiv.org/html/2607.28665#bib.bib3) 等后装解决方案进一步增加了公共道路上软件异构性。尽管当今大多数广泛部署的系统运行在 SAE L2 级(部分自动驾驶),但更高级别的自动驾驶正开始出现[4](https://arxiv.org/html/2607.28665#bib.bib4),导致控制行为显著不同的车辆共享同一驾驶环境。

在软件定义汽车中,多个自动驾驶系统可能共存并被动态激活,依赖系统自我报告的状态是不够的,因为无法假设对 OEM 软件的信任。即使在监管和网络安全合规制度下,软件也可能发生故障、被攻破或故意歪曲其运行状态。一个众所周知的例子是大众汽车“柴油门”丑闻[5](https://arxiv.org/html/2607.28665#bib.bib5),其中发动机控制软件被明确设计为检测实验室测试条件并改变其行为以通过监管检查,同时在真实驾驶中违反排放限值。最近的分析,包括“10 Years of Dieselgate”报告[20](https://arxiv.org/html/2607.28665#bib.bib20),表明类似形式的测试检测和行为操纵仍在各制造商中持续存在。这些发现表明,OEM 软件可能表现出偏离预期运行的调节行为,凸显了独立、基于行为的监控而不是依赖内部软件声明的必要性。

在自动驾驶的背景下,一个自动驾驶系统可能错误报告其是否处于活动状态、是否在其预期设计域内运行,或因故障或网络攻击而退化。这种错误报告——无论是意外的还是对抗性的——都会对安全、责任认定和监管执行构成风险。因此,基于可观测车辆行为的独立验证变得至关重要。车辆遥测数据捕获转向、制动和加速等控制动作,为这种验证提供了实用基础,而无需访问专有软件或传感器。

在本工作中,我们基于先前的工作[9](https://arxiv.org/html/2607.28665#bib.bib9) 研究了基于深度学习的序列模型,仅使用车辆遥测数据对自动驾驶系统进行分类。我们评估了三种代表性的时间模型:门控循环单元(GRU)[6](https://arxiv.org/html/2607.28665#bib.bib6)、长短期记忆网络(LSTM)[7](https://arxiv.org/html/2607.28665#bib.bib7) 和 Transformer 编码器模型[8](https://arxiv.org/html/2607.28665#bib.bib8)。GRU 擅长建模短期时间依赖,LSTM 擅长长期时间依赖,而 Transformer 编码器模型则利用自注意力来捕获驾驶行为中的局部和长距离模式。我们系统比较了这些模型在多个自动驾驶系统平台上的分类性能。

除了分类准确性之外,在现实操作条件下的鲁棒性对于实际部署至关重要。由于传感器噪声、校准漂移、时间对齐误差、通信延迟、数据包丢失以及分布式车辆子系统引入的不一致性,车辆传感器数据本质上是有噪声的。为解决这一局限性,本文引入了一个模块化鲁棒性评估框架,系统性地将自然遥测数据扰动注入对自动驾驶系统分类贡献最大的连续和基于事件的车辆信号中。

所提出的框架使用加性高斯白噪声(AWGN)、随机漂移过程、相关跨通道扰动和时间抖动来模拟连续传感器退化。此外,通过受通信启发的扰动机制引入事件级扰动,包括突发丢失、延迟状态转换、虚假二进制切换以及逻辑相关信号之间的跨特征不一致性。扰动严重程度逐步增加,以评估序列模型在日益不利的操作条件下如何退化。来自[9](https://arxiv.org/html/2607.28665#bib.bib9) 的超过 340 万个标记样本上的实验结果表明,所有模型的干净数据准确率保持在 90% 以上,但鲁棒性主要取决于扰动类型,而非模型本身。Transformer 编码器模型在干净数据上保持微小优势,但如果没有额外机制,任何模型都无法对时间抖动具有鲁棒性。

据我们所知,这是第一项针对基于遥测数据的自动驾驶系统分类引入结构化鲁棒性基准的研究,该基准涵盖了不同严重程度级别下的连续信号扰动和二进制事件扰动。我们表明,尽管所有模型在干净分类性能上都表现强劲,但时间抖动是主要的失效模式,揭示了当前序列模型在自动驾驶系统识别方面的关键局限性。

本文的其余部分组织如下。第二部分回顾相关工作;第三部分描述方法和数据集;第四部分呈现实验结果;第五部分总结全文。

## II. 相关工作

近年来,受车辆传感器、机器学习和自动驾驶软件进步的推动,自动驾驶系统(\(ADSs\))的研究快速增长。现有工作大多集中在理解人类驾驶行为、驾驶员识别或系统级性能上。然而,很少有研究关注在真实世界条件下运行的不同自动驾驶系统的分类。此外,这些模型在传感器噪声下的鲁棒性在很大程度上尚未被探索。

Saleh 等人[10](https://arxiv.org/html/2607.28665#bib.bib10) 提出了一种堆叠长短期记忆(LSTM)模型,使用智能手机传感器将人类驾驶行为分类为正常、激进和昏睡三类,F1 分数达到 91%。然而,他们的方法仅限于智能手机传感器数据,没有结合基于车辆的遥测数据。

Girma 等人[11](https://arxiv.org/html/2607.28665#bib.bib11) 开发了一种基于 LSTM 的驾驶员识别模型,使用车辆遥测特征。他们将 LSTM 的性能与随机森林、决策树和全连接神经网络进行了比较,表明即使在噪声条件下 LSTM 也能保持 88% 以上的准确率,而其他模型则降至 40% 以下。然而,他们的研究没有进行特征选择,使用了全部 51 个可用特征,这表明他们没有关注最小化特征数量。同样,他们对数据集的随机子集施加噪声,使得结果难以解释。

Carvalho 等人[12](https://arxiv.org/html/2607.28665#bib.bib12) 评估了简单循环神经网络(RNNs)、LSTM 和门控循环单元(GRUs)在基于加速度计数据的驾驶员行为画像中的性能。他们的结果表明,GRU 在分类七种驾驶事件(包括激进制动、转弯和变道)中取得了最高准确率。然而,数据集非常有限,仅包含来自四次约 13 分钟驾驶行程的 69 个样本,这限制了其研究结果的普适性。

Guo 和 Hansen[13](https://arxiv.org/html/2607.28665#bib.bib13) 证明,基于 Transformer 编码器的模型在将驾驶行为分类为正常、激进和昏睡类别方面可以优于 LSTM 和 GRU,F1 分数达到 97%。然而,他们的研究受限于少于 10,000 个样本的小型数据集。

Shrestha 等人[9](https://arxiv.org/html/2607.28665#bib.bib9) 表明,GRU 模型不仅能够对人类驾驶行为进行分类,还能区分不同的自动驾驶系统(包括人类驾驶员),F1 分数超过 90%。然而,他们的研究没有评估模型在传感器噪声下的鲁棒性,而这对于遥测数据往往不完美的实际部署至关重要。

这些研究凸显了深度学习模型在驾驶系统分类中的潜力,但也揭示了关键空白:数据集规模小、跨多个自动驾驶系统平台的评估有限,以及缺乏鲁棒性测试。我们的工作通过将 LSTM、GRU 和 Transformer 编码器模型应用于跨越多种驾驶场景的 340 万个样本的大型数据集,并在不断增加的噪声和传感器扰动水平下评估模型性能,来解决这些局限性。

## III. 方法论

### III-A. 问题定义

我们将自动驾驶系统识别定义为仅使用车辆遥测数据的四类序列分类问题。令 \(x_t \in \mathbb{R}^{11}\) 表示时刻 \(t\) 的特征向量,并令 \(X_t = [x_{t-T+1}, \ldots, x_t] \in \mathbb{R}^{T \times 11}\) 是一个固定长度的时间窗口,其中 \(T=32\)。模型预测 \(y_t \in \{0,1,2,3\}\),分别对应 Comma Openpilot、人工驾驶、Tesla Autopilot 和 Cadillac Super Cruise。

### III-B. 数据集与特征

我们使用来自[9](https://arxiv.org/html/2607.28665#bib.bib9) 的遥测数据集,该数据集源自 Comma 数据集[14](https://arxiv.org/html/2607.28665#bib.bib14)、Cadillac 数据集[15](https://arxiv.org/html/2607.28665#bib.bib15) 和 Tesla 数据集[16](https://arxiv.org/html/2607.28665#bib.bib16)。最终数据集包含 11 个特征:六个连续通道 `vEgo`、`aEgo`、`gas`、`yawRate`、`steeringAngleDeg`、`steeringRateDeg`,以及五个二进制事件通道 `standstill`、`brakeLightsDEPRECATED`、`leftBlinker`、`rightBlinker`、`brakePressed`。类别标签编码为 0(Comma Openpilot)、1(人工驾驶)、2(Tesla Autopilot)和 3(Cadillac Super Cruise)。我们使用分层划分,70% 训练、15% 验证和 15% 测试,固定种子为 42。

### III-C. 分类模型

我们在一个共同的多分类框架下评估三种序列学习架构。GRU 模型由六个堆叠的 GRU 层组成,隐藏大小为 64,随后是一个线性分类器,应用于最后一个时间步的表示。LSTM 模型使用相同的整体结构,由六个堆叠的 LSTM 层组成,隐藏大小为 64,并具有相同的最后时间步分类头。Transformer 编码器模型首先将 11 维输入特征投影到 256 维嵌入空间,在 32 步输入窗口上添加可学习的位置嵌入,然后使用八个注意力头的六个 Transformer 编码器块处理序列。最后一个时间步的表示被传递给线性分类器进行四类预测。对于干净数据性能分析,所有模型均使用 Adam 优化器训练,批量大小为 256,学习率为 0.0001,最大训练轮数为 100。基于验证损失应用耐心为 7 的早停。为了解决类别不平衡问题,根据训练标签计算类别权重,并将其纳入交叉熵损失中。大多数超参数选自常用默认值,未进行广泛的超参数调优。我们评估了多个序列长度(4、8、16、32 和 64)以及学习率(0.01、0.001 和 0.0001)。基于验证性能,我们选择了 32 时间步输入窗口和学习率 0.0001,尽管这些设置可能不是全局最优的。

### III-D. 噪声模型

[表 I](https://arxiv.org/html/2607.28665#S3.T1) 总结了我们的鲁棒性框架中使用的遥测扰动族。这些扰动旨在表示真实车辆遥测流中观察到的连续信号退化和二进制事件级故障。

表 I:用于鲁棒性评估的噪声模型
每个扰动族在五个严重程度级别(L1L1 到 L5L5)下进行评估,其中尺度因子 \(s=L/5\)。L1L1 表示轻微扰动,L5L5 表示最强扰动。在每个扰动族内,参数大小随严重程度单调增加。我们使用特定于扰动族的严重程度映射,而不是单一的共享数值强度,因为扰动族以不同的单位和机制运行;这为所有扰动族提供了可比较的语义难度(从轻微到严重)。

### III-E. 在噪声增强数据集上训练模型

为了提高对分布外遥测数据的鲁棒性,我们在训练过程中使用了一种与评估匹配的增强策略,即有意让模型在训练时暴露于在评估时将会遇到的同类扰动。对于每个批次,以 0.85 的概率应用扰动;当应用时,选择一个扰动族,其严重程度从 L1L1 到 L3L3 均匀采样。

### III-F. 基准测试协议与指标

我们对每个模型在以下数据上进行评估:(i)干净测试数据,以及(ii)覆盖所有扰动族和严重程度(L1–L5)(L1–L5)的完整扰动基准。对于鲁棒性实验,我们报告宏 F1 作为主要指标,它赋予每个类别相同权重,因此适用于不平衡的多分类评估。该基准使我们能够不仅衡量整体鲁棒性。

相似文章

通过Transformer揭示UTM安全关键场景

arXiv cs.AI

本研究论文提出了一种基于Transformer的强化学习框架,用于自动生成无人交通管理(UTM)系统的安全关键测试场景,在漏洞发现效率上比专家引导测试提高了8倍。