错误驾驶:利用可解释性于端到端自动驾驶模型
摘要
本文介绍了一种基于概念的可解释性框架,用于端到端自动驾驶模型。该框架通过稀疏自编码器进行无监督字典学习,将驾驶行为分解为人类可解释的概念。该框架能够分析和针对性修正模型决策,从而提升整体驾驶性能。
arXiv:2607.06328v1 公告类型:新论文
摘要:端到端学习在自动驾驶中的日益普及带来了模型复杂性和不透明性的增加,增加了学习到不良或错误行为的风险。在本工作中,我们将无监督字典学习作为事后可解释性模块集成到最先进的驾驶模型中,将驾驶行为分解为具有语义意义的概念,同时展示这些概念对模型驾驶决策的因果影响。我们提出了一个逐步框架,从端到端模型中提取和解释有意义的概念,并将其与多方面的模型输出联系起来,从而揭示预测未来轨迹背后的决策逻辑。此外,在概念层面的针对性干预使我们能够操控和修正驾驶决策,从而在整体驾驶性能上带来可衡量的提升。因此,我们展示了如何有效利用可解释性来降低模型不透明性、发现错误行为并实现针对性缓解,最终提升模型性能。
查看缓存全文
缓存时间: 2026/07/08 04:39
# 错误驾驶方向:利用端到端自动驾驶模型的可解释性
来源:https://arxiv.org/html/2607.06328
Franz Motzkus, Sebastian Bernhard
Franz Motzkus 任职于德国 AUMOVIO 公司,以及德国班贝格大学应用计算机科学系。
###### 摘要
端到端学习在自动驾驶中的日益普及引入了模型复杂性和不透明性的增加,从而带来了学习到非期望或错误行为的风险。在这项工作中,我们将无监督字典学习作为一个事后可解释性模块集成到最先进的驾驶模型中,以将驾驶行为分解为语义上有意义的概念,同时展示它们对模型驾驶决策的因果影响。我们提出一个逐步框架,用于从端到端模型中提取和解释有意义的概念,并将它们与多层面的模型输出相连接,从而揭示未来轨迹预测背后的决策逻辑。此外,在概念层面的定向干预允许我们操纵和纠正驾驶决策,从而在整体驾驶性能上带来可衡量的改进。因此,我们展示了如何有效地利用可解释性来降低模型的不透明性,发现错误行为,并实现定向缓解,最终提升模型性能。
## I. 引言
端到端学习最近已成为自动驾驶系统的一种突出方法。与传统的模块化流水线(明确分离感知、预测和规划组件)不同,现代方法将多模态输入(包括摄像头记录和顶层指令)整合到统一的基于Transformer的架构中\[10 (https://arxiv.org/html/2607.06328#bib.bib27)\]。这些系统联合学习感知、时间推理和决策制定,在NAVSIM\[12 (https://arxiv.org/html/2607.06328#bib.bib44),9 (https://arxiv.org/html/2607.06328#bib.bib45)\]等开放循环基准上取得了最先进的性能。然而,这种架构上的统一是以降低透明度为代价的,因为模型复杂性增加,且之前允许模块级测试的清晰接口消失了。因此,内部决策制定变得越来越不透明,使得分析故障模式更加困难,并导致通过重复的数据整理和重新训练循环进行昂贵的错误调试,而这些循环主要基于最佳猜测。特别是在安全性和可解释性方面,端到端自动驾驶领域缺乏整体描述模型行为并提供对故障模式全面洞察的通用解决方案\[25 (https://arxiv.org/html/2607.06328#bib.bib9),3 (https://arxiv.org/html/2607.06328#bib.bib10)\]。
(请参考图注)
图 1: 将可解释性层集成到端到端自动驾驶模型中的框架架构
在这项工作中,我们通过引入一个基于概念的端到端自动驾驶可解释性框架来解决这一限制。我们的方法揭示了可解释的潜在空间分量,并将它们直接连接到轨迹级别的决策分数。具体来说,我们通过稀疏自编码器 (SAEs) 将字典学习整合到模型的特征空间中,将潜在激活分解为稀疏的、人类可解释的概念。这种分解没有将潜在空间视为一个不透明的复杂特征集合,而是提供了一种更透明的表示,其中单个概念对应于模型学到的有意义模式。因此,复杂的驾驶决策可以表示为语义上有意义的元素的组合,这些元素对预测的未来轨迹具有因果影响。这种基于概念的视角提供了对模型内部推理过程更可解释的观点,同时保留了自动驾驶所需的表示能力。
为了验证我们的方法,我们通过选择性地抑制单个潜在分量来进行概念级别的干预。我们证明,对与错误行为相关的概念进行干预,可以在下游驾驶指标(包括碰撞避免、可行驶区域和交通灯合规性)上带来可衡量的改进。这表明识别出的概念不仅仅是相关性的人为产物,而是模型决策制定中功能相关的组成部分。结果进一步展示了如何利用增强的可解释性进行有针对性的模型优化和改进整体性能。
我们的贡献如下:
1. 我们提出了第一个结构化和通用的方法,用于解释端到端自动驾驶模型中的驾驶决策,为单个候选轨迹的评分提供概念级别的解释。
2. 我们引入了一种基于概念的潜在表示分解方法,识别单个驾驶场景中最具影响力的因素,从而实现对模型决策的细粒度归因。
3. 我们在学习到的概念与轨迹的预测质量分数之间建立了直接对应关系,揭示了哪些概念在影响不同的驾驶行为,例如碰撞避免、交通灯合规性和前进。
4. 我们证明了识别出的概念可以用于有针对性的模型调整和操作,从而无需重新训练即可改进下游驾驶性能。
## II. 相关工作
### II-A 端到端自动驾驶
随着端到端学习范式在自动驾驶 AI 模型中的采用,从模仿学习到强化学习的多种不同方法已被引入\[10 (https://arxiv.org/html/2607.06328#bib.bib27)\]。*模仿学习*方法通过行为克隆从(人类)演示中训练,模仿真实驾驶记录中的真值专家驾驶决策。使用模仿学习的流行最先进模型包括 Hydra-MDP\[26 (https://arxiv.org/html/2607.06328#bib.bib25)\](在轨迹词汇表上评分)和 Emma\[21 (https://arxiv.org/html/2607.06328#bib.bib33)\](结合语言模型构建多模态预测器)。通常,它们输出带有估计质量分数的轨迹,训练目标是逼近真实世界记录中的真值轨迹。*强化学习*则通常在虚拟环境(如模拟器)中运行,模型与环境的交互基于奖励函数进行优化。然而,自动驾驶仿真与现实世界驾驶之间的差距仍然是一个基本问题。当前一组方法被称为离线强化学习,其中训练基于带有真值驾驶行为的记录,但模型生成的替代轨迹也可以被评估和优化\[12 (https://arxiv.org/html/2607.06328#bib.bib44)\]。通过生成场景中可能的后续步骤,环境交互的影响得以进一步增强\[9 (https://arxiv.org/html/2607.06328#bib.bib45)\]。这些模型通常预测带有估计的预测驾驶模型 (PDM) 分数的轨迹,该分数包含一个模仿分数和额外的惩罚分数,包括碰撞、可行驶区域和交通灯合规性,以及沿真值轨迹的前进程度。\[22 (https://arxiv.org/html/2607.06328#bib.bib35)\] 在一个预定义的轨迹字典上引入了概率评分。后来的方法调整 PDM 评分以用于轨迹质量评估。Hydra-MDP\[26 (https://arxiv.org/html/2607.06328#bib.bib25)\] 训练多个不同的轨迹头部,并在推理时从中选择,明确解决人类驾驶行为的多模态性,以提高在 PDM 评估协议下的鲁棒性。GTRS\[27 (https://arxiv.org/html/2607.06328#bib.bib24)\] 建立在 Hydra-MDP 模型之上,并通过扩散模型引入了一个额外的轨迹生成步骤。可能的轨迹不是固定的字典,而是迭代生成的。iPad\[17 (https://arxiv.org/html/2607.06328#bib.bib4)\] 从密集的 BEV 网格特征转向迭代的以提议为中心(proposal-centric)的范式。一组稀疏的、可学习的轨迹提议作为中心组织原则:其 ProFormer 编码器通过提议锚定的注意力(proposal-anchored attention)迭代地细化提议及其相关的 BEV 查询,将特征提取集中在规划相关区域。用于地图和碰撞预测的轻量级以提议为中心的辅助任务进一步提高了规划质量。
### II-B 端到端自动驾驶中的可解释性
虽然端到端训练模式与基于 AI 感知和基于规则规划的经典方法相比,极大地增加了所介绍模型的不透明性,但多种方法试图将可解释性纳入(部分)模型中\[3 (https://arxiv.org/html/2607.06328#bib.bib10)\]。*基于显著性的方法*\[6 (https://arxiv.org/html/2607.06328#bib.bib15),5 (https://arxiv.org/html/2607.06328#bib.bib16)\] 通过显著性图检查模型预测,使用基于梯度的归因(例如 GradCAM、Integrated Gradients)。这些方法因其简单性而被广泛使用,但仅限于识别模型在输入中关注的位置,无法解释模型内部学会了表示什么。特别是在自动驾驶中,多个因素影响驾驶决策,显著性图是有限的,因为它们只突出最显著的一个方面。*注意力可视化方法*利用模型内置的注意力机制来突出前视图\[24 (https://arxiv.org/html/2607.06328#bib.bib17),36 (https://arxiv.org/html/2607.06328#bib.bib18),29 (https://arxiv.org/html/2607.06328#bib.bib19),2 (https://arxiv.org/html/2607.06328#bib.bib6)\]或抽象鸟瞰图\[23 (https://arxiv.org/html/2607.06328#bib.bib5),18 (https://arxiv.org/html/2607.06328#bib.bib21)\]中最受关注的信息。另一项工作则优化模型本身,以在输入空间产生多样化的特征图\[31 (https://arxiv.org/html/2607.06328#bib.bib20)\]。
*潜在空间可解释性*:虽然注意力可视化揭示了高度关注的信息,但其他潜在空间可解释性方法很少应用于端到端自动驾驶模型。\[32 (https://arxiv.org/html/2607.06328#bib.bib1)\] 使用 LSTM 网络的潜在空间表示作为策略网络中预测驾驶动作的额外输入。\[38 (https://arxiv.org/html/2607.06328#bib.bib2)\] 引入了一个使用神经元覆盖率的测试框架,从而测试输入扰动对中间表示的影响。这两种方法都没有关注于使潜在空间更具可解释性。在\[19 (https://arxiv.org/html/2607.06328#bib.bib3)\] 中,一个端到端自动驾驶模型被专门设计为在感知、预测和规划之间具有可解释的中间表示,从而为可行驶区域、车道标记和交通参与者生成独立的场景表示。然而,潜在空间表示受到较多控制,需要使用专门引入的架构。
*视觉-语言模型和视觉-语言-动作模型 (VLM/VLA)* 代表了自动驾驶中一个新兴的研究方向\[40 (https://arxiv.org/html/2607.06328#bib.bib22),39 (https://arxiv.org/html/2607.06328#bib.bib23)\]。虽然这些方法为利用自动驾驶模型的可解释性开辟了有前景的方向,但在底层概念级别——通过该级别可以解耦和检查驾驶决策的不同方面——进行更深入的分析在很大程度上仍然缺失。据我们所知,目前还没有其他基于概念的端到端自动驾驶模型潜在空间可解释性方法存在。
## III. 预备知识
### III-A 稀疏自编码器学习
稀疏自编码器首先在语言模型中展示了提取可解释特征方向的能力\[37 (https://arxiv.org/html/2607.06328#bib.bib38)\],后来也被证明在视觉模型\[11 (https://arxiv.org/html/2607.06328#bib.bib48),28 (https://arxiv.org/html/2607.06328#bib.bib49)\]甚至轨迹预测\[33 (https://arxiv.org/html/2607.06328#bib.bib50)\]中很有用。AI 模型的潜在空间通常是高度纠缠的,单个神经元编码多个不相关的特征,使其不可解释。这种神经元的多语义性阻碍了对单个特征的机械理解\[13 (https://arxiv.org/html/2607.06328#bib.bib36)\],而机械理解旨在探究单个网络单元的功能。由于神经网络学到的特征通常多于其维度,这种叠加可以通过稀疏自编码器来解决\[7 (https://arxiv.org/html/2607.06328#bib.bib37)\]。通过扩展潜在空间同时强制稀疏表示,它们提供了一种原则性的方法,将纠缠的表示分解为对应于可解释的、单语义特征的线性方向,这些方向被称为概念。形式上,给定模型激活 \(x \in \mathbb{R}^d\),学习一个过完备字典 \(D \in \mathbb{R}^{d \times m}\),其中 \(m > d\),使得 \(x \approx Dz\),而 \(z \in \mathbb{R}^m\) 形成一个稀疏表示。SAEs 通过最小化激活向量 \(x\) 与其重构 \(DE(x)\) 之间的重构损失 \(\|x - DE(x)\|_2^2\) 来联合学习字典 \(D\) 和稀疏编码器 \(E: \mathbb{R}^d \to \mathbb{R}^m\)。为了实现潜在码 \(z\) 中的稀疏表示,应用诸如 \(\ell_1\) 正则化或仅保留 \(z\) 中前 \(k\) 个最高值的 top-\(k\) 激活等稀疏性目标\[20 (https://arxiv.org/html/2607.06328#bib.bib39),16 (https://arxiv.org/html/2607.06328#bib.bib40)\]。多项工作调整标准 SAE 训练方案以实现不同的特征分布。*Matryoshka* 训练\[8 (https://arxiv.org/html/2607.06328#bib.bib42)\] 建立在嵌套表示的思想上,其中潜在维度的子集定义了一系列逐步更具表现力的自编码器。给定一个潜在码 \(z \in \mathbb{R}^m\),其坐标对应 \(m\) 个潜在特征,我们考虑前缀 \(z_{1:m_1}, z_{1:m_2}, \dots, z_{1:m}\),其中 \(m_1 < m_2 < \dots < m\),并对每个前缀应用一个单独的损失函数。这不仅允许在不同粒度级别上提取特征,还可以在不同维度配置之间进行重用。
### III-B 端到端自动驾驶模型
作为我们实验的基础模型,我们使用 iPad\[17 (https://arxiv.org/html/2607.06328#bib.bib4)\] 模型,它代表了一种以提议为中心的端到端驾驶范式。该架构使用一组稀疏的、可学习的轨迹提议作为起点,并通过一个迭代的提议细化过程整合感知和预测特征。输入包括来自多个摄像头的图像和低分辨率的高清地图。在推理时,模型输出 \(H\) 个候选轨迹 \(\{\tau_h\}_{h=1}^H\),每个轨迹 \(\tau_h \in \mathbb{R}^{T \times 2}\) 带有关联的 PDM 分数 \(s_h \in \mathbb{R}^5\)。这些分数表示预测轨迹在五个驾驶指标上的评估:\(s_{\text{im}}\)(模仿得分)、\(s_{\text{col}}\)(碰撞得分)、\(s_{\text{dr}}\)(可行驶区域得分)、\(s_{\text{tl}}\)(交通灯得分)和 \(s_{\text{prog}}\)(前进得分)。每个分数 \(s_{h, k}\) 反映轨迹质量,其中 \(s_{h,k} = 1\) 表示完全符合所需行为,\(s_{h,k} = 0\) 表示失败。作为模型性能的代表,我们聚合所有 \(H\) 个轨迹的分数,以获得如 FDE 和碰撞率等指标(参见 IV-D 节)。由于模型不仅预测轨迹,还预测它们的 PDM 分数,因此可以在概念层面上对单个行为(例如碰撞避免或交通灯合规性)进行评估,我们旨在通过我们的可解释性框架将潜在空间表示与这些分数联系起来。相似文章
LIDAR-AD:一种用于自动驾驶的无解码器潜在交互Dreamer与动作残差链
LIDAR-AD提出了一种用于自动驾驶的无解码器潜在交互世界模型,通过减少冗余的潜在对齐和残差动作更新,改进了风险感知的状态抽象和长时域动态预测,在模拟和真实场景中优于基线世界模型。
揭示VLM可解释的故障模式
本文介绍了Revelio,这是一个通过搜索离散概念组合来系统性地发现视觉语言模型(VLM)中可解释故障模式的框架。应用于自动驾驶和室内机器人领域,它揭示了此前未报道的、可能导致碰撞或安全危险的漏洞。
不破坏的引导:基于机制的离散扩散语言模型干预
本文介绍了一种新颖的自适应调度器,用于利用稀疏自编码器引导离散扩散语言模型,结果表明,基于特定属性提交时机进行针对性干预,比均匀方法能提升控制质量和强度。
超越黑盒:智能体人工智能工具使用的可解释性
本文介绍了一种基于稀疏自编码器(SAE)和线性探针的机制可解释性工具包,用于在智能体调用工具之前监控模型内部状态,旨在提高企业工作流中的诊断能力和安全性。
面向部分可观测环境下自动驾驶的统一风险地图学习
提出了一种面向部分可观测环境的自动驾驶统一风险地图建模框架,该框架通过时空建模和基于扩散的场景生成,整合了交通流风险和碰撞风险。在Waymo Open Motion数据集上,该方法优于最先进的遮挡感知基线。