当共享回放在防御性驾驶评估中失败:NAVSIM 评分基础审计
摘要
本文对NAVSIM v2.2的防御性驾驶评分进行了审计,表明共享的参考条件化宽恕规则与数值不稳定性相结合,可能导致无视交通参与者的探针得分高于人类重放,从而削弱基准测试的有效性。
arXiv:2608.04896v1 公告类型:新论文
摘要:防御性驾驶得分只有在能够区分观察周围交通参与者的策略与不观察的策略时才有用。重模拟基准测试可能使用参考条件化宽恕,即当记录的人类参考在合规通道中失败时,智能体仍可获得信用。当智能体与参考共享不稳定的回放变换时,该规则可能将共享参考失败扩散为广泛的合规信用。
我们针对NAVSIM v2.2原始场景单阶段评分审计了该风险。在受影响的文档化堆栈条件下,于审计所用数值后端上,忽略全部的路线无关探针和路线感知的交通参与者无关探针在完整12,146个令牌的navtest划分中得分均高于人类重放和PDM-Closed。按照公开规范的全新安装可在固定的32令牌诊断集上重现回放发散。同源依赖堆栈对照和精确输入诊断将依赖敏感性的数值行为隔离在共享速度重拟合中。在450令牌对照池上,仅替换求解器即可消除回放发散并恢复盲探针垫底的排序,同时保持宽恕机制开启。因此,数值不稳定性是直接触发因素。参考条件化宽恕将由此产生的共享参考失败传播为合规信用。我们贡献了一项审计协议,要求在使用此类分数进行防御性驾驶声明之前,披露评分基础和堆栈、使用盲探针、报告覆盖情况,并进行回放稳定性测试。
查看缓存全文
缓存时间: 2026/08/06 07:43
# 当共享回放在防御性驾驶评估中失效:基于 NAVSIM 评分的审计 来源:https://arxiv.org/html/2608.04896 11institutetext:EABOT\.AI###### 摘要 防御性驾驶评分只有在能够区分观察周围参与者的策略与不观察周围参与者的策略时才有用。重模拟基准测试可能采用参考条件化豁免(reference-conditioned forgiveness),即当记录的真人参考在某个合规通道上失败时,智能体可获得豁免。当智能体和参考共享一个不稳定的回放变换时,该规则可能将共享的参考失败扩散为广泛的合规性豁免。 我们在 NAVSIM v2.2 原始场景单阶段评分中审计了这一风险。在受影响的已记录技术栈条件下(基于所审计的数值后端),无视路线的 Ignore-All 探针和感知路线的无参与者探针在完整的 12,146 个 token 的 navtest 划分中胜过人类回放和 PDM-Closed。按照公开规范的全新安装能够在固定的 32 个 token 诊断集上复现回放发散。同源依赖栈对照组和精确输入诊断实验将共享速度重构中的依赖敏感数值行为分离出来。在 450 个 token 的控制池中,仅替换求解器即可消除回放发散,并在保持豁免开启的同时恢复“盲策略垫底”的排序。因此,数值不稳定性是直接触发因素。参考条件化豁免将由此产生的共享参考失败传播为合规性信用。我们贡献了一个审计协议,要求在使用此类评分进行防御性驾驶声明之前,披露评分基础和依赖栈、设置盲策略探针、报告覆盖情况,并进行回放稳定性测试。 请参阅图表说明图 1:共享失败豁免崩溃。在受影响文档化堆栈条件下的默认开启过滤评分子项(左)中,不接收任何周围参与者输入的无参与者 Ignore-All 以 79.6 对 74.0 的扩展预测驾驶模型评分(EPDMS)胜过人类回放。共享参考失败在聚合前导致核心可行驶区域合规性(DAC)、行驶方向合规性(DDC)和车道保持(LK)通道中出现接近饱和的失败转通过覆盖。一种在提议侧和参考侧均绕过不稳定共享重构的双侧有限差分诊断颠倒了成对排序(人类回放 88.9 对 Ignore-All 13.3 EPDMS)。由于提议和参考共享变换,共同的数值失败会触发策略级覆盖。完整结果见表 ̃2 (https://arxiv.org/html/2608.04896#S4.T2)、3 (https://arxiv.org/html/2608.04896#S4.T3) 和 7 (https://arxiv.org/html/2608.04896#S4.T7)。 ## 1 引言 防御性驾驶评估通常被解释为规划器对周围参与者和交互风险做出响应、而不仅仅是匹配名义轨迹的证据。这种推断需要一个基本的排序性质:在被解释为参与者敏感驾驶证据的评分下,无参与者诊断不应系统性地胜过强参与者感知比较器。大规模驾驶基准测试越来越多地使用*重模拟*:规划器提出一条自我轨迹,场景向前滚动,并根据记录的真人参考对安全性和质量项进行评分 [dauner2023pdm, dauner2024navsim, cao2025pseudosimulation]。此类评分支持关于感知、3D 表示和多模态推理的声明 [hu2023uniad, jiang2023vad, hwang2024emma, sima2024drivelm]。只有当评分保留参与者感知比较器与无参与者探针之间的必要区别时,这些声明才可信。 我们审计了此已记录的 NAVSIM 评分器配置中的一个结构性有效性风险。它使用参考条件化豁免。如果记录的真人参考在某合规通道失败,智能体在该通道上可能被豁免。该规则避免因同样归因于记录参考的违规行为而惩罚智能体。在我们的审计中,共享回放和重构路径中依赖敏感的数值不稳定性是直接触发因素。由于提议和参考都遍历同一条路径,豁免可以将由此产生的共享参考失败传播为信用,并抹去行为相关区分。我们称之为*共享失败豁免崩溃*。它需要提议和参考共享的变换、参考条件化豁免,以及与安全驾驶相关的通道上广泛的共享失败。我们用*评分基础*指代完整的配置,包括回放变换和豁免。 盲策略提供了一种轻量级诊断。Ignore-All 既无视路线又固定直行。感知路线的无参与者探针仅使用当前自我状态和静态地图车道及车道连接器基线来遵循声明的任务路线。它不使用任何参与者框、轨迹、碰撞预测或记录的未来自我轨迹。如果任一探针胜过参与者感知比较器,则该评分未通过此无参与者健全性检查。这是对必要条件的证伪测试,而非对防御性驾驶能力的完整度量。 我们在 NAVSIM v2.2 原始场景单阶段评分上实例化该审计。在受影响的已记录技术栈条件下,两个探针在冻结的 12,146 个 token 的 navtest 划分中都胜过人类回放和 PDM-Closed。然而,一种双侧诊断将人类回放和 PDM-Closed 排在感知路线的无参与者探针之上,而后者又排在无视路线的探针之上,从而将路线跟随与无参与者区分开来。直接触发因素是默认速度重构中的依赖敏感不稳定性。默认伪逆可能产生公里级的路外回放。记录的参考经历相同的重构,从而在几乎每个 token 上激活豁免。 双侧、回退、求解器和依赖栈对照组将不稳定的共享回放基础定位。在启用豁免的情况下,仅替换求解器即可消除发散,并在 450 个 token 的控制池上恢复“盲策略垫底”排序。全新安装能够在固定 32 个 token 诊断集上复现评分器发散,而精确输入诊断实验可在不更改评分器源码的情况下区分受影响栈和控制栈(第 3 节 (https://arxiv.org/html/2608.04896#S3))。这些是诊断性对照,而非替代指标。我们的贡献如下: 1. 1.我们定义了共享失败豁免崩溃,并针对用于支持参与者敏感声明的防御性驾驶评分提出了盲策略探针审计。 2. 2.我们表明,受影响的已记录技术栈条件将无视路线和感知路线的无参与者探针都排在参与者感知比较器之上,并定位了依赖敏感的速度重构触发因素。 3. 3.我们通过互补对照组验证了该机制,并为参考条件化重模拟指标推导出依赖披露、覆盖报告、盲策略探针和回放稳定性要求。 ## 2 相关工作 ### 2.1 驾驶数据集、模拟器和基准测试协议 自动驾驶评估已从离线感知和预测数据集发展为在闭环或伪模拟协议中测试规划器。NAVSIM 和 PDM 风格指标在真实场景抽象上回放提议的自我轨迹,并大规模聚合进度、舒适性、碰撞、碰撞时间和地图合规性项 [dauner2023pdm, dauner2024navsim, cao2025pseudosimulation]。nuPlan 等闭环基准测试则让规划器面对演化的模拟交通 [caesar2021nuplan],而跨基准研究则询问离线及伪模拟分数能否预测闭环性能 [li2025crossbenchmark]。我们问一个更窄的先决条件问题:重模拟评分是否保留了支持防御性驾驶声明所需的参与者敏感区分。 ### 2.2 防御性驾驶评估与参与者敏感行为 防御性驾驶并不等同于避免一次记录的碰撞。它要求预测潜在危险、保持安全裕度、在另一参与者可能进入自我路径时让行,并在交互演化时维持路线和地图约束。交互丰富的数据集使这些行为可测量 [zhan2019interaction]。规划基准测试随后通过安全、进度和合规性项对其进行总结 [caesar2021nuplan, dauner2024navsim]。这类聚合结果常被解读为危险敏感性的证据,而非仅仅是轨迹模仿。 用于支持参与者敏感声明的评分至少必须区分观察周围参与者的策略和不观察周围参与者的策略。仅靠“盲策略垫底”排序并不能证明预测、舒适性或部署安全性。然而,盲策略获胜是一个重要的警告信号。在我们的审计中,它之所以具有诊断意义,是因为评分器仍然观察参与者、核心失败被广泛覆盖,并且在独立稳定的评分基础上排序发生逆转。 ### 2.3 端到端驾驶与感知丰富规划 端到端驾驶系统将感知、预测和规划连接在一个学习栈中。条件模仿、特权教学和世界在轨监督建立了强大的 CARLA 基线 [codevilla2018cil, chen2020lbc, chen2021worldonrails]。后来的系统结合相机-激光雷达融合 [prakash2021mft, chitta2023transfuser]、显式交互感知规划 [chen2022lav, wu2022tcp, shao2023interfuser] 或对象中心表示 [renz2022plant]。BEV 感知、占用网格、向量化规划和语言条件驾驶进一步扩展了附加于聚合规划评分的行为声明 [philion2020lift, li2024bevformer, casas2021mp3, hu2023uniad, jiang2023vad, sima2024drivelm, hwang2024emma]。Hydra-MDP [li2024hydramdp] 和 DiffusionDrive [liao2025diffusiondrive] 等面向 NAVSIM 的规划器使用伪模拟作为评估目标。因此,我们的关注先于模型比较,询问目标是否保留了这些系统设计用于利用的参与者敏感信息。 ### 2.4 评估捷径、奖励错误设定与指标审计 驾驶指标可能奖励与预期能力无关的捷径。AD-MLP 和 BEV-Planner 表明,在开环 nuScenes 指标下,仅基于自我状态或无感知的策略也能显得有竞争力 [zhai2023admlp, li2024bevplanner],而隐藏偏差分析识别了端到端驾驶模型中的相关脆弱性 [jaeger2023hidden]。这些结果主要暴露数据集或开环指标捷径。我们的情况不同,因为盲探针的开环轨迹匹配很差,然而当共享回放失败激活参考条件化豁免时,伪模拟将其排在最高。失效发生在评分基础内部,而非源于利用自我状态或记录的未来轨迹。 更一般地,Goodhart 和 Campbell 式效应描述了优化代理如何偏离其预期含义 [campbell1979assessing, manheim2018goodhart],而关于奖励黑客和奖励错误设定的研究则考察代理目标的失败 [amodei2016concrete, skalse2022reward, pan2022rewardmisspecification, hendrycks2021unsolved]。双模拟和值等价刻画了在控制中何时可以将状态或模型视为相同 [ferns2004bisimulation, grimm2020value, zhang2021dbc]。共享失败豁免崩溃通过在聚合前将行为不同的结构性失败映射为共同的通过状态,违反了相应的测量原则。与刻意学习欺骗奖励的智能体不同,这里的盲探针暴露了评分器自身引入的评估侧等价关系。 ## 3 审计协议 我们可复用的审计从行为症状开始,然后测试其评分基础。我们询问盲策略能否获胜、评分器是否仍观察真实场景、参考豁免是否覆盖行为相关失败,以及消除共享失败后是否恢复“盲策略垫底”排序。这些检查共同将不透明的排序异常与评分基础机制区分开。 ### 3.1 审计测试什么 四个问题有意按顺序排列。首先,盲策略获胜表明参与者盲健全性检查失败。其次,可见性检查将评分基础失败与更简单的实现错误(即参与者从未被传递给评分器)区分开来。第三,通道级掩码显示症状是由参考条件化重写引起,而非普通的聚合权衡。最后,对公共变换的干预测试该重写是否依赖共享回放失败。若没有后三种特征的盲策略获胜,则需要不同的诊断。 表 1:所提议的评分基础审计中的可观察检查。每一步都将行为症状与评分器侧机制区分开;仅凭盲策略获胜不足以诊断豁免崩溃。 ### 3.2 评分基础与对照组 *受影响的已记录技术栈条件*遵循 NAVSIM v2.2 公共提交 0a380a9,在我们审计的 x86-64 后端上使用 OpenBLAS(Python 3.9.23、NumPy 1.23.4、SciPy 1.13.1 和 OpenCV 4.9.0)。此标签标识所测量的条件,而非跨硬件或线性代数后端的复现。其默认原始场景评分器使用默认伪逆重构和参考条件化豁免(*默认开启过滤*);*默认关闭过滤*仅禁用豁免分支。 我们将技术栈与评分器路径分开,因为仅凭求解器结果无法将数值行为与评分器设计区分开来。*同源控制技术栈*仅在导入并运行相同评分器源码所必需的范围内更改二进制依赖(NumPy 2.0.2 和 OpenCV 4.13.0;OpenBLAS 0.3.27 对比受影响条件中的 0.3.20)。这作为运行控制而非生产推荐;此处指定了源码、依赖和后端。 我们的主要审计目标是原始场景单阶段评分。450 个 token 的求解器池是官方 navhard-two-stage 划分的完整原始场景阶段 1 集合。两项范围性检查表明不稳定性并不局限于该基础。在本地对已发布的公开 navhard 两阶段轨迹输出重新评分,在同源控制技术栈下匹配其报告的组合分数(41.74 对比 41.7),但在受影响条件下返回 0.0。在 512 个合成阶段 2 帧上,受影响条件在 99.8–100% 的回放上发散,而控制技术栈为 0%。两项检查均不评估跨审计智能体的最终阶段 1/阶段 2 聚合排序,且合成阶段 2 帧不携带记录的真人轨迹,因此在那里无法测量参考侧豁免。 我们的双侧有限差分诊断对提议和真人参考都使用直接由位姿导出的运动学,而非 BatchLQR 重模拟。它不是替代指标。其对称干预测试反转是否依赖共享重构而非单侧优势。求解器对照在保持依赖条件、交通和豁免固定的同时,仅将速度拟合求解器替换为直接求解或 Hermitian 伪逆。回退保留默认的智能体侧 BatchLQR,除非回放超出提议 100100 米或单步超过 5050 米,此时使用有限差分状态。NumPy-2.x 控制技术栈导入并运行未更改的评分器源码。因此,排序变化分离出依赖敏感的数值差异,而非评分器源码修订。 较窄的回退保留原始真人参考和默认智能体侧 BatchLQR,直到出现预先指定的严重发散——
相似文章
ReflectDrive-2:面向离散扩散驾驶模型的强化学习对齐自编辑方法
ReflectDrive-2 是一款新型自动驾驶离散扩散规划器,通过强化学习实现轨迹 token 的自编辑,在 NAVSIM 基准测试中取得了高性能和低延迟。
当无基准存在时:验证无真实标签的LLM安全评分比较
本文介绍了一个框架,用于在没有真实标签的情况下验证LLM安全评分比较,通过使用'工具有效性链'来建立部署证据。该方法通过一个名为SimpleAudit的本地优先工具在挪威安全包上进行了演示,并比较了Borealis和Gemma 3等模型。
CARVE: 通过包络实现交互式驾驶中否决操作的认证经济修复
CARVE是一个用于自动驾驶的认证框架,为多智能体修复提供运行时证明,在INTERACTION回放场景中接受98.64%的初始否决操作,且无需预测其他驾驶员的合规性。
安全,还是仅仅是能力?对智能体安全基准的效度审计
本文对四个智能体安全基准(R-Judge、InjecAgent、AgentHarm、AgentDojo)在多个模型上进行了审计,表明它们的分数受能力混淆影响,指标存在伪影,且不同基准之间的排名相互矛盾,从而削弱了可互换的安全性声明。
PersonaDrive:面向闭环驾驶仿真的基于人类风格的检索增强VLA智能体
本文介绍了PersonaDrive,一种将视觉-语言-动作(VLA)驾驶智能体基于从风格引导的人类驾驶数据集中检索到的演示进行条件化的流程,从而能够为闭环仿真提供风格多样的非自车智能体,并在Bench2Drive上提升了驾驶评分。