LIDAR-AD:一种用于自动驾驶的无解码器潜在交互Dreamer与动作残差链
摘要
LIDAR-AD提出了一种用于自动驾驶的无解码器潜在交互世界模型,通过减少冗余的潜在对齐和残差动作更新,改进了风险感知的状态抽象和长时域动态预测,在模拟和真实场景中优于基线世界模型。
arXiv:2607.11964v1 公告类型:新
摘要:自动驾驶需要在动态交通环境中进行长时域闭环决策。潜在世界模型通过支持在紧凑潜在空间中进行基于想象的决策,为此问题提供了有效框架。然而,多源观测包含与控制无关的冗余,而可靠的驾驶决策依赖于风险相关关系、未来动态和连续动作调整。这种不匹配使得观测重建和绝对动作建模在学习决策相关的潜在动态时效果不佳。我们提出了LIDAR-AD,一种用于自动驾驶的无解码器潜在交互Dreamer与动作残差链。LIDAR-AD用减少冗余的潜在对齐替换了观测重建,鼓励在多源驾驶输入中生成风险相关关系的紧凑表示。它还进一步将车辆控制建模为残差动作更新,并使用残差动作序列对比学习将多步残差驱动的推演与未来潜在状态对齐。确定性分析表明,潜在双曲正切残差参数化保留了内部动作可达性,同时将平滑的长时域控制表示为紧凑的局部更新。这些设计共同改进了风险感知的状态抽象、连续控制建模和长时域动态预测。在多种模拟驾驶场景中的大量实验表明,LIDAR-AD持续优于世界模型基线,在基于学习的方法中实现了最高奖励和最佳成功率。在基于nuPlan的日志重建场景上的评估进一步证明了LIDAR-AD在真实交通布局下的可迁移性。
查看缓存全文
缓存时间: 2026/07/15 04:17
# LIDAR-AD: 一种面向自动驾驶的无解码器潜在交互梦想家与动作残差链 来源:https://arxiv.org/html/2607.11964 Yongzhi Liu, Yang Xiao, Zhong Cao, Zeng Kang, Sunan Zhang, Zhaozhi Dong, Guojun Yu, and Weichao Zhuang 本工作部分受江苏省基础研究计划优秀青年基金项目(编号 BK20250172)、江苏省重大科技专项(编号 BG2025018)以及国家自然科学基金(NSFC)项目(编号 52441204)资助。(通讯作者:Weichao Zhuang。) Yongzhi Liu, Yang Xiao, Zeng Kang, Sunan Zhang, Zhaozhi Dong 和 Weichao Zhuang 来自中国江苏南京 211189 东南大学机械工程学院(电子邮箱:[email protected]; [email protected])。 Zhong Cao 来自美国密歇根州安娜堡 48109 密歇根大学土木与环境工程系(电子邮箱:[email protected])。 Guojun Yu 来自中国江苏苏州 215100 苏州心医术科技有限公司(电子邮箱:[email protected])。 ###### 摘要 自动驾驶需要在动态交通环境中进行长时域闭环决策。潜在世界模型通过在高维紧凑潜在空间中进行基于想象力的决策,为解决该问题提供了有效框架。然而,多源观测信息包含与控制无关的冗余,而可靠的驾驶决策依赖于风险相关的交互关系、未来动态及连续的动作调整。这种不匹配使得观测重建和绝对动作建模在学习与决策相关的潜在动态时并非最优。我们提出 LIDAR-AD,一种面向自动驾驶的无解码器潜在交互梦想家与动作残差链。LIDAR-AD 用冗余缩减的潜在对齐替代观测重建,鼓励在多源驾驶输入中表达风险相关交互关系的紧凑表征。它进一步将车辆控制建模为残差动作更新,并利用残差动作序列对比学习来将由每步残差动作递归驱动的轨迹与未来潜在状态对齐。一项确定性分析表明,潜在-tanh 残差参数化在将平滑的长时域控制表示为紧凑的局部更新的同时,保留了内部动作可达性。这些设计共同改进了风险感知的状态抽象、连续控制建模以及长时域动态预测。在多种模拟驾驶场景中的广泛实验表明,LIDAR-AD 持续优于基于世界模型的基线方法,在基于学习方法中取得了最高奖励和最佳成功率。在 nuPlan 衍生的日志重构场景上的评估进一步证明了 LIDAR-AD 在真实交通布局下的可迁移性。项目页面请访问项目网站 (https://lumen2023.github.io/lidar-ad-website/)。 ## I. 引言 自动驾驶需要在动态、交互性强且部分可观测的交通环境中做出可靠决策 [27 (https://arxiv.org/html/2607.11964#bib.bib3)]。与标准的连续控制基准不同,这是一个受安全性、效率和舒适性约束的长时域闭环问题。驾驶策略必须推理周围交通状况,维持稳定的车辆级别控制,并预判当前决策的多步后果。因此,状态表示、动作平滑性或动态预测中的微小误差可能在密集交通、交叉口和环岛中累积成不安全或低效的行为。因此,闭环驾驶需要能够从复杂观测中提取与决策相关的结构,同时保持平滑和可预测控制的模型。 参考图 1 标题 图 1:真实驾驶数据中残差动作空间的紧凑性。来自 NAVSIM 和 nuPlan 的统计数据表明,连续的转向和纵向指令高度相关,而其残差变化集中在更窄的范围内。残差动作链占据的单元格比绝对动作链少 9.1×倍,表明平滑长时域驾驶控制具有更紧凑的几何结构。 强化学习已被广泛研究用于自动驾驶,但无模型策略仍需大量环境交互,这在罕见的安全关键事件中代价高昂 [18 (https://arxiv.org/html/2607.11964#bib.bib50)]。基于模型的强化学习通过学习预测性世界模型来缓解这一问题,该模型利用已收集的经验进行想象轨迹,从短轨迹模型学习到基于 RSSM 的潜在想象和值感知潜在规划 [15 (https://arxiv.org/html/2607.11964#bib.bib26), 9 (https://arxiv.org/html/2607.11964#bib.bib18), 10 (https://arxiv.org/html/2607.11964#bib.bib21), 11 (https://arxiv.org/html/2607.11964#bib.bib54), 12 (https://arxiv.org/html/2607.11964#bib.bib55)]。在自动驾驶中,世界模型已通过几何先验、语义抽象、安全感知优化、风险感知策略协调、无解码器训练和生成式场景演化等方式得到适配 [13 (https://arxiv.org/html/2607.11964#bib.bib56), 5 (https://arxiv.org/html/2607.11964#bib.bib23), 14 (https://arxiv.org/html/2607.11964#bib.bib25), 23 (https://arxiv.org/html/2607.11964#bib.bib27), 25 (https://arxiv.org/html/2607.11964#bib.bib51), 20 (https://arxiv.org/html/2607.11964#bib.bib57), 32 (https://arxiv.org/html/2607.11964#bib.bib61), 38 (https://arxiv.org/html/2607.11964#bib.bib63)]。这些研究证明了学习潜在动态在预测、规划和决策中的价值。然而,对于闭环驾驶而言,仍有两个相互关联的问题未得到充分解决。首先,许多世界模型仍将容量分配给冗余或与决策相关性较弱的观测,而不是围绕直接影响驾驶决策的交互变化来组织潜在状态。其次,传统动作条件化将每个动作视为独立输入,对连续的转向和纵向控制缺乏结构。结果,模型可能难以将小的控制调整与未来状态转换关联起来,而策略可能在闭环执行期间产生不必要的动作波动。 观测重建为世界模型学习提供了密集监督,但它可能会将潜在状态偏向于与控制关系较弱的可预测规律性。无解码器表示学习通过直接通过预测性、对比性、冗余缩减和联合嵌入目标优化潜在嵌入来解决这一限制 [31 (https://arxiv.org/html/2607.11964#bib.bib65), 6 (https://arxiv.org/html/2607.11964#bib.bib68), 35 (https://arxiv.org/html/2607.11964#bib.bib69), 1 (https://arxiv.org/html/2607.11964#bib.bib71), 2 (https://arxiv.org/html/2607.11964#bib.bib72)]。这些目标也通过对比性、预测性或基于增强的视觉控制改进了强化学习和潜在动态建模 [19 (https://arxiv.org/html/2607.11964#bib.bib73), 29 (https://arxiv.org/html/2607.11964#bib.bib74), 34 (https://arxiv.org/html/2607.11964#bib.bib76), 33 (https://arxiv.org/html/2607.11964#bib.bib77)]。然而,大多数无解码器目标是为整体输入或增强视图设计的,为建模异构驾驶模态之间的结构化关系提供的机制有限。在驾驶序列中,许多观测因素在时间上是持久的,而安全关键的变化往往稀疏地出现在交互边界周围,例如突然的距离变化、障碍物遭遇、让行、合并或进入冲突区域。当目标强调通用观测预测时,模型可能通过建模持久性而非识别驱动未来决策的交互变化来减少损失。这可能消耗建模容量并削弱长时域闭环决策。 另一个限制在于闭环驾驶动作的常见表示方式。许多基于学习的策略在每个决策步骤输出新的控制指令,这为转向和纵向控制的时间连续性提供的结构有限。残差强化学习和平滑控制正则化表明,学习局部修正或抑制突然的动作变化可以改善连续控制稳定性 [16 (https://arxiv.org/html/2607.11964#bib.bib78), 26 (https://arxiv.org/html/2607.11964#bib.bib79)]。最近的残差动作方法进一步将前一动作作为参考信号,减少了有效搜索空间,并改善了视觉控制中的长时域预测或动作平滑性 [24 (https://arxiv.org/html/2607.11964#bib.bib52), 36 (https://arxiv.org/html/2607.11964#bib.bib53)]。在真实驾驶中,换道、受控停车和避碰等操作很少由孤立指令产生;相反,它们是通过围绕先前控制的逐渐调整形成的。如图 1 (https://arxiv.org/html/2607.11964#S1.F1) 所示,我们在 NAVSIM 和 nuPlan 上的统计数据显示,连续的驾驶指令高度相关,其残差变化所占范围远小于完整动作空间。这表明重复预测绝对动作可能引入不必要的建模负担,特别是当时间上冗余的控制模式持续多个步骤时。然而,单个残差动作只描述了一个局部修正。长时域驾驶则需要建模中间控制变化如何累积成未来结果,这一抽象也体现在序列级动作生成和链式动作建模中 [4 (https://arxiv.org/html/2607.11964#bib.bib81), 37 (https://arxiv.org/html/2607.11964#bib.bib82)]。因此,世界模型应该学习每步残差动作输入如何塑造未来的驾驶状态。 表 I (https://arxiv.org/html/2607.11964#S1.T1) 总结了 LIDAR-AD 相对于代表性无解码器、残差动作和世界模型基线的方法定位。与那些分别解决表示紧凑性或残差控制的方法不同,LIDAR-AD 将无解码器表示学习、组级观测交互、残差动作策略参数化、残差感知转移建模和多步动作对比统一在一个基于 RSSM 的框架内。 为应对这些挑战,本文提出 LIDAR-AD,一种面向自动驾驶的无解码器潜在交互梦想家与动作残差链。核心思想是引导世界模型关注与决策相关的交互变化和连续控制演化,而不是将观测建模和动作预测视为分离的单步目标。LIDAR-AD 将无解码器潜在交互表示 (DLIR)、残差动作世界模型 (RAWM) 和残差动作链对比学习 (ARC-CL) 集成在一个统一的 RSSM 框架内。这种设计减少了冗余的观测建模,为平滑控制提供了紧凑的动作空间,并将多步残差动作轨迹与未来潜在状态对齐。 本文的主要贡献总结如下: - • **无解码器潜在交互表示 (DLIR)**。我们开发了一个轻量级表示学习器,用于建模自车状态、距离感知和导航信号之间的交互,并将 RSSM 潜在状态与交互感知嵌入对齐,而无需重建完整观测。 - • **残差动作世界模型 (RAWM)**。我们将残差动作参数化引入基于 RSSM 的世界模型,其中转移同时依赖于已执行的动作和残差调整。一项确定性分析在平滑控制假设下表征了指令不变性、内部可达性和局部紧凑性。 - • **残差动作链对比学习 (ARC-CL)**。我们设计了一个多步对比目标,将由每步残差动作输入递归驱动的轨迹与真实未来潜在状态对齐,从而改善世界模型捕捉累积控制后果的能力。 本文其余部分组织如下。第二节 (https://arxiv.org/html/2607.11964#S2) 形式化驾驶问题,定义观测、动作和潜在状态空间。第三节 (https://arxiv.org/html/2607.11964#S3) 介绍 LIDAR-AD 框架。第四节 (https://arxiv.org/html/2607.11964#S4) 描述实验设置,第四节-B (https://arxiv.org/html/2607.11964#S4.SS2) 报告结果。第五节 (https://arxiv.org/html/2607.11964#S5) 讨论含义和局限性,第六节 (https://arxiv.org/html/2607.11964#S6) 总结全文。 表 I:与相关方法的组件级比较 | 方法 | 无解码器 | 组级交互 | 残差执行器 | 残差感知转移 | 多步动作对比 | |------|----------|----------|------------|--------------|--------------| | DreamerV3 [10 (https://arxiv.org/html/2607.11964#bib.bib21)] | – | – | – | – | – | | R2-Dreamer [25 (https://arxiv.org/html/2607.11964#bib.bib51)] | ✓ | – | – | – | – | | ResAct [24 (https://arxiv.org/html/2607.11964#bib.bib52)] | – | – | ✓ | – | – | | ResWM [36 (https://arxiv.org/html/2607.11964#bib.bib53)] | – | – | ✓ | ✓ | – | | LIDAR-AD (我们的方法) | ✓ | ✓ | ✓ | ✓ | ✓ | *注:* ✓ 表示方法明确包含相应组件,– 表示该组件不属于原始方法设计。 ## II. 问题形式化 ### II-A 面向自动驾驶的强化学习 我们将自动驾驶形式化为一个部分可观测的序贯决策问题。在每个时间步 \(t\),智能体接收一个观测 \(o_t\),执行一个连续控制动作 \(a_t\),并从环境获得一个奖励 \(\rho_t\)。该任务被建模为一个部分可观测 Markov 决策过程 (POMDP): \[ \mathcal{M} = (\mathcal{O}, \mathcal{A}, P, \mathcal{R}, \gamma), \tag{1} \] 其中 \(\mathcal{O}\) 是观测空间,\(\mathcal{A}\) 是连续动作空间,\(P(o_{t+1} \mid o_{\le t}, a_t)\) 表示未知的历史条件转移动态,\(\mathcal{R}(o_t, a_t)\) 是奖励函数,\(\gamma \in [0,1)\) 是折扣因子。策略 \(\pi(a_t \mid o_{\le t})\) 被优化以最大化期望折扣回报: \[ \max_{\pi} \; \mathbb{E}_{\pi} \left[ \sum_{t=0}^{\infty} \gamma^t \rho_t \right]. \tag{2} \] 这里 \(\rho_t = \mathcal{R}(o_t, a_t)\) 表示时间步 \(t\) 实现的标量奖励。在我们的驾驶设定中,\(a_t\) 表示执行的连续控制指令,包括纵向和横向控制,如加速度和转向。具体的观测组成、动作范围、奖励设计和仿真器配置在第四节 (https://arxiv.org/html/2607.11964#S4) 中报告。 **RSSM 潜在状态。** 遵循 R2-Dreamer [25 (https://arxiv.org/html/2607.11964#bib.bib51)] 中无重建的 RSSM 形式化,我们学习用于策略优化的紧凑潜在动态,而无需重建原始观测。观测历史被总结为一个潜在状态 \[ s_t = (h_t, z_t), \tag{3} \] 其中 \(h_t\) 是确定性循环状态,\(z_t\) 是随机潜在状态。循环转移将历史信息汇总为 \[ h_t = f_\phi (h_{t-1}, z_{t-1}, \xi_{t-1}), \tag{4} \] 而随机状态则从当前观测嵌入中推断或从先验中预测: \[ z_t \sim q_\phi (z_t \mid h_t, e_t
相似文章
Dreamer-SAC:在潜在世界模型中进行离策略学习以实现样本高效的自动驾驶
本文提出Dreamer-SAC,一种基于模型的强化学习框架,将递归状态空间世界模型与潜在空间中的软演员-评论家算法相结合,以实现样本高效的自动驾驶。该框架在需要更少的真实环境交互的情况下,优于DreamerV3、SAC和PPO基线。
Delta-JEPA: 通过潜在差异解码学习动作敏感的世界模型
Delta-JEPA 引入了一种无重建的世界模型,通过潜在差异动作解码器增强潜在前向预测,以防止崩溃并提高动作敏感性,从而在视觉连续控制任务上实现更好的规划性能。
Reason--Imagine--Act:基于世界模型的闭环大语言模型决策在自动驾驶中的应用
提出了Reason-Imagine-Act (RIA),一种将大语言模型推理器与动作条件世界模型相结合的闭环框架,用于自动驾驶中的在线安全验证,在CARLA仿真中实现了80.05%的路线完成率和0.20%的碰撞率。
LaWAM:面向高效动力学感知机器人策略的潜在世界动作模型
LaWAM通过预测紧凑的潜在视觉子目标而非昂贵的视频生成,实现了高效的机器人控制,相比像素空间世界动作模型,成功率可达最先进水平,同时延迟降低高达24倍。
作为意图的潜在动作为世界动作模型提供高效未来想象
LAWA是一个世界动作模型,使用潜在动作来实现机器人控制的高效未来想象,在降低推理延迟的同时达到最先进的性能。它无需生成未来观测即可在泛化能力和效率上优于基线。