ReflectDrive-2:面向离散扩散驾驶模型的强化学习对齐自编辑方法

Hugging Face Daily Papers 论文

摘要

ReflectDrive-2 是一款新型自动驾驶离散扩散规划器,通过强化学习实现轨迹 token 的自编辑,在 NAVSIM 基准测试中取得了高性能和低延迟。

我们提出了 ReflectDrive-2,这是一种用于自动驾驶的掩码离散扩散规划器,包含独立的操作专家模块。该模型将规划方案表示为离散轨迹 token,并通过并行掩码解码生成这些 token。这种离散 token 空间支持原地轨迹修订:AutoEdit 使用同一模型重写选定的 token,无需额外的辅助细化网络。为了训练这一能力,我们采用两阶段流程。首先,我们沿纵向进程和横向航向方向构建专家轨迹的结构感知扰动,并监督模型恢复原始专家轨迹。随后,我们使用强化学习(RL)对整个“决策-草稿-反思”生成流程进行微调,为最终编辑后的轨迹分配终端驾驶奖励,并通过完整生成流程的过渡传播策略梯度信用。完整流程的 RL 被证明对于耦合草稿和编辑至关重要:仅在有监督训练下,推理时的 AutoEdit 最多仅能将 PDMS 提升 0.3,而 RL 将其增益提高至 1.9。我们还共同设计了一个高效的反思式解码堆栈,适用于“决策-草稿-反思”流程,结合共享前缀 KV 复用、交替步解码以及设备端融合掩码解除技术。在 NAVSIM 基准测试中,ReflectDrive-2 在仅使用摄像头输入时达到 91.0 的 PDMS,在 6 选 1 的 Oracle 设定下达到 94.8 的 PDMS,同时在 NVIDIA Thor 平台上平均延迟仅为 31.8 毫秒。
查看原文
查看缓存全文

缓存时间: 2026/05/08 07:19

论文页面 - ReflectDrive-2:面向离散扩散自动驾驶的强化学习对齐自编辑

来源: https://huggingface.co/papers/2605.04647

摘要

ReflectDrive-2 采用带有并行解码的掩码离散扩散规划器用于自动驾驶,通过令牌重写实现原地轨迹修订,并通过高效的反思式解码实现了高性能。

我们介绍了 ReflectDrive-2,一种带有独立动作专家的掩码离散扩散规划器 (https://huggingface.co/papers?q=masked%20discrete%20diffusion%20planner),用于自动驾驶。它将规划表示为离散轨迹令牌 (https://huggingface.co/papers?q=discrete%20trajectory%20tokens),并通过并行掩码解码 (https://huggingface.co/papers?q=parallel%20masked%20decoding) 生成这些令牌。这种离散令牌空间支持原地轨迹修订:AutoEdit (https://huggingface.co/papers?q=AutoEdit) 使用同一模型重写选定的令牌,无需辅助细化网络。为了训练这种能力,我们采用了两阶段流程。首先,我们构建沿纵向进度和横向航向方向的专家轨迹的结构感知扰动 (https://huggingface.co/papers?q=structure-aware%20perturbations),并监督模型恢复原始专家轨迹。然后,我们使用强化学习 (https://huggingface.co/papers?q=reinforcement%20learning) (RL) 微调完整的决策-草稿-反思 (decision-draft-reflect) rollout 过程,将终端驾驶奖励分配给最终编辑后的轨迹,并通过完整 rollout 过渡传播策略梯度信用 (https://huggingface.co/papers?q=policy-gradient%20credit)。完整的 rollout RL 对于耦合草稿和编辑被证明至关重要:仅在监督训练下,推理时的 AutoEdit (https://huggingface.co/papers?q=AutoEdit) 最多仅能提高 PDMS (https://huggingface.co/papers?q=PDMS) 0.3,而 RL 将其增益提高到了 1.9。我们还为决策-草稿-反思管道 (https://huggingface.co/papers?q=decision–draft–reflect%20pipeline) 共同设计了一个高效的反思式解码堆栈,结合了共享前缀 KV 复用 (https://huggingface.co/papers?q=shared-prefix%20KV%20reuse)、交替步解码 (https://huggingface.co/papers?q=Alternating%20Step%20Decode) 以及融合的设备端解掩码 (https://huggingface.co/papers?q=fused%20on-device%20unmasking)。在 NAVSIM (https://huggingface.co/papers?q=NAVSIM) 上,ReflectDrive-2 在仅摄像头输入下实现了 91.0 的 PDMS (https://huggingface.co/papers?q=PDMS),在 best-of-6 神谕设置下实现了 94.8 的 PDMS (https://huggingface.co/papers?q=PDMS),同时在 NVIDIA Thor 上运行时的平均延迟为 31.8 毫秒。

查看 arXiv 页面 (https://arxiv.org/abs/2605.04647) 查看 PDF (https://arxiv.org/pdf/2605.04647) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2605.04647)

在你的 agent 中获取这篇论文:

hf papers read 2605\.04647

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2605.04647 以从此页面链接它。

引用此论文的数据集 0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2605.04647 以从此页面链接它。

引用此论文的 Spaces 0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2605.04647 以从此页面链接它。

包含此论文的合集 0

没有合集包含此论文

将此论文添加到合集 (https://huggingface.co/new-collection) 以从此页面链接它。

相似文章

RAD-2:在生成器-判别器框架中扩展强化学习

Hugging Face Daily Papers

RAD-2 提出了一个用于自动驾驶的统一生成器-判别器框架,将基于扩散的轨迹生成与强化学习优化的重排序相结合,与基于扩散的规划器相比,碰撞率降低了56%。该方法引入了 Temporally Consistent Group Relative Policy Optimization 和 BEV-Warp 仿真环境等技术,以实现高效的大规模训练。

Fast-dDrive: 用于自动驾驶的高效块扩散VLM

arXiv cs.CL

Fast-dDrive是一种用于端到端自动驾驶的块扩散VLA模型,实现了最先进的轨迹精度,同时相比自回归基线提供了超过12倍的吞吐量加速,解决了高保真规划与边缘部署高效推理之间的权衡。

SafeDiffusion-R1: 在线奖励引导的安全扩散后训练

Hugging Face Daily Papers

SafeDiffusion-R1 引入了一个基于 GRPO 和引导奖励机制的在线强化学习框架,用于提升扩散模型的安全性,无需监督数据或奖励调优,在多个有害类别上实现了最先进的性能。