ReflectDrive-2:面向离散扩散驾驶模型的强化学习对齐自编辑方法
摘要
ReflectDrive-2 是一款新型自动驾驶离散扩散规划器,通过强化学习实现轨迹 token 的自编辑,在 NAVSIM 基准测试中取得了高性能和低延迟。
查看缓存全文
缓存时间: 2026/05/08 07:19
论文页面 - ReflectDrive-2:面向离散扩散自动驾驶的强化学习对齐自编辑
来源: https://huggingface.co/papers/2605.04647
摘要
ReflectDrive-2 采用带有并行解码的掩码离散扩散规划器用于自动驾驶,通过令牌重写实现原地轨迹修订,并通过高效的反思式解码实现了高性能。
我们介绍了 ReflectDrive-2,一种带有独立动作专家的掩码离散扩散规划器 (https://huggingface.co/papers?q=masked%20discrete%20diffusion%20planner),用于自动驾驶。它将规划表示为离散轨迹令牌 (https://huggingface.co/papers?q=discrete%20trajectory%20tokens),并通过并行掩码解码 (https://huggingface.co/papers?q=parallel%20masked%20decoding) 生成这些令牌。这种离散令牌空间支持原地轨迹修订:AutoEdit (https://huggingface.co/papers?q=AutoEdit) 使用同一模型重写选定的令牌,无需辅助细化网络。为了训练这种能力,我们采用了两阶段流程。首先,我们构建沿纵向进度和横向航向方向的专家轨迹的结构感知扰动 (https://huggingface.co/papers?q=structure-aware%20perturbations),并监督模型恢复原始专家轨迹。然后,我们使用强化学习 (https://huggingface.co/papers?q=reinforcement%20learning) (RL) 微调完整的决策-草稿-反思 (decision-draft-reflect) rollout 过程,将终端驾驶奖励分配给最终编辑后的轨迹,并通过完整 rollout 过渡传播策略梯度信用 (https://huggingface.co/papers?q=policy-gradient%20credit)。完整的 rollout RL 对于耦合草稿和编辑被证明至关重要:仅在监督训练下,推理时的 AutoEdit (https://huggingface.co/papers?q=AutoEdit) 最多仅能提高 PDMS (https://huggingface.co/papers?q=PDMS) 0.3,而 RL 将其增益提高到了 1.9。我们还为决策-草稿-反思管道 (https://huggingface.co/papers?q=decision–draft–reflect%20pipeline) 共同设计了一个高效的反思式解码堆栈,结合了共享前缀 KV 复用 (https://huggingface.co/papers?q=shared-prefix%20KV%20reuse)、交替步解码 (https://huggingface.co/papers?q=Alternating%20Step%20Decode) 以及融合的设备端解掩码 (https://huggingface.co/papers?q=fused%20on-device%20unmasking)。在 NAVSIM (https://huggingface.co/papers?q=NAVSIM) 上,ReflectDrive-2 在仅摄像头输入下实现了 91.0 的 PDMS (https://huggingface.co/papers?q=PDMS),在 best-of-6 神谕设置下实现了 94.8 的 PDMS (https://huggingface.co/papers?q=PDMS),同时在 NVIDIA Thor 上运行时的平均延迟为 31.8 毫秒。
查看 arXiv 页面 (https://arxiv.org/abs/2605.04647) 查看 PDF (https://arxiv.org/pdf/2605.04647) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2605.04647)
在你的 agent 中获取这篇论文:
hf papers read 2605\.04647
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2605.04647 以从此页面链接它。
引用此论文的数据集 0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2605.04647 以从此页面链接它。
引用此论文的 Spaces 0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2605.04647 以从此页面链接它。
包含此论文的合集 0
没有合集包含此论文
将此论文添加到合集 (https://huggingface.co/new-collection) 以从此页面链接它。
相似文章
DiDrive:一种用于自动驾驶安全离线强化学习的风险感知分层扩散框架
DiDrive是一种用于自动驾驶安全离线强化学习的风险感知分层扩散框架,通过集成表示学习和分布校正优化,提升复杂交通场景中的性能。
RAD-2:在生成器-判别器框架中扩展强化学习
RAD-2 提出了一个用于自动驾驶的统一生成器-判别器框架,将基于扩散的轨迹生成与强化学习优化的重排序相结合,与基于扩散的规划器相比,碰撞率降低了56%。该方法引入了 Temporally Consistent Group Relative Policy Optimization 和 BEV-Warp 仿真环境等技术,以实现高效的大规模训练。
Fast-dDrive: 用于自动驾驶的高效块扩散VLM
Fast-dDrive是一种用于端到端自动驾驶的块扩散VLA模型,实现了最先进的轨迹精度,同时相比自回归基线提供了超过12倍的吞吐量加速,解决了高保真规划与边缘部署高效推理之间的权衡。
不破坏的引导:基于机制的离散扩散语言模型干预
本文介绍了一种新颖的自适应调度器,用于利用稀疏自编码器引导离散扩散语言模型,结果表明,基于特定属性提交时机进行针对性干预,比均匀方法能提升控制质量和强度。
SafeDiffusion-R1: 在线奖励引导的安全扩散后训练
SafeDiffusion-R1 引入了一个基于 GRPO 和引导奖励机制的在线强化学习框架,用于提升扩散模型的安全性,无需监督数据或奖励调优,在多个有害类别上实现了最先进的性能。