DriveZero:超越人类演示的端到端驾驶
摘要
DriveZero 是一个端到端自动驾驶系统,它结合了用于感知的视觉基础模型和用于行动的强化学习,实现了超越人类演示的驾驶行为,并在 nuPlan 和 NAVSIM 等基准测试中取得了最先进的性能。
查看缓存全文
缓存时间: 2026/09/09 04:31
论文页面 - DriveZero:超越人类演示的端到端自动驾驶
来源:https://huggingface.co/papers/2609.06055
发布日期:9月5日
#2 当日热门论文(https://huggingface.co/papers/date/2026-09-09)
作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
DriveZero是一个端到端自动驾驶系统,它将用于感知的视觉基础模型与闭环强化学习动作模型相结合,学习超越人类演示的驾驶行为。
大多数端到端自动驾驶系统通过模仿人类驾驶日志进行学习,这使得其学习到的行为受限于所记录轨迹的质量和行为覆盖范围。本报告介绍了DriveZero(https://huggingface.co/papers?q=DriveZero),一个能够学习超越人类演示的驾驶行为的端到端系统。它将驾驶分解为感知模型和动作模型,分别在最适其学习规律的条件下进行预训练,然后将二者组合成一个端到端的规划器。这两个模型需要不同的学习方案:感知模型需要理解世界,因此受益于大规模、多样化的视觉数据;动作模型需要与世界交互,因此需要闭环反馈。在动作方面,我们引入了DriveRL(https://huggingface.co/papers?q=DriveRL),一个混合智能体闭环强化学习框架。它将真实的驾驶日志转化为交互式世界,在这个世界中,一个特权教师策略通过PPO(https://huggingface.co/papers?q=PPO)进行闭环展开训练。对于感知模型,DriveVFM将多个冻结的视觉基础模型(https://huggingface.co/papers?q=vision%20foundation%20models),包括DINOv3(https://huggingface.co/papers?q=DINOv3)、SigLIP2(https://huggingface.co/papers?q=SigLIP2)、SAM(https://huggingface.co/papers?q=SAM)和Depth Anything V2(https://huggingface.co/papers?q=Depth%20Anything%20V2)整合成一个仅从原始图像学习的主干网络,无需任务特定的标注。随后,DriveZero(https://huggingface.co/papers?q=DriveZero)统一了这两者:一个仅依赖摄像头的规划器,通过蒸馏冻结的DriveRL(https://huggingface.co/papers?q=DriveRL)教师模型展开的轨迹进行学习。这个目标条件教师(https://huggingface.co/papers?q=goal-conditioned%20teacher)还可以在增强的驾驶意图下进行查询,从而提供日志数据无法提供的多样化、目标一致的监督信号。在nuPlan基准测试中,DriveRL(https://huggingface.co/papers?q=DriveRL)在Val14、Test14-hard和Test14-random这三个社区划分上,无论是在非反应模式还是反应模式下,均实现了93.57的平均分数,超越了Log-Replay专家方法。DriveZero(https://huggingface.co/papers?q=DriveZero)在NAVSIMv1、NAVSIMv2和闭环HUGSIM基准测试中取得了最先进的性能,且无需任何人类轨迹监督。
查看arXiv页面(https://arxiv.org/abs/2609.06055)| 查看PDF(https://arxiv.org/pdf/2609.06055)| 项目主页(https://xiaomiautol3.github.io/DriveZero/)| GitHub 42(https://github.com/XiaomiAutoL3/DriveZero)| 添加到收藏夹(https://huggingface.co/login?next=%2Fpapers%2F2609.06055)
在你的智能体中获取此论文:
hf papers read 2609.06055
没有最新版CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
无模型链接此论文
在模型README.md中引用 arxiv.org/abs/2609.06055 可将其链接到此页面。
引用此论文的数据集 0
无数据集链接此论文
在数据集README.md中引用 arxiv.org/abs/2609.06055 可将其链接到此页面。
引用此论文的空间 0
无空间链接此论文
在空间README.md中引用 arxiv.org/abs/2609.06055 可将其链接到此页面。
包含此论文的收藏夹 0
无收藏夹包含此论文
将此论文添加到收藏夹(https://huggingface.co/new-collection)可将其链接到此页面。
相似文章
Qwen-Drive (GitHub 仓库)
Qwen-Drive-1.0 是一个用于自动驾驶的视觉语言基础模型,它在一个统一框架中整合了3D感知、视觉问答和运动规划,在基准测试中表现出色。
PersonaDrive:面向闭环驾驶仿真的基于人类风格的检索增强VLA智能体
本文介绍了PersonaDrive,一种将视觉-语言-动作(VLA)驾驶智能体基于从风格引导的人类驾驶数据集中检索到的演示进行条件化的流程,从而能够为闭环仿真提供风格多样的非自车智能体,并在Bench2Drive上提升了驾驶评分。
Qwen-Drive-1.0:迈向自动驾驶视觉语言基础模型的初步探索
Qwen-Drive-1.0是一款面向自动驾驶的视觉语言基础模型,通过共享表征与分阶段训练,统一了三维感知、视觉问答和运动规划能力。
驾驶席上:一项关于自动驾驶系统测试现状的多公司研究
一项基于访谈的研究,涵盖六个国家的九家公司,考察当前自动驾驶系统测试实践、挑战和未来趋势,提出了一个以证据为中心的闭环测试框架。
CMU-Drive 与 V2V-VLA:基于推理基准和车对车视觉-语言-行动模型的协同多智能体统一驾驶
介绍了 CMU-Drive,一个用于协同多智能体自动驾驶的闭环基准,以及 V2V-VLA,一个联合生成驾驶动作、路径点、推理和通信策略的视觉-语言-行动模型。这为协同 VLA 驾驶提供了首个基准和基线。