DriveZero:超越人类演示的端到端驾驶

Hugging Face Daily Papers 论文

摘要

DriveZero 是一个端到端自动驾驶系统,它结合了用于感知的视觉基础模型和用于行动的强化学习,实现了超越人类演示的驾驶行为,并在 nuPlan 和 NAVSIM 等基准测试中取得了最先进的性能。

大多数端到端自动驾驶系统通过模仿人类驾驶日志来学习,这使得它们学到的行为受到记录轨迹的质量和行为覆盖范围的限制。本报告介绍了 DriveZero,一个学习超越人类演示的驾驶行为的端到端系统。它将驾驶分解为感知模型和行动模型,分别在最适合它们的环境中进行预训练,并将它们组合成一个端到端规划器。这两个模型需要不同的学习配方:感知必须理解世界,并受益于大规模和多样化的视觉数据;行动必须与之交互,并需要闭环反馈。在行动方面,我们介绍了 DriveRL,一个多智能体闭环强化学习框架。它将真实驾驶日志转换为交互式世界,在其中使用 PPO 通过闭环回滚训练一个特权教师策略。对于感知模型,DriveVFM 将多个冻结的视觉基础模型,包括 DINOv3、SigLIP2、SAM 和 Depth Anything V2,整合到一个主干网络中,仅从原始图像中学习,无需任务特定的标注。DriveZero 随后统一了两者:一个仅使用摄像头的规划器,通过其回滚轨迹蒸馏冻结的 DriveRL 教师。此外,这个目标条件的教师可以在增强的驾驶意图下被查询,产生多样化的、目标一致的监督,这是记录数据无法提供的。在 nuPlan 上,DriveRL 使用价值引导的测试时动作搜索,在 Val14、Test14-hard 和 Test14-random 社区拆分中,在非反应和反应模式下平均得分为 93.57,在所有三个拆分上都超过了 Log-Replay 专家。DriveZero 在 NAVSIMv1、NAVSIMv2 和闭环 HUGSIM 基准测试中取得了最先进的性能,没有任何人类轨迹监督。
查看原文
查看缓存全文

缓存时间: 2026/09/09 04:31

论文页面 - DriveZero:超越人类演示的端到端自动驾驶

来源:https://huggingface.co/papers/2609.06055
发布日期:9月5日

#2 当日热门论文(https://huggingface.co/papers/date/2026-09-09)
作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,

摘要

DriveZero是一个端到端自动驾驶系统,它将用于感知的视觉基础模型与闭环强化学习动作模型相结合,学习超越人类演示的驾驶行为。

大多数端到端自动驾驶系统通过模仿人类驾驶日志进行学习,这使得其学习到的行为受限于所记录轨迹的质量和行为覆盖范围。本报告介绍了DriveZero(https://huggingface.co/papers?q=DriveZero),一个能够学习超越人类演示的驾驶行为的端到端系统。它将驾驶分解为感知模型和动作模型,分别在最适其学习规律的条件下进行预训练,然后将二者组合成一个端到端的规划器。这两个模型需要不同的学习方案:感知模型需要理解世界,因此受益于大规模、多样化的视觉数据;动作模型需要与世界交互,因此需要闭环反馈。在动作方面,我们引入了DriveRL(https://huggingface.co/papers?q=DriveRL),一个混合智能体闭环强化学习框架。它将真实的驾驶日志转化为交互式世界,在这个世界中,一个特权教师策略通过PPO(https://huggingface.co/papers?q=PPO)进行闭环展开训练。对于感知模型,DriveVFM将多个冻结的视觉基础模型(https://huggingface.co/papers?q=vision%20foundation%20models),包括DINOv3(https://huggingface.co/papers?q=DINOv3)、SigLIP2(https://huggingface.co/papers?q=SigLIP2)、SAM(https://huggingface.co/papers?q=SAM)和Depth Anything V2(https://huggingface.co/papers?q=Depth%20Anything%20V2)整合成一个仅从原始图像学习的主干网络,无需任务特定的标注。随后,DriveZero(https://huggingface.co/papers?q=DriveZero)统一了这两者:一个仅依赖摄像头的规划器,通过蒸馏冻结的DriveRL(https://huggingface.co/papers?q=DriveRL)教师模型展开的轨迹进行学习。这个目标条件教师(https://huggingface.co/papers?q=goal-conditioned%20teacher)还可以在增强的驾驶意图下进行查询,从而提供日志数据无法提供的多样化、目标一致的监督信号。在nuPlan基准测试中,DriveRL(https://huggingface.co/papers?q=DriveRL)在Val14、Test14-hard和Test14-random这三个社区划分上,无论是在非反应模式还是反应模式下,均实现了93.57的平均分数,超越了Log-Replay专家方法。DriveZero(https://huggingface.co/papers?q=DriveZero)在NAVSIMv1、NAVSIMv2和闭环HUGSIM基准测试中取得了最先进的性能,且无需任何人类轨迹监督。

查看arXiv页面(https://arxiv.org/abs/2609.06055)| 查看PDF(https://arxiv.org/pdf/2609.06055)| 项目主页(https://xiaomiautol3.github.io/DriveZero/)| GitHub 42(https://github.com/XiaomiAutoL3/DriveZero)| 添加到收藏夹(https://huggingface.co/login?next=%2Fpapers%2F2609.06055)

在你的智能体中获取此论文:

hf papers read 2609.06055

没有最新版CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

无模型链接此论文

在模型README.md中引用 arxiv.org/abs/2609.06055 可将其链接到此页面。

引用此论文的数据集 0

无数据集链接此论文

在数据集README.md中引用 arxiv.org/abs/2609.06055 可将其链接到此页面。

引用此论文的空间 0

无空间链接此论文

在空间README.md中引用 arxiv.org/abs/2609.06055 可将其链接到此页面。

包含此论文的收藏夹 0

无收藏夹包含此论文

将此论文添加到收藏夹(https://huggingface.co/new-collection)可将其链接到此页面。

相似文章

Qwen-Drive (GitHub 仓库)

TLDR AI

Qwen-Drive-1.0 是一个用于自动驾驶的视觉语言基础模型,它在一个统一框架中整合了3D感知、视觉问答和运动规划,在基准测试中表现出色。