DriveDNA:大规模多模态自然驾驶数据集及驾驶风格识别基准
摘要
介绍 DriveDNA,这是一个包含来自 115 种车型的 465 名驾驶员的 4,121 次行程的大规模多模态自然驾驶数据集,以及通过小样本驾驶员重识别和个性化行为预测等任务进行驾驶风格识别的基准。
查看缓存全文
缓存时间: 2026/07/28 06:34
论文页面 - DriveDNA:一个用于驾驶风格识别的大规模多模态自然驾驶数据集与基准
来源: https://huggingface.co/papers/2607.23822 发表于 7月26日
·
提交者 https://huggingface.co/HenryYHW
Henry (https://huggingface.co/HenryYHW) 于7月28日
摘要
驾驶风格捕捉了车辆如何被驾驶中的稳定、驾驶员特有的模式。然而在自然数据中,由于驾驶员在不同车辆、不同道路以及不同条件下被观察,这一信号难以孤立,模型可能会将车辆或情境特定的规律误认为是驾驶员特有的风格。我们引入 DriveDNA,一个用于个性化驾驶风格建模的大规模自然数据集和基准,包含来自 465 名驾驶员在 115 种车辆模型上的 4,121 次驾驶,总计 975 小时的人类控制驾驶(10Hz 采样率,含前向视频),数据由社区驾驶员在日常使用中收集。DriveDNA 将驾驶风格定义为在相似条件下车辆运动的一致、驾驶员特有的行为模式。该基准通过三个核心任务评估这一信号:少样本驾驶员再识别、个性化行为预测以及条件匹配比较,并提供行为标注以及经大规模人工审核的 276,248 个规则生成的六类机动事件。我们在固定多随机种子协议下评估了涵盖经典描述符、有监督和自监督时序编码器、多模态融合、概率预测以及零样本基础模型的基线方法。学习到的表示在未见驾驶员上大幅优于经典描述符(AUROC .935 vs .707),并在匹配驾驶条件下保留了驾驶员特有信息,而描述符性能接近随机。纯视频模型取得了可比的再识别准确率,但存在严重的路线泄漏,表明强识别能力可能源于上下文捷径而非驾驶行为。这些发现表明,可靠的驾驶风格评估必须同时评估学习到的表示的行为价值及其对车辆、驾驶和条件混淆因素的鲁棒性。
查看 arXiv 页面 (https://arxiv.org/abs/2607.23822)查看 PDF (https://arxiv.org/pdf/2607.23822)GitHub0 (https://github.com/WangYuHang-cmd/DriveDNA)添加至收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.23822)
在您的 agent 中获取此论文:
hf papers read 2607.23822
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
无模型关联此论文
在模型的 README.md 中引用 arxiv.org/abs/2607.23822 以从此页面链接它。
引用此论文的数据集1
HenryYHW/DriveDNA 更新于大约4小时前 • 19 (https://huggingface.co/datasets/HenryYHW/DriveDNA)
引用此论文的 Space0
无 Space 关联此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2607.23822 以从此页面链接它。
包含此论文的收藏0
无收藏包含此论文
将此论文添加至收藏 (https://huggingface.co/new-collection) 以从此页面链接它。
相似文章
PersonaDrive:面向闭环驾驶仿真的基于人类风格的检索增强VLA智能体
本文介绍了PersonaDrive,一种将视觉-语言-动作(VLA)驾驶智能体基于从风格引导的人类驾驶数据集中检索到的演示进行条件化的流程,从而能够为闭环仿真提供风格多样的非自车智能体,并在Bench2Drive上提升了驾驶评分。
自动驾驶的前沿之路:KITScenes多模态数据集
KITScenes Multimodal 是一个高保真度的欧洲自动驾驶数据集,配备同步传感器、完整的3D高精地图,以及用于空间学习和具身AI研究的四个基准测试。
CMU-Drive 与 V2V-VLA:基于推理基准和车对车视觉-语言-行动模型的协同多智能体统一驾驶
介绍了 CMU-Drive,一个用于协同多智能体自动驾驶的闭环基准,以及 V2V-VLA,一个联合生成驾驶动作、路径点、推理和通信策略的视觉-语言-行动模型。这为协同 VLA 驾驶提供了首个基准和基线。
DriveZero:超越人类演示的端到端驾驶
DriveZero 是一个端到端自动驾驶系统,它结合了用于感知的视觉基础模型和用于行动的强化学习,实现了超越人类演示的驾驶行为,并在 nuPlan 和 NAVSIM 等基准测试中取得了最先进的性能。
DF3DV-1K:大规模无干扰新视角合成数据集与基准
介绍了DF3DV-1K,一个包含1048个场景和89924张图像的大规模真实世界数据集,用于无干扰的新视角合成,同时提供了九种方法的基准测试,以及通过微调基于扩散的2D增强器来改进辐射场方法的应用。