Robusto-2:在利马和纽约市对人与VLMs进行自动驾驶基准测试

Hugging Face Daily Papers 论文

摘要

本文研究了自动驾驶系统与人类在不同地理位置(利马和纽约市)的视觉问答任务中的表现,发现人类和VLM无论地点如何都表现出相似的性能,但根据问题类型存在差异。

随着自动驾驶汽车在国际上的持续扩展,并采用多模态系统(如VLM)作为其行动模型的认知核心,这些系统在全新环境(特别是新地理区域中的分布外(OOD)边缘场景)中泛化能力如何?在本文中,我们通过全因子分析研究了这一开放性问题,涉及利马的人类驾驶员、纽约市的人类驾驶员以及VLM,向它们展示从利马和纽约市收集的行车记录仪视频,并在视觉问答(VQA)范式下向它们提出各种问题。具体而言,我们选择这两个城市,因为它们是极具挑战性的驾驶地点,目前没有自动驾驶汽车公司在此运营,并且我们提出的问题涵盖四大类别:事实性、评分、反事实和推理。我们发现人类和VLM的回答存在分歧——尽管这种分歧受到问题类型的影响,并且人类的回答相似,无论他们来自哪里(利马/纽约市)。令我们惊讶的是,我们没有发现地理因素对回答(人类或VLM)产生显著影响,这可能是由于这些场景的高度分布外特性。我们的数据集可在以下网址获取:https://huggingface.co/datasets/Artificio/robusto-2
查看原文
查看缓存全文

缓存时间: 2026/06/23 17:43

论文页面 - Robusto-2:利马与纽约市自动驾驶中人类与VLM的基准测试

来源:https://huggingface.co/papers/2606.20980

摘要

本研究考察了自动驾驶系统与人类在不同地理位置的视觉问答任务上的表现,揭示出人类和AI的回答因问题类型而异,但不同地点的表现却相似。

随着自动驾驶汽车(Self-Driving Cars)持续拓展国际市场,并采用多模态系统(multi-modal systems)如VLM(VLMs)作为其动作模型的认知核心,这些系统在新环境——尤其是新地理区域中分布外(out-of-distribution, OOD)的边界情况——里泛化能力如何?本文通过提供全因子分析来探讨这一开放问题:我们让利马的人类驾驶员、纽约市的人类驾驶员以及VLM观看分别从利马和纽约市采集的行车记录仪(dashcam)片段,并在视觉问答(Visual Question Answering, VQA)范式下用多种问题对它们进行提示。我们特意选择了这两个城市,因为它们都是极具挑战性的驾驶地点,目前尚无自动驾驶汽车公司在此运营,并提出涵盖4个类别的问题:事实(Factual)、评分(Ratings)、反事实(Counterfactual)和推理(Reasoning)。我们发现人类与VLM在回答上存在差异——尽管这种差异受到问题类型的调节,而不同地域(利马/纽约)的人类回答则相似。令我们惊讶的是,我们并未发现地理因素对回答(人类或VLM)有明显的差异影响,这很可能是因为这些场景本身处于高度分布外(out-of-distribution)的状态。我们的数据集可在 https://huggingface.co/datasets/Artificio/robusto-2 获取。

查看 arXiv 页面(https://arxiv.org/abs/2606.20980)查看 PDF(https://arxiv.org/pdf/2606.20980)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.20980)

引用本文的模型0

没有模型关联本文

在模型 README.md 中引用 arxiv.org/abs/2606.20980 即可在此页面链接。

引用本文的数据集1

Artificio/robusto-2 更新于约3小时前 • 2(https://huggingface.co/datasets/Artificio/robusto-2)

引用本文的 Spaces0

没有 Space 关联本文

在 Space README.md 中引用 arxiv.org/abs/2606.20980 即可在此页面链接。

包含本文的收藏集0

没有收藏集包含本文

将本文添加至收藏集(https://huggingface.co/new-collection)即可在此页面链接。

相似文章

OVO-S-Bench:面向多模态大语言模型流式空间智能的层次化基准测试

Papers with Code Trending

OVO-S-Bench 构建了一个全面的人工标注基准测试,涵盖 348 个视频中的 1,680 道问题,用于评估多模态大语言模型的流式空间智能能力。结果显示,即便是表现最佳的模型(Gemini-3.1-Pro)也比人类专家低 27 分。该基准测试揭示了若干关键局限:以他者为中心的空间映射是主要瓶颈,而思维链推理则会放大空间错误。

SuperMemory-VQA: 一个面向长期记忆的自我中心视觉问答基准

Hugging Face Daily Papers

SuperMemory-VQA 是一个新的自我中心VQA基准,包含52.9小时AI眼镜录像和4,853个问答对,旨在评估AI助手在长期记忆任务上的表现,涵盖物体回忆、意图、时间线和对话。基准测试显示,现有的智能体框架和大型语言模型在这些真实世界的记忆挑战上仍远未达到可靠水平。

揭示VLM可解释的故障模式

arXiv cs.AI

本文介绍了Revelio,这是一个通过搜索离散概念组合来系统性地发现视觉语言模型(VLM)中可解释故障模式的框架。应用于自动驾驶和室内机器人领域,它揭示了此前未报道的、可能导致碰撞或安全危险的漏洞。