Robusto-2:在利马和纽约市对人与VLMs进行自动驾驶基准测试
摘要
本文研究了自动驾驶系统与人类在不同地理位置(利马和纽约市)的视觉问答任务中的表现,发现人类和VLM无论地点如何都表现出相似的性能,但根据问题类型存在差异。
查看缓存全文
缓存时间: 2026/06/23 17:43
论文页面 - Robusto-2:利马与纽约市自动驾驶中人类与VLM的基准测试
来源:https://huggingface.co/papers/2606.20980
摘要
本研究考察了自动驾驶系统与人类在不同地理位置的视觉问答任务上的表现,揭示出人类和AI的回答因问题类型而异,但不同地点的表现却相似。
随着自动驾驶汽车(Self-Driving Cars)持续拓展国际市场,并采用多模态系统(multi-modal systems)如VLM(VLMs)作为其动作模型的认知核心,这些系统在新环境——尤其是新地理区域中分布外(out-of-distribution, OOD)的边界情况——里泛化能力如何?本文通过提供全因子分析来探讨这一开放问题:我们让利马的人类驾驶员、纽约市的人类驾驶员以及VLM观看分别从利马和纽约市采集的行车记录仪(dashcam)片段,并在视觉问答(Visual Question Answering, VQA)范式下用多种问题对它们进行提示。我们特意选择了这两个城市,因为它们都是极具挑战性的驾驶地点,目前尚无自动驾驶汽车公司在此运营,并提出涵盖4个类别的问题:事实(Factual)、评分(Ratings)、反事实(Counterfactual)和推理(Reasoning)。我们发现人类与VLM在回答上存在差异——尽管这种差异受到问题类型的调节,而不同地域(利马/纽约)的人类回答则相似。令我们惊讶的是,我们并未发现地理因素对回答(人类或VLM)有明显的差异影响,这很可能是因为这些场景本身处于高度分布外(out-of-distribution)的状态。我们的数据集可在 https://huggingface.co/datasets/Artificio/robusto-2 获取。
查看 arXiv 页面(https://arxiv.org/abs/2606.20980)查看 PDF(https://arxiv.org/pdf/2606.20980)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.20980)
引用本文的模型0
没有模型关联本文
在模型 README.md 中引用 arxiv.org/abs/2606.20980 即可在此页面链接。
引用本文的数据集1
Artificio/robusto-2 更新于约3小时前 • 2(https://huggingface.co/datasets/Artificio/robusto-2)
引用本文的 Spaces0
没有 Space 关联本文
在 Space README.md 中引用 arxiv.org/abs/2606.20980 即可在此页面链接。
包含本文的收藏集0
没有收藏集包含本文
将本文添加至收藏集(https://huggingface.co/new-collection)即可在此页面链接。
相似文章
OVO-S-Bench:面向多模态大语言模型流式空间智能的层次化基准测试
OVO-S-Bench 构建了一个全面的人工标注基准测试,涵盖 348 个视频中的 1,680 道问题,用于评估多模态大语言模型的流式空间智能能力。结果显示,即便是表现最佳的模型(Gemini-3.1-Pro)也比人类专家低 27 分。该基准测试揭示了若干关键局限:以他者为中心的空间映射是主要瓶颈,而思维链推理则会放大空间错误。
PersonaDrive:面向闭环驾驶仿真的基于人类风格的检索增强VLA智能体
本文介绍了PersonaDrive,一种将视觉-语言-动作(VLA)驾驶智能体基于从风格引导的人类驾驶数据集中检索到的演示进行条件化的流程,从而能够为闭环仿真提供风格多样的非自车智能体,并在Bench2Drive上提升了驾驶评分。
SuperMemory-VQA: 一个面向长期记忆的自我中心视觉问答基准
SuperMemory-VQA 是一个新的自我中心VQA基准,包含52.9小时AI眼镜录像和4,853个问答对,旨在评估AI助手在长期记忆任务上的表现,涵盖物体回忆、意图、时间线和对话。基准测试显示,现有的智能体框架和大型语言模型在这些真实世界的记忆挑战上仍远未达到可靠水平。
LEVANTE-bench:使用认知任务对VLM与儿童进行多尺度比较(或者,“你的VLM比五年级学生更聪明吗?”)
本文介绍了LEVANTE-bench,这是一个系统评估视觉-语言模型在六项认知任务上的表现,并将其与5-12岁儿童的表现进行比较的基准测试,发现当前的VLM仅部分与儿童的认知能力相符。
揭示VLM可解释的故障模式
本文介绍了Revelio,这是一个通过搜索离散概念组合来系统性地发现视觉语言模型(VLM)中可解释故障模式的框架。应用于自动驾驶和室内机器人领域,它揭示了此前未报道的、可能导致碰撞或安全危险的漏洞。