SleepWalk:一个用于压力测试指令引导的视觉语言导航的三层基准
摘要
SleepWalk 是一个三层基准,用于评估视觉语言模型从文本指令和视觉观察中预测3D环境中空间连贯轨迹的能力,揭示了在遮挡和多步指令下接地空间推理的系统性失败。
查看缓存全文
缓存时间: 2026/05/14 00:15
论文页面 - SleepWalk:用于压力测试指令引导视觉-语言导航的三级基准
来源:https://huggingface.co/papers/2605.10376
摘要
SleepWalk 是一个基准测试,用于评估视觉-语言模型根据文本指令和视觉观察在 3D 环境中预测空间连贯、可执行轨迹的能力。
视觉-语言模型(Vision-Language Models)(VLMs)在多模态感知(multimodal perception)和语言理解(language understanding)方面取得了快速进展,但尚不清楚它们能否可靠地将语言落地为 3D 数字环境中空间连贯、可合理执行的动作。我们提出 SleepWalk,一个用于评估基于指令的轨迹预测(trajectory prediction)的基准,其场景为根据文本场景描述生成并经过可通行性筛选的单场景 3D 世界。与以往聚焦于跨房间长程探索的导航基准不同,SleepWalk 专注于局部的、以交互为中心的具身推理(embodied reasoning):给定渲染的视觉观察和自然语言指令,模型必须预测一条轨迹,该轨迹需尊重场景几何结构、避免碰撞,并终止于与动作兼容的位置。该基准涵盖多样的室内和室外环境,并将任务按空间和时间难度分为三个层级,从而在组合复杂度递增的情况下进行细粒度的接地分析。我们使用标准化的逐点评判评估协议,在 2,472 个经过筛选的 3D 环境(3D environments)中,对三种前沿 VLM 进行了评估,每个场景包含九条指令。结果揭示了在接地空间推理中的系统性失败,尤其是在遮挡、交互约束和多步指令下:随着任务难度级别的增加,性能下降。总体而言,当前的 VLM 能够在一定程度上生成同时具有空间连贯性、可合理执行性且与预期动作一致的轨迹。通过在可控但可扩展的设置中暴露失败,SleepWalk 为推动接地多模态推理、具身规划、视觉-语言导航(vision-language navigation)以及 3D 环境(3D environments)中具有行动能力的智能体(action-capable agents)提供了关键基准。
查看 arXiv 页面(https://arxiv.org/abs/2605.10376)查看 PDF(https://arxiv.org/pdf/2605.10376)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.10376)
引用本文的模型0
暂无模型关联本文
请在模型 README.md 中引用 arxiv.org/abs/2605.10376 以建立与本文的链接。
引用本文的数据集0
暂无数据集关联本文
请在数据集 README.md 中引用 arxiv.org/abs/2605.10376 以建立与本文的链接。
引用本文的 Spaces0
暂无 Space 关联本文
请在 Space README.md 中引用 arxiv.org/abs/2605.10376 以建立与本文的链接。
包含本文的收藏0
暂无收藏包含本文
请将本文添加至收藏(https://huggingface.co/new-collection)以建立与本文的链接。
相似文章
PlanBench-V: 面向视觉语言模型的空间规划地图基准
本文介绍了PlanBench-V,这是首个用于评估视觉语言模型在空间规划地图解读方面能力的综合性基准,包括一个专家标注的数据集和一个四维度评估框架。实验显示取得了显著进展,但也突显了在面向实施的任务中持续存在的挑战。
RoboStressBench:具身场景中VLM对物理视觉压力鲁棒性的基准测试
RoboStressBench提出了一个基准,用于评估视觉语言模型在具身场景中对物理视觉压力(材质、视点、光照、几何)的鲁棒性,并识别特定于压力的失效模式。
MultiView-Bench:一种面向VLMs的世界中心多视角集成诊断基准
MultiView-Bench是一个诊断基准,用于评估视觉语言模型将多个视角整合为一致3D心智模型的能力,揭示了3D空间推理中的系统性失败,并引入了ViewNavigator以缓解这些问题。
SpatialWorld: 多模态智能体在真实世界任务中的交互式空间推理基准测试
SpatialWorld是一个统一的基准测试,用于评估多模态智能体在各种真实世界任务中的交互式空间推理能力。结果表明,即使是最强大的模型,其任务成功率也很低。
OVO-S-Bench:面向多模态大语言模型流式空间智能的层次化基准测试
OVO-S-Bench 构建了一个全面的人工标注基准测试,涵盖 348 个视频中的 1,680 道问题,用于评估多模态大语言模型的流式空间智能能力。结果显示,即便是表现最佳的模型(Gemini-3.1-Pro)也比人类专家低 27 分。该基准测试揭示了若干关键局限:以他者为中心的空间映射是主要瓶颈,而思维链推理则会放大空间错误。