SleepWalk:一个用于压力测试指令引导的视觉语言导航的三层基准

Hugging Face Daily Papers 论文

摘要

SleepWalk 是一个三层基准,用于评估视觉语言模型从文本指令和视觉观察中预测3D环境中空间连贯轨迹的能力,揭示了在遮挡和多步指令下接地空间推理的系统性失败。

视觉语言模型(VLMs)在多模态感知和语言理解方面取得了快速进展,但尚不清楚它们是否能够可靠地将语言接地到空间连贯、合理可执行的3D数字环境中的动作。我们介绍了 SleepWalk,一个用于评估在从文本场景描述生成并过滤可导航性的单场景3D世界中指令接地轨迹预测的基准。与以往专注于跨房间长距离探索的导航基准不同,SleepWalk 针对局部、以交互为中心的具身推理:给定渲染的视觉观察和自然语言指令,模型必须预测一条尊重场景几何、避免碰撞并终止于动作兼容位置的轨迹。该基准涵盖多样化的室内外环境,并将任务组织成三个空间和时间难度层级,使得能够在日益增加的组合复杂性下对接地进行细粒度分析。使用标准化的逐点评分评估协议,我们在2,472个精心策划的3D环境中评估了三个前沿的VLM,每个场景有九个指令。结果揭示接地空间推理的系统性失败,尤其在遮挡、交互约束和多步指令下:随着任务难度级别的增加,性能下降。总体而言,当前的VLMs能够在某种程度上生成同时具有空间连贯性、合理可执行性并与预期动作一致的轨迹。通过在一个可控且可扩展的设置中暴露失败,SleepWalk 为推进3D环境中的接地多模态推理、具身规划、视觉语言导航和具备行动能力的智能体提供了一个关键基准。
查看原文
查看缓存全文

缓存时间: 2026/05/14 00:15

论文页面 - SleepWalk:用于压力测试指令引导视觉-语言导航的三级基准

来源:https://huggingface.co/papers/2605.10376

摘要

SleepWalk 是一个基准测试,用于评估视觉-语言模型根据文本指令和视觉观察在 3D 环境中预测空间连贯、可执行轨迹的能力。

视觉-语言模型(Vision-Language Models)(VLMs)在多模态感知(multimodal perception)和语言理解(language understanding)方面取得了快速进展,但尚不清楚它们能否可靠地将语言落地为 3D 数字环境中空间连贯、可合理执行的动作。我们提出 SleepWalk,一个用于评估基于指令的轨迹预测(trajectory prediction)的基准,其场景为根据文本场景描述生成并经过可通行性筛选的单场景 3D 世界。与以往聚焦于跨房间长程探索的导航基准不同,SleepWalk 专注于局部的、以交互为中心的具身推理(embodied reasoning):给定渲染的视觉观察和自然语言指令,模型必须预测一条轨迹,该轨迹需尊重场景几何结构、避免碰撞,并终止于与动作兼容的位置。该基准涵盖多样的室内和室外环境,并将任务按空间和时间难度分为三个层级,从而在组合复杂度递增的情况下进行细粒度的接地分析。我们使用标准化的逐点评判评估协议,在 2,472 个经过筛选的 3D 环境(3D environments)中,对三种前沿 VLM 进行了评估,每个场景包含九条指令。结果揭示了在接地空间推理中的系统性失败,尤其是在遮挡、交互约束和多步指令下:随着任务难度级别的增加,性能下降。总体而言,当前的 VLM 能够在一定程度上生成同时具有空间连贯性、可合理执行性且与预期动作一致的轨迹。通过在可控但可扩展的设置中暴露失败,SleepWalk 为推动接地多模态推理、具身规划、视觉-语言导航(vision-language navigation)以及 3D 环境(3D environments)中具有行动能力的智能体(action-capable agents)提供了关键基准。

查看 arXiv 页面(https://arxiv.org/abs/2605.10376)查看 PDF(https://arxiv.org/pdf/2605.10376)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.10376)

引用本文的模型0

暂无模型关联本文

请在模型 README.md 中引用 arxiv.org/abs/2605.10376 以建立与本文的链接。

引用本文的数据集0

暂无数据集关联本文

请在数据集 README.md 中引用 arxiv.org/abs/2605.10376 以建立与本文的链接。

引用本文的 Spaces0

暂无 Space 关联本文

请在 Space README.md 中引用 arxiv.org/abs/2605.10376 以建立与本文的链接。

包含本文的收藏0

暂无收藏包含本文

请将本文添加至收藏(https://huggingface.co/new-collection)以建立与本文的链接。

相似文章

PlanBench-V: 面向视觉语言模型的空间规划地图基准

arXiv cs.CL

本文介绍了PlanBench-V,这是首个用于评估视觉语言模型在空间规划地图解读方面能力的综合性基准,包括一个专家标注的数据集和一个四维度评估框架。实验显示取得了显著进展,但也突显了在面向实施的任务中持续存在的挑战。

OVO-S-Bench:面向多模态大语言模型流式空间智能的层次化基准测试

Papers with Code Trending

OVO-S-Bench 构建了一个全面的人工标注基准测试,涵盖 348 个视频中的 1,680 道问题,用于评估多模态大语言模型的流式空间智能能力。结果显示,即便是表现最佳的模型(Gemini-3.1-Pro)也比人类专家低 27 分。该基准测试揭示了若干关键局限:以他者为中心的空间映射是主要瓶颈,而思维链推理则会放大空间错误。