SpatialAct: 探索VLM智能体在3D场景中的空间推理到行动的能力

Hugging Face Daily Papers 论文

摘要

SpatialAct是一个新的基于模拟器的基准,用于探索VLM智能体是否能在多轮反馈设置下进行连贯的空间推理并将其转化为3D环境中的行动。实验揭示了一个显著的推理到行动差距:当前的VLM尽管在孤立推理任务上表现良好,但难以维持空间信念并产生可靠的行为。

人类可以毫不费力地感知空间布局、形成认知表征、推理空间关系,并在日常3D环境中将这种推理转化为行动。尽管最近的视觉-语言模型(VLM)在基于观察的空间感知和推理任务上展示了有希望的性能,但仍不清楚它们能否构建连贯的空间理解、据此采取行动并通过多轮反馈优化其行动。为了研究这个问题,我们提出了SpatialAct,一个基于模拟器的基准,用于探索3D场景中基于行动的空间推理。从最具挑战性的设置Multi-turn Interactive Refinement开始,我们进一步设计了其分解形式Single-step Error Detection and Fix,连同五个基础空间能力任务,以诊断模型失败的潜在原因。实验揭示了一个清晰的推理到行动差距:当前的VLM在孤立空间推理任务上表现良好,但在多轮反馈中难以维持连贯的空间信念并产生可靠的行为,显著低于人类表现。这些结果表明,当前的VLM智能体在行动引起的环境变化下仍然缺乏稳健的空间状态追踪,即使底层控制被抽象掉也是如此。
查看原文

相似文章