SpatialAct: 探索VLM智能体在3D场景中的空间推理到行动的能力
摘要
SpatialAct是一个新的基于模拟器的基准,用于探索VLM智能体是否能在多轮反馈设置下进行连贯的空间推理并将其转化为3D环境中的行动。实验揭示了一个显著的推理到行动差距:当前的VLM尽管在孤立推理任务上表现良好,但难以维持空间信念并产生可靠的行为。
人类可以毫不费力地感知空间布局、形成认知表征、推理空间关系,并在日常3D环境中将这种推理转化为行动。尽管最近的视觉-语言模型(VLM)在基于观察的空间感知和推理任务上展示了有希望的性能,但仍不清楚它们能否构建连贯的空间理解、据此采取行动并通过多轮反馈优化其行动。为了研究这个问题,我们提出了SpatialAct,一个基于模拟器的基准,用于探索3D场景中基于行动的空间推理。从最具挑战性的设置Multi-turn Interactive Refinement开始,我们进一步设计了其分解形式Single-step Error Detection and Fix,连同五个基础空间能力任务,以诊断模型失败的潜在原因。实验揭示了一个清晰的推理到行动差距:当前的VLM在孤立空间推理任务上表现良好,但在多轮反馈中难以维持连贯的空间信念并产生可靠的行为,显著低于人类表现。这些结果表明,当前的VLM智能体在行动引起的环境变化下仍然缺乏稳健的空间状态追踪,即使底层控制被抽象掉也是如此。
相似文章
用想象力思考:基于世界模拟器的主动式视觉空间推理
本文提出了Astra,一个主动式空间推理框架,将经过强化学习训练的VLM策略与一个世界模拟器结合起来,生成新视角的观察结果,以改进视觉语言模型中的空间推理能力。
SceneActBench: 智能体能否在其看到的3D场景中执行操作?
SceneActBench是一个基准测试,用于评估VLM智能体在完整的多对象3D场景中执行操作的能力,通过五个任务中的任务特定几何指标进行评估。
MetaSpatial:强化VLMs在元宇宙中的3D空间推理
MetaSpatial是一个强化学习框架,旨在增强视觉语言模型(VLMs)的3D空间推理能力,能够生成连贯且物理上合理的3D场景,无需硬编码优化。
SpatialWorld: 多模态智能体在真实世界任务中的交互式空间推理基准测试
SpatialWorld是一个统一的基准测试,用于评估多模态智能体在各种真实世界任务中的交互式空间推理能力。结果表明,即使是最强大的模型,其任务成功率也很低。
SpatialClaw: 重新思考智能体空间推理的动作接口
SpatialClaw是一个无需训练的框架,它采用代码作为动作接口,使视觉语言模型能够进行灵活、有状态的空间推理,在多种3D/4D空间推理任务上取得了卓越性能。