VABench: 通过视觉演示、主动感知和度量控制来测量具身空间智能
摘要
VABench 引入了一个基准,通过测试模型在视觉演示和主动感知下观察、推理和行动的能力,来评估模型中的具身空间智能。它表明主动摄像头控制提高了任务成功率,但没有模型能完成长期任务。
查看缓存全文
缓存时间: 2026/09/18 03:01
论文页面 - VABench:通过视觉演示、主动感知和度量控制测量具身空间智能
来源:https://huggingface.co/papers/2609.19554
摘要
空间智能不仅需要描述物体位置。在不完全观察的情况下,模型必须识别并获取缺失的证据,在一个共同的空间框架中解释这些证据,并基于它采取行动。我们引入了VABench来评估完整的观察-推理-行动-修正循环。通用多模态大语言模型从纯RGB演示中学习程序上下文,主动选择相机视角,发出度量笛卡尔坐标命令,并根据执行反馈对其进行修正。模型不会获得特权物体姿态、预言机轨迹或经过学习的动作头。一个固定的、与模型无关的控制器仅执行模型指定的目标。VABench包含14个基础任务族(11个单臂和3个双臂),7个保留几何/布局变体,以及一个长时间跨度五物体组合赛道。我们在每个基础任务的20个经过物理验证的种子上,对12个主要模型条件进行了三次独立运行评估,报告了最终成功率、九个轨迹层面行为诊断和子任务进展。首先,在标注运行中,表现最佳的模型在目标定位上得分100.0%,在空间关系上得分78.9%。但其三次运行的宏平均任务成功率仅为53.93 ± 3.17%。其次,主动相机控制相比于被动多视角观察显著提高了任务成功率。在一次匹配对比中,成功率从27.86%提升至57.50%。第三,保留几何形状的迁移可使任务成功率降低超过30个百分点。尽管取得了大量部分进展,但没有模型能够完成一个严格的长时间跨度回合。因此,VABench测试了通用多模态大语言模型是否能够将视觉演示和主动获取的证据转化为成功的具身行动。
查看 arXiv 页面 (https://arxiv.org/abs/2609.19554) 查看 PDF (https://arxiv.org/pdf/2609.19554) GitHub3 (https://github.com/zhangzhongbo2213/VABench) 添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2609.19554)
引用本文的模型0
没有模型链接到本文。 在模型 README.md 中引用 arxiv.org/abs/2609.19554 以从本页链接到该模型。
引用本文的数据集0
没有数据集链接到本文。 在数据集 README.md 中引用 arxiv.org/abs/2609.19554 以从本页链接到该数据集。
引用本文的 Spaces0
没有 Space 链接到本文。 在 Space README.md 中引用 arxiv.org/abs/2609.19554 以从本页链接到该 Space。
包含本文的收藏集0
没有收藏集包含本文。 将本文添加到收藏集 (https://huggingface.co/new-collection) 以从本页链接到该收藏集。
相似文章
ESI-Bench:迈向闭环感知-行动的具身空间智能
介绍了 ESI-BENCH,这是一个基于 OmniGibson 构建的全面具身空间智能基准,涵盖 10 个任务类别和 29 个子类别。实验表明,主动探索显著优于被动方法,失败主要源于行动盲视而非感知,揭示了模型与人类相比的元认知差距。
空间中的自我:无人机具身智能中自我意识与空间认知的基准测试
本文介绍了SIS-Bench,一个用于通过多模态大语言模型评估无人机具身智能中自我意识与空间认知的基准,并探索了运动感知表示以提升性能。
Embodied-BenchClaw:一种用于具身空间智能基准构建的自主多智能体系统
本文提出Embodied-BenchClaw,一种自主多智能体系统,能够通过包含过程质量控制与可扩展技能库的五阶段流水线,根据用户意图自动构建具身空间智能基准。
SVI-Bench:战略视频智能的动态微世界
介绍了SVI-Bench,这是一个利用团队运动进行战略视频智能的大规模基准,旨在评估模型在动态场景理解、因果推理、战略模拟和代理综合方面的能力。该基准揭示了一个能力断崖:模型在感知任务上表现良好,但在更高层次的战略推理上急剧下降。
SceneActBench: 智能体能否在其看到的3D场景中执行操作?
SceneActBench是一个基准测试,用于评估VLM智能体在完整的多对象3D场景中执行操作的能力,通过五个任务中的任务特定几何指标进行评估。