VABench: 通过视觉演示、主动感知和度量控制来测量具身空间智能

Hugging Face Daily Papers 论文

摘要

VABench 引入了一个基准,通过测试模型在视觉演示和主动感知下观察、推理和行动的能力,来评估模型中的具身空间智能。它表明主动摄像头控制提高了任务成功率,但没有模型能完成长期任务。

空间智能不仅需要描述物体位置。在不完全观察下,模型必须识别并获取缺失的证据,在一个共同的空间框架中解释它,并基于此采取行动。我们引入 VA-Bench 来评估完整的观察-推理-行动-修正循环。通用 MLLMs 从仅 RGB 演示中学习过程上下文,主动选择摄像头视图,发出度量笛卡尔命令,并根据执行反馈进行修正。模型不会获得特权的物体位姿、预言轨迹或学习到的动作头。一个固定的模型无关控制器仅执行模型指定的目标。VA-Bench 包含 14 个基础任务族(11 个单臂和三个双臂),七个保留的几何/布局变体,以及一个长期五物体组合轨道。我们在每个基础任务的相同 20 个物理验证种子上,对 12 个主要模型条件进行三次独立运行,报告终端成功率、九个轨迹级行为诊断和子任务进展。首先,表现最好的模型在标注运行中,目标定位得分为 100.0%,空间关系得分为 78.9%。其三次运行的宏平均任务成功率仅为 53.93+/-3.17%。其次,主动摄像头控制显著提高了任务成功率,优于被动多视图观察。在一个匹配比较中,成功率从 27.86% 上升到 57.50%。第三,保留的几何转移可将任务成功率降低超过 30 个百分点。尽管有显著的部分进展,但没有模型能完成严格的长期任务。因此,VA-Bench 测试通用 MLLMs 是否能够将视觉演示和主动获取的证据转化为成功的具身行动。
查看原文
查看缓存全文

缓存时间: 2026/09/18 03:01

论文页面 - VABench:通过视觉演示、主动感知和度量控制测量具身空间智能

来源:https://huggingface.co/papers/2609.19554

摘要

空间智能不仅需要描述物体位置。在不完全观察的情况下,模型必须识别并获取缺失的证据,在一个共同的空间框架中解释这些证据,并基于它采取行动。我们引入了VABench来评估完整的观察-推理-行动-修正循环。通用多模态大语言模型从纯RGB演示中学习程序上下文,主动选择相机视角,发出度量笛卡尔坐标命令,并根据执行反馈对其进行修正。模型不会获得特权物体姿态、预言机轨迹或经过学习的动作头。一个固定的、与模型无关的控制器仅执行模型指定的目标。VABench包含14个基础任务族(11个单臂和3个双臂),7个保留几何/布局变体,以及一个长时间跨度五物体组合赛道。我们在每个基础任务的20个经过物理验证的种子上,对12个主要模型条件进行了三次独立运行评估,报告了最终成功率、九个轨迹层面行为诊断和子任务进展。首先,在标注运行中,表现最佳的模型在目标定位上得分100.0%,在空间关系上得分78.9%。但其三次运行的宏平均任务成功率仅为53.93 ± 3.17%。其次,主动相机控制相比于被动多视角观察显著提高了任务成功率。在一次匹配对比中,成功率从27.86%提升至57.50%。第三,保留几何形状的迁移可使任务成功率降低超过30个百分点。尽管取得了大量部分进展,但没有模型能够完成一个严格的长时间跨度回合。因此,VABench测试了通用多模态大语言模型是否能够将视觉演示和主动获取的证据转化为成功的具身行动。

查看 arXiv 页面 (https://arxiv.org/abs/2609.19554) 查看 PDF (https://arxiv.org/pdf/2609.19554) GitHub3 (https://github.com/zhangzhongbo2213/VABench) 添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2609.19554)

引用本文的模型0

没有模型链接到本文。 在模型 README.md 中引用 arxiv.org/abs/2609.19554 以从本页链接到该模型。

引用本文的数据集0

没有数据集链接到本文。 在数据集 README.md 中引用 arxiv.org/abs/2609.19554 以从本页链接到该数据集。

引用本文的 Spaces0

没有 Space 链接到本文。 在 Space README.md 中引用 arxiv.org/abs/2609.19554 以从本页链接到该 Space。

包含本文的收藏集0

没有收藏集包含本文。 将本文添加到收藏集 (https://huggingface.co/new-collection) 以从本页链接到该收藏集。

相似文章

ESI-Bench:迈向闭环感知-行动的具身空间智能

Hugging Face Daily Papers

介绍了 ESI-BENCH,这是一个基于 OmniGibson 构建的全面具身空间智能基准,涵盖 10 个任务类别和 29 个子类别。实验表明,主动探索显著优于被动方法,失败主要源于行动盲视而非感知,揭示了模型与人类相比的元认知差距。

SVI-Bench:战略视频智能的动态微世界

Hugging Face Daily Papers

介绍了SVI-Bench,这是一个利用团队运动进行战略视频智能的大规模基准,旨在评估模型在动态场景理解、因果推理、战略模拟和代理综合方面的能力。该基准揭示了一个能力断崖:模型在感知任务上表现良好,但在更高层次的战略推理上急剧下降。