RoboSPA:视觉-语言-动作模型能否超越简单场景和短期任务?
摘要
本文介绍了RoboSPA,这是一个用于评估视觉-语言-动作模型在机器人操作中细粒度空间推理和长期过程规划能力的大规模基准测试。
查看缓存全文
缓存时间: 2026/09/09 08:31
论文页面 - RoboSPA:VLA模型能否超越简单场景与短时程任务?
来源:https://huggingface.co/papers/2609.05324
作者:
,
,
,
,
,
,
,
,
,
,
摘要
RoboSPA是一个大规模机器人操作基准,旨在评估视觉-语言-动作模型在逐步增加难度的任务变体中,进行细粒度空间推理与长时程程序规划的能力。
视觉-语言-动作(VLA)模型在语言条件下的机器人操作方面已展现出令人鼓舞的进展。然而,现有数据集和基准主要评估预设场景下的任务完成情况,对于模型在空间和程序复杂度增加时的推理能力揭示有限。我们推出了RoboSPA(机器人空间-程序评估),这是一个大规模的机器人操作数据集与基准,用于诊断VLA模型中的具身推理。RoboSPA聚焦于两个核心维度:细粒度空间推理和长时程程序规划,涵盖10个任务类别和56个基础任务。每个任务在五个难度层级上进行实例化,生成280个空间模糊性和程序复杂性递增的变体。我们收集了52.7万条跨多种执行体与多样化场景的轨迹。除二元成功率外,RoboSPA还引入了诊断性指标以实现更精细的评估。在代表性VLA模型上的实验表明,当前系统仍在复杂空间关系、精确的底层执行以及需要大量记忆的规划方面存在挑战。这些结果确立了RoboSPA作为一个具有挑战性的诊断基准,用于开发更强大、可靠且可泛化的具身智能体。我们的数据和代码已开源:https://github.com/fanzhenxuan/RoboSPA\。
查看arXiv页面 查看PDF 项目主页 GitHub 添加到收藏
引用本文的模型 0
暂无模型链接本文
在模型的 README.md 中引用 arxiv.org/abs/2609.05324 以从本页建立链接。
引用本文的数据集 0
暂无数据集链接本文
在数据集的 README.md 中引用 arxiv.org/abs/2609.05324 以从本页建立链接。
引用本文的Spaces 0
暂无Space链接本文
在Space的 README.md 中引用 arxiv.org/abs/2609.05324 以从本页建立链接。
包含本文的收藏 0
暂无收藏包含本文
将本文添加到收藏 以从本页建立链接。
相似文章
SpatialAct: 探索VLM智能体在3D场景中的空间推理到行动的能力
SpatialAct是一个新的基于模拟器的基准,用于探索VLM智能体是否能在多轮反馈设置下进行连贯的空间推理并将其转化为3D环境中的行动。实验揭示了一个显著的推理到行动差距:当前的VLM尽管在孤立推理任务上表现良好,但难以维持空间信念并产生可靠的行为。
τ_0-VLA:基于世界模型引导的测试时计算的分层机器人基础模型
分层视觉-语言-动作模型通过世界模型引导的测试时搜索扩展计算,用于高级子任务决策,从而提升长期机器人操作的性能。
SmolVLA:一种经济高效的视觉-语言-动作模型
SmolVLA是一种紧凑的视觉-语言-动作模型,在降低计算成本的同时实现了具有竞争力的机器人控制性能,使其能够部署在消费级硬件上。它引入了异步推理,并利用了社区收集的数据集。
SurgVLA-Bench:面向腹腔镜手术机器人视觉-语言-动作模型评估的基准
SurgVLA-Bench是首个用于评估腹腔镜手术机器人视觉-语言-动作模型的综合基准,利用SurRoL仿真平台评估动作准确性和语义一致性。
机器人需要的不仅仅是VLA和世界模型
本文立场论文认为,推进机器人智能需要将非结构化的行为数据通过专门的接口进行整合,用于标注、具身映射、世界建模和奖励推断,而不是仅仅依赖扩展视觉-语言-动作(VLA)模型和世界模型。