RoboSPA:视觉-语言-动作模型能否超越简单场景和短期任务?

Hugging Face Daily Papers 论文

摘要

本文介绍了RoboSPA,这是一个用于评估视觉-语言-动作模型在机器人操作中细粒度空间推理和长期过程规划能力的大规模基准测试。

视觉-语言-动作(VLA)模型在基于语言的机器人操作方面已展现出令人鼓舞的进展。然而,现有的数据集和基准主要评估在预定义设置下的任务完成情况,对模型在日益增加的空间和过程复杂性下的推理能力提供的洞察有限。我们推出了RoboSPA(机器人空间-过程评估),这是一个用于诊断VLA模型中具身推理能力的大规模机器人操作数据集和基准。RoboSPA专注于两个核心维度:细粒度空间推理和长期过程规划,涵盖10个任务类别和56个基础任务。每个任务跨五个难度等级实例化,产生280个具有递增空间模糊性和过程复杂性的变体。我们在多种具身形态和多样场景中收集了527K条轨迹。除了二元成功率外,RoboSPA还引入了诊断指标以进行更详细的评估。对代表性VLA模型的实验表明,当前系统仍在复杂空间关系、精确底层执行和内存密集型规划方面存在困难。这些结果确立了RoboSPA作为一个具有挑战性的诊断基准,用于开发更强大、可靠和通用的具身智能体。我们的数据和代码可在https://github.com/fanzhenxuan/RoboSPA获取。
查看原文
查看缓存全文

缓存时间: 2026/09/09 08:31

论文页面 - RoboSPA:VLA模型能否超越简单场景与短时程任务?

来源:https://huggingface.co/papers/2609.05324
作者:

,

,

,

,

,

,

,

,

,

,

摘要

RoboSPA是一个大规模机器人操作基准,旨在评估视觉-语言-动作模型在逐步增加难度的任务变体中,进行细粒度空间推理与长时程程序规划的能力。

视觉-语言-动作(VLA)模型在语言条件下的机器人操作方面已展现出令人鼓舞的进展。然而,现有数据集和基准主要评估预设场景下的任务完成情况,对于模型在空间和程序复杂度增加时的推理能力揭示有限。我们推出了RoboSPA(机器人空间-程序评估),这是一个大规模的机器人操作数据集与基准,用于诊断VLA模型中的具身推理。RoboSPA聚焦于两个核心维度:细粒度空间推理长时程程序规划,涵盖10个任务类别和56个基础任务。每个任务在五个难度层级上进行实例化,生成280个空间模糊性和程序复杂性递增的变体。我们收集了52.7万条跨多种执行体与多样化场景的轨迹。除二元成功率外,RoboSPA还引入了诊断性指标以实现更精细的评估。在代表性VLA模型上的实验表明,当前系统仍在复杂空间关系、精确的底层执行以及需要大量记忆的规划方面存在挑战。这些结果确立了RoboSPA作为一个具有挑战性的诊断基准,用于开发更强大、可靠且可泛化的具身智能体。我们的数据和代码已开源:https://github.com/fanzhenxuan/RoboSPA\。

查看arXiv页面 查看PDF 项目主页 GitHub 添加到收藏

引用本文的模型 0

暂无模型链接本文

在模型的 README.md 中引用 arxiv.org/abs/2609.05324 以从本页建立链接。

引用本文的数据集 0

暂无数据集链接本文

在数据集的 README.md 中引用 arxiv.org/abs/2609.05324 以从本页建立链接。

引用本文的Spaces 0

暂无Space链接本文

在Space的 README.md 中引用 arxiv.org/abs/2609.05324 以从本页建立链接。

包含本文的收藏 0

暂无收藏包含本文

将本文添加到收藏 以从本页建立链接。

相似文章

SpatialAct: 探索VLM智能体在3D场景中的空间推理到行动的能力

Hugging Face Daily Papers

SpatialAct是一个新的基于模拟器的基准,用于探索VLM智能体是否能在多轮反馈设置下进行连贯的空间推理并将其转化为3D环境中的行动。实验揭示了一个显著的推理到行动差距:当前的VLM尽管在孤立推理任务上表现良好,但难以维持空间信念并产生可靠的行为。

SmolVLA:一种经济高效的视觉-语言-动作模型

Papers with Code Trending

SmolVLA是一种紧凑的视觉-语言-动作模型,在降低计算成本的同时实现了具有竞争力的机器人控制性能,使其能够部署在消费级硬件上。它引入了异步推理,并利用了社区收集的数据集。

机器人需要的不仅仅是VLA和世界模型

Hugging Face Daily Papers

本文立场论文认为,推进机器人智能需要将非结构化的行为数据通过专门的接口进行整合,用于标注、具身映射、世界建模和奖励推断,而不是仅仅依赖扩展视觉-语言-动作(VLA)模型和世界模型。