Grounded Action Model:3D定位作为机器人技术的基础

Hugging Face Daily Papers 论文

摘要

本文提出了Grounded Action Models (GAMs),一种集成3D定位的新型机器人基础模型范式,在操作任务上实现了最先进的性能。

操作策略必须知道哪些对象重要以及它们的位置,然而当前机器人基础模型所依赖的预训练主干网络,从视觉语言动作模型(VLAs)中的语言到世界动作模型(WAMs)中的视频生成,并不直接需要这种度量定位,而是让它从机器人演示中隐式学习。我们提出了Grounded Action Models (GAMs),一种基于3D定位构建的新型机器人基础模型范式。GAM可以使用语言、点或框提示进行条件化,这些提示首先被转换为所选对象的共享对象中心表示。这种表示捕获目标聚焦的视觉特征和度量对象几何,通过多流变换器与机器人状态历史混合以预测动作块。虽然GAMs可以自主运行,但它们也可以作为低级控制器,由高级规划器使用其各种输入模态控制,允许长期和记忆依赖的操作。在RoboTwin 2.0上,GAM在50个任务上平均成功率为55.3%(对比Spatial Forcing的52.0%),包括在场景随机化下为47.6%(对比Abot-M0的30.4%),其动作策略仅在干净场景演示上训练。在LIBERO-PRO上,它在16种扰动设置上达到了最先进的平均成功率61%(对比π_{0.5}的53%),在目标被重新定位或新指定时获得最大收益。在两个真实机器人上,GAM在双臂YAM上视觉偏移下保留了17/20的成功,而π_{0.5}为4/20,同时其与Molmo2规划器在Franka上的组合在长期和记忆依赖任务上实现了64.7% ID和49.8% OOD步骤完成率。
查看原文
查看缓存全文

缓存时间: 2026/09/22 07:27

论文页面 - 基于空间理解的动作模型:以3D空间理解为机器人技术基石

来源:https://huggingface.co/papers/2609.23863
发布日期:9月20日

·
由 https://huggingface.co/Jiafei1224 提交


段(https://huggingface.co/Jiafei1224)于9月22日发布

摘要

操作策略必须知道哪些物体重要以及它们的位置,但当前机器人基础模型所依赖的预训练主干网络——从语言-视觉-动作模型(VLA)中的语言处理到世界-动作模型(WAM)中的视频生成——并未直接要求这种度量级的空理解,而是将其隐含地从机器人演示中学习。我们提出了基于空间理解的动作模型(Grounded Action Models,GAMs),这是一种利用3D空间理解构建的新型机器人基础模型。GAM可以使用语言、点或框提示进行条件化,这些提示首先被转换为所选物体的共享、以物体为中心的表示。该表示捕获了目标导向的视觉特征和度量级物体几何信息,并通过多流Transformer与机器人状态历史混合,以预测动作块。尽管GAMs可以自主运行,但它们也可作为底层控制器,供高层规划器通过其多种输入模态进行控制,从而实现长期和依赖记忆的操作。在RoboTwin2.0上,GAM在50个任务中实现了55.3%的平均成功率(对比SpatialForcing的52.0%),其中包括在场景随机化下的47.6%成功率(对比Abot-M0的30.4%),其动作策略仅在干净场景的演示上训练。在LIBERO-PRO上,它在16种扰动设置中实现了最先进的61%平均成功率(对比π_{0.5}的53%),在目标被重新定位或新指定时获得最大提升。在两个真实机器人上,GAM在双臂YAM的视觉偏移下保持了20次中17次成功(对比π_{0.5}的20次中4次),而其与Molmo2规划器在Franka机器人上的组合,在长期和依赖记忆的任务中,实现了64.7%的分布内和49.8%的分布外步骤完成率。

查看arXiv页面(https://arxiv.org/abs/2609.23863)查看PDF(https://arxiv.org/pdf/2609.23863)项目页面(https://grounded-action-model.github.io/)GitHub(https://github.com/GehaoZhang6/Grounded-Action-Model)添加到收藏夹(https://huggingface.co/login?next=%2Fpapers%2F2609.23863)

在你的代理中获取此论文:

hf papers read 2609.23863

没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接此论文

在模型README.md中引用arxiv.org/abs/2609.23863以从此页面链接它。

引用此论文的数据集0

没有数据集链接此论文

在数据集README.md中引用arxiv.org/abs/2609.23863以从此页面链接它。

引用此论文的空间0

没有空间链接此论文

在空间README.md中引用arxiv.org/abs/2609.23863以从此页面链接它。

包含此论文的收藏集0

没有收藏集包含此论文

将此论文添加到收藏集(https://huggingface.co/new-collection)以从此页面链接它。

相似文章

Geometric Action Model 用于机器人策略学习

Hugging Face Daily Papers

Geometric Action Model (GAM) 将预训练的几何基础模型 (GFM) 重新用作语言条件机器人操作的统一骨干,在模拟和真实世界基准测试中,相比现有的基础模型规模基线,实现了更高的准确性、鲁棒性和效率。

Cortex 2.0:在现实工业部署中落地世界模型

Hugging Face Daily Papers

Cortex 2.0 提出“先规划再行动”的控制框架,利用视觉隐空间轨迹生成,在复杂工业环境中实现可靠的长时域机器人操作,性能超越反应式 Vision-Language-Action 模型。

重新审视机器人操作中的关节部件感知

Hugging Face Daily Papers

本文提出了几何基本结构(GPS),这是一种用于机器人操作中关节部件感知的新表示方法,支持高效的VR标注,无需微调即可达到73%的成功率。

ABot-M0.5: 统一移动与操作的世界动作模型

Hugging Face Daily Papers

ABot-M0.5 是一种针对移动操作的新型世界动作模型,通过时间粒度对齐、动作空间解耦和训练-测试一致性提升性能,在长时域和细粒度操作基准上达到了最先进水平。