Grounded Action Model:3D定位作为机器人技术的基础
摘要
本文提出了Grounded Action Models (GAMs),一种集成3D定位的新型机器人基础模型范式,在操作任务上实现了最先进的性能。
查看缓存全文
缓存时间: 2026/09/22 07:27
论文页面 - 基于空间理解的动作模型:以3D空间理解为机器人技术基石
来源:https://huggingface.co/papers/2609.23863
发布日期:9月20日
·
由 https://huggingface.co/Jiafei1224 提交
段(https://huggingface.co/Jiafei1224)于9月22日发布
摘要
操作策略必须知道哪些物体重要以及它们的位置,但当前机器人基础模型所依赖的预训练主干网络——从语言-视觉-动作模型(VLA)中的语言处理到世界-动作模型(WAM)中的视频生成——并未直接要求这种度量级的空理解,而是将其隐含地从机器人演示中学习。我们提出了基于空间理解的动作模型(Grounded Action Models,GAMs),这是一种利用3D空间理解构建的新型机器人基础模型。GAM可以使用语言、点或框提示进行条件化,这些提示首先被转换为所选物体的共享、以物体为中心的表示。该表示捕获了目标导向的视觉特征和度量级物体几何信息,并通过多流Transformer与机器人状态历史混合,以预测动作块。尽管GAMs可以自主运行,但它们也可作为底层控制器,供高层规划器通过其多种输入模态进行控制,从而实现长期和依赖记忆的操作。在RoboTwin2.0上,GAM在50个任务中实现了55.3%的平均成功率(对比SpatialForcing的52.0%),其中包括在场景随机化下的47.6%成功率(对比Abot-M0的30.4%),其动作策略仅在干净场景的演示上训练。在LIBERO-PRO上,它在16种扰动设置中实现了最先进的61%平均成功率(对比π_{0.5}的53%),在目标被重新定位或新指定时获得最大提升。在两个真实机器人上,GAM在双臂YAM的视觉偏移下保持了20次中17次成功(对比π_{0.5}的20次中4次),而其与Molmo2规划器在Franka机器人上的组合,在长期和依赖记忆的任务中,实现了64.7%的分布内和49.8%的分布外步骤完成率。
查看arXiv页面(https://arxiv.org/abs/2609.23863)查看PDF(https://arxiv.org/pdf/2609.23863)项目页面(https://grounded-action-model.github.io/)GitHub(https://github.com/GehaoZhang6/Grounded-Action-Model)添加到收藏夹(https://huggingface.co/login?next=%2Fpapers%2F2609.23863)
在你的代理中获取此论文:
hf papers read 2609.23863
没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接此论文
在模型README.md中引用arxiv.org/abs/2609.23863以从此页面链接它。
引用此论文的数据集0
没有数据集链接此论文
在数据集README.md中引用arxiv.org/abs/2609.23863以从此页面链接它。
引用此论文的空间0
没有空间链接此论文
在空间README.md中引用arxiv.org/abs/2609.23863以从此页面链接它。
包含此论文的收藏集0
没有收藏集包含此论文
将此论文添加到收藏集(https://huggingface.co/new-collection)以从此页面链接它。
相似文章
Geometric Action Model 用于机器人策略学习
Geometric Action Model (GAM) 将预训练的几何基础模型 (GFM) 重新用作语言条件机器人操作的统一骨干,在模拟和真实世界基准测试中,相比现有的基础模型规模基线,实现了更高的准确性、鲁棒性和效率。
GE-Act 2.0: 用于机器人操作的预训练与扩展世界-动作模型
本文介绍了GE-Act 2.0,这是一个从头预训练的世界-动作模型,旨在实现可扩展的零样本机器人操作,提升在多样化任务和条件下的成功率。
Cortex 2.0:在现实工业部署中落地世界模型
Cortex 2.0 提出“先规划再行动”的控制框架,利用视觉隐空间轨迹生成,在复杂工业环境中实现可靠的长时域机器人操作,性能超越反应式 Vision-Language-Action 模型。
重新审视机器人操作中的关节部件感知
本文提出了几何基本结构(GPS),这是一种用于机器人操作中关节部件感知的新表示方法,支持高效的VR标注,无需微调即可达到73%的成功率。
ABot-M0.5: 统一移动与操作的世界动作模型
ABot-M0.5 是一种针对移动操作的新型世界动作模型,通过时间粒度对齐、动作空间解耦和训练-测试一致性提升性能,在长时域和细粒度操作基准上达到了最先进水平。