Geometric Action Model 用于机器人策略学习
摘要
Geometric Action Model (GAM) 将预训练的几何基础模型 (GFM) 重新用作语言条件机器人操作的统一骨干,在模拟和真实世界基准测试中,相比现有的基础模型规模基线,实现了更高的准确性、鲁棒性和效率。
查看缓存全文
缓存时间: 2026/06/16 11:32
论文页面 - 几何动作模型(Geometric Action Model)用于机器人策略学习
来源:https://huggingface.co/papers/2606.17046
摘要
一种几何动作模型利用预训练的几何基础模型,使基于语言指令的操作策略在三维物理环境中获得更高的准确性、鲁棒性和效率。
通用型机器人策略必须遵循用户指令,同时推理物体、相机和机器人动作如何在三维物理世界(https://huggingface.co/papers?q=3D%20physical%20world)中交互。最近的视觉-语言-动作模型(https://huggingface.co/papers?q=vision-language-action%20models)(VLA)和视频世界-动作模型(https://huggingface.co/papers?q=video%20world-action%20models)(WAM)从大规模基础模型中继承了强大的语义或时间先验,但它们仍然主要在二维图像帧或二维导出的潜在空间上运行,隐含了对接触丰富的操作(https://huggingface.co/papers?q=contact-rich%20manipulation)所需的三维几何信息。我们提出了几何动作模型(GAM),一种基于语言指令的操作策略(https://huggingface.co/papers?q=language-conditioned%20manipulation%20policy),它直接将预训练的几何基础模型(GFM)重新用作感知、时间预测和动作解码(https://huggingface.co/papers?q=action%20decoding)的共享基座。GAM 在中间层将 GFM 分割:浅层用作观测编码器,在分割层插入一个因果未来预测器(https://huggingface.co/papers?q=causal%20future%20predictor),用于预测以语言、本体感觉和动作历史为条件的未来潜在标记(https://huggingface.co/papers?q=latent%20tokens)。然后,预测的未来标记通过剩余的 GFM 块进行特征传播和解码,使得单个骨干网络能够同时生成未来几何和动作。这种设计通过最小的架构修改,为 GFM 配备了基于语言条件的时间世界建模(https://huggingface.co/papers?q=temporal%20world%20modeling),同时保留了其丰富的几何先验。在广泛的仿真和真实机器人操作基准测试中,GAM 比当前基础模型规模基线的准确性更高、鲁棒性更强、速度更快且更轻量。
查看 arXiv 页面 (https://arxiv.org/abs/2606.17046)
查看 PDF (https://arxiv.org/pdf/2606.17046)
项目页面 (https://cvlab-kaist.github.io/Geometric-Action-Model/)
GitHub27 (https://github.com/cvlab-kaist/Geometric-Action-Model)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.17046)
在你的智能体中获取此论文:
hf papers read 2606.17046
没有最新 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用该论文的模型0
没有模型链接此论文
请在模型 README.md 中引用 arxiv.org/abs/2606.17046 以从此页面链接。
引用该论文的数据集0
没有数据集链接此论文
请在数据集 README.md 中引用 arxiv.org/abs/2606.17046 以从此页面链接。
引用该论文的 Spaces0
没有 Space 链接此论文
请在 Space README.md 中引用 arxiv.org/abs/2606.17046 以从此页面链接。
包含该论文的集合1
相似文章
@HuggingPapers:用于机器人策略学习的几何动作模型,复用几何基础模型作为感知的骨干网络…
几何动作模型将几何基础模型用于机器人策略学习,在LIBERO-Plus上达到85.5%的准确率,推理仅需6.9毫秒,比基线模型快55倍。
SG-WAM:几何感知策略空间中的自引导世界建模
本文提出SG-WAM,一种自引导框架,用于直接在策略派生的表示空间中学习几何感知的、以动作为条件的世界模型。它在LIBERO和LIBERO-Plus基准测试上取得了最先进的成功率,在真实世界评估中超越了强基线。
LaWAM:面向高效动力学感知机器人策略的潜在世界动作模型
LaWAM通过预测紧凑的潜在视觉子目标而非昂贵的视频生成,实现了高效的机器人控制,相比像素空间世界动作模型,成功率可达最先进水平,同时延迟降低高达24倍。
GaP:一种面向变体自动化任务的图即策略多智能体自学习框架
引入图即策略(GaP),一种多智能体编码框架,通过模块化机器人技能库生成有向计算图,并利用并行模拟迭代优化任务执行,在变体自动化任务上成功率显著高于基准方法。
ABot-M0.5: 统一移动与操作的世界动作模型
ABot-M0.5 是一种针对移动操作的新型世界动作模型,通过时间粒度对齐、动作空间解耦和训练-测试一致性提升性能,在长时域和细粒度操作基准上达到了最先进水平。