像机器人一样看:面向视觉-语言-动作模型的机器人中心点云图
摘要
本文介绍了机器人中心点云图,它将机器人坐标系中的3D场景坐标直接编码到图像像素中,以解决视觉-语言-动作模型中相机观测与机器人动作定义之间的坐标系不匹配问题。该方法在RoboCasa上提升了Pi0.5和SmolVLA的性能,并在真实机器人实验中更好地泛化到未见过的相机位置。
查看缓存全文
缓存时间: 2026/07/20 17:26
论文页面 - 像机器人一样看:面向视觉-语言-动作模型的机器人中心点图
来源: https://huggingface.co/papers/2607.11498
摘要
视觉-语言-动作(VLA)模型根据视觉观察和语言指令预测机器人动作。这些动作在机器人自身的3D坐标系中定义,然而大多数VLA模型在相机坐标系中观察场景,从而在场景观察位置与动作定义位置之间产生了坐标系不匹配。在固定视角下这种不匹配尚可容忍——策略可以记忆单一的观察-动作映射——但随着大规模数据集从多种相机设置中聚合演示数据,策略必须跨视角泛化该映射,不匹配问题就变得愈发困难。我们通过机器人中心点图来解决这一不匹配问题,这是一种图像,其像素存储场景点在机器人坐标系中的3D坐标。点图提供机器人坐标系下的3D几何信息,同时保留预训练2D VLA所期望的密集H×W网格,因此能以最小的架构变更集成到现有VLA中。在RoboCasa上,点图同时改进了pi0.5和SmolVLA,并优于代表性的相机视角和3D感知基线。在真实机器人实验中,当相机被移动到训练中未见过的位置时,点图相对于仅使用RGB的策略的优势进一步扩大。
查看 arXiv 页面 (https://arxiv.org/abs/2607.11498)查看 PDF (https://arxiv.org/pdf/2607.11498)项目页面 (https://davian-robotics.github.io/pointmap/)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.11498)
在你的 agent 中获取这篇论文:
hf papers read 2607.11498
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本论文的模型 0
暂无模型引用本论文
在模型 README.md 中引用 arxiv.org/abs/2607.11498 以从本页面链接。
引用本论文的数据集 0
暂无数据集引用本论文
在数据集 README.md 中引用 arxiv.org/abs/2607.11498 以从本页面链接。
引用本论文的 Spaces 0
暂无 Space 引用本论文
在 Space README.md 中引用 arxiv.org/abs/2607.11498 以从本页面链接。
包含本论文的收藏集 0
暂无包含本论文的收藏集
将本论文添加至收藏集 (https://huggingface.co/new-collection) 以从本页面链接。
相似文章
SmolVLA:一种经济高效的视觉-语言-动作模型
SmolVLA是一种紧凑的视觉-语言-动作模型,在降低计算成本的同时实现了具有竞争力的机器人控制性能,使其能够部署在消费级硬件上。它引入了异步推理,并利用了社区收集的数据集。
BridgeVLA++:面向三维操作的数据高效、可泛化且记忆增强的视觉-语言-动作框架
BridgeVLA++ 是一个用于三维机器人操作的记忆增强视觉-语言-动作框架,它在 BridgeVLA 的基础上增加了时空记忆,在记忆依赖的操作基准上取得了最先进的成果,同时保持了数据效率和泛化能力。
机器人需要的不仅仅是VLA和世界模型
本文立场论文认为,推进机器人智能需要将非结构化的行为数据通过专门的接口进行整合,用于标注、具身映射、世界建模和奖励推断,而不是仅仅依赖扩展视觉-语言-动作(VLA)模型和世界模型。
IntentVLA: 针对混叠机器人操作的短期意图建模
IntentVLA 是一种历史条件视觉-语言-动作框架,通过从视觉观察中编码短期意图来提高机器人模仿学习的稳定性,解决了部分可观察性和模糊观察带来的挑战。它还引入了 AliasBench,这是一个用于评估此类方法的模糊感知基准。
MotionVLA:用于人形机器人运动的视觉-语言-动作模型
提出MotionVLA,一种用于人形运动生成的视觉-语言-动作模型,采用双流频率分词器分别编码姿态和物理动态,实现了更高的多样性和一致性。