像机器人一样看:面向视觉-语言-动作模型的机器人中心点云图

Hugging Face Daily Papers 论文

摘要

本文介绍了机器人中心点云图,它将机器人坐标系中的3D场景坐标直接编码到图像像素中,以解决视觉-语言-动作模型中相机观测与机器人动作定义之间的坐标系不匹配问题。该方法在RoboCasa上提升了Pi0.5和SmolVLA的性能,并在真实机器人实验中更好地泛化到未见过的相机位置。

视觉-语言-动作(VLA)模型根据视觉观测和语言指令预测机器人动作。这些动作在机器人自身的3D坐标系中定义,然而大多数VLA模型在相机坐标系中观测场景,导致观测场景与动作定义之间的坐标系不匹配。在固定视角下,这种不匹配影响较小,因为策略可以记忆单一的观测到动作映射;但随着大规模数据集聚合来自不同相机设置的演示,策略必须跨视角泛化这种映射,不匹配问题变得更加棘手。我们通过机器人中心点云图来解决这一问题,这种图像的像素存储的是机器人坐标系中场景点的3D坐标。点云图提供了机器人坐标系下的3D几何信息,同时保留了预训练2D VLA模型所期望的密集H×W网格结构,因此只需最小的架构改动即可集成到现有VLA中。在RoboCasa上,点云图同时提升了pi0.5和SmolVLA的性能,并优于具有代表性的相机视角和3D感知基线方法。在真实机器人实验中,当相机被移动到训练中未出现的位置时,点云图相比于仅使用RGB的策略优势更加明显。
查看原文
查看缓存全文

缓存时间: 2026/07/20 17:26

论文页面 - 像机器人一样看:面向视觉-语言-动作模型的机器人中心点图

来源: https://huggingface.co/papers/2607.11498

摘要

视觉-语言-动作(VLA)模型根据视觉观察和语言指令预测机器人动作。这些动作在机器人自身的3D坐标系中定义,然而大多数VLA模型在相机坐标系中观察场景,从而在场景观察位置与动作定义位置之间产生了坐标系不匹配。在固定视角下这种不匹配尚可容忍——策略可以记忆单一的观察-动作映射——但随着大规模数据集从多种相机设置中聚合演示数据,策略必须跨视角泛化该映射,不匹配问题就变得愈发困难。我们通过机器人中心点图来解决这一不匹配问题,这是一种图像,其像素存储场景点在机器人坐标系中的3D坐标。点图提供机器人坐标系下的3D几何信息,同时保留预训练2D VLA所期望的密集H×W网格,因此能以最小的架构变更集成到现有VLA中。在RoboCasa上,点图同时改进了pi0.5和SmolVLA,并优于代表性的相机视角和3D感知基线。在真实机器人实验中,当相机被移动到训练中未见过的位置时,点图相对于仅使用RGB的策略的优势进一步扩大。

查看 arXiv 页面 (https://arxiv.org/abs/2607.11498)查看 PDF (https://arxiv.org/pdf/2607.11498)项目页面 (https://davian-robotics.github.io/pointmap/)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.11498)

在你的 agent 中获取这篇论文:

hf papers read 2607.11498

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本论文的模型 0

暂无模型引用本论文

在模型 README.md 中引用 arxiv.org/abs/2607.11498 以从本页面链接。

引用本论文的数据集 0

暂无数据集引用本论文

在数据集 README.md 中引用 arxiv.org/abs/2607.11498 以从本页面链接。

引用本论文的 Spaces 0

暂无 Space 引用本论文

在 Space README.md 中引用 arxiv.org/abs/2607.11498 以从本页面链接。

包含本论文的收藏集 0

暂无包含本论文的收藏集

将本论文添加至收藏集 (https://huggingface.co/new-collection) 以从本页面链接。

相似文章

SmolVLA:一种经济高效的视觉-语言-动作模型

Papers with Code Trending

SmolVLA是一种紧凑的视觉-语言-动作模型,在降低计算成本的同时实现了具有竞争力的机器人控制性能,使其能够部署在消费级硬件上。它引入了异步推理,并利用了社区收集的数据集。

机器人需要的不仅仅是VLA和世界模型

Hugging Face Daily Papers

本文立场论文认为,推进机器人智能需要将非结构化的行为数据通过专门的接口进行整合,用于标注、具身映射、世界建模和奖励推断,而不是仅仅依赖扩展视觉-语言-动作(VLA)模型和世界模型。

IntentVLA: 针对混叠机器人操作的短期意图建模

Hugging Face Daily Papers

IntentVLA 是一种历史条件视觉-语言-动作框架,通过从视觉观察中编码短期意图来提高机器人模仿学习的稳定性,解决了部分可观察性和模糊观察带来的挑战。它还引入了 AliasBench,这是一个用于评估此类方法的模糊感知基准。