3D HAMSTER:通过三维轨迹引导连接分层视觉-语言-动作模型中的规划与控制
摘要
3D HAMSTER利用带深度编码的视觉-语言模型生成用于点云控制的三维轨迹,从而增强机器人操作能力,其表现优于二维引导的基线方法。
查看缓存全文
缓存时间: 2026/07/08 06:48
论文页面 - 3D HAMSTER:通过3D轨迹引导在分层视觉语言动作模型中连接规划与控制
来源:https://huggingface.co/papers/2606.31329
摘要
3D HAMSTER 框架通过将视觉语言模型与深度编码相结合,生成度量精确的3D轨迹,用于基于点云的控制策略,从而增强机器人操作能力。
分层视觉-语言-动作(VLA)模型将高层规划与底层控制解耦,以提高机器人操作中的泛化能力。该范式下的近期工作使用视觉语言模型(VLM)预测的2D末端执行器轨迹,作为下游策略的显式指导。然而,最先进的底层控制策略是在3D度量空间中对点云进行操作,将缺乏深度信息的2D轨迹输入其中,会导致每个路径点被赋予其下方场景表面的深度,从而产生几何畸变的轨迹。我们提出3D HAMSTER,一个分层框架,通过让规划器直接输出度量可靠的3D轨迹来弥合这一差距。我们为VLM增加了专用的深度编码器,并引入密集深度重建目标,以预测3D路径点序列,这些序列被直接集成到基于点云的底层控制策略中。在3D轨迹预测、仿真和真实世界操作中,3D HAMSTER始终优于专有VLM和基于2D引导的基线方法,在表观变化、未见语言、空间和视觉条件下提升最为显著。项目页面位于 https://davian-robotics.github.io/3D_HAMSTER/。
查看 arXiv 页面 (https://arxiv.org/abs/2606.31329) 查看 PDF (https://arxiv.org/pdf/2606.31329) 项目页面 (https://davian-robotics.github.io/3D_HAMSTER/) GitHub (https://github.com/DAVIAN-Robotics/3D_HAMSTER) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.31329)
在你的 agent 中获取此论文:
hf papers read 2606.31329
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型 1
DAVIAN-Robotics/3D_HAMSTER 机器人 • 9B • 更新于7天前 • 66 (https://huggingface.co/DAVIAN-Robotics/3D_HAMSTER)
引用此论文的数据集 0
没有数据集关联此论文
在数据集 README.md 中引用 arxiv.org/abs/2606.31329 以将其链接到此页面。
引用此论文的 Space 0
没有 Space 关联此论文
在 Space README.md 中引用 arxiv.org/abs/2606.31329 以将其链接到此页面。
包含此论文的收藏集 0
没有收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 以将其链接到此页面。
相似文章
HiVLA: 一种以视觉接地为中心的分层具身操作系统
HiVLA 提出了一种分层视觉-语言-动作框架,通过使用扩散变换器动作专家将语义规划与运动控制解耦,从而改进机器人操作。该系统结合了用于任务分解和视觉接地的VLM规划器与使用级联交叉注意力的专用DiT动作专家,在长周期任务和细粒度操作方面尤其优于端到端基线。
BridgeVLA++:面向三维操作的数据高效、可泛化且记忆增强的视觉-语言-动作框架
BridgeVLA++ 是一个用于三维机器人操作的记忆增强视觉-语言-动作框架,它在 BridgeVLA 的基础上增加了时空记忆,在记忆依赖的操作基准上取得了最先进的成果,同时保持了数据效率和泛化能力。
τ_0-VLA:基于世界模型引导的测试时计算的分层机器人基础模型
分层视觉-语言-动作模型通过世界模型引导的测试时搜索扩展计算,用于高级子任务决策,从而提升长期机器人操作的性能。
AHA-WAM:异步视野自适应世界动作建模与观测引导上下文路由
AHA-WAM是一种异步世界动作模型,采用双扩散Transformer将世界预测与动作执行解耦,实现了高效的长视野规划和实时控制。它在机器人操作任务上达到了最先进的性能,在RoboTwin上成功率达92.8%,在现实世界任务中达78.3%,同时实现了24.17 Hz的闭环控制。
像机器人一样看:面向视觉-语言-动作模型的机器人中心点云图
本文介绍了机器人中心点云图,它将机器人坐标系中的3D场景坐标直接编码到图像像素中,以解决视觉-语言-动作模型中相机观测与机器人动作定义之间的坐标系不匹配问题。该方法在RoboCasa上提升了Pi0.5和SmolVLA的性能,并在真实机器人实验中更好地泛化到未见过的相机位置。