人类通用抓取
摘要
一种流匹配模型可从RGB-D图像生成多样化的人类抓取动作,实现零样本机器人抓取,性能优于现有方法。该模型在大规模自我中心数据集上训练,在新基准测试中显著超越当前最先进的基线方法。
查看缓存全文
缓存时间: 2026/06/16 15:32
论文页面 - Human Universal Grasping
来源:https://huggingface.co/papers/2606.17054
摘要
一种流匹配模型能够从RGB-D图像中生成多样的人类抓取方式,实现零样本机器人抓取,并在性能上优于现有方法。
人类可以毫不费力地抓取物体,而多指机器人远未达到这种通用性。我们认为,机器人抓取数据最自然的来源是人类——他们每天都会拿起数千个物体。我们提出HUG,这是一种流匹配模型(https://huggingface.co/papers?q=flow-matching%20model),能够为单张RGB-D图像(https://huggingface.co/papers?q=RGB-D%20image)(由立体相机捕获)中用户指定的任意物体生成多样化的人类抓取方式。利用智能眼镜,我们首先收集了1M-HUGs,这是一个自我中心数据集(https://huggingface.co/papers?q=egocentric%20dataset),包含跨越100万帧(27.8小时)、涵盖41栋建筑中6,707个物体实例的人类抓取数据。接下来,为了对自然人类抓取的分布进行建模,我们新颖的流匹配模型(https://huggingface.co/papers?q=flow-matching%20model)融合RGB和深度观测,输出以手腕平移、手腕旋转和MANO手部姿态(https://huggingface.co/papers?q=MANO%20hand%20pose)参数化的抓取。预测的抓取可以重新定位到各种机器手,从而在日常生活场景中实现零样本抓取(https://huggingface.co/papers?q=zero-shot%20grasping)。为了规范评估,我们构建了一个新的模拟基准(https://huggingface.co/papers?q=simulated%20benchmark)——HUG-Bench(https://huggingface.co/papers?q=HUG-Bench),包含来自五个几何类别和多种尺寸的90个未见物体,并配有公制尺度的3D网格。我们在真实世界中对HUG进行评估,测试集为HUG-Bench(https://huggingface.co/papers?q=HUG-Bench)中的30个物体,涉及多种立体相机、机器人实体和家庭环境。HUG在我们具有挑战性的物体集上,相比最先进的抓取基线分别提升了+23%和+34%。代码、数据、基准、检查点和交互式演示已在我们的网站上发布:https://grasping.io/
查看arXiv页面(https://arxiv.org/abs/2606.17054)查看PDF(https://arxiv.org/pdf/2606.17054)项目页面(https://grasping.io/)GitHub0(https://github.com/KevinyWu/hug)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.17054)
在您的智能体中获取此论文:
hf papers read 2606.17054
没有最新的命令行界面?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型1
kevinywu/hug Robotics• 更新于约1小时前(https://huggingface.co/kevinywu/hug)
引用此论文的数据集0
没有数据集引用此论文
在数据集的README.md中引用arxiv.org/abs/2606.17054,以便从本页链接。
引用此论文的Space0
没有Space引用此论文
在Space的README.md中引用arxiv.org/abs/2606.17054,以便从本页链接。
包含此论文的收藏集0
没有收藏集包含此论文
将此论文添加到收藏集(https://huggingface.co/new-collection),以便从本页链接。
相似文章
SeededGrasp:复杂场景中多形态语言引导的抓取
SeededGrasp 提出了一种数据高效的框架,利用视觉语言模型预测种子点,用于轻量级抓取生成器的条件输入,从而在复杂场景中实现多机器人形态的语言引导抓取。该方法在仿真中达到72%的成功率,在实际中达到78%,优于基线方法,并包含一个全新的大规模多形态抓取数据集。
CosmoH2G:用于复杂空间运动物体操作的手到夹具迁移数据集与基线方法
本文提出CosmoH2G,一个用于将复杂人手演示迁移到机器人夹具的数据集和基线方法,通过两阶段框架预测稀疏关键帧和连续动作,以处理复杂的空间运动。
HumanScale: 自我中心人类视频在具身预训练中可超越真实机器人数据
本文发现,经过过滤和标注流水线处理的自我中心人类视频,在预训练具身基础模型时可以超越遥操作真实机器人数据,在真实机器人任务上实现了更低的验证损失和更高的成功率。
@AdinaYakup: Gen-HumanEgo 来自 @GenrobotAI 的新机器人学习数据集 - 超过1,800小时的自我中心人类数据 - 超过10,000个独特任务…
Gen-HumanEgo 是 GenrobotAI 发布的新机器人学习数据集,包含超过1,800小时的自我中心人类数据、超过10,000个独特任务以及同步的相机视图,包括3D手部关键点和结构化注释。
域随机化与生成模型在机器人抓取中的应用
# 域随机化与生成模型在机器人抓取中的应用 来源:[https://openai.com/index/domain-randomization-and-generative-models-for-robotic-grasping/](https://openai.com/index/domain-randomization-and-generative-models-for-robotic-grasping/) ## 摘要 基于深度学习的机器人抓取在算法改进和数据可用性增加的推动下取得了重大进展。然而,最先进的模型往往仅在数百或数千个未