SeededGrasp:复杂场景中多形态语言引导的抓取

Hugging Face Daily Papers 论文

摘要

SeededGrasp 提出了一种数据高效的框架,利用视觉语言模型预测种子点,用于轻量级抓取生成器的条件输入,从而在复杂场景中实现多机器人形态的语言引导抓取。该方法在仿真中达到72%的成功率,在实际中达到78%,优于基线方法,并包含一个全新的大规模多形态抓取数据集。

在实际的复杂场景中进行机器人抓取需要同时具备3D空间推理能力和任务特定要求的对齐能力。视觉语言模型(VLM)提供了一种通过语言来指定这些要求的自然方式,但现有方法要么直接使用VLM预测抓取,导致空间感知能力有限,要么将VLM与抓取模型联合训练,需要显著更多的数据和计算资源。这些局限性阻碍了性能提升,并使得在复杂场景中扩展到多形态成为难题。为此,我们提出了SeededGrasp,一种新颖的数据高效框架,使VLM能够预测一个种子点,作为后续轻量级抓取生成模型的条件输入。我们的架构将高层语义推理与低层几何执行解耦,在支持多形态的同时,避免了昂贵的端到端训练需求。为了支持模型训练,我们发布了首个多形态桌面抓取数据集,包含超过250万个在杂乱场景中的抓取样本。实验结果表明,我们的方法优于现有基线,在仿真中抓取成功率达到72%,在实际实验中达到78%。数据和代码请访问我们的项目网站:https://uoft-isl.github.io/seeded-grasp/
查看原文
查看缓存全文

缓存时间: 2026/07/24 05:09

论文页面 - SeededGrasp:多形态复杂场景中的语言引导抓取

来源:https://huggingface.co/papers/2607.20207

摘要

实际中的复杂场景机器人抓取需要同时具备三维空间推理能力以及与任务特定需求的对齐能力。视觉-语言模型(VLM)提供了一种使用语言来指定这些需求的自然方法,但现有方法要么直接使用 VLM 预测抓取位置但空间感知有限,要么将 VLM 与抓取模型联合训练,这需要显著更多的数据和计算资源。这些限制阻碍了性能,并阻止了在复杂场景中扩展到多形态机器人。我们通过提出 SeededGrasp 来解决这一问题,这是一种数据高效的新型框架,它使 VLM 能够预测一个种子点,作为后续轻量级抓取生成模型的条件。我们的架构将高层语义推理与低层几何执行解耦,在支持多形态的同时避免了对昂贵的端到端训练需求。为了训练此类模型,我们发布了首个多形态桌面抓取数据集,其中包含超过 250 万个杂乱场景中的抓取样本。实验结果表明,我们的方法优于现有基线,在仿真中实现了 72% 的成功率,在真实世界抓取实验中实现了 78% 的成功率。数据和代码请参见我们的项目网站:https://uoft-isl.github.io/seeded-grasp/

查看 arXiv 页面 (https://arxiv.org/abs/2607.20207) 查看 PDF (https://arxiv.org/pdf/2607.20207) 项目页面 (https://uoft-isl.github.io/seeded-grasp/) GitHub2 (https://github.com/uoft-isl/SeededGrasp) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.20207)

在您的智能体中获取此论文:

hf papers read 2607.20207

没有最新版本的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型 0

无模型关联此论文

在模型 README.md 中引用 arxiv.org/abs/2607.20207 以从此页面链接。

引用此论文的数据集 0

无数据集关联此论文

在数据集 README.md 中引用 arxiv.org/abs/2607.20207 以从此页面链接。

引用此论文的 Spaces 0

无 Space 关联此论文

在 Space README.md 中引用 arxiv.org/abs/2607.20207 以从此页面链接。

包含此论文的集合 1

相似文章

人类通用抓取

Hugging Face Daily Papers

一种流匹配模型可从RGB-D图像生成多样化的人类抓取动作,实现零样本机器人抓取,性能优于现有方法。该模型在大规模自我中心数据集上训练,在新基准测试中显著超越当前最先进的基线方法。

GRASP:在多人物非语言交互中建立社交推理的根基

Hugging Face Daily Papers

GRASP是一个大规模数据集,用于多人物视频中的社交推理,将高层次社交问题与细粒度的注视和手势事件联系起来,并引入了社交基础奖励(Social Grounding Reward)以提升多模态模型的理解能力。

域随机化与生成模型在机器人抓取中的应用

OpenAI Blog

# 域随机化与生成模型在机器人抓取中的应用 来源:[https://openai.com/index/domain-randomization-and-generative-models-for-robotic-grasping/](https://openai.com/index/domain-randomization-and-generative-models-for-robotic-grasping/) ## 摘要 基于深度学习的机器人抓取在算法改进和数据可用性增加的推动下取得了重大进展。然而,最先进的模型往往仅在数百或数千个未