SeededGrasp:复杂场景中多形态语言引导的抓取
摘要
SeededGrasp 提出了一种数据高效的框架,利用视觉语言模型预测种子点,用于轻量级抓取生成器的条件输入,从而在复杂场景中实现多机器人形态的语言引导抓取。该方法在仿真中达到72%的成功率,在实际中达到78%,优于基线方法,并包含一个全新的大规模多形态抓取数据集。
查看缓存全文
缓存时间: 2026/07/24 05:09
论文页面 - SeededGrasp:多形态复杂场景中的语言引导抓取
来源:https://huggingface.co/papers/2607.20207
摘要
实际中的复杂场景机器人抓取需要同时具备三维空间推理能力以及与任务特定需求的对齐能力。视觉-语言模型(VLM)提供了一种使用语言来指定这些需求的自然方法,但现有方法要么直接使用 VLM 预测抓取位置但空间感知有限,要么将 VLM 与抓取模型联合训练,这需要显著更多的数据和计算资源。这些限制阻碍了性能,并阻止了在复杂场景中扩展到多形态机器人。我们通过提出 SeededGrasp 来解决这一问题,这是一种数据高效的新型框架,它使 VLM 能够预测一个种子点,作为后续轻量级抓取生成模型的条件。我们的架构将高层语义推理与低层几何执行解耦,在支持多形态的同时避免了对昂贵的端到端训练需求。为了训练此类模型,我们发布了首个多形态桌面抓取数据集,其中包含超过 250 万个杂乱场景中的抓取样本。实验结果表明,我们的方法优于现有基线,在仿真中实现了 72% 的成功率,在真实世界抓取实验中实现了 78% 的成功率。数据和代码请参见我们的项目网站:https://uoft-isl.github.io/seeded-grasp/
查看 arXiv 页面 (https://arxiv.org/abs/2607.20207) 查看 PDF (https://arxiv.org/pdf/2607.20207) 项目页面 (https://uoft-isl.github.io/seeded-grasp/) GitHub2 (https://github.com/uoft-isl/SeededGrasp) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.20207)
在您的智能体中获取此论文:
hf papers read 2607.20207
没有最新版本的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型 0
无模型关联此论文
在模型 README.md 中引用 arxiv.org/abs/2607.20207 以从此页面链接。
引用此论文的数据集 0
无数据集关联此论文
在数据集 README.md 中引用 arxiv.org/abs/2607.20207 以从此页面链接。
引用此论文的 Spaces 0
无 Space 关联此论文
在 Space README.md 中引用 arxiv.org/abs/2607.20207 以从此页面链接。
包含此论文的集合 1
相似文章
人类通用抓取
一种流匹配模型可从RGB-D图像生成多样化的人类抓取动作,实现零样本机器人抓取,性能优于现有方法。该模型在大规模自我中心数据集上训练,在新基准测试中显著超越当前最先进的基线方法。
GRASP:在多人物非语言交互中建立社交推理的根基
GRASP是一个大规模数据集,用于多人物视频中的社交推理,将高层次社交问题与细粒度的注视和手势事件联系起来,并引入了社交基础奖励(Social Grounding Reward)以提升多模态模型的理解能力。
Agentic RAG-VLM: 基于功能感知的检索增强生成与自反思规划用于机器人抓取
本文介绍了Agentic RAG-VLM,一个统一的框架,将检索增强生成与视觉语言模型及自反思规划相结合,实现在杂乱环境中的泛化机器人抓取,成功率达到78.3%。
域随机化与生成模型在机器人抓取中的应用
# 域随机化与生成模型在机器人抓取中的应用 来源:[https://openai.com/index/domain-randomization-and-generative-models-for-robotic-grasping/](https://openai.com/index/domain-randomization-and-generative-models-for-robotic-grasping/) ## 摘要 基于深度学习的机器人抓取在算法改进和数据可用性增加的推动下取得了重大进展。然而,最先进的模型往往仅在数百或数千个未
@_TobiasLee: 来自字节跳动的 Seed 2.1 在我们两项基准测试中取得了令人瞩目的成绩。Claw-Eval (多模态,https://claw-eval.…
字节跳动的 Seed 2.1 模型在多模态智能体(Claw-Eval)和长视频理解(Video-MME)基准测试中取得了强劲的结果,尽管在感知和智能体能力之间仍存在差距。