标签
SeededGrasp 提出了一种数据高效的框架,利用视觉语言模型预测种子点,用于轻量级抓取生成器的条件输入,从而在复杂场景中实现多机器人形态的语言引导抓取。该方法在仿真中达到72%的成功率,在实际中达到78%,优于基线方法,并包含一个全新的大规模多形态抓取数据集。
本文介绍了UESF-Bench,一个面向统一具身人类搜索与跟随的大规模基准,并提出了SeekFollow-VLA,一个视觉-语言-动作框架,该框架处理语义引导的探索以及搜索与跟随之间的可靠行为切换。