标签
本文将有具身数据源组织成一个五级金字塔(真实机器人、UMI、自我中心/外部中心、仿真、通用视觉语言),分析它们在可扩展性和机器人对齐之间的权衡,并回顾了近期具身基础模型的数据策略。还讨论了构建下一代具身系统的开放性挑战。
本文介绍了GGT-100K,一个包含103,707对图像的真实图像修复数据集,通过使用如Nano-Banana-2等多模态基础模型,从低质量输入生成高质量目标。实验表明,该数据集提升了多种图像修复模型的泛化能力。
WildTableBench 提出了首个针对真实世界表格图像的问答应答基准,揭示了现有多模态基础模型在结构感知和数值推理方面存在显著困难,仅有1个模型准确率超过50%。