开源权重VLA在17个真实机器人任务中的4个上实现了80%以上的任务进度,零微调。附带演示视频。

Reddit r/singularity 模型

摘要

发布Wall-OSS-0.5,一个开源权重的视觉-语言-动作模型,在17个真实机器人任务中的4个上实现了超过80%的任务进度,且无需微调,包括一个预训练中未见过的可变形绳索任务。该模型在提升具身接地能力的同时,保留了通用的视觉-语言能力。

分享这个是因为它是一个具身AI发布,试图让预训练检查点本身可衡量,而不是只显示任务特定调优后的结果。视频是Wall-OSS-0.5的演示,这是一个开源资源发布的视觉语言动作模型。演示中的每个剪辑都在角落有相同的“无微调自主控制”水印。机器人在做诸如打开锅盖并将水果放入其中、用布覆盖积木、按颜色分类物品、按指定顺序将饮料放入特定容器、碎纸、将杯子放在计算器右侧等操作。根据发布说明,这些剪辑来自预训练检查点,而不是任务特定的微调。与通常的人形机器人演示周期相比,有趣的是评估框架。他们报告了17个真实机器人任务中的4个在零样本下实现了超过80%的任务进度,包括一个不在预训练集中的可变形绳索拧紧任务。他们还展示了预训练任务进度随着检查点而上升,保留的任务与已见任务趋势一致。这是人们在具身AI中一直要求的那种曲线,尽管为时尚早。另一个我认为值得注意的部分是,该模型似乎在保持通用图像/语言能力的同时提升了具身接地能力,至少根据他们的评估是如此。这很重要,因为许多机器人策略感觉像是通过变窄来获得控制能力。代码:[https://github.com/X-Square-Robot/wall-x](https://github.com/X-Square-Robot/wall-x)。论文:[https://x2robot.com/api/files/file/wall_oss_05.pdf](https://x2robot.com/api/files/file/wall_oss_05.pdf)。Hugging Face组织:[https://huggingface.co/x-square-robot](https://huggingface.co/x-square-robot)。需要注意的是,较难的任务仍然没有解决。毛巾折叠、充电器插入和摆桌在零样本下仍然非常低,所以仅靠预训练并非魔法。真正的考验是外部团队能否在他们自己的机械臂上运行检查点并看到类似的优势和失败。附上演示视频。原始演示在他们的项目页面上。
查看原文

相似文章

刚刚开源 FastVLA

Reddit r/LocalLLaMA

FastVLA,一款开源视觉-语言-动作模型,现可在 L4 GPU 上实现 5 Hz 机器人控制。