开源权重VLA在17个真实机器人任务中的4个上实现了80%以上的任务进度,零微调。附带演示视频。
摘要
发布Wall-OSS-0.5,一个开源权重的视觉-语言-动作模型,在17个真实机器人任务中的4个上实现了超过80%的任务进度,且无需微调,包括一个预训练中未见过的可变形绳索任务。该模型在提升具身接地能力的同时,保留了通用的视觉-语言能力。
分享这个是因为它是一个具身AI发布,试图让预训练检查点本身可衡量,而不是只显示任务特定调优后的结果。视频是Wall-OSS-0.5的演示,这是一个开源资源发布的视觉语言动作模型。演示中的每个剪辑都在角落有相同的“无微调自主控制”水印。机器人在做诸如打开锅盖并将水果放入其中、用布覆盖积木、按颜色分类物品、按指定顺序将饮料放入特定容器、碎纸、将杯子放在计算器右侧等操作。根据发布说明,这些剪辑来自预训练检查点,而不是任务特定的微调。与通常的人形机器人演示周期相比,有趣的是评估框架。他们报告了17个真实机器人任务中的4个在零样本下实现了超过80%的任务进度,包括一个不在预训练集中的可变形绳索拧紧任务。他们还展示了预训练任务进度随着检查点而上升,保留的任务与已见任务趋势一致。这是人们在具身AI中一直要求的那种曲线,尽管为时尚早。另一个我认为值得注意的部分是,该模型似乎在保持通用图像/语言能力的同时提升了具身接地能力,至少根据他们的评估是如此。这很重要,因为许多机器人策略感觉像是通过变窄来获得控制能力。代码:[https://github.com/X-Square-Robot/wall-x](https://github.com/X-Square-Robot/wall-x)。论文:[https://x2robot.com/api/files/file/wall_oss_05.pdf](https://x2robot.com/api/files/file/wall_oss_05.pdf)。Hugging Face组织:[https://huggingface.co/x-square-robot](https://huggingface.co/x-square-robot)。需要注意的是,较难的任务仍然没有解决。毛巾折叠、充电器插入和摆桌在零样本下仍然非常低,所以仅靠预训练并非魔法。真正的考验是外部团队能否在他们自己的机械臂上运行检查点并看到类似的优势和失败。附上演示视频。原始演示在他们的项目页面上。
相似文章
机器人基础模型总是用微调后的数字来展示性能。Wall-OSS-0.5 正在尝试一种不同的方法
X Square Robot 发布了 Wall-OSS-0.5,这是一个 4B 参数的开源 VLA 机器人基础模型,在包含 17 个任务的真实机器人零样本测试集上进行了评估,无需任务特定的微调,旨在直接测量预训练能力。
@AdinaYakup: @Open_MOSS 发布 MOSS-VL 视觉模型:https://huggingface.co/collections/OpenMOSS-Team/moss-vl… 演示:https://hug…
Open_MOSS 开源 110 亿参数 Apache 2.0 视觉-语言模型 MOSS-VL,采用交叉注意力与 XRoPE,在 VSI-bench 上比 Qwen3-VL-8B 高 8.3 分。
刚刚开源 FastVLA
FastVLA,一款开源视觉-语言-动作模型,现可在 L4 GPU 上实现 5 Hz 机器人控制。
@robbyant_brain: LingBot-VLA 2.0 现已开源——我们新一代的具身基础模型。6万小时高质量预训练数据…
LingBot-VLA 2.0,一个开源的具身基础模型,已发布,拥有6万小时预训练数据,支持17个品牌的20种机器人配置,在RTX 4090上推理时间低于130毫秒。
LingBot-Video: 稀疏MoE视频扩散Transformer(总参数13B,激活参数1.4B)后训练为动作条件世界模型[R]
LingBot-Video是一个13B的稀疏MoE视频扩散Transformer(1.4B激活参数),通过强化学习后训练为动作条件世界模型,权重和代码已开源。它包含一个由VLM评分的物理合理性奖励,并将其自身定位为策略评估器和动作规划器,但缺少闭环机器人实验结果。