机器人基础模型总是用微调后的数字来展示性能。Wall-OSS-0.5 正在尝试一种不同的方法

Reddit r/artificial 模型

摘要

X Square Robot 发布了 Wall-OSS-0.5,这是一个 4B 参数的开源 VLA 机器人基础模型,在包含 17 个任务的真实机器人零样本测试集上进行了评估,无需任务特定的微调,旨在直接测量预训练能力。

大多数机器人基础模型的演示都难以解读,因为那些令人印象深刻的数据通常来自任务特定的微调。Wall-OSS-0.5 是 X Square Robot 新发布的开源 VLA 模型,其有趣之处在于报告试图测量预训练检查点在额外适应步骤之前的能力。该模型是一个 4B 参数的视觉-语言-动作模型,基于 3B 的 VLM 骨干网络加上动作生成组件。根据报告,预训练检查点在一个包含 17 个任务的真实机器人测试集上进行了评估,没有进行任务特定的微调。四个任务的任务进度超过了 80:积木分类、水果分类、叠环,以及一个保留的可变形任务——绳索紧固。比起原始分数,更重要的部分在于框架本身。在语言模型中,没有人会只接受一个经过微调的下游分数作为预训练有效的证据。而对于机器人,这要困难得多,因为评估是物理的、缓慢的、依赖于具体实体的,并且昂贵。一个真实机器人零样本测试集是直接提出同样问题的一个有用步骤:预训练本身是否就能产生可执行的行为,还是说它主要提供了一个更好的初始化?该方法也在尝试解决一个特定的训练问题。连续动作损失对执行有用,但论文认为它们本身无法向 VLM 骨干网络传递足够强的学习信号。他们的方案将动作标记交叉熵、多模态交叉熵和流匹配结合在一个阶段中,利用离散动作标记路径作为进入骨干网络的梯度桥梁,同时在部署时用流匹配处理连续动作。参考信息:代码在 [https://github.com/X-Square-Robot/wall-x](https://github.com/X-Square-Robot/wall-x),论文在 [https://x2robot.com/api/files/file/wall\_oss\_05.pdf](https://x2robot.com/api/files/file/wall_oss_05.pdf),项目页面在 [https://x2robot.com/oss#resources](https://x2robot.com/oss#resources),Hugging Face 组织在 [https://huggingface.co/x-square-robot](https://huggingface.co/x-square-robot)。需要注意但也很重要的一点是,零样本仍然无法解决最困难的操控任务。报告提到,毛巾折叠、摆桌和充电器插入在微调前的表现仍然很低,这大概是一个值得关注的边界。尽管如此,看到一个机器人模型发布时以微调前真实硬件数据作为亮点,感觉比另一个干净的一分钟演示对具身 AI 来说是一个更健康的方向。开放的问题是:这是否是评估机器人基础模型的正确方法?还是说真实机器人零样本测试集仍然过于依赖具体实体,难以成为有用的标准?
查看原文

相似文章

LeRobot v0.5.0:全面扩展

Hugging Face Blog

LeRobot v0.5.0 是一个重大版本,支持 Unitree G1 人形机器人、新的策略架构(Pi0-FAST VLAs、实时分块)、用于提升 3 倍训练速度的流式视频编码,以及用于从 Hugging Face Hub 加载仿真环境的 EnvHub。

X Square Robot 在现实物流运营中演示具身智能

Reddit r/singularity

X Square Robot 在直播中演示了其具身智能模型 WALL-B 和高性能六轴机器人手臂,在现实物流操作中自主分拣包裹,实现了每小时1,816个包裹的分拣速度,准确率超过98%。

从基础到应用:在实践中改进VLA模型

Papers with Code Trending

本文介绍了LingBot-VLA 2.0,它通过改进跨任务和具身形态的泛化能力、将动作空间扩展至全身自由度,并引入预测动力学建模以提升时间推理能力,从而增强了用于机器人技术的VLA基础模型。