标签
Zero-WAM 是一个因果视频-动作模型,通过基于上下文的人类视频指导,实现对未见过任务的零样本机器人操作,并利用 HumanGen 数据集和未来块预测目标来提高泛化能力。
LingBot-VA 2.0 是一个从头开始为机器人控制训练的视频动作基础模型,实现了 225 Hz 的闭环执行,具有 13B 参数(每个 token 激活 1.9B),并在 RoboTwin 2.0 上优于之前的模型。
一个使用LingBot-VA 2.0视频动作模型的机器人,以1倍速实时从移动传送带上抓取物体,它预测未来运动而不仅仅是反应当前帧。