@rohanpaul_ai: 大多数视频动作机器人模型都是带有动作模块的内容创作视频生成器。LingBot-VA 2.0 fr…

X AI KOLs Timeline 模型

摘要

LingBot-VA 2.0 是一个从头开始为机器人控制训练的视频动作基础模型,实现了 225 Hz 的闭环执行,具有 13B 参数(每个 token 激活 1.9B),并在 RoboTwin 2.0 上优于之前的模型。

大多数视频动作机器人模型都是带有动作模块的内容创作视频生成器。 来自 @robbyant_brain 的 LingBot-VA 2.0 是一个视频动作基础模型,它抛弃了上述起点,从头开始原生地为控制而训练整个堆栈。 并且它以 225 Hz 的峰值频率运行闭环控制。 这一点至关重要,因为如果控制器需要停下来想象接下来的几帧,机器人就无法做出即时响应。LingBot-VA 2.0 在执行过程中进行预测,然后利用每个真实观测进行修正。 它仅携带约 13B 视频参数,而每个 token 激活约 1.9B 参数。更大的机器人模型通常意味着更慢的反应,这在智能和控制之间产生了直接冲突。 LingBot-VA 2.0 是为机器人控制从头训练的,而不是从用于内容创作的视频生成器改编而来。 Robbyant 是蚂蚁集团旗下的一家具身 AI 公司,该公司构建了该模型,使其学习场景如何在动作下变化,预测接下来应该发生什么,并将这些预测转化为实时的机器人运动。 大多数视频动作系统继承了主要以再现视觉外观为目标的 tokenizer 和视频骨干网络。LingBot-VA 2.0 围绕物理控制重建了这两个部分。 其语义视觉-动作 tokenizer 将观测映射到来自冻结视觉基础模型的特征,并通过自监督逆动力学和正动力学从帧间变化中学习紧凑的潜在动作。因此,未标注的网络视频无需机器人动作标签就能携带与动作相关的训练信号。 该策略从一开始就是因果性的,因此每个预测只能使用过去的观测。 其稀疏的专家混合视频骨干网络总参数约 13B,而每个 token 激活约 1.9B,从而在每个步骤中降低计算量。一个高层视觉语言规划器将长任务分解为较小的指令,而低层视频动作策略则处理连续运动。 前瞻推理在机器人正在行动时预测未来视觉状态,然后用每个新的真实观测替换设想的状态。结合少步骤蒸馏和系统加速,论文报告峰值异步执行频率达到 225 Hz。 该模型可从 10-15 个演示中适应,跨机器人形态迁移,并能零样本处理部分新任务。 在论文自身的评估中,它在 RoboTwin 2.0 上达到平均 93.6,并且在测试任务上报告了比 LingBot-VA 和 π0.5 更强的真实世界结果。 1.
查看原文
查看缓存全文

缓存时间: 2026/07/14 04:23

大多数视频动作机器人模型本质上是一个内容生成的视频生成器,外加一个动作模块。

来自@robbyant_brain的LingBot-VA 2.0 是一款视频动作基础模型,它彻底抛弃了这个起点,从头开始原生地为控制任务训练整个技术栈。

而且它能够以峰值225 Hz的频率进行闭环运行。

这一点至关重要,因为当机器人的控制器停下来“想象”接下来几帧的画面时,机器人就无法做出快速响应。LingBot-VA 2.0 在执行过程中进行预测,然后利用每一次真实的观测数据进行校正。

它仅有大约130亿的视频参数,而每个token激活的参数大约为19亿。更大的机器人模型通常意味着更慢的响应速度,这就造成了智能与控制之间的直接冲突。

LingBot-VA 2.0 是为机器人控制而从头训练的,而非从为内容创作构建的视频生成器改造而来。

Robbyant,作为蚂蚁集团旗下的具身智能公司,开发了这款模型,使其能够学习在动作作用下场景如何变化,预测接下来会发生什么,并将这些预测转化为实时的机器人运动。

大多数视频动作系统继承了一个主要用于重现视觉外观的分词器和视频骨干网络。LingBot-VA 2.0 则围绕物理控制重建了这两个部分。

它的语义视觉动作分词器将观测映射到来自冻结视觉基础模型的特征,并利用自我监督的逆向和前向动力学,从帧间变化中学习紧凑的潜在动作。因此,未标记的网络视频也能够携带与动作相关的训练信号,而无需机器人动作标签。

该策略从一开始就是因果式的,因此每个预测只能依赖过去的观测数据。

其稀疏的混合专家视频骨干网络总参数约为130亿,而每个token激活的参数约为19亿,从而在每个推理步骤中降低了计算量。一个高层级的视觉语言规划器将长任务分解为较小的指令,而低层级的视频动作策略则负责处理连续的运动。

前瞻推理(Foresight Reasoning)在机器人已经行动的同时预测未来的视觉状态,然后利用每一次新的真实观测数据替换想象的画面。结合少步蒸馏和系统加速,论文报告了峰值异步执行频率达到225 Hz。

该模型能够从10-15次演示中适应,跨机器人形态迁移,并且在部分新任务上实现零样本处理。

在论文自身的评估中,它在RoboTwin 2.0上达到了93.6的平均分,并报告了在测试任务上比LingBot-VA和π0.5更强的实际世界结果。

相似文章

robbyant/lingbot-video-moe-30b-a3b

Hugging Face Models Trending

LingBot-Video是首个面向具身智能的开源大规模MoE视频生成模型,采用高效MoE架构、海量具身数据训练,以及多奖励系统,实现高美学、物理合理性和任务完成度。