@rohanpaul_ai: 大多数视频动作机器人模型都是带有动作模块的内容创作视频生成器。LingBot-VA 2.0 fr…
摘要
LingBot-VA 2.0 是一个从头开始为机器人控制训练的视频动作基础模型,实现了 225 Hz 的闭环执行,具有 13B 参数(每个 token 激活 1.9B),并在 RoboTwin 2.0 上优于之前的模型。
查看缓存全文
缓存时间: 2026/07/14 04:23
大多数视频动作机器人模型本质上是一个内容生成的视频生成器,外加一个动作模块。
来自@robbyant_brain的LingBot-VA 2.0 是一款视频动作基础模型,它彻底抛弃了这个起点,从头开始原生地为控制任务训练整个技术栈。
而且它能够以峰值225 Hz的频率进行闭环运行。
这一点至关重要,因为当机器人的控制器停下来“想象”接下来几帧的画面时,机器人就无法做出快速响应。LingBot-VA 2.0 在执行过程中进行预测,然后利用每一次真实的观测数据进行校正。
它仅有大约130亿的视频参数,而每个token激活的参数大约为19亿。更大的机器人模型通常意味着更慢的响应速度,这就造成了智能与控制之间的直接冲突。
LingBot-VA 2.0 是为机器人控制而从头训练的,而非从为内容创作构建的视频生成器改造而来。
Robbyant,作为蚂蚁集团旗下的具身智能公司,开发了这款模型,使其能够学习在动作作用下场景如何变化,预测接下来会发生什么,并将这些预测转化为实时的机器人运动。
大多数视频动作系统继承了一个主要用于重现视觉外观的分词器和视频骨干网络。LingBot-VA 2.0 则围绕物理控制重建了这两个部分。
它的语义视觉动作分词器将观测映射到来自冻结视觉基础模型的特征,并利用自我监督的逆向和前向动力学,从帧间变化中学习紧凑的潜在动作。因此,未标记的网络视频也能够携带与动作相关的训练信号,而无需机器人动作标签。
该策略从一开始就是因果式的,因此每个预测只能依赖过去的观测数据。
其稀疏的混合专家视频骨干网络总参数约为130亿,而每个token激活的参数约为19亿,从而在每个推理步骤中降低了计算量。一个高层级的视觉语言规划器将长任务分解为较小的指令,而低层级的视频动作策略则负责处理连续的运动。
前瞻推理(Foresight Reasoning)在机器人已经行动的同时预测未来的视觉状态,然后利用每一次新的真实观测数据替换想象的画面。结合少步蒸馏和系统加速,论文报告了峰值异步执行频率达到225 Hz。
该模型能够从10-15次演示中适应,跨机器人形态迁移,并且在部分新任务上实现零样本处理。
在论文自身的评估中,它在RoboTwin 2.0上达到了93.6的平均分,并报告了在测试任务上比LingBot-VA和π0.5更强的实际世界结果。
相似文章
@robbyant_brain: LingBot-VLA 2.0 现已开源——我们新一代的具身基础模型。6万小时高质量预训练数据…
LingBot-VLA 2.0,一个开源的具身基础模型,已发布,拥有6万小时预训练数据,支持17个品牌的20种机器人配置,在RTX 4090上推理时间低于130毫秒。
@heyshrutimishra: 新视频模型刚刚发布。但这款并非为电影级视频打造。LingBot-Video专为具身智能设计…
LingBot-Video是一个30B参数的视频模型,采用稀疏MoE架构,专为具身智能设计,现已开源。它在RBench上优于现有模型,训练数据来自7万+小时的具身数据。
robbyant/lingbot-video-moe-30b-a3b
LingBot-Video是首个面向具身智能的开源大规模MoE视频生成模型,采用高效MoE架构、海量具身数据训练,以及多奖励系统,实现高美学、物理合理性和任务完成度。
@_akhaliq: LingBot-Video 已在 Hugging Face 上发布——基于 MoE 的视频基础模型,专为具身智能打造,300亿参数,仅……
LingBot-Video,一个基于 MoE 的 300 亿参数视频基础模型,专为具身智能设计,已在 Hugging Face 上发布。推理时仅 30 亿参数激活,并额外使用 7 万小时具身数据增强。
LingBot-Video: 稀疏MoE视频扩散Transformer(总参数13B,激活参数1.4B)后训练为动作条件世界模型[R]
LingBot-Video是一个13B的稀疏MoE视频扩散Transformer(1.4B激活参数),通过强化学习后训练为动作条件世界模型,权重和代码已开源。它包含一个由VLM评分的物理合理性奖励,并将其自身定位为策略评估器和动作规划器,但缺少闭环机器人实验结果。