@heyshrutimishra: 新视频模型刚刚发布。但这款并非为电影级视频打造。LingBot-Video专为具身智能设计…
摘要
LingBot-Video是一个30B参数的视频模型,采用稀疏MoE架构,专为具身智能设计,现已开源。它在RBench上优于现有模型,训练数据来自7万+小时的具身数据。
查看缓存全文
缓存时间: 2026/07/09 09:35
新的视频模型发布了,但这次的模型并非为电影级视频而生。
LingBot-Video 专为具身智能设计,其训练数据才是真正与众不同之处:超过 70,000 小时的操控、导航和第一人称交互数据。互联网视频教你看清事物长什么样,而它教你:当你对事物施加动作时,事物会如何变化。
300 亿参数,推理时仅激活 30 亿。稀疏 MoE(混合专家)架构,长序列处理速度快约 3 倍。已在北大与字节跳动联合推出的 RBench 上超越 Wan2.6、Seedance 1.5 Pro 和 Cosmos3 Super。
它开源了——这一点至关重要。研究者可以在此基础上真正构建自己的成果,而不只是读读论文。
Robbyant (@robbyant_brain): 今天我们开源了 LingBot-Video —— 首个专为具身智能构建的、基于 MoE 的视频基础模型。 🔹300 亿参数,推理时仅激活 30 亿。 🔹在大规模互联网视频预训练基础上,额外补充了 7 万小时的具身数据。 🔹性能已超越
相似文章
@_akhaliq: LingBot-Video 已在 Hugging Face 上发布——基于 MoE 的视频基础模型,专为具身智能打造,300亿参数,仅……
LingBot-Video,一个基于 MoE 的 300 亿参数视频基础模型,专为具身智能设计,已在 Hugging Face 上发布。推理时仅 30 亿参数激活,并额外使用 7 万小时具身数据增强。
robbyant/lingbot-video-moe-30b-a3b
LingBot-Video是首个面向具身智能的开源大规模MoE视频生成模型,采用高效MoE架构、海量具身数据训练,以及多奖励系统,实现高美学、物理合理性和任务完成度。
@rohanpaul_ai: 大多数视频动作机器人模型都是带有动作模块的内容创作视频生成器。LingBot-VA 2.0 fr…
LingBot-VA 2.0 是一个从头开始为机器人控制训练的视频动作基础模型,实现了 225 Hz 的闭环执行,具有 13B 参数(每个 token 激活 1.9B),并在 RoboTwin 2.0 上优于之前的模型。
LingBot-Video: 稀疏MoE视频扩散Transformer(总参数13B,激活参数1.4B)后训练为动作条件世界模型[R]
LingBot-Video是一个13B的稀疏MoE视频扩散Transformer(1.4B激活参数),通过强化学习后训练为动作条件世界模型,权重和代码已开源。它包含一个由VLM评分的物理合理性奖励,并将其自身定位为策略评估器和动作规划器,但缺少闭环机器人实验结果。
@robbyant_brain: LingBot-VLA 2.0 现已开源——我们新一代的具身基础模型。6万小时高质量预训练数据…
LingBot-VLA 2.0,一个开源的具身基础模型,已发布,拥有6万小时预训练数据,支持17个品牌的20种机器人配置,在RTX 4090上推理时间低于130毫秒。