@heyshrutimishra: 新视频模型刚刚发布。但这款并非为电影级视频打造。LingBot-Video专为具身智能设计…

X AI KOLs Following 模型

摘要

LingBot-Video是一个30B参数的视频模型,采用稀疏MoE架构,专为具身智能设计,现已开源。它在RBench上优于现有模型,训练数据来自7万+小时的具身数据。

新视频模型刚刚发布。但这款并非为电影级视频打造。 LingBot-Video专为具身智能设计。其训练数据使其脱颖而出:7万+小时的操作、导航和第一人称交互。互联网视频教会事物看起来如何。而它则教会当你对它们施加动作时,事物如何变化。 30B参数,推理时仅激活3B。稀疏MoE,长序列处理速度约快3倍。已在来自北京大学和字节跳动的RBench上击败了Wan2.6、Seedance 1.5 Pro和Cosmos3 Super。 它是开源的,这一点很重要。研究人员可以真正在此基础上进行开发,而不仅仅是泛泛阅读。
查看原文
查看缓存全文

缓存时间: 2026/07/09 09:35

新的视频模型发布了,但这次的模型并非为电影级视频而生。

LingBot-Video 专为具身智能设计,其训练数据才是真正与众不同之处:超过 70,000 小时的操控、导航和第一人称交互数据。互联网视频教你看清事物长什么样,而它教你:当你对事物施加动作时,事物会如何变化。

300 亿参数,推理时仅激活 30 亿。稀疏 MoE(混合专家)架构,长序列处理速度快约 3 倍。已在北大与字节跳动联合推出的 RBench 上超越 Wan2.6、Seedance 1.5 Pro 和 Cosmos3 Super。

它开源了——这一点至关重要。研究者可以在此基础上真正构建自己的成果,而不只是读读论文。

Robbyant (@robbyant_brain): 今天我们开源了 LingBot-Video —— 首个专为具身智能构建的、基于 MoE 的视频基础模型。 🔹300 亿参数,推理时仅激活 30 亿。 🔹在大规模互联网视频预训练基础上,额外补充了 7 万小时的具身数据。 🔹性能已超越

相似文章

robbyant/lingbot-video-moe-30b-a3b

Hugging Face Models Trending

LingBot-Video是首个面向具身智能的开源大规模MoE视频生成模型,采用高效MoE架构、海量具身数据训练,以及多奖励系统,实现高美学、物理合理性和任务完成度。