LingBot-Video: 稀疏MoE视频扩散Transformer(总参数13B,激活参数1.4B)后训练为动作条件世界模型[R]
摘要
LingBot-Video是一个13B的稀疏MoE视频扩散Transformer(1.4B激活参数),通过强化学习后训练为动作条件世界模型,权重和代码已开源。它包含一个由VLM评分的物理合理性奖励,并将其自身定位为策略评估器和动作规划器,但缺少闭环机器人实验结果。
单流扩散Transformer,采用DeepSeek-V3风格的稀疏MoE(128个专家,top-8路由,总参数13B,激活参数1.4B)。六奖励强化学习后训练,包括一个物理合理性奖励,以及一个动作到视频模式,该模式根据动作和手部姿态条件预测机器人rollout。权重、代码以及Diffusers/SGLang栈以LingBot-Video名义开源。有两件事值得深入探讨,也诚邀本版读者一起思考:物理合理性奖励由VLM从采样帧中评分。VLM能否作为物理合理性的可靠评判者?还是说这是Goodhart定律等待发生?(他们确实添加了真实视频负样本以防止奖励破解。)该系统被定位为策略评估器和动作规划器,但所有结果都是视频帧质量指标,没有闭环机器人数据。视频生成器与世界模型之间的界限在哪里?在RBench上,它取得了平均最高分,但推理密集的维度仍然由闭源模型占据,而且在他们自己的评估中,通用文生视频(T2V)仅排第二。请尽情剖析。论文、代码和权重:https://technology.robbyant.com/lingbot-video , https://github.com/robbyant/lingbot-video , https://huggingface.co/robbyant/lingbot-video
相似文章
robbyant/lingbot-video-moe-30b-a3b
LingBot-Video是首个面向具身智能的开源大规模MoE视频生成模型,采用高效MoE架构、海量具身数据训练,以及多奖励系统,实现高美学、物理合理性和任务完成度。
@_akhaliq: LingBot-Video 已在 Hugging Face 上发布——基于 MoE 的视频基础模型,专为具身智能打造,300亿参数,仅……
LingBot-Video,一个基于 MoE 的 300 亿参数视频基础模型,专为具身智能设计,已在 Hugging Face 上发布。推理时仅 30 亿参数激活,并额外使用 7 万小时具身数据增强。
@heyshrutimishra: 新视频模型刚刚发布。但这款并非为电影级视频打造。LingBot-Video专为具身智能设计…
LingBot-Video是一个30B参数的视频模型,采用稀疏MoE架构,专为具身智能设计,现已开源。它在RBench上优于现有模型,训练数据来自7万+小时的具身数据。
@rohanpaul_ai: 大多数视频动作机器人模型都是带有动作模块的内容创作视频生成器。LingBot-VA 2.0 fr…
LingBot-VA 2.0 是一个从头开始为机器人控制训练的视频动作基础模型,实现了 225 Hz 的闭环执行,具有 13B 参数(每个 token 激活 1.9B),并在 RoboTwin 2.0 上优于之前的模型。
面向具身智能的Mixture-of-Experts视频预训练扩展
LingBot-Video提出了一个基于DiT的视频预训练框架,采用Mixture-of-Experts架构、专用数据增强和多维奖励系统,用于具身智能应用。