LingBot-Video: 稀疏MoE视频扩散Transformer(总参数13B,激活参数1.4B)后训练为动作条件世界模型[R]

Reddit r/MachineLearning 论文

摘要

LingBot-Video是一个13B的稀疏MoE视频扩散Transformer(1.4B激活参数),通过强化学习后训练为动作条件世界模型,权重和代码已开源。它包含一个由VLM评分的物理合理性奖励,并将其自身定位为策略评估器和动作规划器,但缺少闭环机器人实验结果。

单流扩散Transformer,采用DeepSeek-V3风格的稀疏MoE(128个专家,top-8路由,总参数13B,激活参数1.4B)。六奖励强化学习后训练,包括一个物理合理性奖励,以及一个动作到视频模式,该模式根据动作和手部姿态条件预测机器人rollout。权重、代码以及Diffusers/SGLang栈以LingBot-Video名义开源。有两件事值得深入探讨,也诚邀本版读者一起思考:物理合理性奖励由VLM从采样帧中评分。VLM能否作为物理合理性的可靠评判者?还是说这是Goodhart定律等待发生?(他们确实添加了真实视频负样本以防止奖励破解。)该系统被定位为策略评估器和动作规划器,但所有结果都是视频帧质量指标,没有闭环机器人数据。视频生成器与世界模型之间的界限在哪里?在RBench上,它取得了平均最高分,但推理密集的维度仍然由闭源模型占据,而且在他们自己的评估中,通用文生视频(T2V)仅排第二。请尽情剖析。论文、代码和权重:https://technology.robbyant.com/lingbot-video , https://github.com/robbyant/lingbot-video , https://huggingface.co/robbyant/lingbot-video
查看原文

相似文章

robbyant/lingbot-video-moe-30b-a3b

Hugging Face Models Trending

LingBot-Video是首个面向具身智能的开源大规模MoE视频生成模型,采用高效MoE架构、海量具身数据训练,以及多奖励系统,实现高美学、物理合理性和任务完成度。