标签
LingBot-Video提出了一个基于DiT的视频预训练框架,采用Mixture-of-Experts架构、专用数据增强和多维奖励系统,用于具身智能应用。
PhysisForcing 是一种训练框架,通过基于 DiT 架构的像素级轨迹对齐和语义级关系对齐损失来强制物理一致性,从而增强机器人操作的具身视频生成,在基准测试上取得了显著改进。
字节跳动开源了 Bernini-R,一种视频扩散渲染器,结合了基于 MLLM 的语义规划器和基于 DiT 的渲染器,用于统一的视频生成和编辑,在视频编辑上达到顶尖性能。
百度发布了ERNIE-Image-Turbo,一个蒸馏文本到图像生成模型,可在8步推理中实现快速生成,同时保持强大的文本渲染、指令遵循和结构化图像生成能力。