标签
Meta/Oxford 的一项研究发现,如果语言和视觉理解一起训练,多模态模型需要的图像生成数据少得惊人,并提出了语言、图像理解和图像生成 token 的最佳比例为 70/25/5。研究还警告说,延迟视觉训练会导致“视觉懒惰”,即模型忽略图像。
来自Meta FAIR、Reality Labs和牛津大学的一项关于多模态预训练的系统性研究,揭示了模态之间的不对称知识流动、协同与竞争动态、早期统一的益处,以及通过13.5B MoE模型验证的高效训练方案。
本文系统性地探索了多模态预训练的物理机制,揭示了知识在模态之间如何流动、协同与竞争的条件、早期统一的优势,以及在13.5B MoE模型上验证的高效预训练配方。