@rohanpaul_ai:Meta/Oxford 研究发现,多模态模型可能只需要极少量的图像生成数据,如果语言和视觉…
摘要
Meta/Oxford 的一项研究发现,如果语言和视觉理解一起训练,多模态模型需要的图像生成数据少得惊人,并提出了语言、图像理解和图像生成 token 的最佳比例为 70/25/5。研究还警告说,延迟视觉训练会导致“视觉懒惰”,即模型忽略图像。
查看缓存全文
缓存时间: 2026/08/14 15:40
Meta/牛津大学的研究发现,如果从一开始就同时训练语言和视觉理解,那么多模态模型可能只需要极少量的图像生成数据。
所以,你可能不需要耗费那么多训练算力来教多模态模型生成图像。
语言训练本身就能帮助模型提升视觉能力,而学习理解图像也能让它更擅长生成图像。但反过来,训练生成图像对语言或图像理解的提升却微乎其微。
这导致训练配比可以非常不均衡。
在1T token的实验中,他们发现最优的整体分配是:70%语言、25%图像理解,以及仅5%的图像生成。
随后,他们在13.5B规模、2T token的训练中验证了这一配比。与均衡设置相比,即使图像生成token数量少了5倍,GenEval分数也从0.467提升到0.482,同时语言和图像理解能力也有提升。
还有另一个教训:不要过晚才加入视觉能力。
模型仅用语言训练的时间越长,就越容易忽略图像内容,转而依赖语言捷径。作者将这种现象称为“视觉懒惰”。
– arxiv. org/abs/2608.05000
标题:《迈向多模态预训练的物理机制:知识流动、模态协同、早期统一与训练配方》
相似文章
模态如何共同学习(49分钟阅读)
来自Meta FAIR、Reality Labs和牛津大学的一项关于多模态预训练的系统性研究,揭示了模态之间的不对称知识流动、协同与竞争动态、早期统一的益处,以及通过13.5B MoE模型验证的高效训练方案。
@radixark: 现实世界是多模态的。为了人工智能理解和重现它,模型需要在多种模态之间学习。在我们的最新……
Radixark 分享了一篇博客文章,介绍 Miles 如何通过为视觉语言模型和扩散模型提供共享的后训练设计来支持人工智能模型的多模态学习。
研究图像分词器作为统一多模态模型中的视觉语言
本文使用受控的自回归测试平台,分析了图像分词器设计如何影响多模态模型中的联合文本-图像建模,揭示了不同的扩展行为及其与下游性能的相关性。
通过多模态突破纯文本瓶颈?
本文讨论了多模态 AI 模型(如 GPT-4o 和 Claude 3.5 Sonnet)如何通过支持可视化调试、音频转数据以及增强型 RAG 系统,来克服纯文本处理的瓶颈。
视觉语言模型真的能进行视觉推理吗?模态差距的严格研究
本文介绍了CrossMath,一个受控多模态推理基准,揭示了当前视觉语言模型的一个关键局限:它们主要在文本空间进行推理,而非真正的视觉接地推理,视觉输入往往会降低性能相比仅文本基线。作者提出了微调方法来减轻这种模态差距并改进多模态推理能力。