@rohanpaul_ai:Meta/Oxford 研究发现,多模态模型可能只需要极少量的图像生成数据,如果语言和视觉…

X AI KOLs Following 论文

摘要

Meta/Oxford 的一项研究发现,如果语言和视觉理解一起训练,多模态模型需要的图像生成数据少得惊人,并提出了语言、图像理解和图像生成 token 的最佳比例为 70/25/5。研究还警告说,延迟视觉训练会导致“视觉懒惰”,即模型忽略图像。

Meta/Oxford 研究发现,如果从一开始就与语言和视觉理解一起训练,多模态模型可能只需要极少的图像生成数据。 所以,你可能不需要花费那么多训练算力来教多模态模型生成图像。 语言训练已经有助于模型处理视觉,而学习理解图像也会让模型更擅长生成图像。但训练它生成图像对语言或图像理解的帮助却很小。 这导致了非常不均衡的训练配比。 在 1T token 的实验中,最佳整体配比是 70% 语言、25% 图像理解、仅 5% 图像生成。 随后他们在 13.5B 规模、2T token 上测试了这一配比。即使图像生成 token 比均衡设置少 5 倍,GenEval 仍从 0.467 提升到 0.482,同时语言和图像理解也都有提升。 还有另一个教训:不要太晚才加入视觉训练。 模型只训练语言的时间越长,就越开始忽略图像并依赖语言捷径。作者称之为“视觉懒惰”。 – arxiv. org/abs/2608.05000 标题:“迈向多模态预训练的物理学:知识流、模态协同、早期统一与配方”
查看原文
查看缓存全文

缓存时间: 2026/08/14 15:40

Meta/牛津大学的研究发现,如果从一开始就同时训练语言和视觉理解,那么多模态模型可能只需要极少量的图像生成数据。

所以,你可能不需要耗费那么多训练算力来教多模态模型生成图像。

语言训练本身就能帮助模型提升视觉能力,而学习理解图像也能让它更擅长生成图像。但反过来,训练生成图像对语言或图像理解的提升却微乎其微。

这导致训练配比可以非常不均衡。

在1T token的实验中,他们发现最优的整体分配是:70%语言、25%图像理解,以及仅5%的图像生成。

随后,他们在13.5B规模、2T token的训练中验证了这一配比。与均衡设置相比,即使图像生成token数量少了5倍,GenEval分数也从0.467提升到0.482,同时语言和图像理解能力也有提升。

还有另一个教训:不要过晚才加入视觉能力。

模型仅用语言训练的时间越长,就越容易忽略图像内容,转而依赖语言捷径。作者将这种现象称为“视觉懒惰”。

– arxiv. org/abs/2608.05000

标题:《迈向多模态预训练的物理机制:知识流动、模态协同、早期统一与训练配方》

相似文章

模态如何共同学习(49分钟阅读)

TLDR AI

来自Meta FAIR、Reality Labs和牛津大学的一项关于多模态预训练的系统性研究,揭示了模态之间的不对称知识流动、协同与竞争动态、早期统一的益处,以及通过13.5B MoE模型验证的高效训练方案。

通过多模态突破纯文本瓶颈?

Reddit r/AI_Agents

本文讨论了多模态 AI 模型(如 GPT-4o 和 Claude 3.5 Sonnet)如何通过支持可视化调试、音频转数据以及增强型 RAG 系统,来克服纯文本处理的瓶颈。

视觉语言模型真的能进行视觉推理吗?模态差距的严格研究

arXiv cs.CL

本文介绍了CrossMath,一个受控多模态推理基准,揭示了当前视觉语言模型的一个关键局限:它们主要在文本空间进行推理,而非真正的视觉接地推理,视觉输入往往会降低性能相比仅文本基线。作者提出了微调方法来减轻这种模态差距并改进多模态推理能力。