多模态预训练的物理:知识流动、模态协同、早期统一与配方
摘要
本文系统性地探索了多模态预训练的物理机制,揭示了知识在模态之间如何流动、协同与竞争的条件、早期统一的优势,以及在13.5B MoE模型上验证的高效预训练配方。
查看缓存全文
缓存时间: 2026/08/06 05:50
论文页面 - 迈向多模态预训练的物理:知识流动、模态协同、早期统一与配方
来源:https://huggingface.co/papers/2608.05000
摘要
视觉为推进基础模型提供了关键轴线,推动着向原生统一的多模态预训练转变。尽管势头强劲,但设计空间以及统一训练过程中模态交互的基本机制仍未被充分探索。我们通过对多模态预训练的系统性探索,提供了实证层面的清晰认识。我们在合成数据集和大规模真实世界数据集上进行的受控实验,得出了关于多模态预训练物理的四个关键洞见:(i) 知识流动:我们厘清了语言、视觉理解和视觉生成如何跨模态传递知识,揭示了不同的影响模式与不对称性;(ii) 协同与竞争:我们表明数据的“复杂度”在很大程度上决定了模态之间是否具有协同性,并识别出促进协同的架构选择,例如共享注意力以及带模态特定前馈层的归一化,同时发现这些行为能够推广到不同的视觉分词器设计;(iii) 早期统一:从初始阶段就统一模态并进行联合训练,被证明比晚期对齐或顺序训练更为有效。这一过程揭示了“视觉惰性”现象,即延迟整合会导致模型依赖语言先验;(iv) 配方:我们推导出了高效的预训练配方,仅用 5% 的计算预算即可实现强大的生成性能。这些核心发现随后通过训练多个 13.5B MoE 模型(2T tokens)在大规模上得到验证。我们希望这项研究为理解和扩展多模态预训练提供一个有原则的基础。
查看 arXiv 页面 (https://arxiv.org/abs/2608.05000)查看 PDF (https://arxiv.org/pdf/2608.05000)项目页面 (https://junlinhan.github.io/projects/physics_of_mm_pretrain/)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.05000)
在您的代理中获取此论文:
hf papers read 2608\.05000
还没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2608.05000,即可从本页链接到它。
引用此论文的数据集 0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2608.05000,即可从本页链接到它。
引用此论文的 Spaces 0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2608.05000,即可从本页链接到它。
收录此论文的集合 0
没有收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 中,即可从本页链接到它。
相似文章
模态如何共同学习(49分钟阅读)
来自Meta FAIR、Reality Labs和牛津大学的一项关于多模态预训练的系统性研究,揭示了模态之间的不对称知识流动、协同与竞争动态、早期统一的益处,以及通过13.5B MoE模型验证的高效训练方案。
从零开始的原生多模态预训练扩展
本文研究了原生多模态预训练的扩展性质,推导了在固定预算下的计算最优模型大小和令牌数量,并揭示了语言和多模态目标的不同扩展行为。
SeePhys Pro:诊断多模态 RLVR 在物理推理中的模态迁移与盲训练效应
该论文介绍了 SeePhys Pro,这是一个用于诊断多模态强化学习(RL)中模态迁移问题的基准测试,揭示了模型在表征不变推理方面存在困难,且往往依赖残留的文本线索而非视觉证据。
从模态到命题:一种以语言为中心的多模态智能框架
本文提出将多模态数据(图像、视频、文本)表示为原子命题(例如'人拿着杯子')的包,通过全局语义码本统一,实现可解释、组合化和跨模态理解。该框架在自动驾驶和开放世界数据上进行了演示。
迈向原生多模态建模:路线图
本文提出了一份正式的路线图,用于从晚期融合多模态方法向统一Transformer框架内的原生多模态建模(NMM)转型,根据输入-输出对偶性对现有模型进行分类,并系统性地讨论了架构协调、数据整理、训练方案和评估。