从零开始的原生多模态预训练扩展
摘要
本文研究了原生多模态预训练的扩展性质,推导了在固定预算下的计算最优模型大小和令牌数量,并揭示了语言和多模态目标的不同扩展行为。
查看缓存全文
缓存时间: 2026/07/27 05:40
论文页面 - 从头扩展原生多模态预训练
来源:https://huggingface.co/papers/2607.22043
摘要
尽管大型语言模型(LLMs)展现出卓越的推理能力,但它们依赖纯文本预训练的特性限制了其对多模态物理世界的感知。原生多模态预训练通过在多模态输入上从头训练模型来规避这一限制,从而实现了深度的跨模态整合,并缓解了传统后期融合架构中固有的优化不对称性。尽管有这些优势,该范式的扩展特性仍未得到系统性的刻画。为填补这一空白,我们研究了在固定计算预算下,训练基于Transformer的视觉语言模型时的最优模型规模与token数量。我们证明,最小化目标损失遵循可预测的计算法则,而计算最优的模型规模与token数量则按幂律关系进行缩放。值得注意的是,语言目标与多模态目标表现出截然不同的缩放行为。语言分配法则在很大程度上对数据组成不敏感,表明无论多模态数据占比如何,语言学习都保持稳定。相反,多模态分配法则对数据组成高度敏感。具体而言,文本占比较高的混合数据只有在更大的模型规模下才能实现计算高效,从而将最优资源分配转向更大的模型容量。此外,通过对数据组成对计算法则与分配指数的影响进行建模,我们推导出一个效率前沿,明确了模型规模、token数量与数据混合的精确配置。下游评估进一步揭示,原生多模态预训练会引发正面的跨模态迁移,从而增强纯文本空间推理能力,并支持鲁棒的多模态上下文学习。总之,这项实证研究为可预测地扩展多模态基础模型奠定了必要的基础。
查看 arXiv 页面 (https://arxiv.org/abs/2607.22043)查看 PDF (https://arxiv.org/pdf/2607.22043)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.22043)
在您的 Agent 中获取此论文:
hf papers read 2607.22043
还没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本论文的模型0
无模型链接本论文
请在模型 README.md 中引用 arxiv.org/abs/2607.22043 以将其链接至此页面。
引用本论文的数据集0
无数据集链接本论文
请在数据集 README.md 中引用 arxiv.org/abs/2607.22043 以将其链接至此页面。
引用本论文的 Spaces0
无 Space 链接本论文
请在 Space README.md 中引用 arxiv.org/abs/2607.22043 以将其链接至此页面。
包含本论文的收藏0
无收藏包含本论文
请将本论文添加到收藏 (https://huggingface.co/new-collection) 以将其链接至此页面。
相似文章
多模态预训练的物理:知识流动、模态协同、早期统一与配方
本文系统性地探索了多模态预训练的物理机制,揭示了知识在模态之间如何流动、协同与竞争的条件、早期统一的优势,以及在13.5B MoE模型上验证的高效预训练配方。
神经语言模型的缩放规律
基础性实证研究,展示了语言模型性能与模型规模、数据集大小和计算预算之间的幂律缩放关系,对最优训练资源分配和样本效率有重要启示。
数据受限的语言模型预训练:改进的正则化与缩放定律
本文研究数据受限的语言模型预训练,提出了掩码输入正则化(MIR)以改进验证损失和下游性能,以及SoftQ,一种更好地捕捉重复数据下模型与数据交互的缩放定律。
模态如何共同学习(49分钟阅读)
来自Meta FAIR、Reality Labs和牛津大学的一项关于多模态预训练的系统性研究,揭示了模态之间的不对称知识流动、协同与竞争动态、早期统一的益处,以及通过13.5B MoE模型验证的高效训练方案。
迈向原生多模态建模:路线图
本文提出了一份正式的路线图,用于从晚期融合多模态方法向统一Transformer框架内的原生多模态建模(NMM)转型,根据输入-输出对偶性对现有模型进行分类,并系统性地讨论了架构协调、数据整理、训练方案和评估。