从零开始的原生多模态预训练扩展

Hugging Face Daily Papers 论文

摘要

本文研究了原生多模态预训练的扩展性质,推导了在固定预算下的计算最优模型大小和令牌数量,并揭示了语言和多模态目标的不同扩展行为。

尽管大型语言模型(LLMs)展现了卓越的推理能力,但仅依赖文本预训练限制了其对多模态物理世界的感知。原生多模态预训练通过从零开始对多模态输入进行训练,避免了这一局限,从而实现了深度的跨模态整合,并缓解了传统后期融合架构中固有的优化不对称问题。尽管具有这些优势,该范式的扩展性质尚未被系统地表征。为填补这一空白,我们研究了在固定计算预算下训练基于transformer的视觉语言模型时的最优模型大小和token数量。我们证明,最小目标损失遵循可预测的计算律,而计算最优的模型大小和token数量按幂律扩展。值得注意的是,语言和多模态目标表现出不同的扩展行为。语言分配律在很大程度上不受数据组成的影响,表明无论多模态数据比例如何,语言学习都是稳定的。相反,多模态分配律对数据组成高度敏感。具体来说,只有当模型规模较大时,文本密集型混合数据才具有计算效率,从而将最优资源分配转向更大的模型容量。此外,通过对数据组成对计算律和分配指数的影响进行建模,我们推导出了一个效率边界,指定了模型大小、token数量和数据混合的精确配置。下游评估进一步表明,原生多模态预训练能够引发正面的跨模态迁移,从而增强纯文本空间推理能力,并实现稳健的多模态上下文学习。总之,这项实证研究为可预测地扩展多模态基础模型奠定了必要基础。
查看原文
查看缓存全文

缓存时间: 2026/07/27 05:40

论文页面 - 从头扩展原生多模态预训练

来源:https://huggingface.co/papers/2607.22043

摘要

尽管大型语言模型(LLMs)展现出卓越的推理能力,但它们依赖纯文本预训练的特性限制了其对多模态物理世界的感知。原生多模态预训练通过在多模态输入上从头训练模型来规避这一限制,从而实现了深度的跨模态整合,并缓解了传统后期融合架构中固有的优化不对称性。尽管有这些优势,该范式的扩展特性仍未得到系统性的刻画。为填补这一空白,我们研究了在固定计算预算下,训练基于Transformer的视觉语言模型时的最优模型规模与token数量。我们证明,最小化目标损失遵循可预测的计算法则,而计算最优的模型规模与token数量则按幂律关系进行缩放。值得注意的是,语言目标与多模态目标表现出截然不同的缩放行为。语言分配法则在很大程度上对数据组成不敏感,表明无论多模态数据占比如何,语言学习都保持稳定。相反,多模态分配法则对数据组成高度敏感。具体而言,文本占比较高的混合数据只有在更大的模型规模下才能实现计算高效,从而将最优资源分配转向更大的模型容量。此外,通过对数据组成对计算法则与分配指数的影响进行建模,我们推导出一个效率前沿,明确了模型规模、token数量与数据混合的精确配置。下游评估进一步揭示,原生多模态预训练会引发正面的跨模态迁移,从而增强纯文本空间推理能力,并支持鲁棒的多模态上下文学习。总之,这项实证研究为可预测地扩展多模态基础模型奠定了必要的基础。

查看 arXiv 页面 (https://arxiv.org/abs/2607.22043)查看 PDF (https://arxiv.org/pdf/2607.22043)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.22043)

在您的 Agent 中获取此论文:

hf papers read 2607.22043

还没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本论文的模型0

无模型链接本论文

请在模型 README.md 中引用 arxiv.org/abs/2607.22043 以将其链接至此页面。

引用本论文的数据集0

无数据集链接本论文

请在数据集 README.md 中引用 arxiv.org/abs/2607.22043 以将其链接至此页面。

引用本论文的 Spaces0

无 Space 链接本论文

请在 Space README.md 中引用 arxiv.org/abs/2607.22043 以将其链接至此页面。

包含本论文的收藏0

无收藏包含本论文

请将本论文添加到收藏 (https://huggingface.co/new-collection) 以将其链接至此页面。

相似文章

神经语言模型的缩放规律

OpenAI Blog

基础性实证研究,展示了语言模型性能与模型规模、数据集大小和计算预算之间的幂律缩放关系,对最优训练资源分配和样本效率有重要启示。

模态如何共同学习(49分钟阅读)

TLDR AI

来自Meta FAIR、Reality Labs和牛津大学的一项关于多模态预训练的系统性研究,揭示了模态之间的不对称知识流动、协同与竞争动态、早期统一的益处,以及通过13.5B MoE模型验证的高效训练方案。

迈向原生多模态建模:路线图

Hugging Face Daily Papers

本文提出了一份正式的路线图,用于从晚期融合多模态方法向统一Transformer框架内的原生多模态建模(NMM)转型,根据输入-输出对偶性对现有模型进行分类,并系统性地讨论了架构协调、数据整理、训练方案和评估。