从文本到视觉迁移了什么?VLM的能力缩放定律与迁移动态

arXiv cs.CL 论文

摘要

本文提出了一种能力驱动的多模态缩放定律,该定律可从LLM文本基准能力预测VLM性能,从而在不进行昂贵训练扫描的情况下,实现跨模型家族的原则性骨干选择。

arXiv:2608.00013v1 公告类型:新 摘要:选择合适的大型语言模型(LLM)骨干是构建视觉语言模型(VLM)时最关键的决策,但它仍然从根本上缺乏原则性:基于计算量的缩放定律无法跨模型家族泛化,也不存在任何框架可以在训练开始前直接预测VLM性能。我们提出了能力驱动的多模态缩放定律(Capability-Driven Multimodal Scaling Law),这是第一个跨家族框架,可从直接可观测的文本能力预测VLM基准准确率。给定通过PCA从LLM文本基准中提取的低维能力分数$S$,我们将VLM性能建模为$S$的函数,并引入每骨干迁移率和吸收率来量化数据缩放效率。为了拟合和验证该框架,我们在严格受控的配方下,在覆盖7个模型家族的34个LLM上训练了超过150个VLM。对超过200个文本基准和50个多模态基准的评估表明,该定律能够准确地将迁移率从最高8B参数的模型外推到72B规模的骨干,高保真地预测完整的VLM训练轨迹,并泛化到完全未见过的模型家族。除缩放定律外,我们的分析还揭示了可操作的见解:某些文本基准与多模态性能呈负相关,暴露出潜在的基准博弈行为;基础LLM作为VLM骨干优于指令微调版本,原因是其吸收率更高且数据缩放衰减更低;不同模型家族在迁移-吸收空间中占据不同位置。该框架将骨干选择从昂贵的经验扫描转变为原则性的定量决策。代码和数据可在 https://github.com/wangq-dev/CDMScaling 获取。
查看原文
查看缓存全文

缓存时间: 2026/08/04 07:36

# 从文本到视觉迁移了什么?VLM的能力缩放定律与迁移动态  
来源:https://arxiv.org/html/2608.00013  

Ziran Li¹, Qiang Wang², Zhengyu Chen¹, Shanglin Lei¹, Borun Chen¹, Jingang Wang¹, Xunliang Cai¹  
¹美团 ²清华大学  
{liziran02,chenzhengyu04}@meituan.com, [email protected]  

###### 摘要  

选择合适的LLM骨干是构建视觉-语言模型(VLM)时最具决定性的决策,但它仍从根本上缺乏原则指导:基于计算的缩放定律无法跨模型家族泛化,也没有任何框架能在训练开始前直接预测VLM性能。我们提出了能力驱动的多模态缩放定律(Capability-Driven Multimodal Scaling Law),这是首个从直接可观测的文本能力预测VLM基准准确率的跨家族框架。给定通过PCA从LLM文本基准中提取的低维能力分数\(S\),我们将VLM性能建模为\(S\)的函数,其中包含每个骨干的迁移率(transfer rate)和一个量化数据缩放效率的吸收率(absorption rate)。为了拟合和验证该框架,我们在严格受控的训练方案下,基于覆盖7个模型家族的34个LLM训练了150多个VLM。在200多个文本基准和50多个多模态基准上的评估表明,该定律能够将从高达8B参数模型上得到的迁移率准确外推到72B规模的骨干,以高保真度预测完整的VLM训练轨迹,并泛化到完全未见过的模型家族。除了缩放定律本身,我们的分析还揭示了可操作的洞见:某些文本基准与多模态性能负相关,暴露了潜在的基准测试博弈行为;基础LLM作为VLM骨干优于指令微调版本,原因是其更高的吸收率和更低的数据缩放衰减;不同模型家族在迁移-吸收空间中占据不同的位置。该框架将骨干选择从昂贵的经验性扫描转变为有原则、定量的决策。代码和数据可在https://github.com/wangq-dev/CDMScaling获取。  

## 1 引言  

大语言模型(LLM)的缩放定律已被证明具有显著的预测性:只需给定计算预算、参数量和训练数据量,就能准确预测训练损失乃至跨多个基准的下游任务性能(Kaplan et al., 2020 (https://arxiv.org/html/2608.00013#bib.bib14); Hoffmann et al., 2022 (https://arxiv.org/html/2608.00013#bib.bib16))。这种可预测性已经改变了LLM的开发方式——实践者可以在任何一次训练运行完成之前分配资源、比较架构并预测基准分数。然而,对于视觉-语言模型(VLM),尚不存在类似框架。最先进的VLM普遍依赖于强大的LLM骨干(Liu et al., 2024b (https://arxiv.org/html/2608.00013#bib.bib42); Bai et al., 2025 (https://arxiv.org/html/2608.00013#bib

相似文章