从文本到视觉迁移了什么?VLM的能力缩放定律与迁移动态
摘要
本文提出了一种能力驱动的多模态缩放定律,该定律可从LLM文本基准能力预测VLM性能,从而在不进行昂贵训练扫描的情况下,实现跨模型家族的原则性骨干选择。
arXiv:2608.00013v1 公告类型:新
摘要:选择合适的大型语言模型(LLM)骨干是构建视觉语言模型(VLM)时最关键的决策,但它仍然从根本上缺乏原则性:基于计算量的缩放定律无法跨模型家族泛化,也不存在任何框架可以在训练开始前直接预测VLM性能。我们提出了能力驱动的多模态缩放定律(Capability-Driven Multimodal Scaling Law),这是第一个跨家族框架,可从直接可观测的文本能力预测VLM基准准确率。给定通过PCA从LLM文本基准中提取的低维能力分数$S$,我们将VLM性能建模为$S$的函数,并引入每骨干迁移率和吸收率来量化数据缩放效率。为了拟合和验证该框架,我们在严格受控的配方下,在覆盖7个模型家族的34个LLM上训练了超过150个VLM。对超过200个文本基准和50个多模态基准的评估表明,该定律能够准确地将迁移率从最高8B参数的模型外推到72B规模的骨干,高保真地预测完整的VLM训练轨迹,并泛化到完全未见过的模型家族。除缩放定律外,我们的分析还揭示了可操作的见解:某些文本基准与多模态性能呈负相关,暴露出潜在的基准博弈行为;基础LLM作为VLM骨干优于指令微调版本,原因是其吸收率更高且数据缩放衰减更低;不同模型家族在迁移-吸收空间中占据不同位置。该框架将骨干选择从昂贵的经验扫描转变为原则性的定量决策。代码和数据可在 https://github.com/wangq-dev/CDMScaling 获取。
查看缓存全文
缓存时间: 2026/08/04 07:36
# 从文本到视觉迁移了什么?VLM的能力缩放定律与迁移动态
来源:https://arxiv.org/html/2608.00013
Ziran Li¹, Qiang Wang², Zhengyu Chen¹, Shanglin Lei¹, Borun Chen¹, Jingang Wang¹, Xunliang Cai¹
¹美团 ²清华大学
{liziran02,chenzhengyu04}@meituan.com, [email protected]
###### 摘要
选择合适的LLM骨干是构建视觉-语言模型(VLM)时最具决定性的决策,但它仍从根本上缺乏原则指导:基于计算的缩放定律无法跨模型家族泛化,也没有任何框架能在训练开始前直接预测VLM性能。我们提出了能力驱动的多模态缩放定律(Capability-Driven Multimodal Scaling Law),这是首个从直接可观测的文本能力预测VLM基准准确率的跨家族框架。给定通过PCA从LLM文本基准中提取的低维能力分数\(S\),我们将VLM性能建模为\(S\)的函数,其中包含每个骨干的迁移率(transfer rate)和一个量化数据缩放效率的吸收率(absorption rate)。为了拟合和验证该框架,我们在严格受控的训练方案下,基于覆盖7个模型家族的34个LLM训练了150多个VLM。在200多个文本基准和50多个多模态基准上的评估表明,该定律能够将从高达8B参数模型上得到的迁移率准确外推到72B规模的骨干,以高保真度预测完整的VLM训练轨迹,并泛化到完全未见过的模型家族。除了缩放定律本身,我们的分析还揭示了可操作的洞见:某些文本基准与多模态性能负相关,暴露了潜在的基准测试博弈行为;基础LLM作为VLM骨干优于指令微调版本,原因是其更高的吸收率和更低的数据缩放衰减;不同模型家族在迁移-吸收空间中占据不同的位置。该框架将骨干选择从昂贵的经验性扫描转变为有原则、定量的决策。代码和数据可在https://github.com/wangq-dev/CDMScaling获取。
## 1 引言
大语言模型(LLM)的缩放定律已被证明具有显著的预测性:只需给定计算预算、参数量和训练数据量,就能准确预测训练损失乃至跨多个基准的下游任务性能(Kaplan et al., 2020 (https://arxiv.org/html/2608.00013#bib.bib14); Hoffmann et al., 2022 (https://arxiv.org/html/2608.00013#bib.bib16))。这种可预测性已经改变了LLM的开发方式——实践者可以在任何一次训练运行完成之前分配资源、比较架构并预测基准分数。然而,对于视觉-语言模型(VLM),尚不存在类似框架。最先进的VLM普遍依赖于强大的LLM骨干(Liu et al., 2024b (https://arxiv.org/html/2608.00013#bib.bib42); Bai et al., 2025 (https://arxiv.org/html/2608.00013#bib相似文章
大型语言模型教导视觉学生:细粒度概念知识的跨模态迁移
本文介绍了LaViD框架,该框架通过生成多项选择题作为概念签名,将语义知识从纯语言大语言模型转移到视觉学生模型,实现了优越的细粒度分类性能和鲁棒性。
CapVector:面向视觉-语言-动作模型的参数空间可迁移能力向量学习
本文介绍了 CapVector,这是一种将辅助训练目标与视觉-语言-动作模型的标准监督微调解耦的方法。通过提取可迁移能力向量并引入正交正则化,该方法在显著提升模型性能与泛化能力的同时,大幅降低了计算开销。
LEVANTE-bench:使用认知任务对VLM与儿童进行多尺度比较(或者,“你的VLM比五年级学生更聪明吗?”)
本文介绍了LEVANTE-bench,这是一个系统评估视觉-语言模型在六项认知任务上的表现,并将其与5-12岁儿童的表现进行比较的基准测试,发现当前的VLM仅部分与儿童的认知能力相符。
从结构到协同:多模态大语言模型中视觉-语言感知范式演进的综述
本综述论文系统回顾了多模态大语言模型(MLLMs)中统一视觉-语言感知的范式演进,提出了五阶段分类法,并指出了通向通用多模态智能的开放挑战。
VLM是通过自适应测试时优化进行视频推理的优秀教师
本文提出一种新范式:视觉-语言模型(VLM)作为测试时教师,通过可微分奖励和LoRA优化引导视频生成模型(VGM),在视频推理基准测试上平均提升16.7个百分点。