基于噪声学生在线策略自蒸馏的自增强视觉语言模型

arXiv cs.LG 论文

摘要

提出NOPD,一种自蒸馏方法,通过利用干净输入和损坏输入之间的预测差异,在没有外部监督的情况下改进视觉语言模型。在视觉推理任务上取得了显著提升,匹配或超过了强化学习和来自外部模型的蒸馏。

arXiv:2607.23125v1 公告类型:新 摘要:后训练使得视觉语言模型(VLM)能够理解人类指令并执行各种下游任务。当前的后训练方法通常依赖于人工标注数据、外部模型蒸馏、基于人类反馈的强化学习或可验证答案。这限制了它们在无外部监督下的改进能力。为解决这一问题,我们提出了NOPD(噪声学生在线策略自蒸馏),一种简单而有效的自蒸馏方法,无需任何外部模型或真实答案即可改进VLM。我们的关键洞察是,干净输入与损坏输入之间的预测差异自然产生了一种自监督信号。在NOPD中,模型从损坏输入中学习,同时使用其在干净输入下的自身预测作为令牌级监督。我们在五个视觉推理任务上展示了NOPD的有效性;它可以匹配甚至超越强化学习方法或外部模型蒸馏。值得注意的是,当使用Geometry3K中的2100个样本进行训练时,NOPD在验证集上将Qwen2.5-VL-7B提升了20个点。它还在分布外测试集上表现出泛化能力,并在MathVista上获得了7.4个点的提升。此外,我们证明NOPD是一种增强VLM的通用方法,在12个基准测试的三个模型上均实现了改进。
查看原文
查看缓存全文

缓存时间: 2026/07/28 06:25

# 基于噪声学生在线自蒸馏的视觉语言模型自增强

来源:https://arxiv.org/html/2607.23125

王帅¹张道安²唐哲³程浩⁴魏嘉恒¹
¹香港科技大学(广州)
²字节跳动
³浙江工业大学
⁴香港浸会大学

###### 摘要

后训练使视觉语言模型(VLM)能够理解人类指令并执行多种下游任务。当前的后训练方法通常依赖于人工标注数据、外部模型蒸馏、基于人类反馈的强化学习或可验证答案。这限制了它们在无外部监督下自我提升的能力。针对这一问题,我们提出了NOPD(噪声学生在线策略自蒸馏),这是一种简单而有效的自蒸馏方法,无需任何外部模型或真实答案即可改进VLM。我们的关键洞察是:干净输入和受污染输入之间的预测差异自然会产生一个自监督信号。在NOPD中,模型从受污染输入中学习,同时使用其在干净输入下的自身预测作为token级别的监督。我们在五个视觉推理任务上展示了NOPD的有效性;它可以匹配甚至超越强化学习方法或来自外部模型的蒸馏。值得注意的是,当使用Geometry3K的2.1K样本进行训练时,NOPD在验证集上使Qwen2.5-VL-7B提升了20个点。它还在分布外测试集上展现出泛化能力,并在MathVista上取得了7.4个点的提升。此外,我们证明NOPD是一种增强VLM的通用方法,在12个基准测试上为三个模型带来了改进。

## 1 引言

视觉语言模型(VLM)在视觉问答(VQA)、视觉推理和图表理解方面取得了显著进展(Bai et al., 2025b; Hong et al., 2025; Liu et al., 2023)。这一进步主要在后训练阶段实现,可能涉及监督微调(SFT)(Liu et al., 2023)、基于人类反馈的强化学习(Ouyang et al., 2022)或可验证奖励(RLVR)(Guo et al., 2025; OLMo et al., 2024; Shao et al., 2024)以及知识蒸馏(Agarwal et al., 2024; Gu et al., 2024)。尽管近期研究推进了VLM的基础能力,但典型的后训练方法表现出固有的局限性。SFT通常需要人工标注或来自前沿模型的蒸馏。RLVR通常需要可验证的问题,并且仅为整个响应提供稀疏的奖励信号。离线和在线策略知识蒸馏则从外部模型(通常称为教师)提供更强、更密集的token级别监督。

考虑到这些局限性以及现代VLM的强大能力,我们提出疑问:VLM是否可以在没有真实答案或外部模型监督的情况下进行自我改进,即“自增强”?最近,一些自蒸馏方法被提出,通过使用环境反馈(Hübotter et al., 2026)或将答案作为额外上下文(Zhao et al., 2026)来改进模型而无需外部模型。它们主要针对语言模型设计,并且仍然依赖外部信息。我们的目标是在没有任何外部监督或反馈的情况下改进VLM。

我们证明,通过利用非对称输入分布下的预测差异,可以自诱导出监督信号。具体来说,当模型处理干净输入和受污染输入时,输出分布上产生的差异自然会提供一个密集的学习信号——无需标签、奖励或外部教师。我们实例化这一原理,并提出了噪声学生在线策略自蒸馏(NOPD),一种用于VLM的自我改进方法。在NOPD中,单个模型同时扮演教师和学生的角色。教师处理干净输入,而学生则使用受污染输入进行训练。干净输入下的预测作为噪声输入的token级别监督。与先前方法相比,如图1所示,NOPD避免了高质量响应和外部强模型的需求。

我们进行了大量实验来验证NOPD的有效性。我们首先进行初步实验,在五个视觉推理基准测试上将NOPD与不同的后训练方法进行比较。大量实验表明,NOPD在多个基准测试上持续改进VLM,性能达到或超过依赖外部监督的方法。值得注意的是,NOPD还导致了隐式的推理压缩,在提高准确率的同时减少了输出长度。这些结果表明,无需任何外部监督即可实现有效的后训练。最后,我们验证了NOPD是否在不同的模型和超越推理的任务上具有泛化能力。

| 方法 | 无GT | 在线策略 | 无外部模型 | Token级信号 | 低采样成本 |
| :--- | :---: | :---: | :---: | :---: | :---: |
| SFT | ✘ | ✘ | ✔ | ✔ | ✔ |
| RLVR | ✘ | ✔ | ✔ | ✘ | ✘ |
| KD | ✔ | ✘ | ✘ | ✔ | ✔ |
| OPD | ✔ | ✔ | ✘ | ✔ | ✔ |
| NOPD (ours) | ✔ | ✔ | ✔ | ✔ | ✔ |

图1: 不同后训练方法的比较。上方:不同方法的示意图。`q`表示文本查询,`x`表示图像。为简洁起见,我们省略了损失函数的下标,除了GRPO。我们以红色突出显示所有采样操作,例如 `y ∼ π_θ(·|q, x)`。`π_θ` 表示 (a) 和 (b) 中的策略模型,以及 (c)、(d) 和 (e) 中用于蒸馏的学生模型。`π*` 表示蒸馏方法的教师。在 (e) 中,`T` 表示预定义的变换。(e) 给出了我们方法 NOPD 的概述。与典型的在线策略蒸馏不同,NOPD 在学生和教师之间共享相同的参数。教师监督信号来自模型在原始输入 (q, x) 下的输出。对于学生模型,输入是受污染的图像 `T(x)` 和文本查询 `q`。下方:比较总结。GT 表示给定输入问题的答案,可能包含详细的思维链(Wei et al., 2022b)轨迹。

## 2 准备工作

在本节中,我们简要回顾现有的后训练范式。

#### 符号说明。

我们用 `q` 表示文本查询,用 `x` 表示来自训练集 `S` 的图像。参数化为 `θ` 的视觉语言模型定义为 `π_θ`。给定输入对 `(q, x)`,它在 `π_θ` 下的似然是 `π_θ(y | q, x) = ∏_{t=1}^{|y|} π_θ(y_t | q, x, y_<t)`,其中 `|y|` 是输出序列的长度。

#### 监督微调 (SFT)

通常使用预定义的目标函数,例如语言建模损失,将模型 `π_θ` 与学生指导数据上的教师 `π*` 的输出对齐。对于从教师模型进行知识蒸馏的情况,它使用KL散度损失将学生的输出分布与教师的输出分布对齐。然而,这两种方法都严重依赖于标注答案或外部教师模型。

#### 强化学习

另一种后训练范式是基于人类反馈的强化学习 (RLHF) 或基于规则的强化学习 (RLVR)。与基于人类偏好的学习不同,RLVR 使用可验证的真实答案 `a*` 来提供奖励信号。一个流行的变体是近端策略优化 (PPO)。后训练目标由两部分组成:一个KL散度正则化项 `D_KL` 和一个基于奖励模型或可验证奖励分数的奖励函数 `R`。然而,RLVR 仅在生成完整响应后提供一个标量奖励,使得监督信号稀疏且缺乏token级别的指导。

## 3 方法:噪声学生在线策略自蒸馏 (NOPD)

在本节中,我们将介绍 NOPD。核心思想是通过不对称输入扰动自诱导监督信号。具体来说,对于相同的输入,模型因其在预测中的不同强度而给出不同的输出。NOPD 的关键原则是对称采样:从相同初始状态对响应进行采样,但使用不同的输入扰动来区分教师和学生的视角。教师使用原始、未受扰动的输入 `(q, x)` 进行推理,而学生则接收损坏版本 `(q, T(x))`,其中 `T` 是图像变换(例如,添加高斯噪声、降低分辨率或伽马变换)。由于干净输入和扰动输入导致不同的置信度和预测分布,预测之间的差异成为了学生模仿老师的有效训练信号来源。具体来说,在训练过程中,给定一个包含 `N` 个样本的批次,对于每个样本 `i`,我们首先使用教师 `π*` 从干净输入生成一个学生推理序列 `y_i`。值得注意的是,该序列是使用干净输入生成的,用作稳定的监督源。同时,学生模型 `π_θ` 从受污染输入 `(q, T(x))` 接收相同的序列 `y_i`,并计算其似然。因此,NOPD 损失函数可以公式化为:

`L_NOPD = -1/N ∑_{i=1}^N ∑_{t=1}^{|y_i|} log π_θ(y_{i,t} | q, T(x_i), y_{i,<t})`

其中 `y_i ~ π*(·|q, x_i)`。这个过程类似于经典的在线策略蒸馏,但有一个关键区别:教师和学生模型共享相同的架构,并且在整个过程中保持参数同步。此外,由于输入扰动导致性能差距,NOPD 在教师和学生之间引入了预测不对称性。这种不对称性是通过对输入进行不对称处理来诱导的:教师使用清晰、未受污染的数据,而学生接收质量下降的输入。通过监督信号隐式地调解了这种不对称性。教师网络通过自己的生成结果进行训练,而学生网络则通过将这些结果与降级输入相关联来学习。因此,NOPD 完全不需要真实答案或外部模型。

#### 架构和训练效率。

直接实现 NOPD,将教师对每批 `N` 个样本的生成结果(长度可达数千token)传输到训练节点,会产生显著的通信瓶颈。例如,传输 Qwen2.5-VL-7B 的隐藏状态(例如 4096 维度)已经需要 `N × 预测长度 × d_hidden` 的成本,这在 `N` 较大时(例如,N≈ 100K)会变得昂贵。我们仅传输教师最后一层的隐藏状态,并在计算损失函数时,使用教师的预测层即时重新计算logits。由于隐藏状态的维度(例如,Qwen3.5-2B 为 6144)远小于完整词汇表的维度(例如,Qwen3.5-2B 为 248320),相应的通信开销变得可负担且实用,仅引入可忽略的重新计算。基础设施设计来自 KDFlow(Zhang et al., 2026)。在我们的实验中,我们完全同步地更新教师模型和学生模型,即在每个训练步骤 `π* = π_θ`。我们还考虑了另外两种变体:(a) 将教师模型固定为初始权重 `π* = π_θ|_{t=0}`,其中 `t` 表示训练步骤,以及 (b) EMA 更新:`π* ← mπ* + (1-m)π_θ`,其中 `m=0.9` 控制更新速率。我们发现在表2(c)中,教师和学生之间完全同步权重取得了最佳性能。我们假设学生模型的能力在训练过程中得到提升,能够提供更好的监督信号。

图3: 三个基准测试上的输出token数量和准确率。

为了减少计算开销,我们将学生的生成长度限制在2048。我们在表2(d)中探索了不同的生成长度。我们发现,与其他基线相比,将生成长度增加到4096仅带来有限的收益。为了平衡计算和性能,我们将最大生成长度设置为2048。其背后的直觉是,在自回归解码过程中,较早的token对于学习更为关键。早期token的错误可能会累积并导致错误的输出。因此,仅为早期token提供监督信号就足以支持学生的学习。

#### 隐式推理压缩。

我们在图3中使用 Qwen3.5-2B 比较了三个数据集上的输出token数量和准确率。除了准确率的提升,我们发现我们的方法同时在三个基准测试上压缩了思考过程,从而提高了推理效率。具体来说,在 MathVista 上,我们的方法减少了 57.9% 的token,并将准确率提升了 4.3%。尽管我们没有设计专门的技术来压缩token,NOPD 实现了隐式推理压缩,提高了测试时的效率。

#### 跨训练数据集的有效性。

为了评估我们的方法在不同训练数据集上的有效性,我们在 MMK12(Meng et al., 2025) 上进行了实验,该数据集包含 15.6K 个样本。所有其他设置保持不变,只是由于数据集大小相比 Geometry3K 更大,我们将训练步骤增加到 200。如图4所示,在 MMK12 上训练时,NOPD 持续提升性能,展示了随着数据和训练计算量增加的良好可扩展性。例如,MathVision 上的准确率从 47.2% 提升到 50.4%,提高了 3.2 个点。

图4: 使用两个不同训练集进行训练时,三个基准测试上的准确率。我们分别使用 MMK12 和 Geometry3K 训练 Qwen3.5-2B。

#### 图像损坏类型。

我们进行了不同图像损坏类型的实验以验证其重要性。如表3所示,所有损坏类型都对基础模型有提升,其中添加噪声带来了最大的增益(73.2 → 77.1),而组合所有类型效果最佳。这突显了学生输入中图像损坏的重要性。

表 3: 损坏类型的消融实验。N、G、L 分别表示噪声、伽马变换、较低分辨率。我们报告了使用 Qwen3.5-2B 在 Geometry3K 测试集上的结果。

| N | G | L | Geometry3K |
| :---: | :---: | :---: | :---: |
| ✔ | ✔ | ✔ | 78.0 |
| ✔ | | | 77.1 |
| | ✔ | | 74.4 |
| | | ✔ | 76.8 |
| | | | 73.6 |
| w/o training | | | 73.2 |

### 4.3 NOPD 能否成为改进 VLM 的通用方法?

#### 模型。

为了验证我们的方法是否可以用于在不同任务上改进 VLM,并评估其随着数据扩大的可扩展性,我们使用更大规模的数据集进行实验,并在多个任务上进行评估。我们选择 Qwen2.5-VL-7B(Bai et al., 2025b)作为指令模型,Qwen3-VL-Thinking(Bai et al., 2025a)作为思考模型。为进一步检验我们方法在不同模型上的有效性,我们包含了拥有 9B 参数的 GLM4.6-V-Flash(Hong et al., 2025)。

#### 训练和数据集。

我们从多个来源收集数据,包括 Geometry3K(Lu et al., 2021)、GeomVerse(Kazemi et al., 2023)、Geo170K(Gao et al., 2023)、MMK12(Meng et al., 2025)、GeoQA+(Cao and Xiao, 2022)、CoSyn(Yang et al., 2025b)、VQAv2(Goyal et al., 2017)、ArxivQA(Li et al., 2024)、ChartQA(Masry et al., 2022)和 GQA(Hudson and Manning, 2019)。我们移除相似的图像或问题以提高训练集的多样性。此外,为确保视觉相关性(所有问题都必须通过图像回答),我们提示 Qwen3-VL-8B-Instruct 并移除与图像无关的问题。为了平衡训练数据分布,我们将所有问题分为三个领域:通用、推理和图表,并在训练过程中对不同领域进行均匀采样。我们获得了通用领域 19K 个样本,图表领域 56K 个样本,推理领域 54K 个样本。我们将训练步骤增加 1000,并保持其他超参数不变。

#### 评估。

为了对不同任务进行全面评估,我们在 12 个基准测试上评估所有模型,这些基准测试涵盖三个类别:通用视觉问答(VQA)、推理和图表理解。具体来说,对于通用 VQA,我们采用 MMStar(Chen et al., 2024)、MMBench-EN(Liu et al., 2024)、BLINK(Fu et al., 2024)、CV-Bench(Tong et al., 2024) 和 Realworld-QA³。对于推理任务,我们使用 MathVista(Lu et al., 2024)、MathVision(Wang et al., 2024a)、MMMU(Yue et al., 2024) 和 MMMU-Pro(Yue et al., 2025)。对于图表理解,我们在 ChartQA-Pro(Masry et al., 2025)、ChartMuseum(Tang et al., 2025) 和 CharXiv (reasoning)(Wang et al., 2024b) 上评估模型。对于不同的模型,我们采用官方指南推荐的解码参数(见表6),并遵循 lmms-eval(Zhang et al., 2025) 中的评估协议。

#### 结果。

我们在表4中展示结果。首先,注意到 NOPD 在三个模型上都取得了一致的增益。具体来说,我们在 **所有** 基准测试上改进了 Qwen2.5-VL-7B。对于 Qwen3-VL-8B-Thinking 和 GLM-4.6V-Flash,我们在 12 个基准测试中的 10 个上取得了改进。这表明 NOPD 可以用作 VLM 的通用自改进方法。此外,NOPD 在所有三个领域都产生了显著的改进,这表明 NOPD 的有效性不仅限于推理任务,还扩展到 VQA 和图表理解等其他领域。

表 4: 使用不同模型在多模态基准测试上的实证结果。`+x` 和 `-x` 表示与初始模型相比的改进/下降。

| 基准测试 | Qwen2.5 -VL-7B | NOPD -7B | Qwen3-VL -8B-Thinking | NOPD -8B | GLM-4.6V -Flash-9B | NOPD -9B |
| :--- | :---: | :---: | :---: | :---: | :---: | :---: |
| MMStar | 62.5 | 69.9 (+7.4) | 73.6 | 75.2 (+1.6) | 74.3 | 76.8 (+2.5) |
| MMBench-EN | ... | ... | ... | ... | ... | ... |
| ... | ... | ... | ... | ... | ... | ... |

(注意:由于原文表格可能被截断或内容不完整,此处根据提供的文本进行了部分翻译和保留格式。实际完整表格应按原文格式处理。)

相似文章

自监督视觉在线策略蒸馏

Hugging Face Daily Papers

本文介绍了S^2VOPD,一种自监督方法,通过将原始图像蒸馏到强增强的学生视图中,改进视觉语言模型,在基准测试中性能超越GPT-5.4。

OPD-V:具有模态平衡的视觉在策略自蒸馏

Hugging Face Daily Papers

介绍了 OPD-V,一种用于多模态大语言模型的视觉在策略自蒸馏范式,利用正负教师将模态平衡作为特权信息,在降低训练成本的同时提高跨基准的推理性能。

无需任何监督的同策略自蒸馏

Hugging Face Daily Papers

介绍了U-OPSD,一种无监督的同策略自蒸馏方法,利用内部一致性和多数投票伪解决方案来改进大语言模型,无需外部监督,在数学基准上达到或超过有监督方法。