OPD-V:具有模态平衡的视觉在策略自蒸馏

Hugging Face Daily Papers 论文

摘要

介绍了 OPD-V,一种用于多模态大语言模型的视觉在策略自蒸馏范式,利用正负教师将模态平衡作为特权信息,在降低训练成本的同时提高跨基准的推理性能。

在策略自蒸馏(OPSD)已成为改善多模态大语言模型(MLLM)视觉推理的标准后训练方法。现有方法从多样化的输入源中提取特权信息来指导自蒸馏。然而,这些设计忽略了模态不平衡,这是 MLLM 推理固有的一项挑战。当文本信息主导生成时,模型无法完全整合其多模态输入。因此,精心设计的特权信息仍未得到充分利用,限制了 OPSD 的有效性。为了研究这一局限性,我们构建了一个使用缩放图像的积极教师和一个使用掩码图像的消极教师,它们表现出不同程度的模态不平衡。它们的推理正确性和标记逻辑值的变化表明,模态平衡本身可以作为特权信息。受这一发现的启发,我们引入了 OPD-V,一种视觉 OPSD 范式,通过积极教师和消极教师实例化此类信息。积极模态平衡逻辑值边际定义了一个模态平衡信任区域,该区域选择用于自蒸馏的在策略标记。跨 6 个基准、4 个 MLLM 主干和 5 种后训练方法的实验表明,OPD-V 在降低训练成本的同时持续提高推理性能。
查看原文
查看缓存全文

缓存时间: 2026/08/06 05:50

论文页面 - OPD-V:模态平衡的视觉同策略自蒸馏

来源:https://huggingface.co/papers/2608.05131

摘要

同策略自蒸馏(OPSD)已成为提升多模态大语言模型(MLLM)视觉推理能力的标准后训练方法。现有方法从多样化输入来源中提取特权信息来引导自蒸馏。然而,这些设计忽视了模态失衡——这一 MLLM 推理中固有的挑战。当文本信息主导生成过程时,模型无法充分整合其多模态输入。因此,精心设计的特权信息仍未被充分利用,从而限制了 OPSD 的有效性。为了审视这一局限,我们构建了一个带有放大图像的正教师和一个带有掩码图像的负教师,它们表现出不同程度的模态失衡。其推理正确性与 token logits 的变化表明,模态平衡本身即可作为特权信息。受此发现启发,我们提出了 OPD-V,一种通过正教师和负教师实例化此类信息的视觉 OPSD 范式。正模态平衡 Logits 边际定义了一个模态平衡信任区域,用于选择用于自蒸馏的同策略 token。在 6 个基准、4 个 MLLM 骨干和 5 种后训练方法上的实验表明,OPD-V 在降低训练成本的同时,持续提升了推理性能。

查看 arXiv 页面 (https://arxiv.org/abs/2608.05131)查看 PDF (https://arxiv.org/pdf/2608.05131)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.05131)

在你的代理中获取此论文:

hf papers read 2608\.05131

没有最新 CLI?curl \-LsSf https://hf.co/cli/install\.sh \| bash

引用此论文的模型0

暂无模型关联此论文 请在模型 README.md 中引用 arxiv.org/abs/2608.05131,以便从此页面链接到该模型。

引用此论文的数据集0

暂无数据集关联此论文 请在数据集 README.md 中引用 arxiv.org/abs/2608.05131,以便从此页面链接到该数据集。

引用此论文的 Space0

暂无 Space 关联此论文 请在 Space README.md 中引用 arxiv.org/abs/2608.05131,以便从此页面链接到该 Space。

包含此论文的收藏集0

暂无收藏集包含此论文 将此论文添加到收藏集 (https://huggingface.co/new-collection),以便从此页面链接到该收藏集。

相似文章

自监督视觉在线策略蒸馏

Hugging Face Daily Papers

本文介绍了S^2VOPD,一种自监督方法,通过将原始图像蒸馏到强增强的学生视图中,改进视觉语言模型,在基准测试中性能超越GPT-5.4。

基于噪声学生在线策略自蒸馏的自增强视觉语言模型

arXiv cs.LG

提出NOPD,一种自蒸馏方法,通过利用干净输入和损坏输入之间的预测差异,在没有外部监督的情况下改进视觉语言模型。在视觉推理任务上取得了显著提升,匹配或超过了强化学习和来自外部模型的蒸馏。