OPD-V:具有模态平衡的视觉在策略自蒸馏
摘要
介绍了 OPD-V,一种用于多模态大语言模型的视觉在策略自蒸馏范式,利用正负教师将模态平衡作为特权信息,在降低训练成本的同时提高跨基准的推理性能。
查看缓存全文
缓存时间: 2026/08/06 05:50
论文页面 - OPD-V:模态平衡的视觉同策略自蒸馏
来源:https://huggingface.co/papers/2608.05131
摘要
同策略自蒸馏(OPSD)已成为提升多模态大语言模型(MLLM)视觉推理能力的标准后训练方法。现有方法从多样化输入来源中提取特权信息来引导自蒸馏。然而,这些设计忽视了模态失衡——这一 MLLM 推理中固有的挑战。当文本信息主导生成过程时,模型无法充分整合其多模态输入。因此,精心设计的特权信息仍未被充分利用,从而限制了 OPSD 的有效性。为了审视这一局限,我们构建了一个带有放大图像的正教师和一个带有掩码图像的负教师,它们表现出不同程度的模态失衡。其推理正确性与 token logits 的变化表明,模态平衡本身即可作为特权信息。受此发现启发,我们提出了 OPD-V,一种通过正教师和负教师实例化此类信息的视觉 OPSD 范式。正模态平衡 Logits 边际定义了一个模态平衡信任区域,用于选择用于自蒸馏的同策略 token。在 6 个基准、4 个 MLLM 骨干和 5 种后训练方法上的实验表明,OPD-V 在降低训练成本的同时,持续提升了推理性能。
查看 arXiv 页面 (https://arxiv.org/abs/2608.05131)查看 PDF (https://arxiv.org/pdf/2608.05131)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.05131)
在你的代理中获取此论文:
hf papers read 2608\.05131
没有最新 CLI?curl \-LsSf https://hf.co/cli/install\.sh \| bash
引用此论文的模型0
暂无模型关联此论文 请在模型 README.md 中引用 arxiv.org/abs/2608.05131,以便从此页面链接到该模型。
引用此论文的数据集0
暂无数据集关联此论文 请在数据集 README.md 中引用 arxiv.org/abs/2608.05131,以便从此页面链接到该数据集。
引用此论文的 Space0
暂无 Space 关联此论文 请在 Space README.md 中引用 arxiv.org/abs/2608.05131,以便从此页面链接到该 Space。
包含此论文的收藏集0
暂无收藏集包含此论文 将此论文添加到收藏集 (https://huggingface.co/new-collection),以便从此页面链接到该收藏集。
相似文章
OPD-Aha:从语言动量到多模态在策略蒸馏中的视觉反思
OPD-Aha 引入了一种新颖的在策略蒸馏方法,利用视觉偏好来纠正多模态推理中的幻觉,在多个基准测试中实现了持续改进。
自监督视觉在线策略蒸馏
本文介绍了S^2VOPD,一种自监督方法,通过将原始图像蒸馏到强增强的学生视图中,改进视觉语言模型,在基准测试中性能超越GPT-5.4。
基于噪声学生在线策略自蒸馏的自增强视觉语言模型
提出NOPD,一种自蒸馏方法,通过利用干净输入和损坏输入之间的预测差异,在没有外部监督的情况下改进视觉语言模型。在视觉推理任务上取得了显著提升,匹配或超过了强化学习和来自外部模型的蒸馏。
EasyOPD: 一种易用的面向大语言模型在策略蒸馏框架
EasyOPD 是一种新型的大语言模型在策略蒸馏框架,它将配置、监督逻辑和执行分离开来,并支持跨分词器、自蒸馏和逐步 OPD。
先见后思:解耦感知与推理实现抗捷径的多模态在策略自蒸馏
本文介绍了ViGOS,一种多模态在策略自蒸馏方法,通过让学生模型先产生视觉描述再进行推理来解耦感知与推理,减少对捷径的依赖并改善图像接地行为。