VAD:多模态在线策略蒸馏中用于目标重建的视觉证据归因

Hugging Face Daily Papers 论文

摘要

介绍了视觉归因蒸馏(VAD),这是一种用于多模态在线策略蒸馏的反事实目标重建方法,可估计教师纠正中可归因于视觉的部分。在4B和9B规模下的细粒度视觉基准测试中,该方法优于现有方法。

多模态在线策略蒸馏(OPD)通过使用特权视角教师对学生生成的轨迹进行监督,来迁移细粒度的视觉知识。然而,其下一词元纠正来源于混合信号,将视觉信号与语言先验及教师特定效应结合在一起。关键挑战在于估计哪些纠正得到视觉证据支持,而不仅仅是确定在何处或以多大强度进行蒸馏。我们引入了视觉归因蒸馏(VAD),一种反事实目标重建算法,用于估计教师纠正中可归因于视觉的部分。在每个学生生成的前缀处,VAD在保留和移除相关证据的情况下评估同一固定教师。相应的居中对数概率变化定义了ut,这是视觉证据方向的有符号代理,用于估计证据在多大程度上支持或反驳候选词元。VAD将原始纠正投影到此代理上,获得干预对齐分量和代理无法解释的残差,然后从前者的基础上重建一个以学生为锚定的目标。在训练过程中,该重建目标提供主要监督信号,而特权视角教师则提供弱正则化器。在4B和9B规模下的六个细粒度视觉基准上,VAD优于直接特权视角蒸馏和视觉优势加权。词元级别和受控目标分析表明,代理对齐分量富含与任务相关的视觉纠正,并产生更强的目标偏移,尤其是在证据反驳错误答案时。这些结果支持反事实目标重建作为源混合监督的有效替代方案。
查看原文
查看缓存全文

缓存时间: 2026/08/04 05:37

论文页面 - VAD:多模态在线策略蒸馏中用于目标重建的视觉证据归因

来源:https://huggingface.co/papers/2607.28590 发布于 7 月 30 日

·

提交者 https://huggingface.co/zhangkangning

张康宁 于 8 月 4 日

#2 每日论文 (https://huggingface.co/papers/date/2026-08-04) 作者:, , , , , , , , , ,

摘要

多模态在线策略蒸馏(OPD)通过使用特权视角教师对学生生成轨迹进行监督,来迁移细粒度视觉知识。然而,其下一个词元修正的来源是混合的,将视觉信号与语言先验及教师特有影响结合在一起。关键挑战在于估计哪些修正得到了视觉证据的支持,而不仅仅是在何处或多大程度上进行蒸馏。我们提出了视觉归因蒸馏(VAD),一种反事实目标重建算法,用于估计教师修正中可归因于视觉的部分。在每个学生生成的前缀处,VAD 在保留和移除相关证据的情况下评估同一个固定教师。中心化对数概率的相应变化定义了 u_t,作为视觉证据方向的有符号代理,用于估计证据对候选词元的支持或反驳程度。VAD 将原始修正投影到该代理上,得到一个干预对齐分量和一个代理未解释残差,然后由前者重建以学生为锚定的目标。在训练过程中,该重建目标提供主要监督信号,而特权视角教师则贡献一个弱正则项。在 4B 和 9B 规模的六个细粒度视觉基准上,VAD 优于直接特权视角蒸馏和视觉优势加权。词元级和受控目标分析表明,代理对齐分量富含任务相关的视觉修正,并产生更强的目标偏移,尤其是在证据反驳错误答案时。这些结果支持将反事实目标重建作为来源混合监督的有效替代方案。

查看 arXiv 页面 (https://arxiv.org/abs/2607.28590) 查看 PDF (https://arxiv.org/pdf/2607.28590) GitHub16 (https://github.com/DeepExperience/VAD_Multimodal_OPD) 添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2607.28590)

将这篇论文获取到你的 agent 中:

hf papers read 2607\.28590

没有最新版 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型 0

没有模型关联此论文

在模型 README.md 中引用 arxiv.org/abs/2607.28590,即可从此页面关联该模型。

引用此论文的数据集 0

没有数据集关联此论文

在数据集 README.md 中引用 arxiv.org/abs/2607.28590,即可从此页面关联该数据集。

引用此论文的 Space 0

没有 Space 关联此论文

在 Space README.md 中引用 arxiv.org/abs/2607.28590,即可从此页面关联该 Space。

包含此论文的收藏集 0

没有收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection) 中,即可从此页面关联它。

相似文章

OPD-V:具有模态平衡的视觉在策略自蒸馏

Hugging Face Daily Papers

介绍了 OPD-V,一种用于多模态大语言模型的视觉在策略自蒸馏范式,利用正负教师将模态平衡作为特权信息,在降低训练成本的同时提高跨基准的推理性能。

视觉对比自蒸馏

Hugging Face Daily Papers

VCSD通过使用内容擦除的对照图像产生对比信号,消除了在策略自蒸馏中对外部教师、特权答案或视觉证据的需求,在视觉语言基准测试中持续优于现有方法。