VAD:多模态在线策略蒸馏中用于目标重建的视觉证据归因
摘要
介绍了视觉归因蒸馏(VAD),这是一种用于多模态在线策略蒸馏的反事实目标重建方法,可估计教师纠正中可归因于视觉的部分。在4B和9B规模下的细粒度视觉基准测试中,该方法优于现有方法。
查看缓存全文
缓存时间: 2026/08/04 05:37
论文页面 - VAD:多模态在线策略蒸馏中用于目标重建的视觉证据归因
来源:https://huggingface.co/papers/2607.28590 发布于 7 月 30 日
·
提交者 https://huggingface.co/zhangkangning
张康宁 于 8 月 4 日
#2 每日论文 (https://huggingface.co/papers/date/2026-08-04) 作者:, , , , , , , , , ,
摘要
多模态在线策略蒸馏(OPD)通过使用特权视角教师对学生生成轨迹进行监督,来迁移细粒度视觉知识。然而,其下一个词元修正的来源是混合的,将视觉信号与语言先验及教师特有影响结合在一起。关键挑战在于估计哪些修正得到了视觉证据的支持,而不仅仅是在何处或多大程度上进行蒸馏。我们提出了视觉归因蒸馏(VAD),一种反事实目标重建算法,用于估计教师修正中可归因于视觉的部分。在每个学生生成的前缀处,VAD 在保留和移除相关证据的情况下评估同一个固定教师。中心化对数概率的相应变化定义了 u_t,作为视觉证据方向的有符号代理,用于估计证据对候选词元的支持或反驳程度。VAD 将原始修正投影到该代理上,得到一个干预对齐分量和一个代理未解释残差,然后由前者重建以学生为锚定的目标。在训练过程中,该重建目标提供主要监督信号,而特权视角教师则贡献一个弱正则项。在 4B 和 9B 规模的六个细粒度视觉基准上,VAD 优于直接特权视角蒸馏和视觉优势加权。词元级和受控目标分析表明,代理对齐分量富含任务相关的视觉修正,并产生更强的目标偏移,尤其是在证据反驳错误答案时。这些结果支持将反事实目标重建作为来源混合监督的有效替代方案。
查看 arXiv 页面 (https://arxiv.org/abs/2607.28590) 查看 PDF (https://arxiv.org/pdf/2607.28590) GitHub16 (https://github.com/DeepExperience/VAD_Multimodal_OPD) 添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2607.28590)
将这篇论文获取到你的 agent 中:
hf papers read 2607\.28590
没有最新版 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型 0
没有模型关联此论文
在模型 README.md 中引用 arxiv.org/abs/2607.28590,即可从此页面关联该模型。
引用此论文的数据集 0
没有数据集关联此论文
在数据集 README.md 中引用 arxiv.org/abs/2607.28590,即可从此页面关联该数据集。
引用此论文的 Space 0
没有 Space 关联此论文
在 Space README.md 中引用 arxiv.org/abs/2607.28590,即可从此页面关联该 Space。
包含此论文的收藏集 0
没有收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 中,即可从此页面关联它。
相似文章
V-Zero: 基于对比证据门控的无答案标签在线策略蒸馏用于细粒度视觉推理
V-Zero 是一种新颖的无标签框架,用于细粒度视觉推理,它利用对比证据门控和在线策略蒸馏,无需标注答案标签即可提升性能,且训练速度远超传统方法。
OPD-V:具有模态平衡的视觉在策略自蒸馏
介绍了 OPD-V,一种用于多模态大语言模型的视觉在策略自蒸馏范式,利用正负教师将模态平衡作为特权信息,在降低训练成本的同时提高跨基准的推理性能。
视觉对比自蒸馏
VCSD通过使用内容擦除的对照图像产生对比信号,消除了在策略自蒸馏中对外部教师、特权答案或视觉证据的需求,在视觉语言基准测试中持续优于现有方法。
先见后思:解耦感知与推理实现抗捷径的多模态在策略自蒸馏
本文介绍了ViGOS,一种多模态在策略自蒸馏方法,通过让学生模型先产生视觉描述再进行推理来解耦感知与推理,减少对捷径的依赖并改善图像接地行为。
无需坐标或区域标签的视觉文档理解中的证据归因
提出了一种用于文档理解中视觉证据归因的语言接口,使用逐字引用替代基于坐标的边界框,在CiteVQA上实现了显著更高的证据召回率和更低的归因幻觉。