V-Zero: 基于对比证据门控的无答案标签在线策略蒸馏用于细粒度视觉推理

Hugging Face Daily Papers 论文

摘要

V-Zero 是一种新颖的无标签框架,用于细粒度视觉推理,它利用对比证据门控和在线策略蒸馏,无需标注答案标签即可提升性能,且训练速度远超传统方法。

细粒度视觉推理要求多模态大语言模型(MLLMs)识别与任务相关的视觉证据,并将其推理建立在局部图像区域之上。现有的基于代理的方法通常依赖于带有可验证奖励的强化学习,或在大规模标注推理轨迹上进行监督微调,这导致了高昂的探索成本、手工设计的验证规则或对文本监督的严重依赖。避免此类外部答案标签的一种自然方式是让学生从自身采样的轨迹中学习,这指向了在线策略蒸馏(OPD)。为了理解 OPD 在视觉推理中的能力与局限,我们将其重新理解为无负样本的停止梯度对齐。这一视角表明,尽管 OPD 提供了有效的 token 级修正,但其上限受限于缺乏轨迹级判别。受这些观察的启发,我们提出了 V-Zero,一种基于对比证据门控的无答案标签视觉推理框架。V-Zero 不使用任何标注的文本答案标签;相反,在训练过程中,它将与问题相关的区域裁剪与负视觉视图配对,以评估学生采样的轨迹并控制密集的 token 级蒸馏。在多个视觉推理基准上的实验表明,V-Zero 持续提升了细粒度视觉推理能力,同时保持了强大的泛化性能。值得注意的是,V-Zero 的训练速度比之前的监督微调方法快 5 倍以上,比强化学习基线快 10 倍以上。代码和数据集将在 https://github.com/eVI-group-SCU/V-Zero 发布。
查看原文
查看缓存全文

缓存时间: 2026/06/25 05:17

论文页面 - V-Zero: 基于对比证据门控的无答案标签在线策略蒸馏方法用于细粒度视觉推理

来源:https://huggingface.co/papers/2606.25319

摘要

提出了一种新颖的无标签视觉推理框架 V-Zero,它利用对比证据门控来改进细粒度视觉推理,无需标注的答案标签,且训练速度比传统方法更快。

细粒度视觉推理(https://huggingface.co/papers?q=Fine-grained%20visual%20reasoning)要求多模态大语言模型(https://huggingface.co/papers?q=multimodal%20large%20language%20models)(MLLMs)识别与任务相关的视觉证据,并将其推理扎根于局部图像区域。现有的智能体方法通常依赖于基于可验证奖励的强化学习(https://huggingface.co/papers?q=reinforcement%20learning)或在大规模标注推理轨迹上进行监督微调(https://huggingface.co/papers?q=supervised%20fine-tuning),这导致了昂贵的探索、手工设计的验证规则或对文本监督的严重依赖。避免此类外部答案标签的一种自然方式是学习学生自身采样的轨迹,这指向了在线策略蒸馏(https://huggingface.co/papers?q=On-Policy%20Distillation)(OPD)。为了理解 OPD 能为视觉推理(https://huggingface.co/papers?q=visual%20reasoning)提供什么以及不能提供什么,我们将其重新审视为无负样本的停止梯度对齐(https://huggingface.co/papers?q=stop-gradient%20alignment)。这一视角表明,尽管 OPD 提供了有效的词元级修正(https://huggingface.co/papers?q=token-level%20correction),但其上限受到缺乏轨迹级判别(https://huggingface.co/papers?q=trajectory-level%20discrimination)的限制。受这些观察的启发,我们提出了 V-Zero,一种用于视觉推理(https://huggingface.co/papers?q=visual%20reasoning)的无答案标签框架,采用对比证据门控(https://huggingface.co/papers?q=contrastive%20evidence%20gating)。V-Zero 不使用标注的文本答案标签;相反,在训练过程中,它将一个与问题相关的区域裁剪与一个负视觉视图配对,以评估学生采样的轨迹,并对密集的词元级蒸馏进行门控。在多个视觉推理(https://huggingface.co/papers?q=visual%20reasoning)基准上的实验表明,V-Zero 持续改善了细粒度视觉推理(https://huggingface.co/papers?q=fine-grained%20visual%20reasoning),同时保持了强大的泛化能力。值得注意的是,V-Zero 比之前的监督微调(https://huggingface.co/papers?q=supervised%20fine-tuning)方法快 5 倍以上,比强化学习(https://huggingface.co/papers?q=reinforcement%20learning)基线快 10 倍以上。代码和数据集将在 https://github.com/eVI-group-SCU/V-Zero 发布。

查看 arXiv 页面(https://arxiv.org/abs/2606.25319)查看 PDF(https://arxiv.org/pdf/2606.25319)项目页面(https://github.com/eVI-group-SCU/V-Zero)GitHub14(https://github.com/eVI-group-SCU/V-Zero)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.25319)

在你的智能体中获取此论文:

hf papers read 2606\.25319

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型1

hao05/v-zero-4b 视觉问答• 5B• 更新于19分钟前 • 21 • 1(https://huggingface.co/hao05/v-zero-4b)

引用本文的数据集0

无数据集链接此论文

在数据集的 README.md 中引用 arxiv.org/abs/2606.25319 以在此页面链接。

引用本文的 Spaces0

无 Space 链接此论文

在 Space 的 README.md 中引用 arxiv.org/abs/2606.25319 以在此页面链接。

包含此论文的收藏1

相似文章

视觉对比自蒸馏

Hugging Face Daily Papers

VCSD通过使用内容擦除的对照图像产生对比信号,消除了在策略自蒸馏中对外部教师、特权答案或视觉证据的需求,在视觉语言基准测试中持续优于现有方法。

Evidence-RL:迈向证据密集型视觉推理

Hugging Face Daily Papers

本文介绍了反事实证据解耦(CED),这是一种训练时方法,使视觉语言模型依赖具体的图像证据而非语言先验或捷径,从而提升跨基准的视觉推理grounding能力。

OPD-V:具有模态平衡的视觉在策略自蒸馏

Hugging Face Daily Papers

介绍了 OPD-V,一种用于多模态大语言模型的视觉在策略自蒸馏范式,利用正负教师将模态平衡作为特权信息,在降低训练成本的同时提高跨基准的推理性能。