Evidence-RL:迈向证据密集型视觉推理

Hugging Face Daily Papers 论文

摘要

本文介绍了反事实证据解耦(CED),这是一种训练时方法,使视觉语言模型依赖具体的图像证据而非语言先验或捷径,从而提升跨基准的视觉推理grounding能力。

视觉语言模型(VLM)应基于具体的图像证据而非语言先验、数据集捷径或无关的视觉上下文来回答。现有的面向感知的后训练方法通过全局扰动或注意力代理来鼓励使用图像,但它们并未检验采样答案是否因果地依赖于支持它的局部证据。我们提出了反事实证据解耦(CED),一种用于VLM grounding的训练时证据审计方法。对于每个响应,CED中和一个以物体为中心的证据区域,并将由此产生的支持度下降与匹配的非证据区域进行比较。我们将该信号与GRPO内部的答案正确性相结合,奖励依赖证据路径而非捷径或干扰路径的正确答案。CED使用弱物体级提议,不需要针对问题的证据标注,并且不增加推理时开销。在九个公开基准和四个主干网络上,CED优于先前基于强化学习的后训练方法,针对性分析验证了其以物体为中心的信号。
查看原文
查看缓存全文

缓存时间: 2026/08/11 02:18

论文页面 - Evidence-RL: Towards Evidence-intensive Visual Reasoning

来源:https://huggingface.co/papers/2608.08021

摘要

视觉语言模型(VLMs)应当基于具体的图像证据进行回答,而非依赖语言先验、数据集捷径或无关的视觉背景。现有的感知感知型后训练方法通过全局扰动或注意力代理来鼓励使用图像,但它们并未检验采样得到的答案是否因果地依赖于支撑它的局部证据。我们提出了反事实证据解耦(Counterfactual Evidence Disentanglement, CED),一种用于VLM接地(grounding)的训练时证据审计方法。对于每个回答,CED会中和一个以对象为中心的证据区域(Evidence Region),并将由此产生的支持度下降与匹配的非证据区域进行比较。我们将该信号与GRPO内的答案正确性相结合,奖励那些依赖证据路径而非捷径或干扰路径的正确答案。CED使用弱对象级提议,无需针对具体问题的证据标注,并且不增加推理时开销。在九个公开基准和四个骨干网络上,CED优于先前基于RL的后训练方法,针对性分析验证了其以对象为中心的信号。

查看 arXiv 页面 (https://arxiv.org/abs/2608.08021) 查看 PDF (https://arxiv.org/pdf/2608.08021) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.08021)

在您的 agent 中获取此论文:

hf papers read 2608\.08021

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

未找到关联此论文的模型

在模型的 README.md 中引用 arxiv.org/abs/2608.08021,即可从本页面链接到该模型。

引用此论文的数据集 0

未找到关联此论文的数据集

在数据集的 README.md 中引用 arxiv.org/abs/2608.08021,即可从本页面链接到该数据集。

引用此论文的 Space 0

未找到关联此论文的 Space

在 Space 的 README.md 中引用 arxiv.org/abs/2608.08021,即可从本页面链接到该 Space。

包含此论文的收藏集 0

没有收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection),即可从本页面链接到它。

相似文章

PixelEyes:解耦感知与推理,实现精准视觉证据搜寻

Hugging Face Daily Papers

PixelEyes 提出了一种多轮视觉推理代理,通过掩码引导搜索和语义区域广度优先搜索解耦感知与推理,并引入新基准(Pinpoint-Bench)和数据集(PixelEyes-6K),以提升视觉证据搜寻中的定位能力。

检索、整合与综合:空间-语义接地潜层视觉推理

arXiv cs.CL

本文介绍了 RIS,这是一个用于多模态大语言模型的空间-语义接地潜层视觉推理框架,旨在克服信息瓶颈。该框架提出将潜在令牌(tokens)锚定于空间和语义证据之上,在 V* 和 HRBench 等基准测试中展现出性能提升。

视觉具象化推理

Hugging Face Daily Papers

本文介绍了视觉具象化推理,一种使视觉语言模型能够将自然语言推理与使用点或框的明确视觉证据基础相结合的方法。一个可扩展的合成流水线和基础感知的强化学习提高了推理准确性,使得一个4B模型在空间和计数基准上能够匹配甚至超越一个27B模型。