PixelEyes:解耦感知与推理,实现精准视觉证据搜寻

Hugging Face Daily Papers 论文

摘要

PixelEyes 提出了一种多轮视觉推理代理,通过掩码引导搜索和语义区域广度优先搜索解耦感知与推理,并引入新基准(Pinpoint-Bench)和数据集(PixelEyes-6K),以提升视觉证据搜寻中的定位能力。

本文探索多轮视觉推理,并观察到 MLLM 反复无法定位目标,导致冗长冗余的轨迹。我们将此失败归因于推理和感知在单个模型中的纠缠,即 MLLM 同时进行推理和定位,而不准确的定位会触发额外的推理轮次,从而膨胀轨迹。为了解决这个问题,我们提出了 PixelEyes,一个多轮视觉推理代理,显式地将推理与感知解耦,即推理器决定寻找什么,而专门的感知工具回答在哪里。具体来说,PixelEyes 引入了:1) 掩码引导的视觉搜索。调用一个指代分割模型来提供掩码精确定位,使推理器无需补偿不精确的定位。2) 语义区域广度优先搜索(BFS)。为了消除因重复裁剪错误子区域而导致的冗余循环,我们将探索组织为对语义区域的广度优先搜索。为了内化这些能力,我们通过从现有数据中重新合成专家轨迹构建了 PixelEyes-6K 数据集。这显式地将我们的掩码引导搜索和 BFS 逻辑嵌入到模型中。我们进一步引入了 Pinpoint-Bench,一个零提示视觉搜索基准,即问题中不提供位置线索,带有实例级掩码和边界框,将定位失败与推理失败分开,从而能够细粒度分析失败模式,如非注意盲视。最新的 MLLM 和视觉推理代理在 Pinpoint-Bench 上留下了很大的提升空间,证明了其质量和难度。代码和模型已开源。
查看原文
查看缓存全文

缓存时间: 2026/07/02 11:48

论文页面 - PixelEyes: Decoupling Perception and Reasoning for Pinpoint Visual Evidence Seeking

来源:https://huggingface.co/papers/2607.00115 作者:

,

,

,

,

,

,

,

,

,

,

,

,

摘要

多轮视觉推理智能体常常因推理与感知的纠缠而产生冗余轨迹;PixelEyes 通过掩码引导搜索和语义区域广度优先搜索将这两个过程解耦,并在一个包含专家重合成数据的新型基准上展示了其效果。

本文探索了多轮视觉推理(https://huggingface.co/papers?q=multi-turn%20visual%20reasoning),观察到 MLLMs(https://huggingface.co/papers?q=MLLMs)反复无法定位目标,导致轨迹冗长且冗余。我们将这一失败归因于单个模型中推理与感知的纠缠——MLLM 同时进行推理和定位,而定位不准确会触发额外的推理轮次,使轨迹膨胀。为解决此问题,我们提出 PixelEyes,一种明确将推理与感知解耦的多轮视觉推理(https://huggingface.co/papers?q=multi-turn%20visual%20reasoning)智能体:即推理器决定寻找什么,而专门的感知工具回答它在哪。具体来说,PixelEyes 引入了 1)掩码引导的视觉搜索(https://huggingface.co/papers?q=Mask-guided%20Visual%20Search)。调用引用分割模型(https://huggingface.co/papers?q=referring%20segmentation%20model)提供掩码级别的精确定位,使推理器无需补偿不精确的定位。2)语义区域广度优先搜索(https://huggingface.co/papers?q=Semantic-region%20Breadth-first%20Search)(BFS)。为消除重复裁剪错误子区域导致的冗余循环,我们将探索组织为对语义区域的广度优先搜索。为内化这些能力,我们通过从现有数据重合成专家轨迹构建了 PixelEyes-6K 数据集(https://huggingface.co/papers?q=PixelEyes-6K%20dataset),将掩码引导搜索和 BFS 逻辑显式嵌入模型。我们还引入了 Pinpoint-Bench(https://huggingface.co/papers?q=Pinpoint-Bench),一个零提示视觉搜索基准(https://huggingface.co/papers?q=visual%20search%20benchmark),即问题中不提供任何位置线索,并包含实例级别掩码和边界框,用于将定位失败与推理失败分离,从而实现对故障模式(如无意视盲)的细粒度分析。当前最先进的 MLLMs(https://huggingface.co/papers?q=MLLMs)和视觉推理智能体在 Pinpoint-Bench(https://huggingface.co/papers?q=Pinpoint-Bench)上仍存在较大提升空间,这证明了该基准的质量和难度。代码和模型已开源。

查看 arXiv 页面(https://arxiv.org/abs/2607.00115)查看 PDF(https://arxiv.org/pdf/2607.00115)项目页面(https://godx-7.github.io/PixelEyesSite/)GitHub2(https://github.com/godx-7/PixelEyes-train-infer-eval)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2607.00115)

在你的智能体中获取此论文:

hf papers read 2607\.00115

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本论文的模型2

godx7/PixelEyes-4B 5B• 更新于约1小时前 • 7 • 2 (https://huggingface.co/godx7/PixelEyes-4B)

godx7/PixelEyes-8B 9B• 更新于约1小时前 • 19 • 2 (https://huggingface.co/godx7/PixelEyes-8B)

引用本论文的数据集0

没有链接本论文的数据集

在数据集 README.md 中引用 arxiv.org/abs/2607.00115,即可将其链接到此页面。

引用本论文的 Spaces0

没有链接本论文的 Space

在 Space README.md 中引用 arxiv.org/abs/2607.00115,即可将其链接到此页面。

包含本论文的收藏夹1

相似文章

Evidence-RL:迈向证据密集型视觉推理

Hugging Face Daily Papers

本文介绍了反事实证据解耦(CED),这是一种训练时方法,使视觉语言模型依赖具体的图像证据而非语言先验或捷径,从而提升跨基准的视觉推理grounding能力。

Visual Para-Thinker++: 视觉推理的单策略多智能体框架

Hugging Face Daily Papers

Visual Para-Thinker++提出了一种用于视觉推理的单策略多智能体框架,该框架使用角色条件化智能体(主智能体、工作智能体、汇总智能体)和专用训练方法,以减少幻觉并提高效率,在幻觉敏感基准测试上优于基线。