PixelEyes:解耦感知与推理,实现精准视觉证据搜寻
摘要
PixelEyes 提出了一种多轮视觉推理代理,通过掩码引导搜索和语义区域广度优先搜索解耦感知与推理,并引入新基准(Pinpoint-Bench)和数据集(PixelEyes-6K),以提升视觉证据搜寻中的定位能力。
查看缓存全文
缓存时间: 2026/07/02 11:48
论文页面 - PixelEyes: Decoupling Perception and Reasoning for Pinpoint Visual Evidence Seeking
来源:https://huggingface.co/papers/2607.00115 作者:
,
,
,
,
,
,
,
,
,
,
,
,
摘要
多轮视觉推理智能体常常因推理与感知的纠缠而产生冗余轨迹;PixelEyes 通过掩码引导搜索和语义区域广度优先搜索将这两个过程解耦,并在一个包含专家重合成数据的新型基准上展示了其效果。
本文探索了多轮视觉推理(https://huggingface.co/papers?q=multi-turn%20visual%20reasoning),观察到 MLLMs(https://huggingface.co/papers?q=MLLMs)反复无法定位目标,导致轨迹冗长且冗余。我们将这一失败归因于单个模型中推理与感知的纠缠——MLLM 同时进行推理和定位,而定位不准确会触发额外的推理轮次,使轨迹膨胀。为解决此问题,我们提出 PixelEyes,一种明确将推理与感知解耦的多轮视觉推理(https://huggingface.co/papers?q=multi-turn%20visual%20reasoning)智能体:即推理器决定寻找什么,而专门的感知工具回答它在哪。具体来说,PixelEyes 引入了 1)掩码引导的视觉搜索(https://huggingface.co/papers?q=Mask-guided%20Visual%20Search)。调用引用分割模型(https://huggingface.co/papers?q=referring%20segmentation%20model)提供掩码级别的精确定位,使推理器无需补偿不精确的定位。2)语义区域广度优先搜索(https://huggingface.co/papers?q=Semantic-region%20Breadth-first%20Search)(BFS)。为消除重复裁剪错误子区域导致的冗余循环,我们将探索组织为对语义区域的广度优先搜索。为内化这些能力,我们通过从现有数据重合成专家轨迹构建了 PixelEyes-6K 数据集(https://huggingface.co/papers?q=PixelEyes-6K%20dataset),将掩码引导搜索和 BFS 逻辑显式嵌入模型。我们还引入了 Pinpoint-Bench(https://huggingface.co/papers?q=Pinpoint-Bench),一个零提示视觉搜索基准(https://huggingface.co/papers?q=visual%20search%20benchmark),即问题中不提供任何位置线索,并包含实例级别掩码和边界框,用于将定位失败与推理失败分离,从而实现对故障模式(如无意视盲)的细粒度分析。当前最先进的 MLLMs(https://huggingface.co/papers?q=MLLMs)和视觉推理智能体在 Pinpoint-Bench(https://huggingface.co/papers?q=Pinpoint-Bench)上仍存在较大提升空间,这证明了该基准的质量和难度。代码和模型已开源。
查看 arXiv 页面(https://arxiv.org/abs/2607.00115)查看 PDF(https://arxiv.org/pdf/2607.00115)项目页面(https://godx-7.github.io/PixelEyesSite/)GitHub2(https://github.com/godx-7/PixelEyes-train-infer-eval)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2607.00115)
在你的智能体中获取此论文:
hf papers read 2607\.00115
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本论文的模型2
godx7/PixelEyes-4B 5B• 更新于约1小时前 • 7 • 2 (https://huggingface.co/godx7/PixelEyes-4B)
godx7/PixelEyes-8B 9B• 更新于约1小时前 • 19 • 2 (https://huggingface.co/godx7/PixelEyes-8B)
引用本论文的数据集0
没有链接本论文的数据集
在数据集 README.md 中引用 arxiv.org/abs/2607.00115,即可将其链接到此页面。
引用本论文的 Spaces0
没有链接本论文的 Space
在 Space README.md 中引用 arxiv.org/abs/2607.00115,即可将其链接到此页面。
包含本论文的收藏夹1
相似文章
Perceive-to-Reason:解耦感知与推理实现细粒度视觉推理
提出Perceive-to-Reason(P2R)框架,通过两阶段流程和角色感知的强化学习策略,将视觉语言模型中的视觉感知与推理解耦,在细粒度视觉推理基准上达到最先进水平。
从网页到像素:将智能体搜索引入视觉感知
本文介绍了 WebEye,这是一个需要解析外部知识的物体定位基准测试;同时提出了 Pixel-Searcher,这是一种将搜索结果与视觉标注相结合的智能体方法。
Evidence-RL:迈向证据密集型视觉推理
本文介绍了反事实证据解耦(CED),这是一种训练时方法,使视觉语言模型依赖具体的图像证据而非语言先验或捷径,从而提升跨基准的视觉推理grounding能力。
Visual-Seeker: 通过主动视觉推理实现视觉原生多模态代理搜索
Visual-Seeker 提出了一种视觉原生多模态深度搜索代理,它主动推理细粒度视觉细节并综合多模态证据,在五个具有挑战性的多模态搜索基准上实现了最先进的性能。
Visual Para-Thinker++: 视觉推理的单策略多智能体框架
Visual Para-Thinker++提出了一种用于视觉推理的单策略多智能体框架,该框架使用角色条件化智能体(主智能体、工作智能体、汇总智能体)和专用训练方法,以减少幻觉并提高效率,在幻觉敏感基准测试上优于基线。