从网页到像素:将智能体搜索引入视觉感知
摘要
本文介绍了 WebEye,这是一个需要解析外部知识的物体定位基准测试;同时提出了 Pixel-Searcher,这是一种将搜索结果与视觉标注相结合的智能体方法。
查看缓存全文
缓存时间: 2026/05/13 04:11
论文页面 - 从网络到像素:将智能体搜索引入视觉感知
来源: https://huggingface.co/papers/2605.12497
摘要
研究人员推出了 WebEye,这是一个需要外部知识解析的对象定位基准,以及 Pixel-Searcher,一种基于智能体的方法,通过搜索和推理将隐藏的目标身份与视觉注释连接起来。
视觉感知将高层语义理解与像素级感知联系起来,但大多数现有设定假设识别目标的决定性证据已经存在于图像或冻结的模型知识中。我们研究了一个更实用但也更困难的开放世界案例,其中可见对象必须首先从外部事实、近期事件、长尾实体或多跳关系中解析出来,然后才能进行定位。我们将这一挑战形式化为 Perception Deep Research (https://huggingface.co/papers?q=Perception%20Deep%20Research),并推出了 WebEye,一个以对象为锚点的基准 (https://huggingface.co/papers?q=object-anchored%20benchmark),具有可验证的证据 (https://huggingface.co/papers?q=verifiable%20evidence)、知识密集型查询 (https://huggingface.co/papers?q=knowledge-intensive%20queries)、精确的边界框/掩码注释 (https://huggingface.co/papers?q=precise%20box%2Fmask%20annotations) 以及三个任务视角:基于搜索的定位 (https://huggingface.co/papers?q=Search-based%20Grounding)、基于搜索的分割 (https://huggingface.co/papers?q=Search-based%20Segmentation) 和基于搜索的视觉问答 (https://huggingface.co/papers?q=Search-based%20VQA)。WebEye 包含 120 张图像、473 个注释的对象实例、645 个唯一的问答对和 1,927 个任务样本。我们进一步提出了 Pixel-Searcher (https://huggingface.co/papers?q=Pixel-Searcher),这是一种基于智能体的搜索到像素的工作流 (https://huggingface.co/papers?q=agentic%20search-to-pixel%20workflow),用于解析隐藏的目标身份并将它们绑定到边界框、掩码或定位答案。实验表明,Pixel-Searcher (https://huggingface.co/papers?q=Pixel-Searcher) 在所有三个任务视角中实现了最强的开源性能,而失败主要源于证据获取、身份解析和视觉实例绑定 (https://huggingface.co/papers?q=visual%20instance%20binding)。
查看 arXiv 页面 (https://arxiv.org/abs/2605.12497) 查看 PDF (https://arxiv.org/pdf/2605.12497) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.12497)
在你的智能体中获取这篇论文:
hf papers read 2605\.12497
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
没有链接此论文的模型
在模型 README.md 中引用 arxiv.org/abs/2605.12497 以从该页面链接它。
引用此论文的数据集 0
没有链接此论文的数据集
在数据集 README.md 中引用 arxiv.org/abs/2605.12497 以从该页面链接它。
引用此论文的 Spaces 0
没有链接此论文的 Space
在 Space README.md 中引用 arxiv.org/abs/2605.12497 以从该页面链接它。
包含此论文的收藏集 0
没有包含此论文的收藏集
将此论文添加到一个收藏集 (https://huggingface.co/new-collection) 以从该页面链接它。
相似文章
PixelEyes:解耦感知与推理,实现精准视觉证据搜寻
PixelEyes 提出了一种多轮视觉推理代理,通过掩码引导搜索和语义区域广度优先搜索解耦感知与推理,并引入新基准(Pinpoint-Bench)和数据集(PixelEyes-6K),以提升视觉证据搜寻中的定位能力。
Visual-Seeker: 通过主动视觉推理实现视觉原生多模态代理搜索
Visual-Seeker 提出了一种视觉原生多模态深度搜索代理,它主动推理细粒度视觉细节并综合多模态证据,在五个具有挑战性的多模态搜索基准上实现了最先进的性能。
SearchEyes:通过搜索世界模拟迈向前沿多模态深度搜索智能
SearchEyes 使用带类型的知识图谱作为模拟搜索世界的骨干,统一了训练数据、搜索环境和奖励信号。它提出了感知知识链(PKC)用于多跳路径采样,以及跳锚策略优化(HaPO)用于步级信用分配,在多模态知识密集型基准测试中取得了最先进的性能。
@dair_ai:关于自主搜索与向量搜索的精彩论文。
本文讨论并比较了自主搜索与向量搜索方法。
WebWatcher:开辟视觉语言深度研究代理新前沿
WebWatcher 是一个用于深度研究的多模态代理,它利用合成轨迹和强化学习在复杂的视觉与文本信息检索任务中实现了卓越性能。本文还引入了 BrowseComp-VL,这是一个评估多模态代理的新基准。