SearchEyes:通过搜索世界模拟迈向前沿多模态深度搜索智能

arXiv cs.AI 论文

摘要

SearchEyes 使用带类型的知识图谱作为模拟搜索世界的骨干,统一了训练数据、搜索环境和奖励信号。它提出了感知知识链(PKC)用于多跳路径采样,以及跳锚策略优化(HaPO)用于步级信用分配,在多模态知识密集型基准测试中取得了最先进的性能。

arXiv:2607.05943v1 Announce Type: new 摘要:训练多模态搜索代理进行多跳推理仍然具有挑战性,因为存在一个根本性的结构脱节:现有流水线独立构建训练数据、搜索环境和奖励信号,导致合成结构元数据被丢弃,环境依赖不可重现的外部引擎,且RL奖励在轨迹层面保持稀疏。我们提出了\textbf{SearchEyes},它使用带类型的知识图谱作为\emph{模拟搜索世界}的骨干,从而统一了这三个组件。我们提出了\textbf{感知知识链(PKC)},用于在Wikidata5M的视觉-知识交集上采样受约束的多跳路径,保留跳级实体元数据,同时定义了一个自包含的搜索世界和步级奖励锚点。我们进一步提出了\textbf{跳锚策略优化(HaPO)},它重用这些锚点进行步级信用分配,而无需单独训练的过程奖励模型。在六个多模态知识密集型基准上的实验表明,SearchEyes在开源多模态搜索代理中取得了最先进的性能,其中SearchEyes-27B比最强开源基线平均提升6.2个百分点。
查看原文
查看缓存全文

缓存时间: 2026/07/08 04:39

# \gradtextSearchEyes:迈向基于搜索世界模拟的前沿多模态深度搜索智能 来源:https://arxiv.org/html/2607.05943 1] 香港中文大学多媒体实验室 2] 清华大学 3] 香港大学 4] 北京大学 5] 南洋理工大学 6] 中国科学院自动化研究所 7] 华东师范大学 8] 哈尔滨工业大学 9] 慕尼黑大学 程一鸣 蒋逸磊 冯凯拓 黄睿 蒋天逸 田娟西 李佳鹏 王群中 陈泰来 魏千山 肖川 荣善宇 李阳富 周延汉 马云普 张一帆 岳翔宇 \ [ [ [ [ [ [ [ [[email protected] (https://arxiv.org/html/2607.05943v1/mailto:[email protected]) [email protected] (https://arxiv.org/html/2607.05943v1/mailto:[email protected]) (2026年6月) ###### 摘要 训练多模态搜索智能体执行多跳推理仍然具有挑战性,原因在于一个根本性的结构脱节:现有的流水线独立地构建训练数据、搜索环境和奖励信号,导致合成的结构化元数据被丢弃,环境依赖不可复现的外部引擎,以及强化学习奖励在轨迹层面仍然稀疏。我们提出**SearchEyes**,它使用一个类型化的知识图谱作为**模拟搜索世界**的骨干,将这三个组成部分统一起来。我们提出**感知-知识链(PKC)**,在Wikidata5M的视觉-知识交集上采样受限的多跳路径,保留跳级别的实体元数据,同时定义一个自包含的搜索世界和步骤级别的奖励锚点。我们进一步提出**跳锚定策略优化(HaPO)**,该优化复用这些锚点进行步骤级别的信用分配,而无需单独训练一个过程奖励模型。在六个多模态知识密集型基准测试上的实验表明,SearchEyes在开源多模态搜索智能体中达到了最先进的性能,其中SearchEyes-27B相比最强的开源基线平均提升了6.2个点。 ## 1 引言 参考图标注 图1:SearchEyes概述。一个类型化的知识图谱作为三个紧密耦合阶段统一的骨干:PKC问题合成(左)、用于智能体交互的自包含搜索世界(中)以及用于策略优化的跳锚定奖励信号(右)。通过在所有阶段保留结构化元数据,SearchEyes消除了限制现有流水线的数据-环境-奖励脱节问题。

强化学习已成为训练自主大语言模型智能体的主导范式[kimik25, glm5, qwen35, deepseekv4],使其能够实现长链推理、工具使用和多步骤决策等能力。其中,多步信息检索与合成已成为一个极具影响力的应用,智能体通过迭代搜索、阅读和推理外部知识来解决复杂问题。在文本方面,诸如Search-R1[jin2025searchr1]、ASearcher[gao2025asearcher]和REDSearcher[chu2026redsearcher]等系统已经证明,经过强化学习训练的搜索智能体可以有效地对检索到的证据进行长时域推理。在多模态领域,Vision-DeepResearch[huang2026visiondeepresearch]、OpenSearch-VL[chen2026opensearchvl]、MMSearch-R1[wu2026mmsearchr1]和VSearcher[zhang2026vsearcher]已开始为多模态大语言模型配备视觉和文本搜索工具,并结合专门的训练环境和智能体强化学习算法。尽管这些努力取得了令人印象深刻的成果,但训练一个强大的长时域多模态搜索智能体仍然是一个开放的挑战,因为当前的流水线在训练数据、搜索环境和奖励信号的构建与连接方式上存在根本性瓶颈。

尽管上述结果令人鼓舞,但现有流水线仍然存在一个根本性的结构脱节:训练数据、搜索环境和奖励信号是独立构建的,没有共享的结构将它们绑定在一起。在数据方面,先前的方法利用图结构来合成多跳问题[chen2026opensearchvl, huang2026visiondeepresearch, deepdive2025],但在合成后丢弃了所有中间元数据(路径结构、实体ID、关系类型),仅将问答对传递给训练阶段。这种解耦延续到了环境:由于缺乏共享的结构信息,现有系统转而使用外部搜索引擎作为训练环境[jin2025searchr1, chu2026redsearcher, li2025webthinker],引入了不可复现、不确定性以及高昂的API成本。后果在强化学习层面最为严重:奖励信号只能基于最终答案在轨迹层面计算[grpo, dapo]。对于长时域多跳推理,完整完成整个链的概率随跳数急剧下降,使得轨迹级奖励对于有效的策略优化来说过于稀疏[gigpo, arpo, prime]。

为了解决这种结构脱节,一个关键的观察是,一个类型化的知识图谱可以同时作为所有三个组成部分的结构骨干,有效地充当一个**模拟搜索世界**。我们提出**SearchEyes**,它使用Wikidata5M的类型化三元组来构建这样一个搜索世界,将数据合成、环境模拟和强化学习训练统一起来。在数据方面,我们提出**感知-知识链(PKC)**,在视觉实体和知识实体的交集上采样受限的多跳路径,然后进行多层次的反捷径过滤,以产生高质量的训练数据。由于所有实体都位于同一个知识库中,这个基础自然构成了一个自包含的搜索世界,无需外部API。在训练方面,我们提出**跳锚定策略优化(HaPO)**,它复用PKC保留的金标准实体ID作为步骤级别的锚点进行信用分配,混合了跳锚定和轨迹级别的优势,无需训练单独的流程奖励模型。图1(https://arxiv.org/html/2607.05943#S1.F1)展示了整体框架。在六个多模态知识密集型基准测试上的实验表明,SearchEyes在开源多模态搜索智能体中达到了最先进的性能;我们的SearchEyes-27B模型相比最强的开源基线平均提升了6.2个点。我们将发布所有数据、代码和模型权重,以促进未来的研究。我们的贡献总结如下:

1.  统一的搜索世界模拟。我们引入SearchEyes,它使用Wikidata5M的类型化三元组来构建一个模拟搜索世界,将数据合成、环境模拟和强化学习训练统一起来,实现了数据-环境-算法的协同设计。
2.  感知-知识链合成。我们提出PKC,一个由知识图谱驱动的流水线,在视觉-知识交集图上采样受限的多跳路径,并结合多层次的反捷径过滤以产生高质量的训练数据。在整个合成过程中保留知识图谱元数据,以支持下游的步骤级训练。
3.  智能体后训练流水线。我们设计了一个完整的后训练流水线,包括带有提示环境和观察去噪的监督微调,然后进行HaPO(跳锚定策略优化),它复用PKC的跳级别金标准实体ID进行步骤级别的信用分配,而无需单独训练一个过程奖励模型。
4.  实证结果。在六个多模态知识密集型基准测试上的实验表明,SearchEyes在开源多模态搜索智能体中达到了最先进的性能;SearchEyes-27B相比最强的开源基线平均提升了6.2个点。我们还引入了用于多跳视觉搜索评估的VisSearch Bench(附录6(https://arxiv.org/html/2607.05943#S6))。

参考图标注
图2:模型规模与多模态知识密集型基准测试平均准确率的比较。*左图:* SearchEyes-27B(紫色,阴影线)在MMSearch上达到82.4,在FVQA上达到79.1,与Gemini-3.1-Pro相当,同时仅使用27B开源骨干。*右图:* 开源多模态搜索智能体的参数效率。SearchEyes-9B以3.3×更少的参数匹配了30B规模的基线(例如,OpenSearch-VL-30B为59.8%),展示了PKC合成和HaPO训练所释放的卓越数据效率。

## 2 相关工作

**深度研究智能体。** 为大语言模型配备搜索工具并通过强化学习进行训练,已成为构建自主研究智能体的主导范式。在文本方面,Search-o1[li2025searcho1]首先通过在推理过程中动态调用搜索引擎,将智能体搜索集成到推理链中。Search-R1[jin2025searchr1]使用基于结果的强化学习端到端地训练大语言模型,以自主决定何时搜索以及搜索什么。ReSearch[chen2025research]探索了强化学习驱动的交错搜索与推理,而REDSearcher[chu2026redsearcher]通过图结构化的任务合成和中期训练,实现了成本高效的长时域智能体训练。在多模态领域,MMSearch-R1[wu2026mmsearchr1]引入了首个端到端的多模态搜索强化学习框架。WebWatcher[geng2025webwatcher]通过反向图像搜索将文本问答重新表述为视觉问答。DeepEyes[hong2025deepeyes]通过将模型原生的视觉接地视为一种工具,并使用强化学习端到端训练(无需冷启动监督微调),激励了“用图像思考”。Vision-DeepResearch[huang2026visiondeepresearch]使多模态大语言模型能够通过冷启动监督微调和强化学习训练,执行数十个推理步骤和数百次搜索引擎交互。VSearcher[zhang2026vsearcher]将静态多模态模型转化为长时域工具调用的搜索智能体。ASearcher[gao2025asearcher]通过完全异步的强化学习,将交互范围扩展到超过100轮。OpenSearch-VL[chen2026opensearchvl]提供了一个完全开源的方案,结合了基于维基百科的多跳数据合成和致命感知的GRPO。

**强化学习环境扩展。** 高质量交互式环境的稀缺已成为智能体强化学习训练的一个核心瓶颈[chu2026agenticworldmodeling]。在通用工具使用场景中,ScaleEnv[tu2026scaleenv]、DreamGym[chen2026dreamgym]和Agent-World[dong2026agentworld]分别通过多样化环境合成、基于世界模型的经验生成以及环境与策略的自演化协同进化来解决这一问题。CUA-Gym[wang2026cuagym]和Gym-Anything[aggarwal2026gymanything]进一步自动化了计算机使用和任意软件场景的环境构建。对于搜索智能体,挑战还延伸至匹配的多跳推理数据。WebSailor-V2[li2025websailorv2]开创了在循环知识图谱上的基于知识图谱的搜索数据合成,并搭配了配对的模拟环境。WebDancer[wu2025webdancer]提出了可扩展的问答合成,并采用两阶段监督微调后再强化学习的训练方案。HopChain[wang2026hopchain]为用于强化学习的视觉检索合成了多跳视觉语言数据。在环境方面,SearchGym[zhang2026searchgym]和LiteResearcher[li2026literesearcher]构建了高保真的搜索模拟器,以降低真实引擎的成本。Agentic Proposing[jiao2026agenticproposing]和Socratic-Zero[wang2025socraticzero]探索了通过目标导向的决策过程和多智能体协同进化来实现智能体驱动的问题合成。

**智能体强化学习。** 智能体强化学习已成为训练强大智能体的标准范式,最近的旗舰模型如Kimi K2.5[kimik25]、GLM-5[glm5]、Qwen3.5[qwen35]和DeepSeek-V4[deepseekv4]都将其作为核心的后训练组件。其算法基础建立在GRPO[grpo]之上,该算法通过组相对优势估计消除了价值模型。DAPO[dapo]将GRPO扩展到工业级训练,而SAPO[sapo]则用平滑的Sigmoid门替代硬裁剪,以提高长序列稳定性。然而,这些方法将统一的轨迹级优势分配给所有token,导致在多轮智能体任务中信用分配退化。为了解决这个问题,GiGPO[gigpo]引入了嵌套组结构进行步骤级信用分配。ARPO[arpo]结合了熵引导的智能体展开和步骤级奖励分配,用于多轮网页智能体。AT2PO[at2po]通过熵引导的扩展和轮次信用,将轮级树搜索与策略优化统一起来。另一条路线通过更密集的奖励信号来解决信用分配问题。PRIME[prime]开创了隐式过程奖励,可以在没有步骤级标注的情况下在线估计。最近,Agent-RRM[agentrrm]将这个想法扩展到智能体轨迹,并带有多维结构化批评。

## 3 方法

### 3.1 概述

给定一张图像 \(I_0\) 和一个自然语言问题 \(q\),一个多模态搜索智能体与搜索环境 \(\mathcal{E}\) 进行多轮交互,以检索证据并推理出答案。我们将这个过程形式化为一个马尔可夫决策过程 \(( \mathcal{S}, \mathcal{A}, \mathcal{E}, R )\):

- **状态**。\( s_t = (I_0, q, z_1, a_1, o_1, \ldots, z_{t-1}, a_{t-1}, o_{t-1}) \) 是截至第 \(t\) 轮的完整交互历史。
- **动作**。遵循ReAct范式[yao2023react],智能体首先生成一个思考 \( z_t \)(自然语言推理),然后是一个动作 \( a_t \)(结构化的工具调用或终止答案)。我们将第 \(t\) 轮的完整生成表示为 \( y_t = (z_t, a_t) \)。
- **观察**。如果 \( a_t \) 是一个工具调用,环境返回一个文本观察 \( o_t = \mathcal{E}(a_t) \)(例如,检索到的文档片段)。如果 \( a_t \) 是终止答案,则回合结束。
- **轨迹**。\( \tau = (z_1, a_1, o_1, \ldots, z_T, a_T) \),其中 \( a_T \) 是终止答案。
- **奖励**。\( R(\tau) \in \{0, 1\} \) 指示最终答案是否正确。
- **策略**。\( \pi_\theta(y_t \mid s_t) \),由多模态大语言模型参数化,自回归地生成每一轮 \( y_t = (z_t, a_t) \)。

训练目标为 \( J(\theta) = \mathbb{E}[R(\tau)] \)。在训练过程中,只有智能体生成的token(在 \( z_t \) 和 \( a_t \) 内)接收梯度;环境观察token \( o_t \) 被屏蔽。

SearchEyes使用一个类型化的知识图谱 \(\mathcal{G}\) 作为统一骨干,它同时定义了搜索环境(第3.2节)、驱动训练数据合成(第3.3节)并为强化学习训练提供步骤级奖励锚点(第3.4节)。

### 3.2 知识图谱与搜索环境

**类型化知识图谱**。我们从三个互补的来源构建一个类型化的知识图谱。Wikidata5M[wang2021kepler]提供结构化的关系三元组 \((h, p, t)\)。Wiki6M(OVEN-Wiki)[hu2023openvocabulary]提供实体级别的文本——标题、摘要和完整文章。维基百科图像为实体的一个子集提供视觉基础。我们将生成的知识图谱定义为 \(\mathcal{G} = (\mathcal{V}, \mathcal{R}, \mathcal{T}, \varphi)\),其中 \(\mathcal{V}\) 是实体集,\(\mathcal{R} \subseteq \mathcal{V} \times \mathcal{P} \times \mathcal{V}\) 是在谓词集 \(\mathcal{P}\) 上的关系三元组集合,\(\mathcal{T} = \{\textsc{Person}, \textsc{Work}, \textsc{Org}, \textsc{Geo}\}\) 是四个语义域组成的集合,\(\varphi: \mathcal{P} \to \mathcal{T}\) 将每个谓词映射到其语义域。一个实体 \(v\) 只有在它出现在所有三个来源中时才会被保留在 \(\mathcal{V}\) 中,确保每个节点同时拥有结构化关系、文本描述和视觉基

相似文章

PixelEyes:解耦感知与推理,实现精准视觉证据搜寻

Hugging Face Daily Papers

PixelEyes 提出了一种多轮视觉推理代理,通过掩码引导搜索和语义区域广度优先搜索解耦感知与推理,并引入新基准(Pinpoint-Bench)和数据集(PixelEyes-6K),以提升视觉证据搜寻中的定位能力。