WebSwarm:深度与广度网络搜索的递归多智能体编排

arXiv cs.CL 论文

摘要

WebSwarm 提出了一种用于深度与广度网络搜索的递归多智能体委托框架,动态实例化能够分解任务、递归扩展并自适应协作的智能搜索节点。在多个基准测试上优于基线方法。

arXiv:2607.08662v1 公告类型:新论文 摘要:基于大语言模型(LLM)的网络搜索智能体正将信息获取从简单的事实型问答转变为复杂的深度与广度搜索及研究型任务。单个 ReAct 风格智能体受限于单条长轨迹和有限上下文,难以同时处理深度和覆盖范围。现有的多智能体系统通过并行执行和聚合提升了搜索覆盖范围,但在递归深度、协作适应性和基于证据的扩展方面仍存在明显局限。我们提出了 WebSwarm,一种渐进式递归委托框架,在推理过程中联合构建任务分解、递归扩展和智能体协作。WebSwarm 动态实例化智能搜索节点,每个节点将局部目标与一种搜索模式耦合,该模式指定节点应如何组织搜索与协作。每个节点可以自行解决其目标,或进一步委托子节点;解决后,它将证据和结果向上返回,使父节点能够进一步扩展、修订或聚合搜索过程。为指导这一过程,WebSwarm 首先探查任务相关信息在网页上的组织方式,以作为后续节点扩展的依据,并跨同质兄弟节点复用过程级经验。在 BrowseComp-Plus、WideSearch、DeepWideSearch 和 GISA 上的实验表明,WebSwarm 在深度、广度以及交织的深度与广度任务上始终优于单智能体和多智能体基线。进一步的消融分析、任务难度分析、网页工具效率分析和模型泛化分析解释了 WebSwarm 的有效性,并为多智能体搜索系统提供了见解。
查看原文
查看缓存全文

缓存时间: 2026/07/10 06:16

# WebSwarm: 面向深度与广度Web搜索的渐进式递归多智能体编排
来源:https://arxiv.org/html/2607.08662
宋晓帅¹,张连成¹\*,赵康志²\⁽²⁾,朱宇涛¹,王中原²\*,董冠廷¹,杨竞涵²\*,李涵²,盖坤²,文继荣¹,窦志成¹\⁽¹⁾

###### 摘要
基于大语言模型(LLM)的网页搜索智能体正在将信息检索从简单的事实性问题解答转变为复杂、深广兼备的搜索与研究型任务。单个ReAct风格的智能体受限于单一长轨迹和有限上下文,难以同时处理深度和覆盖度。现有的多智能体系统通过并行执行和聚合提高了搜索覆盖度,但在递归深度、协作适应性和基于证据的扩展方面仍存在明显局限。我们提出WebSwarm,一种渐进式递归委派框架,在推理过程中联合构建任务分解、递归扩展和智能体协作。WebSwarm动态实例化智能搜索节点,每个节点将局部目标与搜索模式耦合,该模式规定了节点应如何组织搜索和协作。每个节点可以自行解决其目标,或进一步委派子节点;解决后,将证据和结果向上返回,使父节点能够进一步扩展、修正或聚合搜索过程。为引导这一过程,WebSwarm首先探测任务相关信息在网页上的组织方式,以确定后续节点扩展的基础,并在同质兄弟节点间复用过程级经验。在BrowseComp-Plus、WideSearch、DeepWideSearch和GISA上的实验表明,WebSwarm在深度、广度以及深度-广度交错任务上始终优于单智能体和多智能体基线。进一步对消融、任务难度、网页工具效率以及模型泛化能力的分析,解释了WebSwarm的有效性,并为多智能体搜索系统提供了见解。

## 引言

图1:代表性多智能体编排范式与WebSwarm的示意图。

大语言模型的发展正在推动网络信息检索走向智能体式搜索,使搜索智能体能够自主执行多轮搜索和网页浏览,以收集用户查询所需的信息(Zhu等人,2026a ;Xie等人,2025)。随着这种范式的演进,搜索智能体正在超越简单的事实性问答,迈向更复杂的信息检索任务,例如研究级搜索和报告导向的调查。这要求智能体同时支持深度搜索和广度搜索:深度搜索解决多跳依赖和约束,广度搜索则需要在候选实体、网页和信息源之间保持足够的覆盖度。最近,一系列基准测试从深度、广度及其嵌套交互的角度评估了搜索智能体的能力边界(Wei等人,2025;Chen等人,2025b;Wong等人,2026;Lan等人,2025;Zhu等人,2026b)。基准测试结果和实践经验均表明,单个ReAct(Yao等人,2023)智能体在任务深度和广度增加时表现困难。为解决此问题,近期研究引入了多智能体搜索系统(Jin等人,2025b;Team,2026;Lan等人,2026;Chen等人,2026;Alzubi等人,2026a;Lee等人,2026a;Ning等人,2026)。这些系统将工作分配给多个智能体,并使用并行搜索、交叉校验、结果聚合等机制来提高覆盖度和可靠性。对于深度与广度相互交织的复杂网络搜索任务,其求解过程往往无法仅从初始查询中完全确定;相反,中间搜索证据会逐步揭示新的实体、约束和目标。因此,理想的多智能体系统不应事先固定子任务分解和智能体协作结构,而应随着证据积累渐进地、递归地构建它们。然而,如图1所示,现有的多智能体搜索系统在递归深度、协作适应性和基于证据的扩展方面仍存在明显局限:(1)递归深度较浅。更深的子任务可能只有在较早的子任务被扩展或解决后才变得清晰,并且某些子任务可能引入新的依赖和需求。因此,任务树应支持渐进式递归扩展。现有系统通常仅在根级别进行分解。当任务需要多级扩展(例如“年份→品牌→型号→属性”)时,更深的结构被迫挤入子智能体的长ReAct轨迹,使得过程接近于单智能体搜索。(2)协作适应性有限。随着搜索过程递归展开,局部搜索节点可能暴露出不同的目标和瓶颈:事实查找需要快速可靠的执行,广度搜索需要覆盖大量条目,深度搜索需要迭代线索发现和验证,开放式枚举则需要在未知集合边界下平衡召回率和精确度。然而,现有方法通常依赖单一的全协作范式,例如多样本聚合、串行交接或并行分治。虽然每种范式在特定搜索场景中有效,但固定的协作模式难以覆盖所有搜索需求,也无法在不同子任务间灵活切换协作形式。(3)基于证据的扩展较弱。所需信息可能集中在少数聚合页面中,或者分布在时间线、实体、事件集或属性维度上。合理的分解应与网络信息的实际组织方式对齐。因此,系统必须根据相关信息在网络上的组织方式来决定如何扩展。然而,现有的多智能体系统通常仅根据查询的表面语义拆分任务。当分解维度与网络信息结构不对齐时,系统可能对集中信息过度分解,或者沿错误维度拆分分散信息,导致冗余检索、召回不足和难以聚合。

为解决这些局限,我们提出WebSwarm,这是一个渐进递归多智能体框架,通过动态创建和委派具有不同局部目标和协作模式的搜索节点来组织复杂的网络信息检索。在WebSwarm中,根智能体接收原始任务,创建并委派搜索节点。每个搜索节点本身也是一个智能体,接收一个局部目标和一个搜索模式。搜索模式决定了节点如何解决其局部目标:要么自行进行迭代搜索,要么递归生成并委派子节点,同时组织相应的多节点协作结构,例如并行分治、顺序搜索与验证,或多路径采样与聚合。一旦节点完成局部目标,它就将结果向上返回,上层智能体根据返回信息决定是否进一步扩展、修正或终止搜索过程。通过这种方式,WebSwarm将递归委派、多级反馈和多样的局部协作结构统一到一个渐进搜索过程中。

为避免盲目的递归委派,WebSwarm进一步引入了两种互补信号:外部网络信息结构和内部经验。一方面,系统对网络信息结构进行轻量级探测,以确定相关信息是集中在少数聚合页面中,还是沿某个组织维度分散分布,从而指导后续搜索节点应如何扩展。另一方面,对于同一父节点下的同质搜索节点,WebSwarm从少量前驱节点中提炼轨迹经验,以指导后续节点的局部搜索。

我们在四个具有挑战性的网络信息检索基准上评估了WebSwarm:BrowseComp-Plus、WideSearch、DeepWideSearch和GISA,涵盖了深度、广度以及深度-广度混合搜索任务。实验结果表明,WebSwarm始终优于ReAct智能体和多智能体基线。进一步分析考察了模块消融、任务难度与方法性能之间的关系、网络工具使用效率以及不同模型上的泛化能力,为理解WebSwarm的有效性和多智能体搜索系统的设计提供了见解。

总体而言,我们提出了WebSwarm,用于深度和广度网络搜索任务。我们的贡献有三点:
- 我们提出了一个渐进递归委派框架,实例化将局部目标与搜索模式耦合的智能搜索节点,共同构建分解、扩展和协作。
- 我们引入了基于网络结构指导的递归委派,将扩展扎根于网络信息组织,并进一步在同质搜索节点间传递子任务经验。
- 在四个基准上的实验验证了WebSwarm在处理涉及深度、广度以及深度-广度交错的复杂网络信息检索任务中的有效性。

图2:WebSwarm概述,附来自DeepWideSearch基准的运行示例。

## 相关工作

### 面向网络信息检索的智能体
智能体搜索将大语言模型与网络搜索和浏览工具相结合,以解决信息检索任务(Nakano等人,2021;Zhu等人,2026a;Li等人,2025b;Xie等人,2025)。一条工作线专注于模型训练,将信息检索策略内化(Jin等人,2025a;Li等人,2026;Wu等人,2026;Li等人,2025a)。最近的基准包括BrowseComp(Wei等人,2025)、WideSearch(Wong等人,2026)、DeepWideSearch(Lan等人,2025)和GISA(Zhu等人,2026b)揭示了智能体在深度和广度网络搜索任务中面临的困难。为应对这些挑战,推理时架构通过显式状态结构和多智能体协作来组织复杂搜索(Qin等人,2026;Xu等人,2026;Ning等人,2026)。Table-as-Search(Lan等人,2026)和Web2BigTable(Huang等人,2026)将搜索公式化为表格补全。MindSearch(Chen等人,2025a)和HiRA(Jin等人,2025b)采用基于图或分层规划。InfoSeeker(Lee等人,2026a)和A-MapReduce(Chen等人,2026)强调层次化并行或MapReduce风格的水平分解。相比之下,WebSwarm将网络搜索表述为证据驱动的递归委派:它在中级证据揭示新的局部目标时实例化搜索节点,将其扩展扎根于网络信息结构,并将每个目标与搜索模式耦合,以处理异质的局部搜索需求。

### 用于长时域任务的多智能体系统
早期的多智能体系统,包括CAMEL(Li等人,2023)、AutoGen(Wu等人,2023)、MetaGPT(Hong等人,2024)和ChatDev(Qian等人,2024),从角色扮演、软件开发、辩论和投票等角度探索了智能体协作。近期的工作进一步研究了面向长时域任务的智能体编排。Claude Agent Team构建了可以相互通信和协作的智能体团队(Liu等人,2026);Kimi-Swarm将复杂任务分解为多个子问题,并行执行多个工作智能体(Team,2026)。此外,Magentic-One使用中央编排器协调专门智能体(Fourney等人,2024);ROMA(Alzubi等人,2026a)将长时域任务表示为递归子任务树;AgentFugue(Hu等人,2026)通过共享推理中心复用并行智能体的中间发现;AggAgent(Lee等人,2026b)通过聚合多个长时域智能体轨迹实现测试时扩展。相比之下,WebSwarm将多智能体编排视为递归委派,而非固定的全局协作拓扑。它递归实例化智能体节点,其模式定义了局部协作协议;每个节点可以在本地解决、委派子节点,并向上返回证据,使得分解和协作在推理过程中共同演化。

## 方法

### 预备知识与概述

##### ReAct搜索器。
对于网络信息检索任务 \(q_0\),ReAct智能体每一步通过网页工具搜索和阅读网页,直至返回最终答案 \(a\)。工具动作包括 `search(query)` 和 `fetch_url(url)`:前者返回与查询最相关的网页URL和摘要,后者返回指定网页的文本内容。

##### WebSwarm。
如图2所示,WebSwarm的核心是一个递归委派过程,系统通过动态创建搜索节点并实现节点间的委派和反馈,逐步解决原始任务。每个搜索节点本身是一个智能体,接收一个局部目标和一个搜索模式,其中搜索模式决定了节点是直接解决当前目标,还是进一步委派子节点并组织局部协作结构。子节点返回的结果随后成为上层节点进一步扩展、修正或聚合搜索过程的基础(§3.2)。为了使递归委派更加可靠和高效,WebSwarm进一步利用两类引导信号:探测得到的外部网络信息结构指导后续搜索节点如何扩展,而内部

相似文章

SwarmResearch: 编排编码代理以实现开放式发现

arXiv cs.AI

SwarmResearch 引入了一个编排器-子代理框架,其中 Shepherd Agent 引导一群 Search Agents 探索开放优化问题的多样化解决方案,在 13/15 个任务上取得了比最新方法更好或相当的结果。

SearchOS-V1: 迈向稳健的开放域信息检索智能体协作

Hugging Face Daily Papers

介绍SearchOS,一个用于稳健开放域信息检索的多智能体框架,通过新颖的面向搜索的上下文管理(SOCM)系统将搜索进度外化为显式状态,在WideSearch和GISA基准上取得了最先进的结果。