WideSeek-R1:通过多智能体强化学习探索宽度扩展以实现广泛信息检索
摘要
WideSeek-R1是一个为广泛信息检索设计的多智能体强化学习框架,探索宽度扩展以使用更少参数达到与更大单智能体可比的性能。
查看缓存全文
缓存时间: 2026/09/07 18:06
论文页面 - WideSeek-R1:通过多智能体强化学习探索宽度扩展以实现广域信息检索
来源:https://huggingface.co/papers/2602.04634
摘要
采用强化学习的多智能体系统能够实现可扩展编排下的并行信息检索,其性能可与规模更大的单一智能体相媲美。
大语言模型(https://huggingface.co/papers?q=Large%20Language%20Models)(LLMs) 的最新进展主要集中在深度扩展上,即单个智能体通过多轮推理和工具使用来解决长期任务。然而,随着任务范围变得越来越广,关键瓶颈从单个智能体的能力转向了组织协调能力。本文中,我们探索了利用多智能体系统(https://huggingface.co/papers?q=multi-agent%20systems)进行宽度扩展的互补维度,以解决广域信息检索(https://huggingface.co/papers?q=information%20seeking)问题。现有的多智能体系统(https://huggingface.co/papers?q=multi-agent%20systems)通常依赖手工设计的工作流和轮流交互模式,无法有效实现任务并行化。为弥合这一差距,我们提出了WideSeek-R1,一个通过多智能体强化学习(https://huggingface.co/papers?q=multi-agent%20reinforcement%20learning)(MARL) 训练的主-从智能体框架(https://huggingface.co/papers?q=lead-agent-subagent%20framework),旨在协同实现可扩展的编排和并行执行(https://huggingface.co/papers?q=parallel%20execution)。WideSeek-R1利用一个共享的大语言模型(具有隔离的上下文和专用工具),在一个包含2万个广域信息检索任务的精选数据集上联合优化主智能体和并行子智能体。大量实验表明,WideSeek-R1-4B在WideSearch基准测试(https://huggingface.co/papers?q=WideSearch%20benchmark)上的项目F1分数(https://huggingface.co/papers?q=F1%20score)达到了40.0%,其性能可与单智能体DeepSeek-R1-671B相媲美。此外,WideSeek-R1-4B的性能随着并行子智能体数量的增加而持续提升,凸显了宽度扩展的有效性。
查看 arXiv 页面 (https://arxiv.org/abs/2602.04634)查看 PDF (https://arxiv.org/pdf/2602.04634)项目页面 (https://wideseek-r1.github.io/)GitHub4.84k (https://github.com/RLinf/RLinf)添加至收藏 (https://huggingface.co/login?next=%2Fpapers%2F2602.04634)
在您的智能体中获取此论文:
hf papers read 2602.04634
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型1
RLinf/WideSeek-R1-4b 文本生成• 4B• 更新于 Mar 13 • 20 • 6 (https://huggingface.co/RLinf/WideSeek-R1-4b)
引用本文的数据集3
RLinf/WideSeek-R1-train-data 预览• 更新于 Mar 13 • 627 • 2 (https://huggingface.co/datasets/RLinf/WideSeek-R1-train-data)
RLinf/Wiki-2018-Corpus (https://huggingface.co/datasets/RLinf/Wiki-2018-Corpus)
RLinf/WideSeek-R1-test-data 查看器• 更新于 Mar 13 • 200 • 47 (https://huggingface.co/datasets/RLinf/WideSeek-R1-test-data)
引用本文的空间0
没有链接本文的空间
在空间的 README.md 中引用 arxiv.org/abs/2602.04634 以将其链接到此页面。
包含本文的收藏3
相似文章
学习适应:基于认知感知探索的自我改进网络智能体
提出了SCALE框架,用于自我改进的网络智能体,采用认知感知探索,包含三个对抗角色和图探索策略。同时介绍了从真实网站收集的大规模数据集SCALE-20k,显著提升了基于MLLM的网络智能体的性能。
SlimSearcher:通过自适应奖励门控训练效率感知的网络代理
SlimSearcher 是一个框架,通过结合帕累托高效轨迹过滤和自适应奖励塑形,提升深度研究代理的效率,在 GAIA、BrowseComp 和 XBenchDeepSearch 等基准测试中,将工具调用轮次减少 17%-58%,同时保持准确率。
WebSwarm:深度与广度网络搜索的递归多智能体编排
WebSwarm 提出了一种用于深度与广度网络搜索的递归多智能体委托框架,动态实例化能够分解任务、递归扩展并自适应协作的智能搜索节点。在多个基准测试上优于基线方法。
OpenWebRL:揭秘面向视觉网页代理的在线多轮强化学习
OpenWebRL提出了一个开放框架,用于在真实网站上利用在线多轮强化学习训练视觉网页代理,以极少的初始监督实现了最先进的性能。其4B参数模型优于先前的开放代理,并与OpenAI CUA和Gemini CUA等专有系统竞争。
学习探索:通过探索感知策略优化扩展代理推理
本文提出一种探索感知的强化学习框架,使LLM代理仅在不确定性高时自适应探索,从而提升在基于文本和基于GUI的基准测试上的性能。