WideSeek-R1:通过多智能体强化学习探索宽度扩展以实现广泛信息检索

Papers with Code Trending 论文

摘要

WideSeek-R1是一个为广泛信息检索设计的多智能体强化学习框架,探索宽度扩展以使用更少参数达到与更大单智能体可比的性能。

大型语言模型(LLMs)的最新进展主要集中在深度扩展上,即单智能体通过多轮推理和工具使用解决长期问题。然而,随着任务变得更加广泛,关键瓶颈从个体能力转向组织能力。在这项工作中,我们探索了宽度扩展与多智能体系统相结合的互补维度,以解决广泛信息检索。现有的多智能体系统通常依赖手工设计的工作流程和轮流交互,无法有效并行化工作。为了弥合这一差距,我们提出了WideSeek-R1,这是一个通过多智能体强化学习(MARL)训练的主导智能体-子智能体框架,旨在协同可扩展编排和并行执行。通过使用具有隔离上下文和专用工具的共享LLM,WideSeek-R1在一个精选的20k广泛信息检索任务数据集上联合优化主导智能体和并行子智能体。大量实验表明,WideSeek-R1-4B在WideSearch基准测试中实现了40.0%的项F1分数,与单智能体DeepSeek-R1-671B的性能相当。此外,WideSeek-R1-4B随着并行子智能体数量的增加表现出一致的性能提升,突出了宽度扩展的有效性。
查看原文
查看缓存全文

缓存时间: 2026/09/07 18:06

论文页面 - WideSeek-R1:通过多智能体强化学习探索宽度扩展以实现广域信息检索

来源:https://huggingface.co/papers/2602.04634

摘要

采用强化学习的多智能体系统能够实现可扩展编排下的并行信息检索,其性能可与规模更大的单一智能体相媲美。

大语言模型(https://huggingface.co/papers?q=Large%20Language%20Models)(LLMs) 的最新进展主要集中在深度扩展上,即单个智能体通过多轮推理和工具使用来解决长期任务。然而,随着任务范围变得越来越广,关键瓶颈从单个智能体的能力转向了组织协调能力。本文中,我们探索了利用多智能体系统(https://huggingface.co/papers?q=multi-agent%20systems)进行宽度扩展的互补维度,以解决广域信息检索(https://huggingface.co/papers?q=information%20seeking)问题。现有的多智能体系统(https://huggingface.co/papers?q=multi-agent%20systems)通常依赖手工设计的工作流和轮流交互模式,无法有效实现任务并行化。为弥合这一差距,我们提出了WideSeek-R1,一个通过多智能体强化学习(https://huggingface.co/papers?q=multi-agent%20reinforcement%20learning)(MARL) 训练的主-从智能体框架(https://huggingface.co/papers?q=lead-agent-subagent%20framework),旨在协同实现可扩展的编排和并行执行(https://huggingface.co/papers?q=parallel%20execution)。WideSeek-R1利用一个共享的大语言模型(具有隔离的上下文和专用工具),在一个包含2万个广域信息检索任务的精选数据集上联合优化主智能体和并行子智能体。大量实验表明,WideSeek-R1-4B在WideSearch基准测试(https://huggingface.co/papers?q=WideSearch%20benchmark)上的项目F1分数(https://huggingface.co/papers?q=F1%20score)达到了40.0%,其性能可与单智能体DeepSeek-R1-671B相媲美。此外,WideSeek-R1-4B的性能随着并行子智能体数量的增加而持续提升,凸显了宽度扩展的有效性。

查看 arXiv 页面 (https://arxiv.org/abs/2602.04634)查看 PDF (https://arxiv.org/pdf/2602.04634)项目页面 (https://wideseek-r1.github.io/)GitHub4.84k (https://github.com/RLinf/RLinf)添加至收藏 (https://huggingface.co/login?next=%2Fpapers%2F2602.04634)

在您的智能体中获取此论文:

hf papers read 2602.04634

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型1

RLinf/WideSeek-R1-4b 文本生成• 4B• 更新于 Mar 13 • 20 • 6 (https://huggingface.co/RLinf/WideSeek-R1-4b)

引用本文的数据集3

RLinf/WideSeek-R1-train-data 预览• 更新于 Mar 13 • 627 • 2 (https://huggingface.co/datasets/RLinf/WideSeek-R1-train-data)

RLinf/Wiki-2018-Corpus (https://huggingface.co/datasets/RLinf/Wiki-2018-Corpus)

RLinf/WideSeek-R1-test-data 查看器• 更新于 Mar 13 • 200 • 47 (https://huggingface.co/datasets/RLinf/WideSeek-R1-test-data)

引用本文的空间0

没有链接本文的空间

在空间的 README.md 中引用 arxiv.org/abs/2602.04634 以将其链接到此页面。

包含本文的收藏3

相似文章

OpenWebRL:揭秘面向视觉网页代理的在线多轮强化学习

Hugging Face Daily Papers

OpenWebRL提出了一个开放框架,用于在真实网站上利用在线多轮强化学习训练视觉网页代理,以极少的初始监督实现了最先进的性能。其4B参数模型优于先前的开放代理,并与OpenAI CUA和Gemini CUA等专有系统竞争。