OpenResearcher: 面向长周期深度研究轨迹合成的全开放流水线
摘要
OpenResearcher 提出了一种可复现的流水线,用于使用离线搜索环境和合成轨迹训练深度研究智能体,在 BrowseComp-Plus 等基准任务上实现了显著的准确率提升。
查看缓存全文
缓存时间: 2026/07/16 10:24
论文页面 - OpenResearcher:面向长周期深度研究轨迹合成的完全开放管线
来源:https://huggingface.co/papers/2603.20278
摘要
OpenResearcher 提供了一条可复现的管线,利用离线搜索环境和合成轨迹来训练深度研究智能体,从而在基准测试任务上实现更高的准确率。
训练深度研究智能体(https://huggingface.co/papers?q=deep%20research%20agents)需要长周期轨迹(https://huggingface.co/papers?q=long-horizon%20trajectories),这些轨迹需要将搜索、证据聚合和多步推理交织在一起。然而,现有的数据采集管线通常依赖专有 Web API,使得大规模轨迹合成成本高昂、不稳定且难以复现。我们提出 OpenResearcher,一条可复现的管线,它将一次性语料引导与多轮轨迹合成解耦,并完全离线执行搜索与浏览循环(https://huggingface.co/papers?q=search-and-browse%20loop),使用三种明确的浏览器原语(https://huggingface.co/papers?q=browser%20primitives):搜索、打开和查找,基于一个包含 1500 万文档的语料库。以 GPT-OSS-120B(https://huggingface.co/papers?q=GPT-OSS-120B)为教师模型,我们合成了超过 97K 条轨迹,其中包含大量长周期尾部分布(超过 100 次工具调用)。在 30B-A3B 骨干模型(https://huggingface.co/papers?q=30B-A3B%20backbone)上进行监督微调(https://huggingface.co/papers?q=Supervised%20fine-tuning)后,该模型在 BrowseComp-Plus(https://huggingface.co/papers?q=BrowseComp-Plus)上达到 54.8% 的准确率,相比基础模型提升了 34.0 个百分点,同时在 BrowseComp(https://huggingface.co/papers?q=BrowseComp)、GAIA(https://huggingface.co/papers?q=GAIA)和 xbench-DeepSearch(https://huggingface.co/papers?q=xbench-DeepSearch)上仍保持竞争力。由于环境完全离线且经过全面仪器化,它还能进行受控分析,我们的研究揭示了对深度研究管线设计具有实际意义的洞见,包括数据过滤策略、智能体配置选择,以及检索成功与最终答案准确率之间的关系。我们在 https://github.com/TIGER-AI-Lab/OpenResearcher 上发布了管线、合成轨迹、模型检查点和离线搜索环境。
查看 arXiv 页面(https://arxiv.org/abs/2603.20278)查看 PDF(https://arxiv.org/pdf/2603.20278)项目页面(https://github.com/TIGER-AI-Lab/OpenResearcher)GitHub970(https://github.com/TIGER-AI-Lab/OpenResearcher)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2603.20278)
在您的智能体中获取本文:
hf papers read 2603.20278
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本文的模型2
OpenResearcher/OpenResearcher-30B-A3B 文本生成• 32B• 更新于3月25日 • 1.43k • 69 (https://huggingface.co/OpenResearcher/OpenResearcher-30B-A3B)
OpenResearcher/OpenResearcher-30B-A3B-GGUF 32B• 更新于3月24日 • 190 • 13 (https://huggingface.co/OpenResearcher/OpenResearcher-30B-A3B-GGUF)
引用本文的数据集7
i-DeepSearch/observation-masking-eval-logs 预览• 更新于1天前 • 9.99k • 2 (https://huggingface.co/datasets/i-DeepSearch/observation-masking-eval-logs)
OpenResearcher/OpenResearcher-Dataset 查看器• 更新于3月25日 • 97.6k • 6.65k • 130 (https://huggingface.co/datasets/OpenResearcher/OpenResearcher-Dataset)
OpenResearcher/web-bench 查看器• 更新于5月19日 • 5.5k • 4.48k • 4 (https://huggingface.co/datasets/OpenResearcher/web-bench)
OpenResearcher/OpenResearcher-Corpus 查看器• 更新于3月25日 • 14.9M • 1.14k • 10 (https://huggingface.co/datasets/OpenResearcher/OpenResearcher-Corpus)
浏览7个引用本文的数据集(https://huggingface.co/datasets?other=arxiv:2603.20278)### 引用本文的 Space7
包含本文的收藏集13
浏览13个包含本文的收藏集(https://huggingface.co/collections?paper=2603.20278)
相似文章
S1-DeepResearch:超越搜索,迈向真实世界的长周期研究代理
本文介绍了S1-DeepResearch-32B,这是一个开源模型及包含15K条轨迹的数据集,用于深度研究代理,通过联合建模信息获取、知识综合与规划,在20个基准测试中取得了最先进的性能。
@tom_doerr: 生成96,000条高质量深度研究轨迹,并提供完全开源的配方,用于训练代理型语言模型…
OpenResearcher是来自TIGER-AI-Lab的一个开源项目,它提供了96,000条深度研究轨迹以及一套无需外部API即可训练代理型语言模型进行长周期网络研究的方案。它包含数据集、模型和演示,并已被NVIDIA的Nemotron模型采用。
@trendtech33566: 【突发新闻】一款完全以开放方式复现Deep Research工作流程的开源软件(OSS)已出现——OpenResearcher……
OpenResearcher是一个开源项目,它完全复现了Deep Research的工作流程,并提供了数据集、模型和演示。它使研究人员和AI智能体开发者能够以开放的方式构建、训练和评估深度研究管道。
@tom_doerr:开源长周期深度研究智能体 https://github.com/TIGER-AI-Lab/OpenResearcher…
TIGER-AI-Lab 发布 OpenResearcher,一款用于自动化长周期深度研究任务的开源智能体。
RODS:面向多轮工具使用智能体的奖励驱动在线数据合成方法
本文介绍了RODS,一种奖励驱动的在线数据合成方法,该方法解决了多轮工具使用智能体训练中静态数据集信息样本耗尽的问题。它在显著减少轨迹数量的情况下,达到了与更大规模离线流水线相当的性能。