@DanKornas:DeepDive 是一种深度搜索代理的模式:从知识图谱合成问答,然后用……训练多轮浏览
摘要
DeepDive 是一种用于构建深度搜索代理的模式,它从知识图谱合成问答,并通过强化学习(GRPO)训练多轮浏览。该模式包括实体混淆和结合工具调用的测试时缩放。
查看缓存全文
缓存时间: 2026/05/17 07:31
DeepDive 是一种深度搜索代理的模式:从知识图谱中合成问答,然后通过强化学习训练多轮浏览。
核心思想: • 知识图谱随机游走数据 • 实体混淆以强制搜索 • GRPO 用于长时域浏览 • 通过工具调用实现测试时扩展
仓库链接如下:https://t.co/Ud2NMhzcoA
相似文章
@tom_doerr: 从知识图谱训练深度搜索代理 https://github.com/THUDM/DeepDive
DeepDive 提出了一种自动化方法,利用知识图谱进行数据合成和多轮强化学习,训练深度搜索代理,从而实现复杂的多步推理和网页浏览。
@DanKornas:研究智能体需要的不仅仅是一个提示——它们还需要搜索、提取、规划、来源追踪和综合。Open De…
Open Deep Research 是一个开源 Next.js 应用,它将 Firecrawl Search 和 Extract 与推理模型结合,执行迭代式网络研究循环,包括搜索、提取、规划、来源追踪和综合。
@DanKornas:复杂的研究型智能代理会很快变得杂乱:计划、搜索、RAG、代码执行、反馈和最终报告都需要整合在一起……
DeepResearch 是一个基于 Spring AI Alibaba 构建的开源多智能体研究工具,能够将查询转化为结构化报告,它采用动态规划、多智能体角色、混合 RAG 和基于 Docker 的执行方式。
DeepSearch-World:可验证环境中深度搜索代理的自我蒸馏
DeepSearch-Evolve 引入了一个用于 Web 代理的自我蒸馏框架,该框架使用可验证环境(DeepSearch-World)和 420K 多跳问答任务,无需从更强模型蒸馏即可实现有竞争力的性能。
@Apodex_AI: 深入阅读博客:https://apodex.com/blog/apodex-1.0 技术报告:http://apodex.com/pdf/20260608 GitHub:https://github.com…
ApodexAI 发布了 Apodex-1.0,这是一个深度研究模型,作为使用工具的 ReAct 代理运行。其重型模式 Apodex-1.0-H 采用异步代理团队,最多包含 150 个子代理,在深度研究基准测试(包括 BrowseComp、DeepSearchQA、HLE 和 FrontierScience)上取得了新的最先进结果,超越了 GPT-5.5-pro 和 Claude-Opus-4.8 等模型。