@DanKornas:DeepDive 是一种深度搜索代理的模式:从知识图谱合成问答,然后用……训练多轮浏览

X AI KOLs Timeline 工具

摘要

DeepDive 是一种用于构建深度搜索代理的模式,它从知识图谱合成问答,并通过强化学习(GRPO)训练多轮浏览。该模式包括实体混淆和结合工具调用的测试时缩放。

DeepDive 是一种深度搜索代理的模式:从知识图谱合成问答,然后用强化学习训练多轮浏览。 关键思想: • KG 随机游走数据 • 实体混淆以强制搜索 • GRPO 用于长程浏览 • 结合工具调用的测试时缩放 仓库见下方。https://t.co/Ud2NMhzcoA
查看原文
查看缓存全文

缓存时间: 2026/05/17 07:31

DeepDive 是一种深度搜索代理的模式:从知识图谱中合成问答,然后通过强化学习训练多轮浏览。

核心思想: • 知识图谱随机游走数据 • 实体混淆以强制搜索 • GRPO 用于长时域浏览 • 通过工具调用实现测试时扩展

仓库链接如下:https://t.co/Ud2NMhzcoA

相似文章

@Apodex_AI: 深入阅读博客:https://apodex.com/blog/apodex-1.0 技术报告:http://apodex.com/pdf/20260608 GitHub:https://github.com…

X AI KOLs Following

ApodexAI 发布了 Apodex-1.0,这是一个深度研究模型,作为使用工具的 ReAct 代理运行。其重型模式 Apodex-1.0-H 采用异步代理团队,最多包含 150 个子代理,在深度研究基准测试(包括 BrowseComp、DeepSearchQA、HLE 和 FrontierScience)上取得了新的最先进结果,超越了 GPT-5.5-pro 和 Claude-Opus-4.8 等模型。