标签
微软研究人员推出了 DualGraph,这是一种将智能体记忆分割为大纲和知识图谱的架构,以增强自主研究。该架构在 Claude Opus 5.5 和 GPT-6 Sol 上实现了前所未有的 RACE 分数和成本节约。
论文提出了一种名为DLD-RL的方法,通过将强化学习轨迹重新用作长上下文问答数据,增强AI智能体的深度研究和长上下文能力,在基准测试中显示出显著的性能提升。
这篇文章批评了open AI的复制品,将其比作串联网络搜索工具调用,并错误地称之为open deep research。
作者分享了一篇关于构建可靠智能体框架的文章,包括来自4,000次运行的基准测试,以及计划发布一个开源的深度研究和构建应用,强调了质量测试和对AI智能体开发的见解。
本文介绍了Mr.LHDR,一个用于评估多模态真实世界长周期深度研究代理的基准,表明当前模型在复杂推理链中难以实现依赖一致的证据整合。
作者正在构建一个交易筛选系统,在对多家公司进行深度研究时面临高成本问题,寻求关于漏斗式筛选、重用或替代工具等成本效益策略的建议。
本文介绍了HybridDeepResearch,一个用于评估AI智能体在需要整合网络搜索和SQL查询任务上的基准测试,揭示了即使最先进的模型在跨结构化和非结构化数据维护约束方面也存在困难。
APEx是一种分层经验利用框架,它将代理历史组织为记忆和技能,并通过闭环架构来提升深度研究问答的能力,实现了超越GPT-5.4的最先进性能。
本文介绍了ClaimProbe,一个用于检测深度研究报告中幻觉和错误归因的声明级审计框架,以及ClaimWriter,一个分层写作者,可将幻觉减少高达4.5倍,同时提高事实召回率。
Apodex是一个开源的深度研究工具和AI模型,它是Qwen 3.5 35B A3B的微调版本,仅使用30亿活跃参数就达到了与前沿模型相当的性能。
Apodex 1.1 是一个专为深度研究设计的AI代理,能处理需要大量调研的复杂任务,通过主代理分解问题并异步派发多个子代理执行,支持长时间运行和自动恢复。
Google 正在为 Gemini 添加一个专属学生中心,包含学习笔记本、抽认卡和日历集成等功能,以及 Gemini Live 中的 Deep Research 和新的 Lens 教育工具。
本文介绍了ICD-Deepresearch,一个结合EHR基础模型与语言模型及医学搜索的系统,用于预测患者就诊的未来ICD代码,实现了比基线方法更高的准确性和医生评价的有用性。
Mole 是一个用于终端的深度研究代理,它利用人工智能分解问题、搜索来源,并提供带验证引用的答案,同时强制执行预算并确保本地数据隐私。
LangChain 开源了 open_deep_research,基于 LangGraph 的多智能体架构,完全开源复刻 OpenAI Deep Research,支持多种模型和搜索工具,可本地部署生成深度研报。
WebRover 是一个基于 MIT 协议的开源 AI Agent,通过自然语言即可驱动浏览器完成网页自动化、跨站数据抓取与深度研究,支持本地部署。
介绍了深度研究预训练(DRP),一种离线框架,从引文和超链接证据结构中生成搜索-打开-撰写轨迹。在1B token上预训练的Qwen3-14B模型在深度研究基准测试中优于匹配的无DRP基线,即使使用较少的监督微调数据也是如此。
Video-DeepResearch (Video-DR) 将多模态智能体从静态图像扩展到连续视频流,引入了解耦的感知-探索流水线以及新的基准 Video-DR-Bench。其 Video-DeepResearch-35B-A3B 模型取得了 64.0% 的准确率,超越了 Claude-4.5-Sonnet、GPT-5 和 Gemini 2.5 Pro。
本文介绍了SIEVE,一种搜索-检查-获取策略,利用布尔查询语言使深度研究智能体仅检索相关文档片段,在多个基准数据集和智能体主干上,以节省20.7%-50.6%的令牌数实现了更高准确性。
本文介绍了FinanceHarness,一个由LLM智能体驱动的端到端自动化金融深度研究框架,以及FinanceGym,一个可验证的时间点基准。专家验证显示通过率为82%,而领先模型得分低于40%,FinanceHarness将开源权重基座模型的性能从25.3%提升至32.4%。