标签
LangChain 开源了 open_deep_research,基于 LangGraph 的多智能体架构,完全开源复刻 OpenAI Deep Research,支持多种模型和搜索工具,可本地部署生成深度研报。
WebRover 是一个基于 MIT 协议的开源 AI Agent,通过自然语言即可驱动浏览器完成网页自动化、跨站数据抓取与深度研究,支持本地部署。
介绍了深度研究预训练(DRP),一种离线框架,从引文和超链接证据结构中生成搜索-打开-撰写轨迹。在1B token上预训练的Qwen3-14B模型在深度研究基准测试中优于匹配的无DRP基线,即使使用较少的监督微调数据也是如此。
Video-DeepResearch (Video-DR) 将多模态智能体从静态图像扩展到连续视频流,引入了解耦的感知-探索流水线以及新的基准 Video-DR-Bench。其 Video-DeepResearch-35B-A3B 模型取得了 64.0% 的准确率,超越了 Claude-4.5-Sonnet、GPT-5 和 Gemini 2.5 Pro。
本文介绍了SIEVE,一种搜索-检查-获取策略,利用布尔查询语言使深度研究智能体仅检索相关文档片段,在多个基准数据集和智能体主干上,以节省20.7%-50.6%的令牌数实现了更高准确性。
本文介绍了FinanceHarness,一个由LLM智能体驱动的端到端自动化金融深度研究框架,以及FinanceGym,一个可验证的时间点基准。专家验证显示通过率为82%,而领先模型得分低于40%,FinanceHarness将开源权重基座模型的性能从25.3%提升至32.4%。
本文介绍了 Similarweb 如何使用 LangSmith 评估长篇代理研究报告,结合工具调用的确定性检查和 LLM 作为评委的质量评分,重点关注使回归可检查并实现 A/B 比较。
Elon Musk 宣布为 Grok Build 添加 /deep-research 命令,该命令使用有界并行代理进行研究,交叉验证证据,并生成带引用的报告。
本文介绍了 MisKnow-Agent,一个用于生成误导性知识以测试深度研究代理的框架,表明即使是有限的看似可信的错误信息暴露,也可能导致最终报告中的错误结论。
AREX 引入了一系列用于深度研究的递归自我改进代理,在内层研究循环和外层自我改进循环之间交替,并通过长周期强化学习进行训练。在 BrowseComp 和 Humanity's Last Exam 等基准测试中,其表现大幅优于同量级基线模型。
Octen是一款网页搜索工具,能在3分钟内提供完整的来源支持报告,在DeepResearch Bench上比OpenAI、Gemini、Grok和Perplexity高出10-17分,兼具速度与准确性。
作者描述了如何通过多个订阅和更便宜的模型构建自定义AI研究管线以降低代币成本,并在研究代币经济学的过程中亲身体验了如何优化代币使用。
OpenResearcher是一个开源项目,它完全复现了Deep Research的工作流程,并提供了数据集、模型和演示。它使研究人员和AI智能体开发者能够以开放的方式构建、训练和评估深度研究管道。
OpenResearcher是来自TIGER-AI-Lab的一个开源项目,它提供了96,000条深度研究轨迹以及一套无需外部API即可训练代理型语言模型进行长周期网络研究的方案。它包含数据集、模型和演示,并已被NVIDIA的Nemotron模型采用。
一篇分析,质疑自2025年2月惊艳发布以来,Deep Research AI产品的进展为何停滞不前,指出尽管有渐进式改进,但已知弱点(如幻觉和不可靠的源验证)依然存在。
本文对8个用于深度研究系统中引用质量的LLM评估器进行了基准测试,发现较便宜的模型在来源相关性和事实支持方面仍与前沿模型竞争,但在方向偏差上有所不同,这对强化学习训练很重要。
Apodex发布了开放权重的DeepResearch特调模型Apodex-1.0-mini,基于Qwen3.5-35B-A3B,在BrowseComp达到71.5分,接近旗舰模型,可以在本地高效运行,作者打包了开箱即用的skill。
LiteResearcher是一个可扩展的强化学习训练框架,专为深度研究智能体设计。
本文认为,严肃AI系统下一个主要的竞争轴线是可靠性和可信度,而不仅仅是能力或流畅度。文章强调了新兴的验证技术——如独立检查和基于评分标准的评级——旨在捕捉自信但错误的输出,这种失败模式被称为'pseudo-correctness'。