deep-research

标签

Cards List
#deep-research

@CycleDecoded: 以为 OpenAI 那种高门槛的 Deep Research 离普通人很远?LangChain 官方直接把底裤都给扒出来了。 LangChain 开源的 open_deep_research,说白了就是完全开源复刻了顶尖 AI 机构的“深…

X AI KOLs Timeline · 18小时前 缓存

LangChain 开源了 open_deep_research,基于 LangGraph 的多智能体架构,完全开源复刻 OpenAI Deep Research,支持多种模型和搜索工具,可本地部署生成深度研报。

0 人收藏 0 人点赞
#deep-research

@CycleDecoded: 一个叫 WebRover 的开源 AI Agent,你给它一句话,它自己打开浏览器、识别网页元素、点击、翻页、抓数据、搞定任务,最后把你要的结果整理得明明白白。 开源协议:MIT License 定位:自主式 Web 自动化 AI 智能体…

X AI KOLs Timeline · 5天前 缓存

WebRover 是一个基于 MIT 协议的开源 AI Agent,通过自然语言即可驱动浏览器完成网页自动化、跨站数据抓取与深度研究,支持本地部署。

0 人收藏 0 人点赞
#deep-research

通过预测性导航进行深度研究预训练

arXiv cs.CL · 5天前 缓存

介绍了深度研究预训练(DRP),一种离线框架,从引文和超链接证据结构中生成搜索-打开-撰写轨迹。在1B token上预训练的Qwen3-14B模型在深度研究基准测试中优于匹配的无DRP基线,即使使用较少的监督微调数据也是如此。

0 人收藏 0 人点赞
#deep-research

Video-DeepResearch:迈向下一代多模态深度研究智能体

Hugging Face Daily Papers · 5天前 缓存

Video-DeepResearch (Video-DR) 将多模态智能体从静态图像扩展到连续视频流,引入了解耦的感知-探索流水线以及新的基准 Video-DR-Bench。其 Video-DeepResearch-35B-A3B 模型取得了 64.0% 的准确率,超越了 Claude-4.5-Sonnet、GPT-5 和 Gemini 2.5 Pro。

0 人收藏 0 人点赞
#deep-research

搜索、检查、获取:利用布尔检索赋能深度研究智能体

Hugging Face Daily Papers · 6天前 缓存

本文介绍了SIEVE,一种搜索-检查-获取策略,利用布尔查询语言使深度研究智能体仅检索相关文档片段,在多个基准数据集和智能体主干上,以节省20.7%-50.6%的令牌数实现了更高准确性。

0 人收藏 0 人点赞
#deep-research

FinanceHarness:自主金融深度研究框架

arXiv cs.CL · 2026-07-31 缓存

本文介绍了FinanceHarness,一个由LLM智能体驱动的端到端自动化金融深度研究框架,以及FinanceGym,一个可验证的时间点基准。专家验证显示通过率为82%,而领先模型得分低于40%,FinanceHarness将开源权重基座模型的性能从25.3%提升至32.4%。

0 人收藏 0 人点赞
#deep-research

@LangChain:@Similarweb 如何在没有唯一正确答案的情况下评估深度研究代理:工具调用的确定性检查……

X AI KOLs Timeline · 2026-07-29 缓存

本文介绍了 Similarweb 如何使用 LangSmith 评估长篇代理研究报告,结合工具调用的确定性检查和 LLM 作为评委的质量评分,重点关注使回归可检查并实现 A/B 比较。

0 人收藏 0 人点赞
#deep-research

@elonmusk: Grok Build /deep-research

X AI KOLs Following · 2026-07-26 缓存

Elon Musk 宣布为 Grok Build 添加 /deep-research 命令,该命令使用有界并行代理进行研究,交叉验证证据,并生成带引用的报告。

0 人收藏 0 人点赞
#deep-research

深度研究是否可靠?误导性知识会诱发错误结论

Hugging Face Daily Papers · 2026-07-23 缓存

本文介绍了 MisKnow-Agent,一个用于生成误导性知识以测试深度研究代理的框架,表明即使是有限的看似可信的错误信息暴露,也可能导致最终报告中的错误结论。

0 人收藏 0 人点赞
#deep-research

AREX:迈向递归自我改进的深度研究代理

Hugging Face Daily Papers · 2026-07-23 缓存

AREX 引入了一系列用于深度研究的递归自我改进代理,在内层研究循环和外层自我改进循环之间交替,并通过长周期强化学习进行训练。在 BrowseComp 和 Humanity's Last Exam 等基准测试中,其表现大幅优于同量级基线模型。

0 人收藏 0 人点赞
#deep-research

@omarsar0: Octen的网页搜索延迟相当惊人。像OpenAI、Gemini、Grok和Perplexity这样的深度研究工具可能需要长达…

X AI KOLs Following · 2026-07-21 缓存

Octen是一款网页搜索工具,能在3分钟内提供完整的来源支持报告,在DeepResearch Bench上比OpenAI、Gemini、Grok和Perplexity高出10-17分,兼具速度与准确性。

0 人收藏 0 人点赞
#deep-research

Lattics

Product Hunt · 2026-07-21

Lattics 是一个集成了 AI 写作和深度研究能力的类脑知识库。

0 人收藏 0 人点赞
#deep-research

我消耗了所有代币来研究如何节省代币

Hacker News Top · 2026-07-19 缓存

作者描述了如何通过多个订阅和更便宜的模型构建自定义AI研究管线以降低代币成本,并在研究代币经济学的过程中亲身体验了如何优化代币使用。

0 人收藏 0 人点赞
#deep-research

@trendtech33566: 【突发新闻】一款完全以开放方式复现Deep Research工作流程的开源软件(OSS)已出现——OpenResearcher……

X AI KOLs Timeline · 2026-07-15 缓存

OpenResearcher是一个开源项目,它完全复现了Deep Research的工作流程,并提供了数据集、模型和演示。它使研究人员和AI智能体开发者能够以开放的方式构建、训练和评估深度研究管道。

0 人收藏 0 人点赞
#deep-research

@tom_doerr: 生成96,000条高质量深度研究轨迹,并提供完全开源的配方,用于训练代理型语言模型…

X AI KOLs Timeline · 2026-07-14 缓存

OpenResearcher是来自TIGER-AI-Lab的一个开源项目,它提供了96,000条深度研究轨迹以及一套无需外部API即可训练代理型语言模型进行长周期网络研究的方案。它包含数据集、模型和演示,并已被NVIDIA的Nemotron模型采用。

0 人收藏 0 人点赞
#deep-research

Deep Research 产品进展为何停滞不前?

Reddit r/singularity · 2026-07-12

一篇分析,质疑自2025年2月惊艳发布以来,Deep Research AI产品的进展为何停滞不前,指出尽管有渐进式改进,但已知弱点(如幻觉和不可靠的源验证)依然存在。

0 人收藏 0 人点赞
#deep-research

你需要一个前沿模型作为引用验证器吗?——针对深度研究来源归因的评估LLM基准测试

arXiv cs.CL · 2026-07-10 缓存

本文对8个用于深度研究系统中引用质量的LLM评估器进行了基准测试,发现较便宜的模型在来源相关性和事实支持方面仍与前沿模型竞争,但在方向偏差上有所不同,这对强化学习训练很重要。

0 人收藏 0 人点赞
#deep-research

@karminski3: 终于有好用的本地 DeepResearch 可以用了! 我给大家包了个skill, 开箱即用. 驱动模型是 Apodex 刚发的开放权重 DeepResearch 特调模型 Apodex-1.0-mini (now available a…

X AI KOLs Timeline · 2026-07-06 缓存

Apodex发布了开放权重的DeepResearch特调模型Apodex-1.0-mini,基于Qwen3.5-35B-A3B,在BrowseComp达到71.5分,接近旗舰模型,可以在本地高效运行,作者打包了开箱即用的skill。

0 人收藏 0 人点赞
#deep-research

@_akhaliq: LiteResearcher — 面向深度研究智能体的可扩展代理RL训练框架

X AI KOLs Following · 2026-07-01 缓存

LiteResearcher是一个可扩展的强化学习训练框架,专为深度研究智能体设计。

0 人收藏 0 人点赞
#deep-research

可靠性正成为严肃AI发布竞争的实际轴线,而非它们听起来有多聪明

Reddit r/artificial · 2026-07-01

本文认为,严肃AI系统下一个主要的竞争轴线是可靠性和可信度,而不仅仅是能力或流畅度。文章强调了新兴的验证技术——如独立检查和基于评分标准的评级——旨在捕捉自信但错误的输出,这种失败模式被称为'pseudo-correctness'。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈