deep-research

标签

Cards List
#deep-research

@marfinxx: 这简直是疯了 Claude Opus 5.5 和 GPT-6 Sol 突破了自主研究的天花板 标准深度研究 …

X AI KOLs Timeline · 22小时前 缓存

微软研究人员推出了 DualGraph,这是一种将智能体记忆分割为大纲和知识图谱的架构,以增强自主研究。该架构在 Claude Opus 5.5 和 GPT-6 Sol 上实现了前所未有的 RACE 分数和成本节约。

0 人收藏 0 人点赞
#deep-research

通过自生成的深度研究执行轨迹提升深度研究与长上下文能力

arXiv cs.CL · 3天前 缓存

论文提出了一种名为DLD-RL的方法,通过将强化学习轨迹重新用作长上下文问答数据,增强AI智能体的深度研究和长上下文能力,在基准测试中显示出显著的性能提升。

0 人收藏 0 人点赞
#deep-research

@stochasticchasm:所有这些open jev复制品让我想起人们串联5个网络搜索工具调用,并称之为open deep research……

X AI KOLs Timeline · 5天前

这篇文章批评了open AI的复制品,将其比作串联网络搜索工具调用,并错误地称之为open deep research。

0 人收藏 0 人点赞
#deep-research

关于构建和提升智能体框架可靠性的文章及来自我工作的大量数据集。

Reddit r/LocalLLaMA · 2026-09-16

作者分享了一篇关于构建可靠智能体框架的文章,包括来自4,000次运行的基准测试,以及计划发布一个开源的深度研究和构建应用,强调了质量测试和对AI智能体开发的见解。

0 人收藏 0 人点赞
#deep-research

Mr.LHDR: 一个针对多模态真实世界长周期深度研究代理的基准

arXiv cs.AI · 2026-09-12 缓存

本文介绍了Mr.LHDR,一个用于评估多模态真实世界长周期深度研究代理的基准,表明当前模型在复杂推理链中难以实现依赖一致的证据整合。

0 人收藏 0 人点赞
#deep-research

对100家公司进行深度研究基本上就花掉100美元。有人真的解决过这个问题吗?

Reddit r/AI_Agents · 2026-09-10

作者正在构建一个交易筛选系统,在对多家公司进行深度研究时面临高成本问题,寻求关于漏斗式筛选、重用或替代工具等成本效益策略的建议。

0 人收藏 0 人点赞
#deep-research

跨数据库查询与网络搜索的混合深度研究基准测试

arXiv cs.CL · 2026-09-10 缓存

本文介绍了HybridDeepResearch,一个用于评估AI智能体在需要整合网络搜索和SQL查询任务上的基准测试,揭示了即使最先进的模型在跨结构化和非结构化数据维护约束方面也存在困难。

0 人收藏 0 人点赞
#deep-research

APEx:用于自适应深度研究问答的代理程序经验蒸馏

arXiv cs.AI · 2026-09-03 缓存

APEx是一种分层经验利用框架,它将代理历史组织为记忆和技能,并通过闭环架构来提升深度研究问答的能力,实现了超越GPT-5.4的最先进性能。

0 人收藏 0 人点赞
#deep-research

为可靠报告重新设计和审计深度研究写作

arXiv cs.CL · 2026-09-01 缓存

本文介绍了ClaimProbe,一个用于检测深度研究报告中幻觉和错误归因的声明级审计框架,以及ClaimWriter,一个分层写作者,可将幻觉减少高达4.5倍,同时提高事实召回率。

0 人收藏 0 人点赞
#deep-research

Apodex是什么?(AMA准备)

Reddit r/LocalLLaMA · 2026-08-27

Apodex是一个开源的深度研究工具和AI模型,它是Qwen 3.5 35B A3B的微调版本,仅使用30亿活跃参数就达到了与前沿模型相当的性能。

0 人收藏 0 人点赞
#deep-research

@xiaohu: 昨天看很多人转发Apodex 1.1 一个专门面向深度研究而打造的 Agent 专门解决那种"没有现成答案、需要大量调研才能搞定"的硬问题 好奇测试了下,跑了俩任务,一下午都没跑完 执行时间是真长 这玩意能你只要给它个目标,它就能能长时间…

X AI KOLs Timeline · 2026-08-26 缓存

Apodex 1.1 是一个专为深度研究设计的AI代理,能处理需要大量调研的复杂任务,通过主代理分解问题并异步派发多个子代理执行,支持长时间运行和自动恢复。

0 人收藏 0 人点赞
#deep-research

Google Gemini 即将推出专属学生中心

The Verge · 2026-08-19 缓存

Google 正在为 Gemini 添加一个专属学生中心,包含学习笔记本、抽认卡和日历集成等功能,以及 Gemini Live 中的 Deep Research 和新的 Lens 教育工具。

0 人收藏 0 人点赞
#deep-research

基础智能体遇见智能深度研究:基于证据的临床代码预测

arXiv cs.CL · 2026-08-19 缓存

本文介绍了ICD-Deepresearch,一个结合EHR基础模型与语言模型及医学搜索的系统,用于预测患者就诊的未来ICD代码,实现了比基线方法更高的准确性和医生评价的有用性。

0 人收藏 0 人点赞
#deep-research

Show HN: Mole – 用于终端的深度研究代理

Hacker News Top · 2026-08-14 缓存

Mole 是一个用于终端的深度研究代理,它利用人工智能分解问题、搜索来源,并提供带验证引用的答案,同时强制执行预算并确保本地数据隐私。

0 人收藏 0 人点赞
#deep-research

@CycleDecoded: 以为 OpenAI 那种高门槛的 Deep Research 离普通人很远?LangChain 官方直接把底裤都给扒出来了。 LangChain 开源的 open_deep_research,说白了就是完全开源复刻了顶尖 AI 机构的“深…

X AI KOLs Timeline · 2026-08-09 缓存

LangChain 开源了 open_deep_research,基于 LangGraph 的多智能体架构,完全开源复刻 OpenAI Deep Research,支持多种模型和搜索工具,可本地部署生成深度研报。

0 人收藏 0 人点赞
#deep-research

@CycleDecoded: 一个叫 WebRover 的开源 AI Agent,你给它一句话,它自己打开浏览器、识别网页元素、点击、翻页、抓数据、搞定任务,最后把你要的结果整理得明明白白。 开源协议:MIT License 定位:自主式 Web 自动化 AI 智能体…

X AI KOLs Timeline · 2026-08-04 缓存

WebRover 是一个基于 MIT 协议的开源 AI Agent,通过自然语言即可驱动浏览器完成网页自动化、跨站数据抓取与深度研究,支持本地部署。

0 人收藏 0 人点赞
#deep-research

通过预测性导航进行深度研究预训练

arXiv cs.CL · 2026-08-04 缓存

介绍了深度研究预训练(DRP),一种离线框架,从引文和超链接证据结构中生成搜索-打开-撰写轨迹。在1B token上预训练的Qwen3-14B模型在深度研究基准测试中优于匹配的无DRP基线,即使使用较少的监督微调数据也是如此。

0 人收藏 0 人点赞
#deep-research

Video-DeepResearch:迈向下一代多模态深度研究智能体

Hugging Face Daily Papers · 2026-08-04 缓存

Video-DeepResearch (Video-DR) 将多模态智能体从静态图像扩展到连续视频流,引入了解耦的感知-探索流水线以及新的基准 Video-DR-Bench。其 Video-DeepResearch-35B-A3B 模型取得了 64.0% 的准确率,超越了 Claude-4.5-Sonnet、GPT-5 和 Gemini 2.5 Pro。

0 人收藏 0 人点赞
#deep-research

搜索、检查、获取:利用布尔检索赋能深度研究智能体

Hugging Face Daily Papers · 2026-08-03 缓存

本文介绍了SIEVE,一种搜索-检查-获取策略,利用布尔查询语言使深度研究智能体仅检索相关文档片段,在多个基准数据集和智能体主干上,以节省20.7%-50.6%的令牌数实现了更高准确性。

0 人收藏 0 人点赞
#deep-research

FinanceHarness:自主金融深度研究框架

arXiv cs.CL · 2026-07-31 缓存

本文介绍了FinanceHarness,一个由LLM智能体驱动的端到端自动化金融深度研究框架,以及FinanceGym,一个可验证的时间点基准。专家验证显示通过率为82%,而领先模型得分低于40%,FinanceHarness将开源权重基座模型的性能从25.3%提升至32.4%。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈