research-agents

标签

Cards List
#research-agents

研究智能体最实用的记忆或许是其拒绝的实验

Reddit r/AI_Agents · 2026-08-24

AQuA v2预印本介绍了一种为研究智能体设计的记忆系统,该系统利用已接受和拒绝实验的持久证据来指导未来的提案,强调了证据生命周期管理的重要性。

0 人收藏 0 人点赞
#research-agents

@startupideaspod: 使用GrokBot运行的最佳业务之一是目录。目录基本上就是网站上的精选数据,…

X AI KOLs Timeline · 2026-08-22 缓存

本文讨论了使用如GrokBot和Astro框架等AI工具建立盈利性目录业务,概述了细分市场选择、自动化内容创建和变现的步骤。

0 人收藏 0 人点赞
#research-agents

WANDR:广度与深度研究基准

arXiv cs.LG · 2026-08-18 缓存

WANDR是一个用于评估AI代理在广度与深度研究任务上的基准,专注于高容量数据收集且具有可验证的准确性。它包括500个任务和一个评估框架,以对现有系统进行压力测试。

0 人收藏 0 人点赞
#research-agents

不值得再花一个Token:高效深度研究智能体的边际价值估计

Hugging Face Daily Papers · 2026-08-09 缓存

本文对长时程深度研究智能体中减少Token使用和延迟的剪枝策略进行了系统性研究,表明早期剪枝能带来最大的效率提升,且质量损失很小。

0 人收藏 0 人点赞
#research-agents

Project2Task:面向自主研究的图引导项目级规划

arXiv cs.AI · 2026-08-07 缓存

介绍了Project2Task,一种用于自主研究系统的图引导项目级规划层,可将宏观项目简报分解为有界、依赖感知的研究任务,并明确贡献归属。评估显示其提高了项目组合质量和下游任务准确性。

0 人收藏 0 人点赞
#research-agents

EviGraph:证据引导的自主研究代理

arXiv cs.AI · 2026-08-06 缓存

EviGraph 是一个自主研究框架,它将研究过程表示为类型化证据图,以在各阶段保持主张与证据的一致性,在 ARC-Bench-ML 和 NanoResearch-20 上提升了主张支持率和实验数据一致性。

0 人收藏 0 人点赞
#research-agents

@Lyubh22:编程基准测试正在趋于饱和。AI4Research 是下一个前沿领域。很高兴看到我们的 MLS-Bench(https://mls-bench.co…)

X AI KOLs Timeline · 2026-08-03 缓存

正式发布 MLS-Bench,这是首个获得社区广泛采用的 AI4Research 基准测试,它在 12 个领域的 140 个可执行任务上测试 AI 智能体,以提出模块化的机器学习改进方案。该帖子还包含 Claude Opus 4.6 和 GPT-5.4 等模型的排行榜分数。

0 人收藏 0 人点赞
#research-agents

@omarsar0:新晋最爱作品。我每天早上都读它来了解高信号 X 账户中的人工智能新闻。它是一个 HTML 产物……

X AI KOLs Following · 2026-07-17 缓存

一位研究人员分享了一个每日自动化流程,该流程使用 X MCP 工具和研究代理,将高信号 X 账户中的人工智能新闻整理成一个 HTML 产物。

0 人收藏 0 人点赞
#research-agents

WANDR基准测试:评估需要搜索广度与深度的研究代理(阅读时间15分钟)

TLDR AI · 2026-07-15 缓存

Perplexity发布了WANDR,一个用于研究代理的开放基准测试与评估框架,包含500个需要广泛探索与深度验证的现实数据收集任务。初步结果显示,即使是最强大的系统也得分较低,凸显出广度和深度兼具的研究仍是一个具有挑战性的开放问题。

0 人收藏 0 人点赞
#research-agents

IdeaTrail:科学构思的全过程智能体轨迹

arXiv cs.AI · 2026-07-14 缓存

IdeaTrail是一个多轮过程轨迹数据集,用于科学构思,通过Generator--Advisor循环从证据收集到提案构建合成研究过程,以确保依据充分。

0 人收藏 0 人点赞
#research-agents

从求解器到研究者:大型语言模型驱动的前沿形式化数学

arXiv cs.CL · 2026-07-10 缓存

这篇立场论文回顾了LLM驱动的形式化数学的现状,指出了将这些系统应用于开放性研究数学的关键局限性,并提出了一条战略性路线图,用于开发能够推进数学前沿的AI智能体。

0 人收藏 0 人点赞
#research-agents

@Xudong07452910: 现在很多人聊 Research Agent,默认期待是: 读论文、找 gap、想 idea、做实验、写 paper。 但耶鲁大学的这篇论文问了一个更深入的问题: LLM 生成的研究想法,和人类研究者真正做出来的 paper idea,差距…

X AI KOLs Timeline · 2026-07-09 缓存

耶鲁大学的论文通过构建大规模评估框架,比较了LLM与人类研究者在生成研究想法上的分布差距,发现LLM想法高度集中于bridge和synthesis类型,而人类想法分布更广,揭示了'研究品味'的差异,对Research Agent的多样性提出挑战。

0 人收藏 0 人点赞
#research-agents

长周期研究智能体的搜索纪律

arXiv cs.AI · 2026-06-11 缓存

本文识别了长周期研究智能体中的一种失败模式:优化聚合指标可能选出提升核心数字但破坏关键子群体(反转)的候选项。它提出了一种搜索纪律协议,该协议使用一个外部控制环路,基于候选项的分解行为而非得分进行审计。

0 人收藏 0 人点赞
#research-agents

@k_dense_ai: 推出Science Superpowers — 一种面向AI研究代理的完整计算科学方法论。它让你的代…

X AI KOLs Timeline · 2026-05-28 缓存

Science Superpowers是一种开源的、面向AI研究代理的计算科学方法论,强制预注册和可重复工作流,以防止p-hacking和HARKing。

0 人收藏 0 人点赞
#research-agents

ScientistOne:通过 Chain-of-Evidence 实现人类级自主研究

arXiv cs.AI · 2026-05-27 缓存

ScientistOne 引入了 Chain-of-Evidence,这是一个面向自主研究代理的可验证性框架,确保每个声明都可追溯到证据来源。该框架实现了零幻觉引用、完美的分数验证,并在 75 篇论文中达到了最高的方法-代码对齐度,同时在五个前沿研究任务上达到或超过了人类专家水平。

0 人收藏 0 人点赞
#research-agents

@_avichawla: 排名第一的深度研究系统用一个Claude和ChatGPT都没用的技巧击败了它们。我研究了其开源架构……

X AI KOLs Timeline · 2026-05-25 缓存

Onyx开源深度研究系统通过从其编排代理中移除搜索权限,迫使其将查询分解为聚焦的研究线程,从而获得最高排名。其三阶段流水线和两级架构防止了信息失真和过早回答,性能优于OpenAI、Anthropic和Google的专有解决方案。

0 人收藏 0 人点赞
#research-agents

产品集成

Reddit r/AI_Agents · 2026-05-24

NineLayer,一个基于MCP的编码和研究代理搜索引擎,已将延迟从40秒降低到1.5秒,目前正在寻求用户意见,以确定优先进行哪些平台集成。

0 人收藏 0 人点赞
#research-agents

是时候 REFLECT 了:我们能信任 LLM 评判者来评估基于证据的研究代理吗?

arXiv cs.CL · 2026-05-20 缓存

本文介绍了 REFLECT,这是一个用于评估 LLM 评判者在深度研究代理评估中可靠性的元评估基准。实验表明,当前的 LLM 评判者仍然不可靠,在推理、工具使用和报告质量失败方面的整体准确率低于 55%。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈