标签
AQuA v2预印本介绍了一种为研究智能体设计的记忆系统,该系统利用已接受和拒绝实验的持久证据来指导未来的提案,强调了证据生命周期管理的重要性。
本文讨论了使用如GrokBot和Astro框架等AI工具建立盈利性目录业务,概述了细分市场选择、自动化内容创建和变现的步骤。
WANDR是一个用于评估AI代理在广度与深度研究任务上的基准,专注于高容量数据收集且具有可验证的准确性。它包括500个任务和一个评估框架,以对现有系统进行压力测试。
本文对长时程深度研究智能体中减少Token使用和延迟的剪枝策略进行了系统性研究,表明早期剪枝能带来最大的效率提升,且质量损失很小。
介绍了Project2Task,一种用于自主研究系统的图引导项目级规划层,可将宏观项目简报分解为有界、依赖感知的研究任务,并明确贡献归属。评估显示其提高了项目组合质量和下游任务准确性。
EviGraph 是一个自主研究框架,它将研究过程表示为类型化证据图,以在各阶段保持主张与证据的一致性,在 ARC-Bench-ML 和 NanoResearch-20 上提升了主张支持率和实验数据一致性。
正式发布 MLS-Bench,这是首个获得社区广泛采用的 AI4Research 基准测试,它在 12 个领域的 140 个可执行任务上测试 AI 智能体,以提出模块化的机器学习改进方案。该帖子还包含 Claude Opus 4.6 和 GPT-5.4 等模型的排行榜分数。
一位研究人员分享了一个每日自动化流程,该流程使用 X MCP 工具和研究代理,将高信号 X 账户中的人工智能新闻整理成一个 HTML 产物。
Perplexity发布了WANDR,一个用于研究代理的开放基准测试与评估框架,包含500个需要广泛探索与深度验证的现实数据收集任务。初步结果显示,即使是最强大的系统也得分较低,凸显出广度和深度兼具的研究仍是一个具有挑战性的开放问题。
IdeaTrail是一个多轮过程轨迹数据集,用于科学构思,通过Generator--Advisor循环从证据收集到提案构建合成研究过程,以确保依据充分。
这篇立场论文回顾了LLM驱动的形式化数学的现状,指出了将这些系统应用于开放性研究数学的关键局限性,并提出了一条战略性路线图,用于开发能够推进数学前沿的AI智能体。
耶鲁大学的论文通过构建大规模评估框架,比较了LLM与人类研究者在生成研究想法上的分布差距,发现LLM想法高度集中于bridge和synthesis类型,而人类想法分布更广,揭示了'研究品味'的差异,对Research Agent的多样性提出挑战。
本文识别了长周期研究智能体中的一种失败模式:优化聚合指标可能选出提升核心数字但破坏关键子群体(反转)的候选项。它提出了一种搜索纪律协议,该协议使用一个外部控制环路,基于候选项的分解行为而非得分进行审计。
Science Superpowers是一种开源的、面向AI研究代理的计算科学方法论,强制预注册和可重复工作流,以防止p-hacking和HARKing。
ScientistOne 引入了 Chain-of-Evidence,这是一个面向自主研究代理的可验证性框架,确保每个声明都可追溯到证据来源。该框架实现了零幻觉引用、完美的分数验证,并在 75 篇论文中达到了最高的方法-代码对齐度,同时在五个前沿研究任务上达到或超过了人类专家水平。
Onyx开源深度研究系统通过从其编排代理中移除搜索权限,迫使其将查询分解为聚焦的研究线程,从而获得最高排名。其三阶段流水线和两级架构防止了信息失真和过早回答,性能优于OpenAI、Anthropic和Google的专有解决方案。
NineLayer,一个基于MCP的编码和研究代理搜索引擎,已将延迟从40秒降低到1.5秒,目前正在寻求用户意见,以确定优先进行哪些平台集成。
本文介绍了 REFLECT,这是一个用于评估 LLM 评判者在深度研究代理评估中可靠性的元评估基准。实验表明,当前的 LLM 评判者仍然不可靠,在推理、工具使用和报告质量失败方面的整体准确率低于 55%。