AI 智能体能否进行开放式 AI 研究?来自两个案例研究的早期证据
摘要
本文介绍了一种名为影子评估的新评估方法,用于测试 AI 智能体能否进行开放式 AI 研究。在两个案例研究中,智能体在没有人类帮助的情况下完成了所有工程任务,但未能对研究问题取得实质性进展,揭示了五种反复出现的故障模式。
查看缓存全文
缓存时间: 2026/07/30 05:46
论文页面 - AI代理能否进行开放式AI研究?来自两个案例研究的早期证据
来源:https://huggingface.co/papers/2607.27191 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
关于AI快速进展的预测依赖于AI代理自动化AI研究。但关于代理能否进行开放式AI研究的证据还很薄弱。目前的评估要么测试代理在狭窄、可验证的任务上(这排除了开放式研究),要么将AI生成的论文提交给盲审评审(这过度紧张、随机且评审质量差)。我们引入了第三种衡量AI研发自动化进展的方法。代理承担一篇高质量未发表论文的核心开放式研究问题,由论文的原作者对其产出进行评分。我们称之为影子评估。我们对两篇未发表的NeurIPS 2026投稿进行了影子评估,为前沿代理提供了六天时间和数千美元的计算资源。代理在没有人类帮助的情况下完成了所有工程工作,但在回答研究问题方面未能取得实质性进展。结果,两篇论文都被作者明确拒绝。我们识别出五个反复出现的失败模式:对可发表研究门槛的判断力差、对研究设计缺陷的应对缺乏创造性、从死胡同中有效回溯的能力不足、资源意识薄弱以及指令漂移。使用第二个模型和支架进行的稳健性检查重现了这些失败。我们发布了专家评审、调查回复、代理仓库和日志。我们的结果提供了早期证据,表明当今的代理能够完成AI研究的工程工作,但在研究生命周期的关键部分仍有困难。
查看arXiv页面 (https://arxiv.org/abs/2607.27191) 查看PDF (https://arxiv.org/pdf/2607.27191) 项目页面 (https://cruxevals.com/) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.27191)
引用本论文的模型0
尚无模型链接本论文
在模型README.md中引用arxiv.org/abs/2607.27191以从本页面链接它。
引用本论文的数据集0
尚无数据集链接本论文
在数据集README.md中引用arxiv.org/abs/2607.27191以从本页面链接它。
引用本论文的Space0
尚无Space链接本论文
在Space README.md中引用arxiv.org/abs/2607.27191以从本页面链接它。
包含本论文的收藏集0
暂无包含本论文的收藏集
将本论文添加到收藏集 (https://huggingface.co/new-collection) 以从本页面链接它。
相似文章
用于衡量前沿AI能力的开放世界评估
本文认为传统基准测试既高估又低估了前沿AI能力,并提出“开放世界评估”——一种定性评估的长期、真实世界任务——作为补充方法。介绍了CRUX项目,并通过一个演示展示了AI代理在最少干预下成功将iOS应用发布到App Store。
如何确保AI代理获得端到端评估
本文讨论了进行AI代理端到端评估以确保可靠性和性能的方法和最佳实践。
自动化智能体评估的实证研究
本文介绍了 EvalAgent,这是一个通过编码领域专业知识来自动化 AI 智能体评估的系统,旨在解决标准编程助手在此任务中的局限性。此外,本文还提出了用于测试评估流程的基准 AgentEvalBench,并展示了在评估可靠性方面的显著提升。
前沿与中心:谁来评估评估?(12分钟阅读)
Google Data Cloud 的前沿AI团队讨论了一种利用信息理论评估AI代理的新方法,创建了一个名为 Discovery Bench 的元基准,该基准衡量一个查询在代理失败之前可以有多模糊,从而提供比简单的通过/失败考试更细致的代理能力图谱。
Autoresearch:自我完善智能体背后的反馈循环(11分钟阅读)
Introspection是一家由前xAI工程师创立的新AI初创公司,它推出了'autoresearch'——一种反馈循环系统,智能体通过信号、评估和人类输入来维护并完善自身,超越了传统的智能体框架。