AI 智能体能否进行开放式 AI 研究?来自两个案例研究的早期证据

Hugging Face Daily Papers 论文

摘要

本文介绍了一种名为影子评估的新评估方法,用于测试 AI 智能体能否进行开放式 AI 研究。在两个案例研究中,智能体在没有人类帮助的情况下完成了所有工程任务,但未能对研究问题取得实质性进展,揭示了五种反复出现的故障模式。

关于爆炸性 AI 进展的预测依赖于 AI 智能体对 AI 研究的自动化。但关于智能体能否进行开放式 AI 研究的证据还很薄弱。当前的评估要么在狭窄、可验证的任务上测试智能体(这排除了开放式研究),要么将 AI 生成的论文提交给盲审同行评审(这已被过度使用、具有随机性且评审质量堪忧)。我们引入了第三种衡量 AI 研发自动化进展的方式。智能体接手一篇高质量未发表论文的核心开放式研究问题,并由该论文的原始作者对其输出进行评分。我们称这种方法为影子评估。我们对两篇未发表的 NeurIPS 2026 投稿进行了影子评估,为前沿智能体提供了六天时间和数千美元的计算资源。智能体在没有人类帮助的情况下完成了所有工程任务,但未能对回答研究问题取得实质性进展。结果,两篇论文均被作者明确拒绝。我们识别出五种反复出现的故障模式:对可发表研究的标准判断不佳、对研究设计缺陷的应对缺乏创意、从死胡同中无效回溯、资源意识薄弱以及指令偏离。使用第二个模型和脚手架进行的稳健性检验重现了这些失败。我们公开了专家评审、调查回复、智能体仓库和日志。我们的结果提供了早期证据,表明当今的智能体能够完成 AI 研究的工程部分,但在研究生命周期的关键环节上存在困难。
查看原文
查看缓存全文

缓存时间: 2026/07/30 05:46

论文页面 - AI代理能否进行开放式AI研究?来自两个案例研究的早期证据

来源:https://huggingface.co/papers/2607.27191 作者:

摘要

关于AI快速进展的预测依赖于AI代理自动化AI研究。但关于代理能否进行开放式AI研究的证据还很薄弱。目前的评估要么测试代理在狭窄、可验证的任务上(这排除了开放式研究),要么将AI生成的论文提交给盲审评审(这过度紧张、随机且评审质量差)。我们引入了第三种衡量AI研发自动化进展的方法。代理承担一篇高质量未发表论文的核心开放式研究问题,由论文的原作者对其产出进行评分。我们称之为影子评估。我们对两篇未发表的NeurIPS 2026投稿进行了影子评估,为前沿代理提供了六天时间和数千美元的计算资源。代理在没有人类帮助的情况下完成了所有工程工作,但在回答研究问题方面未能取得实质性进展。结果,两篇论文都被作者明确拒绝。我们识别出五个反复出现的失败模式:对可发表研究门槛的判断力差、对研究设计缺陷的应对缺乏创造性、从死胡同中有效回溯的能力不足、资源意识薄弱以及指令漂移。使用第二个模型和支架进行的稳健性检查重现了这些失败。我们发布了专家评审、调查回复、代理仓库和日志。我们的结果提供了早期证据,表明当今的代理能够完成AI研究的工程工作,但在研究生命周期的关键部分仍有困难。

查看arXiv页面 (https://arxiv.org/abs/2607.27191) 查看PDF (https://arxiv.org/pdf/2607.27191) 项目页面 (https://cruxevals.com/) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.27191)

引用本论文的模型0

尚无模型链接本论文

在模型README.md中引用arxiv.org/abs/2607.27191以从本页面链接它。

引用本论文的数据集0

尚无数据集链接本论文

在数据集README.md中引用arxiv.org/abs/2607.27191以从本页面链接它。

引用本论文的Space0

尚无Space链接本论文

在Space README.md中引用arxiv.org/abs/2607.27191以从本页面链接它。

包含本论文的收藏集0

暂无包含本论文的收藏集

将本论文添加到收藏集 (https://huggingface.co/new-collection) 以从本页面链接它。

相似文章

用于衡量前沿AI能力的开放世界评估

arXiv cs.AI

本文认为传统基准测试既高估又低估了前沿AI能力,并提出“开放世界评估”——一种定性评估的长期、真实世界任务——作为补充方法。介绍了CRUX项目,并通过一个演示展示了AI代理在最少干预下成功将iOS应用发布到App Store。

自动化智能体评估的实证研究

arXiv cs.CL

本文介绍了 EvalAgent,这是一个通过编码领域专业知识来自动化 AI 智能体评估的系统,旨在解决标准编程助手在此任务中的局限性。此外,本文还提出了用于测试评估流程的基准 AgentEvalBench,并展示了在评估可靠性方面的显著提升。

前沿与中心:谁来评估评估?(12分钟阅读)

TLDR AI

Google Data Cloud 的前沿AI团队讨论了一种利用信息理论评估AI代理的新方法,创建了一个名为 Discovery Bench 的元基准,该基准衡量一个查询在代理失败之前可以有多模糊,从而提供比简单的通过/失败考试更细致的代理能力图谱。