超越最终分数:长期AI研发智能体的系统性评估
摘要
本文系统评估了七个前沿AI智能体在长期任务上的表现,发现它们更像是工程优化器而非自主研究者,并提出了改进训练和经验管理的建议。
查看缓存全文
缓存时间: 2026/08/17 03:45
论文页面 - 超越最终分数:对长期人工智能研发代理的系统性评估
来源:https://huggingface.co/papers/2608.13417 发布于8月13日
#3 每日论文 (https://huggingface.co/papers/date/2026-08-17) 作者:
,
,
,
,
,
,
,
,
,
,
,
摘要
前沿自主代理在工程优化方面表现出色,但在长期任务中表现出性能不稳定、创新性有限以及经验复用可变性等问题。
自主代理 (https://huggingface.co/papers?q=Autonomous%20agents)通过长期实验 (https://huggingface.co/papers?q=long-horizon%20experimentation)改进模型、系统和其他技术制品的能力日益增强。然而,要理解这种能力的当前状态,评估必须超越最终分数,因为最终分数既无法揭示进展的得失,也无法表明积累的经验是否改善了后续决策。因此,我们基于一个新框架,对七个前沿模型在36项长期任务上的表现进行了系统性评估。该框架使用基于规则的指标 (https://huggingface.co/papers?q=rule-based%20metrics),通过方案框架 (https://huggingface.co/papers?q=Solution%20Framing)、执行 (https://huggingface.co/papers?q=Execution) 和反馈控制 (https://huggingface.co/papers?q=Feedback%20Control)来描述运行中行为,并通过受控比较来评估任务内和跨任务的经验复用 (https://huggingface.co/papers?q=experience%20reuse)。结果表明,当前代理更像工程优化器 (https://huggingface.co/papers?q=engineering%20optimizers),而非完全自主的研究人员:它们能够制定和实施实际解决方案,但其性能在不同运行中差异显著,其最强解决方案主要是对现有技术的调整或组合,而真正的方法论创新 (https://huggingface.co/papers?q=methodological%20novelty)依然罕见。详细分析显示,观察到的性能由多种因素共同塑造,包括导致相似最终结果的不同过程瓶颈、可能帮助或误导后续决策的经验复用 (https://huggingface.co/papers?q=experience%20reuse),以及影响性能稳定性的运行框架设计 (https://huggingface.co/papers?q=harness%20design)。这些发现为改进模型训练、推理时策略、经验管理和运行框架设计 (https://huggingface.co/papers?q=harness%20design)指明了具体方向。
查看arXiv页面 (https://arxiv.org/abs/2608.13417)查看PDF (https://arxiv.org/pdf/2608.13417)项目页面 (https://yiwei98.github.io/AutoResearchEval)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.13417)
在您的代理中获取此论文:
hf papers read 2608\.13417
没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有链接此论文的模型
在模型README.md中引用arxiv.org/abs/2608.13417以从此页面链接。
引用此论文的数据集0
没有链接此论文的数据集
在数据集README.md中引用arxiv.org/abs/2608.13417以从此页面链接。
引用此论文的Spaces0
没有链接此论文的Space
在Space README.md中引用arxiv.org/abs/2608.13417以从此页面链接。
包含此论文的收藏0
没有包含此论文的收藏
将此论文添加到收藏夹 (https://huggingface.co/new-collection)以从此页面链接。
相似文章
@dair_ai:关于长时程智能体的杰出论文(建议收藏)——类似人类,如何让智能体在困难任务中坚持下去?
AutoLab 是一个新基准测试,针对 36 个由专家精心设计的长时程任务(系统优化、模型开发、CUDA 内核、谜题),对 17 个前沿模型进行评估。研究发现,决定成功的关键因素是持久性——而非初始尝试的质量。Claude-opus-4.6 在所有类别中名列前茅,而大多数其他模型要么过早终止,要么在几乎没有进展的情况下耗尽了预算。
@rohanpaul_ai: 当前前沿智能体在现实自动化方面的准备程度远不及它们在基准测试中的分数所暗示的那样。本文提…
本文介绍了“智能体最终考试”(Agents' Last Exam),这是一个测试AI智能体在55个数字工作领域中进行真实专家工作能力的基准。目前最强的智能体在大多数任务上失败,在最难的层级中平均通过率仅为2.6%,揭示了基准分数与现实世界自动化准备程度之间的巨大差距。
Long-Horizon-Terminal-Bench:通过密集奖励评分测试智能体在长时程终端任务上的极限
介绍了 Long-Horizon-Terminal-Bench,这是一个包含46个长时程终端任务的基准,采用密集奖励评分,评估AI智能体在规划、长上下文和调试方面的能力。即使是最强模型也仅达到15.2%的pass@1,显示仍有很大的改进空间。
前沿与中心:谁来评估评估?(12分钟阅读)
Google Data Cloud 的前沿AI团队讨论了一种利用信息理论评估AI代理的新方法,创建了一个名为 Discovery Bench 的元基准,该基准衡量一个查询在代理失败之前可以有多模糊,从而提供比简单的通过/失败考试更细致的代理能力图谱。
用于衡量前沿AI能力的开放世界评估
本文认为传统基准测试既高估又低估了前沿AI能力,并提出“开放世界评估”——一种定性评估的长期、真实世界任务——作为补充方法。介绍了CRUX项目,并通过一个演示展示了AI代理在最少干预下成功将iOS应用发布到App Store。