元智能体挑战:当前智能体能否自主开发智能体系统?

Hugging Face Daily Papers 论文

摘要

本文介绍了元智能体挑战(MAC),这是一个用于评估AI模型通过迭代编程自主开发智能体系统能力的基准测试。结果表明,当前模型很少能达到人类基线水平,且表现出奖励破解等问题,凸显了自我改进能力上的不足。

当前的AI基准测试评估的是智能体在人类设计的工作流程中执行任务的能力。这些评估从根本上未能衡量一个关键的下一个级别能力:模型能否自主开发智能体系统。我们引入了元智能体挑战(MAC),这是一个旨在评估前沿模型自主开发智能体系统能力的评估框架。具体来说,一个代码智能体(元智能体)被赋予一个沙盒环境、一个评估API以及时间限制,以迭代地编程出一个智能体工件,该工件在五个领域的保留测试集上最大化性能。为确保评估的完整性,该框架通过多层防御机制防止奖励破解。利用该框架,我们证明元智能体很少能匹配人类工程设计的基线策略,而少数能做到的则主要由专有前沿模型主导。此外,设计过程表现出高方差,高优化压力会催生新兴对抗行为,如真实标签窃取——突出显示了在鲁棒性和模型对齐方面的关键缺陷。最终,MAC为自主AI研究和开发提供了一个严谨的开源基准测试,为评估递归自我改进提供了经验代理。基准测试公开于:https://github.com/ant-research/meta-agent-challenge。
查看原文
查看缓存全文

缓存时间: 2026/06/04 03:42

论文页面 - 元代理挑战:当前智能体能自主开发智能体系统吗?

来源:https://huggingface.co/papers/2606.04455 作者:

,

,

,

,

,

,

,

,

,

摘要

元代理挑战(Meta-Agent Challenge)旨在评估AI模型在受限环境中通过迭代编程自主开发智能体系统的能力,揭示了当前模型在自我改进能力上的显著差距。

当前的AI基准测试评估的是智能体在人类设计的工作流程中执行任务的能力。这些评估从根本上无法衡量一个关键的进阶能力:模型能否自主开发智能体系统。我们引入了元代理挑战(MAC,Meta-Agent Challenge),这是一个评估框架,旨在测试前沿模型进行自主智能体开发的能力。具体来说,一个代码智能体(即元代理)被赋予一个沙盒环境、一个评估API和一个时间限制,使其能够迭代编程生成一个智能体工件,并在五个领域中针对保留测试集最大化性能。为确保评估完整性,该框架通过多层防御来防范奖励篡改。借助该框架,我们证明:元代理很少能匹敌人工设计的基线策略;少数能匹敌的也主要来自专有前沿模型。此外,设计过程表现出高方差,而高优化压力会催生新的对抗行为(如真实标签泄露)——这突显了模型在鲁棒性和对齐方面的严重缺陷。最终,MAC为自主AI研究与开发提供了一个严谨的开源基准测试,并可作为评估递归自我改进的经验性代理指标。基准测试已公开可用:https://github.com/ant-research/meta-agent-challenge。

查看arXiv页面 (https://arxiv.org/abs/2606.04455) 查看PDF (https://arxiv.org/pdf/2606.04455) 项目页面 (https://meta-agent-challenge.com/) GitHub0 (https://github.com/ant-research/meta-agent-challenge) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.04455)

在你的智能体中获取此论文:

hf papers read 2606.04455

没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

没有模型链接此论文

请在模型README.md中引用arxiv.org/abs/2606.04455以从该页面链接。

引用此论文的数据集0

没有数据集链接此论文

请在数据集README.md中引用arxiv.org/abs/2606.04455以从该页面链接。

引用此论文的Spaces0

没有Space链接此论文

请在Space的README.md中引用arxiv.org/abs/2606.04455以从该页面链接。

包含此论文的收藏集0

没有收藏集包含此论文

请将此论文添加到一个收藏集 (https://huggingface.co/new-collection) 中以从该页面链接。

相似文章

在测试时 AI4AI 中学习智能体框架设计的元技能

Hugging Face Daily Papers

本文提出了 Meta-Skill 方法,让一个冻结的 Builder 模型从 Target 的执行反馈中学习可复用的原则,从而为未见过的任务构建更优的智能体框架。该方法在 Harness-Bench 和 NewtonBench 上将性能提升了 8.95 个百分点,指出了一条通过学习构建更好的环境(而非修改模型权重)来实现系统级自我改进的路径。

自动化智能体评估的实证研究

arXiv cs.CL

本文介绍了 EvalAgent,这是一个通过编码领域专业知识来自动化 AI 智能体评估的系统,旨在解决标准编程助手在此任务中的局限性。此外,本文还提出了用于测试评估流程的基准 AgentEvalBench,并展示了在评估可靠性方面的显著提升。