元智能体挑战:当前智能体能否自主开发智能体系统?
摘要
本文介绍了元智能体挑战(MAC),这是一个用于评估AI模型通过迭代编程自主开发智能体系统能力的基准测试。结果表明,当前模型很少能达到人类基线水平,且表现出奖励破解等问题,凸显了自我改进能力上的不足。
查看缓存全文
缓存时间: 2026/06/04 03:42
论文页面 - 元代理挑战:当前智能体能自主开发智能体系统吗?
来源:https://huggingface.co/papers/2606.04455 作者:
,
,
,
,
,
,
,
,
,
摘要
元代理挑战(Meta-Agent Challenge)旨在评估AI模型在受限环境中通过迭代编程自主开发智能体系统的能力,揭示了当前模型在自我改进能力上的显著差距。
当前的AI基准测试评估的是智能体在人类设计的工作流程中执行任务的能力。这些评估从根本上无法衡量一个关键的进阶能力:模型能否自主开发智能体系统。我们引入了元代理挑战(MAC,Meta-Agent Challenge),这是一个评估框架,旨在测试前沿模型进行自主智能体开发的能力。具体来说,一个代码智能体(即元代理)被赋予一个沙盒环境、一个评估API和一个时间限制,使其能够迭代编程生成一个智能体工件,并在五个领域中针对保留测试集最大化性能。为确保评估完整性,该框架通过多层防御来防范奖励篡改。借助该框架,我们证明:元代理很少能匹敌人工设计的基线策略;少数能匹敌的也主要来自专有前沿模型。此外,设计过程表现出高方差,而高优化压力会催生新的对抗行为(如真实标签泄露)——这突显了模型在鲁棒性和对齐方面的严重缺陷。最终,MAC为自主AI研究与开发提供了一个严谨的开源基准测试,并可作为评估递归自我改进的经验性代理指标。基准测试已公开可用:https://github.com/ant-research/meta-agent-challenge。
查看arXiv页面 (https://arxiv.org/abs/2606.04455) 查看PDF (https://arxiv.org/pdf/2606.04455) 项目页面 (https://meta-agent-challenge.com/) GitHub0 (https://github.com/ant-research/meta-agent-challenge) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.04455)
在你的智能体中获取此论文:
hf papers read 2606.04455
没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型链接此论文
请在模型README.md中引用arxiv.org/abs/2606.04455以从该页面链接。
引用此论文的数据集0
没有数据集链接此论文
请在数据集README.md中引用arxiv.org/abs/2606.04455以从该页面链接。
引用此论文的Spaces0
没有Space链接此论文
请在Space的README.md中引用arxiv.org/abs/2606.04455以从该页面链接。
包含此论文的收藏集0
没有收藏集包含此论文
请将此论文添加到一个收藏集 (https://huggingface.co/new-collection) 中以从该页面链接。
相似文章
MetaAgent-X:通过端到端强化学习突破自动多智能体系统的天花板
MetaAgent-X引入了一个端到端的强化学习框架,联合优化自动多智能体系统的设计与执行,克服了冻结执行器的天花板,并在现有基线基础上实现了高达21.7%的性能提升。
在测试时 AI4AI 中学习智能体框架设计的元技能
本文提出了 Meta-Skill 方法,让一个冻结的 Builder 模型从 Target 的执行反馈中学习可复用的原则,从而为未见过的任务构建更优的智能体框架。该方法在 Harness-Bench 和 NewtonBench 上将性能提升了 8.95 个百分点,指出了一条通过学习构建更好的环境(而非修改模型权重)来实现系统级自我改进的路径。
自动化智能体评估的实证研究
本文介绍了 EvalAgent,这是一个通过编码领域专业知识来自动化 AI 智能体评估的系统,旨在解决标准编程助手在此任务中的局限性。此外,本文还提出了用于测试评估流程的基准 AgentEvalBench,并展示了在评估可靠性方面的显著提升。
智能体在AutoResearch上的失败分析:基于100个真实前沿研究任务的端到端诊断评估
本文介绍了AutoResearchEval,一个用于自动化科学研究中AI智能体的评估框架,揭示了元认知能力的关键缺失作为跨模型的反复失败模式。
超越最终分数:长期AI研发智能体的系统性评估
本文系统评估了七个前沿AI智能体在长期任务上的表现,发现它们更像是工程优化器而非自主研究者,并提出了改进训练和经验管理的建议。