智能体的最终考试
摘要
介绍智能体的最终考试(ALE),这是一个基准测试,用于评估AI智能体在长期、具有经济价值的现实世界任务上的表现,涵盖13个行业集群的1000多项任务,揭示了基准性能与实际部署之间的巨大差距。
查看缓存全文
缓存时间: 2026/06/10 00:08
Paper page - Agents’ Last Exam (智能体终极考试)
来源:https://huggingface.co/papers/2606.05405
发布于6月3日
·
由 https://huggingface.co/XinyangDavidHan 提交
Han (https://huggingface.co/XinyangDavidHan) 于6月9日提交
#2 今日论文 (https://huggingface.co/papers/date/2026-06-09)
作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
Agents’ Last Exam (ALE) 是一个用于评估AI代理在长期、经济价值高、现实世界任务上表现的基准,涵盖13个行业集群、1000+任务,揭示了基准性能与实际部署之间的显著差距。
近年来,AI系统在广泛基准上取得了强劲成绩,但这些成果并未转化为多个专业领域的经济意义部署。我们认为,这种差距很大程度上是一个评估问题:广泛使用的基准缺乏对真实且有经济价值的工作流程的持续性性能测量。本文介绍Agents’ Last Exam (ALE)——一个旨在评估AI代理在长期、经济价值高、现实世界任务上并具有可验证结果的基准。ALE与250+行业专家合作开发,覆盖了参考O*NET (https://huggingface.co/papers?q=O*NET)/SOC 2018 (https://huggingface.co/papers?q=SOC%202018)(美国联邦职业分类体系)定义的非体力型行业。它围绕一个任务分类体系组织,包含55个子领域,归为13个行业集群,涵盖1000+任务。当前结果显示,最难的层级远未饱和:在主流框架和后端配置中,平均完全通过率仅为2.6%。ALE被设计为一个动态基准:其任务池随着新工作流程和行业的加入而持续增长。更广泛地说,ALE不仅旨在成为另一个排行榜,更希望成为弥合基准成功与GDP相关影响力之间差距的工具。
查看arXiv页面 (https://arxiv.org/abs/2606.05405)
查看PDF (https://arxiv.org/pdf/2606.05405)
项目页面 (https://agents-last-exam.org/)
GitHub 183 (https://github.com/rdi-berkeley/agents-last-exam)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.05405)
在你的代理中获取这篇论文:
hf papers read 2606\.05405
没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型0
没有模型链接这篇论文
在模型README.md中引用 arxiv.org/abs/2606.05405 以从此页面链接到它。
引用本文的数据集0
没有数据集链接这篇论文
在数据集README.md中引用 arxiv.org/abs/2606.05405 以从此页面链接到它。
引用本文的Spaces0
没有Space链接这篇论文
在Space README.md中引用 arxiv.org/abs/2606.05405 以从此页面链接到它。
包含本文的收藏0
没有收藏包含这篇论文
将此论文添加到一个收藏 (https://huggingface.co/new-collection) 以从此页面链接到它。
相似文章
@dair_ai: // Agents' Last Exam // Agents' Last Exam 是一个包含1000多项经济价值任务的动态基准,由2…
Agents' Last Exam 是一个动态基准,包含超过1000项经济价值任务,旨在评估AI agents在真实世界工作流程中的表现,目前在最高难度级别上的完全通过率仅为2.6%。
@dawnsongtweets: 人人都说最新的AI智能体很快就能“可胜任工作”,尤其是在本周Fable 5发布之后。但事实果真如此吗…
本文介绍了Agents' Last Exam (ALE),这是一个持续更新的基准测试,旨在检验AI智能体能否执行具有经济价值的工作。对Fable 5等前沿模型的评估显示,在最困难的任务上成功率为0%,表明真正可胜任工作的智能体尚未到来。
@rohanpaul_ai: 当前前沿智能体在现实自动化方面的准备程度远不及它们在基准测试中的分数所暗示的那样。本文提…
本文介绍了“智能体最终考试”(Agents' Last Exam),这是一个测试AI智能体在55个数字工作领域中进行真实专家工作能力的基准。目前最强的智能体在大多数任务上失败,在最难的层级中平均通过率仅为2.6%,揭示了基准分数与现实世界自动化准备程度之间的巨大差距。
HealthAgentBench: 面向前沿AI智能体的统一真实医疗智能体环境基准套件
本文介绍了HealthAgentBench,一个包含54个真实医疗任务的套件,用于评估前沿AI智能体。研究发现,即使是最强的智能体(Codex GPT-5.5)也仅能达到约42%的成功率,凸显了巨大的改进空间。
@dair_ai: https://x.com/dair_ai/status/2066174390048358760
一个精选的推文串,涵盖了三篇引人注目的人工智能论文:用于高效长上下文推理的MiniMax Sparse Attention、用于自我改进智能体框架的Self-Harness,以及用于衡量智能体经济价值的Agents' Last Exam基准测试。