标签
本文介绍了Agents' Last Exam (ALE),这是一个持续更新的基准测试,旨在检验AI智能体能否执行具有经济价值的工作。对Fable 5等前沿模型的评估显示,在最困难的任务上成功率为0%,表明真正可胜任工作的智能体尚未到来。