标签
本文探讨了为什么像 Terminal-Bench 这样的智能体 AI 基准测试中的任务可能无法解决,区分了真正的困难与诸如损坏的预言机或基础设施故障等问题,并强调了为准确的能力声明验证所有失败任务的必要性。