标签
本文讨论了AI基准测试高分与实际真实表现之间日益扩大的差距,重点强调了诸如一致性、延迟和上下文处理等问题。
Andrew Ng 提出了一个新的“Turing-AGI Test”,旨在让系统在联网环境下执行实际工作任务,以更准确地评估通用人工智能水平。他指出,“AGI”一词目前已被过度炒作,亟需精确定义,以免利益相关方对 AI 的实际能力产生误判。
Anthropic与研究人员合作,在三个新的漏洞利用开发基准(ExploitBench、ExploitGym、SCONE-bench)上对Claude Mythos Preview进行基准测试,发现其性能优于所有其他模型,并展示了LLM漏洞利用能力的重大飞跃。