Humanity’s Last Exam 的更新版:HLE-Diamond
摘要
Humanity’s Last Exam 的一个更新版本,这是一个用于AI评估的基准,名为 HLE-Diamond,已经宣布并发布。
推文链接: https://x.com/CAIS/status/2102787839964729431 博客链接: https://lastexam.ai/blog/hle-diamond
相似文章
Human Bench 3.0,Humanity-2 AI-0
介绍 Human Bench 3.0,一个用于评估 AI 系统与人类表现对比的基准,Humanity-2 AI-0 可能表示特定的分数或版本。
Humanity's Last Exam 当前基准测试成绩思考?
讨论近期AI模型在'Humanity's Last Exam'基准测试中的得分,指出从2024年5月GPT-4o的2.7%提升至2026年6月左右45%,并对该考试的难度提出疑问。
新基准测试发布
一个新基准测试已发布,可能用于评估AI或软件性能。
Fable 通过“当 AI 通过这项测试,务必警惕”测试
Claude Fable 在“人类最后的考试”(Humanity's Last Exam)基准测试中取得 53% 的成绩,比预期的 2025 年底里程碑更早达到,表明 AI 进展迅速。
智能体的最终考试
介绍智能体的最终考试(ALE),这是一个基准测试,用于评估AI智能体在长期、具有经济价值的现实世界任务上的表现,涵盖13个行业集群的1000多项任务,揭示了基准性能与实际部署之间的巨大差距。