Fable 通过“当 AI 通过这项测试,务必警惕”测试
摘要
Claude Fable 在“人类最后的考试”(Humanity's Last Exam)基准测试中取得 53% 的成绩,比预期的 2025 年底里程碑更早达到,表明 AI 进展迅速。
《纽约时报》2025 年 1 月文章——“当 AI 通过这项测试,务必警惕”,而 Claude Fable 刚刚以 53% 的成绩通过了该测试。但他们也预计这项测试会在 2025 年底通过,而现在大约晚了 6 个月。[https://www.nytimes.com/2025/01/23/technology/ai-test-humanitys-last-exam.html](https://www.nytimes.com/2025/01/23/technology/ai-test-humanitys-last-exam.html) *Hendrycks 先生表示,他预计这些分数会迅速上升,并可能在今年年底前超过 50%。届时,他认为 AI 系统可能会被视为“世界级先知”,能够比人类专家更准确地回答任何主题的问题。*
相似文章
Claude Fable 5 基准测试
Anthropic 发布了 Claude Fable 5(一款新的人工智能模型)的基准测试,显示出显著的性能提升。
Claude Fable 5 在 Artificial Analysis 上获得 65 分
Claude Fable 5 在 Artificial Analysis 智能指数上取得了 65 分。
Claude Fable 5 及新的AI安全寓言(14分钟阅读)
Anthropic 发布了 Claude Fable 5,这是一款重大新模型,在各项基准测试中显示出显著的能力提升,并引入了新的安全措施,标志着AI发展的一个关键时刻。
Fable 是天花板。
一篇评论文章推测,Anthropic 的 Fable 模型可能代表了美国 AI 进步的天花板,并且中国 AI 开发者将因更快的迭代和蒸馏技术而很快超过美国的前沿模型。
Humanity's Last Exam 当前基准测试成绩思考?
讨论近期AI模型在'Humanity's Last Exam'基准测试中的得分,指出从2024年5月GPT-4o的2.7%提升至2026年6月左右45%,并对该考试的难度提出疑问。