Fable 通过“当 AI 通过这项测试,务必警惕”测试

Reddit r/ArtificialInteligence 模型

摘要

Claude Fable 在“人类最后的考试”(Humanity's Last Exam)基准测试中取得 53% 的成绩,比预期的 2025 年底里程碑更早达到,表明 AI 进展迅速。

《纽约时报》2025 年 1 月文章——“当 AI 通过这项测试,务必警惕”,而 Claude Fable 刚刚以 53% 的成绩通过了该测试。但他们也预计这项测试会在 2025 年底通过,而现在大约晚了 6 个月。[https://www.nytimes.com/2025/01/23/technology/ai-test-humanitys-last-exam.html](https://www.nytimes.com/2025/01/23/technology/ai-test-humanitys-last-exam.html) *Hendrycks 先生表示,他预计这些分数会迅速上升,并可能在今年年底前超过 50%。届时,他认为 AI 系统可能会被视为“世界级先知”,能够比人类专家更准确地回答任何主题的问题。*
查看原文

相似文章

Claude Fable 5 基准测试

Reddit r/singularity

Anthropic 发布了 Claude Fable 5(一款新的人工智能模型)的基准测试,显示出显著的性能提升。

Fable 是天花板。

Reddit r/artificial

一篇评论文章推测,Anthropic 的 Fable 模型可能代表了美国 AI 进步的天花板,并且中国 AI 开发者将因更快的迭代和蒸馏技术而很快超过美国的前沿模型。