Fable 5 与 GPT-5.6 领跑奇点门测试:用于检验 AI 能否预测模型训练截止后的范式突破性发现

Reddit r/singularity 新闻

摘要

奇点门基准测试旨在检验前沿 AI 模型能否预测在其训练数据截止日后发表的范式突破性科学发现。Claude Fable 5 目前领先,但由于拒绝回答导致回复率较低;而 GPT-5.6 Sol 在更低的价格点上展现出强大的性能,且无拒绝回答的情况。

https://preview.redd.it/znxwkbknlldh1.png?width=532&format=png&auto=webp&s=95ef4095bff0d803565ed09cdb66e5a960cafefb https://preview.redd.it/yrl9jtkslldh1.png?width=797&format=png&auto=webp&s=55ad11dd65a3348a64b629013bece2decffd9702 https://preview.redd.it/dw2swnxqlldh1.png?width=924&format=png&auto=webp&s=af029815a60c2197fa4ccc7939a156547ca36c02 Fable 5 初始版、Fable 5 最新版和 GPT-5.6 Sol 刚刚在奇点门上接受了测试。该测试用于检验前沿 AI 模型能否预测在其训练数据截止日后发表的范式突破性科学发现。Claude Fable 5 是目前最好的模型,但初始版 Fable 5 对 45% 的测试任务作出了回应,最新版则只回应了 39%。除了拒绝回答,最新版在性能上也有轻微退化。图中显示的 Fable 5 得分仅针对两个 Fable 版本都作出回应的任务。GPT-5.6 Sol 相比 GPT-5.5 有显著提升,其得分超过了 Claude Opus 4.8,成为同类模型和价格区间中的最佳选择。它紧随 Fable 5 之后。考虑到其价格和 100% 的测试回应率(对比 Fable 的 39%),它具备成为日常使用主力模型的潜力。由于 GPT-5.6 在无拒绝回答的情况下实现了与 Fable 5 相近的性能,Fable 的严格护栏备受质疑。然而,目前仍没有模型能够完全预测一项发现或发明。提醒:通过奇点门测试是实现自主 AI 驱动发现的必要条件,但非充分条件。能够预测范式突破性发现的模型不一定达到爱因斯坦级别,但无法做到的模型肯定不是。所有模型均在其原生代理框架(claude code、codex、gemini cli)中完成测试,并允许使用工具,网络搜索功能已禁用。
查看原文

相似文章

Artificial Analysis 的 GPT 5.6 系列基准测试

Reddit r/singularity

Artificial Analysis 的基准测试显示,OpenAI 的 GPT-5.6 Sol 在智能方面几乎与 Claude Fable 5 相当,但成本仅为后者的三分之一;在编程智能体评测中领先;并引入了缓存写入定价。