Fable 5 与 GPT-5.6 领跑奇点门测试:用于检验 AI 能否预测模型训练截止后的范式突破性发现
摘要
奇点门基准测试旨在检验前沿 AI 模型能否预测在其训练数据截止日后发表的范式突破性科学发现。Claude Fable 5 目前领先,但由于拒绝回答导致回复率较低;而 GPT-5.6 Sol 在更低的价格点上展现出强大的性能,且无拒绝回答的情况。
https://preview.redd.it/znxwkbknlldh1.png?width=532&format=png&auto=webp&s=95ef4095bff0d803565ed09cdb66e5a960cafefb https://preview.redd.it/yrl9jtkslldh1.png?width=797&format=png&auto=webp&s=55ad11dd65a3348a64b629013bece2decffd9702 https://preview.redd.it/dw2swnxqlldh1.png?width=924&format=png&auto=webp&s=af029815a60c2197fa4ccc7939a156547ca36c02 Fable 5 初始版、Fable 5 最新版和 GPT-5.6 Sol 刚刚在奇点门上接受了测试。该测试用于检验前沿 AI 模型能否预测在其训练数据截止日后发表的范式突破性科学发现。Claude Fable 5 是目前最好的模型,但初始版 Fable 5 对 45% 的测试任务作出了回应,最新版则只回应了 39%。除了拒绝回答,最新版在性能上也有轻微退化。图中显示的 Fable 5 得分仅针对两个 Fable 版本都作出回应的任务。GPT-5.6 Sol 相比 GPT-5.5 有显著提升,其得分超过了 Claude Opus 4.8,成为同类模型和价格区间中的最佳选择。它紧随 Fable 5 之后。考虑到其价格和 100% 的测试回应率(对比 Fable 的 39%),它具备成为日常使用主力模型的潜力。由于 GPT-5.6 在无拒绝回答的情况下实现了与 Fable 5 相近的性能,Fable 的严格护栏备受质疑。然而,目前仍没有模型能够完全预测一项发现或发明。提醒:通过奇点门测试是实现自主 AI 驱动发现的必要条件,但非充分条件。能够预测范式突破性发现的模型不一定达到爱因斯坦级别,但无法做到的模型肯定不是。所有模型均在其原生代理框架(claude code、codex、gemini cli)中完成测试,并允许使用工具,网络搜索功能已禁用。
相似文章
奇点之门:一个针对模型截止日期后发表的范式转变科学发现的基准测试
介绍了奇点之门,一个测试前沿AI模型是否能预测其训练截止日期后发表的范式转变科学发现的基准。当前最高得分为17.75%的部分分数,完全正确率为0%。
Artificial Analysis 的 GPT 5.6 系列基准测试
Artificial Analysis 的基准测试显示,OpenAI 的 GPT-5.6 Sol 在智能方面几乎与 Claude Fable 5 相当,但成本仅为后者的三分之一;在编程智能体评测中领先;并引入了缓存写入定价。
@VraserX: GPT-5.6 Sol 看起来简直太疯狂了。如果这些早期基准测试成立,Fable 5 就彻底被超越了。更好的性能,更好的效率…
关于 OpenAI 的 GPT-5.6 Sol 模型在基准测试中表现出色的传闻,暗示可能很快发布。
GPT-5.6 vs. Claude Fable 5 物理AI对决:谁更胜一筹?
JuliaHub 在五个物理建模问题上对 GPT-5.6 和 Claude Fable 5 进行了测试。Claude Fable 5 以 0.889 的加权得分名列前茅,而 GPT-5.6 的变体得分较低,但更便宜且速度更快。
@hqmank: Fable 5 > GPT-5.6 Sol,改变我的想法。
一位用户声称Fable 5的性能优于GPT-5.6,并挑战其他人提出不同意见。