我测试了所有AI实验室的前沿模型 - Claude Fable 5、GPT 5.6 Sol、Kimi K3、GLM 5.3、Qwen 3.8 Max、DS v4 Pro、Grok 4.6,但只有一款成功通过。
摘要
作者在从大型日志文件中提取数据的任务上测试了多个前沿AI模型,发现只有Claude Fable 5通过流式数据而非将文件加载到内存的方式成功,凸显了其相比其他模型更优的实际智能。
任务和提示都很简单。我没有要求他们为我制作一个操作系统或完整的游戏。我只是想测试他们在一些非常基础的事情上的智能。我有一个包含非常大的日志文件的仓库,每个文件20-30 GB。我的工作目录AGENTS.MD中有很多指令,我已经包含了如何处理这些文件的内容。为了测试,我为每个代理创建了全新的工作区(文件夹),并给了它们完全相同的提示。我在每个工作区中对日志目录进行了符号链接,工作区中没有其他东西可以指导代理。然后我要求每个代理从这些日志文件中提取特定的数据。结果:GPT 5.6 Sol、Kimi K3、GLM 5.3、Qwen 3.8 Max、DS v4 Pro、Grok 4.6 - 所有这些模型都通过将这些大文件加载到内存中而导致测试框架崩溃。只有Fable 5足够聪明,想到,嘿,这些是大文件;于是构建了一个脚本来流式传输数据并成功完成了任务。即使我们忽略所有其他模型,我一直假设GPT 5.6 Sol和Fable 5一样智能,并且一直将其作为我的主要工作模型,但这个简单的测试告诉我,Fable 5实际上比Sol更智能。'不要将大文件加载到内存中'是连初级开发者都知道的事情。我的机器有16GB RAM,在运行这些测试时大约有50%的空闲空间。每当有新模型发布时,我总是兴奋地寻找测试,而且这些测试总是相同的 - 骑自行车的鹳、几个网站模型,或者像HLE这样的测试中的数字。设计感知是主观的,所以很难真正根据它来评判模型。没有可用的编码测试,如果有我也不知道,而且即使那些也会是主观的。对我来说,我已经找到了自己的测试,我将用它来测试从现在开始的每个新模型。你们是否也有自己定制的测试来评估AI模型的性能?
相似文章
'一刀切'式AI时代已终结。我实测了GPT-5.5、Claude 4.7、Gemini 3.1 Pro和DeepSeek V4 Pro——以下是最新前沿格局。
对GPT-5.5、Claude Opus 4.7、Gemini 3.1 Pro和DeepSeek V4 Pro的基准测试分析表明,没有单一模型在所有任务上占据优势;要实现最佳性能,需要采用多模型路由器,根据各模型的优势与弱点进行专门化使用。
GPT-5.6 vs. Claude Fable 5 物理AI对决:谁更胜一筹?
JuliaHub 在五个物理建模问题上对 GPT-5.6 和 Claude Fable 5 进行了测试。Claude Fable 5 以 0.889 的加权得分名列前茅,而 GPT-5.6 的变体得分较低,但更便宜且速度更快。
Fable 5 与 GPT-5.6 领跑奇点门测试:用于检验 AI 能否预测模型训练截止后的范式突破性发现
奇点门基准测试旨在检验前沿 AI 模型能否预测在其训练数据截止日后发表的范式突破性科学发现。Claude Fable 5 目前领先,但由于拒绝回答导致回复率较低;而 GPT-5.6 Sol 在更低的价格点上展现出强大的性能,且无拒绝回答的情况。
@auroter: Frontier AI 简直脑死亡。GPT5.5 xHigh 在 Codex 中认为我应该使用张量并行来部署 Qwen 3.6 27B 在我的系统上…
作者批评 Frontier AI(GPT5.5 xHigh)错误地建议对一个能单 GPU 容纳的模型使用张量并行,并宣布计划进行一场对决,比较多个 AI 模型(GPT5.5、Opus 4.8、Qwen 系列、Nemotron)在真实问题上的表现。
GLM-5.3:中国实验室如何跟上前沿步伐(11分钟阅读)
Z.ai的GLM-5.3模型展示了卓越的基准测试性能,超越了像Kimi K3这样的大型模型,并与前沿模型相媲美,突显了中国AI实验室在训练后效率方面的进步。