我测试了所有AI实验室的前沿模型 - Claude Fable 5、GPT 5.6 Sol、Kimi K3、GLM 5.3、Qwen 3.8 Max、DS v4 Pro、Grok 4.6,但只有一款成功通过。

Reddit r/singularity 新闻

摘要

作者在从大型日志文件中提取数据的任务上测试了多个前沿AI模型,发现只有Claude Fable 5通过流式数据而非将文件加载到内存的方式成功,凸显了其相比其他模型更优的实际智能。

任务和提示都很简单。我没有要求他们为我制作一个操作系统或完整的游戏。我只是想测试他们在一些非常基础的事情上的智能。我有一个包含非常大的日志文件的仓库,每个文件20-30 GB。我的工作目录AGENTS.MD中有很多指令,我已经包含了如何处理这些文件的内容。为了测试,我为每个代理创建了全新的工作区(文件夹),并给了它们完全相同的提示。我在每个工作区中对日志目录进行了符号链接,工作区中没有其他东西可以指导代理。然后我要求每个代理从这些日志文件中提取特定的数据。结果:GPT 5.6 Sol、Kimi K3、GLM 5.3、Qwen 3.8 Max、DS v4 Pro、Grok 4.6 - 所有这些模型都通过将这些大文件加载到内存中而导致测试框架崩溃。只有Fable 5足够聪明,想到,嘿,这些是大文件;于是构建了一个脚本来流式传输数据并成功完成了任务。即使我们忽略所有其他模型,我一直假设GPT 5.6 Sol和Fable 5一样智能,并且一直将其作为我的主要工作模型,但这个简单的测试告诉我,Fable 5实际上比Sol更智能。'不要将大文件加载到内存中'是连初级开发者都知道的事情。我的机器有16GB RAM,在运行这些测试时大约有50%的空闲空间。每当有新模型发布时,我总是兴奋地寻找测试,而且这些测试总是相同的 - 骑自行车的鹳、几个网站模型,或者像HLE这样的测试中的数字。设计感知是主观的,所以很难真正根据它来评判模型。没有可用的编码测试,如果有我也不知道,而且即使那些也会是主观的。对我来说,我已经找到了自己的测试,我将用它来测试从现在开始的每个新模型。你们是否也有自己定制的测试来评估AI模型的性能?
查看原文

相似文章