你们还记得蛇模型测试吗?
摘要
这篇文章回顾了三年前AI模型的快速进展,比较了像Bard这样在编码测试中挣扎的早期模型与当前的Qwen 27B和Opus 5.5,并对未来的发展进行了推测。
刚看了一个三年前的视频,其中Matt Berman测试了Bard(是的,还记得Bard吗?)大部分测试像是总结或逻辑测试。如果涉及到编码,就是蛇测试或者Pong,而三年前的那些模型几乎都做不对。现在用本地部署的Qwen 27B或者订阅的Opus 5.5,差距就太大了。我在想三年后我会用什么样的眼睛来看这篇文章。可能是机器人的眼睛。
相似文章
你们不害怕我们正走向何方吗?一年前,GPT-5 还被认为是世界上最好的模型之一。今天,我们已经有了像 Qwen3.6-27B 这样的开放权重模型,其性能足以在高端消费级硬件上本地运行。进步的速度绝对残酷。
对 AI 进步迅速步伐的评论,指出像 Qwen3.6-27B 这样的开放权重模型现在已足够有竞争力,可以在消费级硬件上本地运行,而一年前 GPT-5 还是最好的之一。
GPT-5,一年前还是全球最佳模型,如今却不如Qwen3.6 27B及当今大多数低端模型
GPT-5一年前还是最佳模型,如今已被Qwen3.6 27B及其他当前低端模型超越,凸显了AI发展的迅猛速度。
@lxfater: 这里有个小秘密,我悄悄告诉大家如何判断模型是否在变差:方法是使用AI进行以下测试…
一个提示,使用三个特定的绘图测试——鹈鹕骑自行车、Sun Wukong 开飞机和 Qin Shi Huang 骑北极熊——来评估AI模型的智能是否随时间变化。
@no_stp_on_snek: Qwen3.8 27B 概览。版本 3.6:退步:* 偏见/公平性 * 配置易用性 增强:* 核心 * 能力 结论…
本文评估了Qwen3.8 27B AI模型的3.6版本,强调了在偏见/公平性和配置易用性方面的退步,同时指出了在核心和能力方面的改进,得出结论:这不是一次干净的升级。
@mattpocockuk: 感觉最近给模型分类变得更难了。我曾将模型归类为Opus类、Sonnet类或Hai…
Matt Pocock观察到,随着Fable等新模型名称的出现以及性能等级的变动,给AI模型分类变得愈发困难,他询问社区是如何评估模型的。