你们还记得蛇模型测试吗?

Reddit r/LocalLLaMA 新闻

摘要

这篇文章回顾了三年前AI模型的快速进展,比较了像Bard这样在编码测试中挣扎的早期模型与当前的Qwen 27B和Opus 5.5,并对未来的发展进行了推测。

刚看了一个三年前的视频,其中Matt Berman测试了Bard(是的,还记得Bard吗?)大部分测试像是总结或逻辑测试。如果涉及到编码,就是蛇测试或者Pong,而三年前的那些模型几乎都做不对。现在用本地部署的Qwen 27B或者订阅的Opus 5.5,差距就太大了。我在想三年后我会用什么样的眼睛来看这篇文章。可能是机器人的眼睛。
查看原文

相似文章