GLM-5.2的人类评估

Reddit r/LocalLLaMA 模型

摘要

作者称赞GLM-5.2(一个MIT开源权重模型)在人类评估基准中表现出色,声称其能与Claude等最佳闭源模型相媲美。

我见过很多基准测试将GLM-5.2排在许多闭源替代方案之后,但紧随其后。我当时想,下一个版本的GLM将完全达到目前最前沿的水平。过去几天我在一个实际项目上测试了它,在我看来它基本上就是神级。我希望能在本地运行它,但我看到周围有些硬件大神能做到。今天我第一次看到Design Arena的排行榜,OpenRouter的基准测试数字就是基于这个的……而且它是基于人类投票的!你可以在那里插入Doner kebab测试,并投票选出看起来最美味的🍢游戏开发方面,GLM-5.2仅落后Fable 5一步。几乎在每个类别中,GLM-5.2都在大杀四方。在某些测试中,它紧随Fable之后,而Fable实际上已经MIA(失踪)了。因此,GLM-5.2,这个MIT开源权重模型……在我看来,与Claude今天拥有的最佳模型相当😳👏 我觉得我们赢了。所以我想大多数标准化基准测试真的不再反映实际性能了,要么是因为它们基于旧的假设/期望,要么就是公然被操纵了。
查看原文

相似文章

GLM-5.2 是 Artificial Analysis 上新的领先开源权重模型

Hacker News Top

智谱AI的GLM-5.2已成为Artificial Analysis Intelligence Index上新的领先开源权重模型,得分为51,超越了MiniMax-M3和DeepSeek V4 Pro等竞争对手。该模型拥有744B总参数、40B活跃参数、MIT许可证和1M上下文窗口。