GLM-5.2的人类评估
摘要
作者称赞GLM-5.2(一个MIT开源权重模型)在人类评估基准中表现出色,声称其能与Claude等最佳闭源模型相媲美。
我见过很多基准测试将GLM-5.2排在许多闭源替代方案之后,但紧随其后。我当时想,下一个版本的GLM将完全达到目前最前沿的水平。过去几天我在一个实际项目上测试了它,在我看来它基本上就是神级。我希望能在本地运行它,但我看到周围有些硬件大神能做到。今天我第一次看到Design Arena的排行榜,OpenRouter的基准测试数字就是基于这个的……而且它是基于人类投票的!你可以在那里插入Doner kebab测试,并投票选出看起来最美味的🍢游戏开发方面,GLM-5.2仅落后Fable 5一步。几乎在每个类别中,GLM-5.2都在大杀四方。在某些测试中,它紧随Fable之后,而Fable实际上已经MIA(失踪)了。因此,GLM-5.2,这个MIT开源权重模型……在我看来,与Claude今天拥有的最佳模型相当😳👏 我觉得我们赢了。所以我想大多数标准化基准测试真的不再反映实际性能了,要么是因为它们基于旧的假设/期望,要么就是公然被操纵了。
相似文章
GLM-5.2 是 Artificial Analysis 上新的领先开源权重模型
智谱AI的GLM-5.2已成为Artificial Analysis Intelligence Index上新的领先开源权重模型,得分为51,超越了MiniMax-M3和DeepSeek V4 Pro等竞争对手。该模型拥有744B总参数、40B活跃参数、MIT许可证和1M上下文窗口。
GLM-5.2 是首个在 Terminal-Bench 上突破 80% 的开源权重模型,超越了所有其他开源模型。
GLM-5.2 是首个在 Terminal-Bench 上超过 80% 的开源权重模型,超越了所有其他开源模型乃至 Gemini,使其以极低的成本成为前沿水准的模型。
GLM-5.2 刚发布开放权重,在编程方面已经异常强大
GLM-5.2 已以 MIT 许可证发布开放权重,拥有 100 万上下文窗口和两种推理努力模式。早期基准测试显示它在编程任务中表现出色,值得在基准截图之外进行测试。
@haider1: GLM 5.2 感觉像是开放权重模型的 opus 4.5 时刻,真正让我印象深刻的是在长时间、多步骤的…
GLM 5.2 标志着开放权重模型的一个重要里程碑,展示了在长多步骤任务中强大的上下文保留能力以及更可靠的工具调用。
GLM-5.2 为开放模型树立更高标杆(14分钟阅读)
GLM-5.2 是一款新的开源AI模型,为开放模型树立了高标准,但仍在追赶专有前沿模型,并且缺乏一些功能,如视觉功能。