令牌在吃我的钱包,所以我试了 GLM5.2,并将其与 Fable 5 和 Opus 4.8 进行比较
摘要
一位开发者在 OpenRouter 上比较了 GLM 5.2 与 Fable 5 和 Opus 4.8,发现 GLM 5.2 在代码审计和审查方面成本效益高,但由于测试-错误-编辑成本的累积,不适合长时间的无人值守构建。
我的 Claude Code 账单一直在悄悄上涨,而我的信息流里也充斥着 GLM 5.2 的评测,于是我在 OpenRouter 上充值了 5 美元,在我最熟悉的代码库上跑了一次:我自己的开源 SDK。设置真的就 5 行配置(ANTHROPIC_BASE_URL + AUTH_TOKEN 指向 OpenRouter,模型变量设置为 z-ai/glm-5.2)。Claude Code 并不关心 API 格式背后是什么。我学到了两件在追捧帖子里没看到的事:固定提供商,否则你的测试毫无意义。同一模型名称在 OpenRouter 上由十几个主机提供服务,其中一些便宜的版本是经过量化的。我固定了 Z.ai 第一方服务,并关闭了回退。如果你使用自动路由,你可能会在不知情的情况下测试一个压缩副本。读/构建的成本拆分才是真正的故事。架构审计(41 个文件,每个声明都附带了文件+行号,我用 grep 检查时所有引用都正确)花费 0.59 美元,耗时 6 分钟。我根据它自己的审计分配的任务(修复一个组件漂移 bug、生成一个清单、编写一个保护测试)成功了,92 个测试全部通过,但花费了 4 美元。几乎全部成本都来自大约 300 次测试-错误-编辑循环,而不是代码变更本身。有一个习惯我想推荐给任何尝试的人:我先清理了仓库。只复制了公开部分,对副本用关键词(billing、tenant 等)进行 grep,零命中,然后才发送。模型便宜并不意味着私人代码可以去任何地方。我的结论比“它能取代 Claude”更窄:对于读取、审查和审计,它确实物超所值,我现在会特地使用它。对于长时间的无人值守构建,价格差距很快就会缩小,我选择前沿模型的理由又回来了。如果谁想要,我很乐意分享确切的设置模块。关于使用更便宜的中国模型有什么看法?希望从社区了解更多,以及我是否应该切换 < 令牌在吃我的钱包 >
相似文章
@thoughtfullab: GLM 5.2 比 Opus 4.8 便宜 5 倍,比 Fable 5 便宜 11 倍,却在 PostTrainBench 上名列前茅。这令人兴奋,因为更低的成本……
GLM 5.2 在 PostTrainBench 上表现最佳,同时比 Opus 4.8 便宜 5 倍,比 Fable 5 便宜 11 倍,使个性化 AI 对企业和国家来说经济上可行。
GLM 5.2 对比 Opus
GLM 5.2 是 Z.ai 推出的全新开放权重模型,与 Claude Opus 在 3D 游戏编码任务中进行了对比。Opus 性能更快更清晰,但 GLM 5.2 在成本和易用性上具有显著优势。
@TheAhmadOsman: GPT 5.5 优于 GLM 5.2,但 GLM 5.2 优于 Opus 4.8
一则对比,指出 GPT 5.5 性能优于 GLM 5.2,而 GLM 5.2 又优于 Opus 4.8。
@_MaxBlade: 我简直不敢相信我现在会这么说……但 open code 中的 GLM 5.2 在 claude code 中碾压 opus 4.8。这是怎么……
一位用户声称,开源模型 GLM 5.2 在 Claude Code 中的编码任务表现优于 Opus 4.8,并表达了难以置信。
@omarsar0: GLM-5.2 在设计方面非常出色(在我看来达到了 Opus 级别)。我也开始看到在长时间运行的任务上取得了很好的结果。如何……
GLM-5.2 是一款具有 Opus 级别设计能力的开放权重模型,它集成了通过强化学习训练的反奖励破解模块,以减轻奖励破解问题并提升长时间运行任务的性能。