令牌在吃我的钱包,所以我试了 GLM5.2,并将其与 Fable 5 和 Opus 4.8 进行比较

Reddit r/ArtificialInteligence 模型

摘要

一位开发者在 OpenRouter 上比较了 GLM 5.2 与 Fable 5 和 Opus 4.8,发现 GLM 5.2 在代码审计和审查方面成本效益高,但由于测试-错误-编辑成本的累积,不适合长时间的无人值守构建。

我的 Claude Code 账单一直在悄悄上涨,而我的信息流里也充斥着 GLM 5.2 的评测,于是我在 OpenRouter 上充值了 5 美元,在我最熟悉的代码库上跑了一次:我自己的开源 SDK。设置真的就 5 行配置(ANTHROPIC_BASE_URL + AUTH_TOKEN 指向 OpenRouter,模型变量设置为 z-ai/glm-5.2)。Claude Code 并不关心 API 格式背后是什么。我学到了两件在追捧帖子里没看到的事:固定提供商,否则你的测试毫无意义。同一模型名称在 OpenRouter 上由十几个主机提供服务,其中一些便宜的版本是经过量化的。我固定了 Z.ai 第一方服务,并关闭了回退。如果你使用自动路由,你可能会在不知情的情况下测试一个压缩副本。读/构建的成本拆分才是真正的故事。架构审计(41 个文件,每个声明都附带了文件+行号,我用 grep 检查时所有引用都正确)花费 0.59 美元,耗时 6 分钟。我根据它自己的审计分配的任务(修复一个组件漂移 bug、生成一个清单、编写一个保护测试)成功了,92 个测试全部通过,但花费了 4 美元。几乎全部成本都来自大约 300 次测试-错误-编辑循环,而不是代码变更本身。有一个习惯我想推荐给任何尝试的人:我先清理了仓库。只复制了公开部分,对副本用关键词(billing、tenant 等)进行 grep,零命中,然后才发送。模型便宜并不意味着私人代码可以去任何地方。我的结论比“它能取代 Claude”更窄:对于读取、审查和审计,它确实物超所值,我现在会特地使用它。对于长时间的无人值守构建,价格差距很快就会缩小,我选择前沿模型的理由又回来了。如果谁想要,我很乐意分享确切的设置模块。关于使用更便宜的中国模型有什么看法?希望从社区了解更多,以及我是否应该切换 < 令牌在吃我的钱包 >
查看原文

相似文章

GLM 5.2 对比 Opus

Hacker News Top

GLM 5.2 是 Z.ai 推出的全新开放权重模型,与 Claude Opus 在 3D 游戏编码任务中进行了对比。Opus 性能更快更清晰,但 GLM 5.2 在成本和易用性上具有显著优势。