@AstroHanRay: 对比了下,Ollama Cloud 的 tokens/s 比 http://Z.ai 的 Max 套餐高 40%,首字延迟更是低非常多,流式输出几乎秒回。 各家套餐都用下来,我还是觉得 Ollama Cloud 是使用 GLM-5.2 的…

X AI KOLs Timeline 工具

摘要

AstroHanRay 对比了 Ollama Cloud 和 Z.ai Max 套餐,发现 Ollama Cloud 在吞吐量和首字延迟上明显优于 Z.ai,推荐使用 Ollama Cloud 运行 GLM-5.2 模型。

对比了下,Ollama Cloud 的 tokens/s 比 https://t.co/77Gy4q0tbu 的 Max 套餐高 40%,首字延迟更是低非常多,流式输出几乎秒回。 各家套餐都用下来,我还是觉得 Ollama Cloud 是使用 GLM-5.2 的最佳选择,吞吐快,延迟低,用量大。 https://t.co/B3pcD6Oqsw
查看原文
查看缓存全文

缓存时间: 2026/07/06 02:01

对比了下,Ollama Cloud 的 tokens/s 比 https://t.co/77Gy4q0tbu 的 Max 套餐高 40%,首字延迟更是低非常多,流式输出几乎秒回。

各家套餐都用下来,我还是觉得 Ollama Cloud 是使用 GLM-5.2 的最佳选择,吞吐快,延迟低,用量大。 https://t.co/B3pcD6Oqsw

AstroHan (@AstroHanRay): 如果要用 GLM-5.2, Ollama Cloud Pro 个人测试下面是市面上的最佳选择了,量大管饱,20 美金非多并发基本上用不完。

同价位下的 https://t.co/77Gy4q0tbu 海外套餐性价比完全比不过,而且还有北京时间 14:00-18:00 的三倍消耗,会比较影响效率。

另外,GLM-5.2 是个好模型!

相似文章

@0xcherry: https://x.com/0xcherry/status/2067610347633025281

X AI KOLs Timeline

本文分析智谱GLM-5.2性能飞跃的原因,认为其40B激活参数在扣除固定开销后提供更大有效容量,使RL后训练更有效;同时回顾中国AI模型发展史,指出大模型路线最终获胜。