16块AMD MI50 32GB:GLM-5.2 Q4 在 llama.cpp RPC 上以 12.2 tok/s 运行

Reddit r/LocalLLaMA 模型

摘要

描述了在由16块AMD MI50 GPU组成的集群上,使用llama.cpp的RPC以4位量化运行GLM-5.2模型,达到12.2令牌每秒的速度,并在10.7k上下文中实现了连贯的长文本生成。

GLM-5.2 UD-Q4_K_XL GGUF @ 12.2 tok/s 输出 // 30.9 tok/s 输入,在一个真实的10.7k令牌文档上使用llama.cpp RPC - 在10.7k上下文下:10.2 tok/s 输出,生成长文本时保持连贯 两个并行请求:14.5 tok/s 聚合 上下文:2个16,384令牌槽 模型大小:436 GiB 硬件:16块AMD MI50 32GB,共512GB,每块VRAM功耗上限100W,分布在两个8-GPU节点上 互连:直接10 GbE DAC,MTU 9000 在llama.cpp之前,花费了大量时间将GLM-5.2 AWQ INT4集成到自定义的vLLM-gfx906 v19 Moby Dick构建中,使用TP=8和PP=2。解码速度达到14 t/s,预填充速度50 t/s,但在超过10k时推理性能下降。还没空处理MTP相关的事情。希望有人能成功让Moby Dick仓库与之兼容运行。
查看原文

相似文章

消费级硬件上的 GLM 5.2

Reddit r/LocalLLaMA

一位用户在配备双 RTX 5090 的高端类消费级系统上测试了 unsloth 量化版 GLM-5.2 模型,达到了每秒 12 个 token。