GLM-5.2 UD-IQ1_M 在 llama.cpp 上的运行 — 5090 + 3090 Ti 速度测试 (~ 579 t/s 预填充 @ 8k 上下文, ~324 t/s 预填充 @ 57k 上下文, ~10.6 t/s 解码)

Reddit r/LocalLLaMA 新闻

摘要

GLM-5.2 在 llama.cpp 上使用 RTX 5090 和 RTX 3090 Ti 运行的速度测试结果,显示在 8k 上下文中预填充速度高达 579 t/s,解码速度约为 10.6 t/s。

分享一些 GLM-5.2 在 llama.cpp 上运行的速度测试数据。 硬件配置: 模型:unsloth/GLM-5.2-GGUF,UD-IQ1_M 量化 GPU:RTX 5090 + RTX 3090 Ti 使用 186 GB DDR5 内存 系统:Debian 13,CUDA 13.3 上下文长度:128k,q8_0 KV 缓存 预填充(提示处理): n_tokens tokens/s 8,201 579.75 16,393 522.28 24,585 468.21 32,777 422.61 40,969 384.43 49,161 351.90 57,353 324.48 解码(生成): 在超过 580 个解码 token 时稳定在约 10.6 t/s。在 60k 上下文中为 9.37 t/s。 启动命令: llama-server \ -m GLM-5.2-UD-IQ1_M.gguf \ -fa 1 \ --fit off \ --tensor-split 100,0 \ --override-tensor "blk\.[0-3]\.(ffn_(up|down|gate)_exps\.weight)=CUDA0,blk\.([4-9]|10])\.(ffn_(up|down|gate)_exps\.weight)=CUDA1,blk\.11\.(ffn_down_exps\.weight)=CUDA1" \ --main-gpu 0 \ --n-cpu-moe 99 \ --no-mmap \ --mlock \ --cpu-range 0-23 \ --cpu-range-batch 0-23 \ --ctx-size 131072 \ --parallel 1 \ --jinja --no-warmup --threads 24 --numa isolate \ --batch-size 8192 --ubatch-size 8192 --threads-batch 24 \ -cms 24000 \ -ctxcp 5 \ --cache-type-k q8_0 --cache-type-v q8_0 \ --alias glm.5.2 \ --host 0.0.0.0 --port 8080
查看原文

相似文章