@0xSero:终于搞定 GLM-5.1-505B-REAP-NVFP4,解码 45 tokens/s,预填充 1350 tokens/s,剪枝 32%,这是我跑通过最费劲的一次…

X AI KOLs Timeline 新闻

摘要

开发者 @0xSero 在优化版 GLM-5.1-505B 上通过 NVFP4 量化与 32% 剪枝实现高吞吐推理,解码速度 45 tokens/s,预填充速度 1350 tokens/s。

终于把 GLM-5.1-505B-REAP-NVFP4 跑起来了:解码 45 tokens/s,预填充 1350 tokens/s,剪枝 32%。这是我折腾模型以来最拼的一次。
查看原文
查看缓存全文

缓存时间: 2026/04/21 08:28

终于 GLM-5.1-505B-REAP-NVFP4 45 tokens/s 解码 1350 tokens/s 预填充 32% 剪枝
这是我为了跑起一个模型最拼命的一次

相似文章

消费级硬件上的 GLM 5.2

Reddit r/LocalLLaMA

一位用户在配备双 RTX 5090 的高端类消费级系统上测试了 unsloth 量化版 GLM-5.2 模型,达到了每秒 12 个 token。