@RayFernando1337:我需要什么硬件才能以不错的每秒token数跑通这个庞然大物?
摘要
一位用户询问服务GLM-5.2(NVFP4格式)所需的硬件要求,该格式现已被vLLM支持,具有减少的内存占用和保持的准确性。
查看缓存全文
缓存时间: 2026/06/29 02:25
我需要什么硬件才能让这个庞然大物以可观的 token/s 运行?
vLLM (@vllm_project): GLM-5.2 的 NVFP4 版本已经在 vLLM 中准备就绪 🚀
@NVIDIAAI 在 Blackwell 上发布的 GLM-5.2 官方 NVFP4 检查点相比 FP8 大幅减少了内存占用,同时在推理、编程和长上下文基准测试中保持了相同的准确率。
今天即可用以下命令部署: vllm serve nvidia/GLM-5.2-NVFP4
相似文章
@0xSero:我们找到了一种在 vLLM 中以完整上下文运行 GLM-5.2 且无需剪枝的方法。 - 前 32 个专家使用 NVFP4 - 其余使用 fp3 - intel auto…
一位社区研究员通过混合量化(NVFP4、NF3、MXFP8),在无需剪枝的情况下,在 vLLM 中运行了 GLM-5.2(753B 参数,全部 256 个专家),可在 4×96GB GPU 上运行,拥有约 307k KV 缓存,精度接近 FP8。
消费级硬件上的 GLM 5.2
一位用户在配备双 RTX 5090 的高端类消费级系统上测试了 unsloth 量化版 GLM-5.2 模型,达到了每秒 12 个 token。
16块AMD MI50 32GB:GLM-5.2 Q4 在 llama.cpp RPC 上以 12.2 tok/s 运行
描述了在由16块AMD MI50 GPU组成的集群上,使用llama.cpp的RPC以4位量化运行GLM-5.2模型,达到12.2令牌每秒的速度,并在10.7k上下文中实现了连贯的长文本生成。
GLM5.2 @7tg 在预算主板+CPU上使用4x3090+192GB
在预算配置下,使用4块RTX 3090 GPU和192GB内存运行GLM5.2,处理7万亿tokens。
@ErickSky: 忘掉vLLM、llama.cpp和昂贵的GPU吧。[colibri] 这个工具用纯C语言在约25GB RAM上运行GLM-5.2 (744B MoE)…
colibri 是一个纯C语言推理工具,通过从磁盘流式传输专家模型,在约25GB RAM上运行GLM-5.2 744B MoE模型,无需昂贵的GPU。