@RayFernando1337:我需要什么硬件才能以不错的每秒token数跑通这个庞然大物?

X AI KOLs Following 模型

摘要

一位用户询问服务GLM-5.2(NVFP4格式)所需的硬件要求,该格式现已被vLLM支持,具有减少的内存占用和保持的准确性。

我需要什么硬件才能以不错的每秒token数跑通这个庞然大物?
查看原文
查看缓存全文

缓存时间: 2026/06/29 02:25

我需要什么硬件才能让这个庞然大物以可观的 token/s 运行?

vLLM (@vllm_project): GLM-5.2 的 NVFP4 版本已经在 vLLM 中准备就绪 🚀

@NVIDIAAI 在 Blackwell 上发布的 GLM-5.2 官方 NVFP4 检查点相比 FP8 大幅减少了内存占用,同时在推理、编程和长上下文基准测试中保持了相同的准确率。

今天即可用以下命令部署: vllm serve nvidia/GLM-5.2-NVFP4

相似文章

消费级硬件上的 GLM 5.2

Reddit r/LocalLLaMA

一位用户在配备双 RTX 5090 的高端类消费级系统上测试了 unsloth 量化版 GLM-5.2 模型,达到了每秒 12 个 token。