标签
本文为GLM-5.2在8×B200节点上提供了最佳部署配置,展示了使用两个TP=4副本的NVFP4方案相比FP8 TP=8方案可实现约2倍的吞吐量,并附有详细的性能数据和注意事项。
本文详细介绍了作者在GIGABYTE AI TOP ATOM(DGX Spark)工作站上运行NVFP4量化图像和视频生成模型的设置与基准测试,使用FLUX.2、Qwen-Image和LTX-2.3等模型(含同步音频的视频)取得了令人印象深刻的性能。
一位用户成功在 Intel Arc B70s GPU 上运行了 nvfp4 量化,相比其最佳的 int4 配置,实现了近乎两倍的速度和更高的精度,挑战了硬件特定的格式假设。
修复了vLLM中为四块DGX Spark配置GLM-5.2 NVFP4时的一个推测解码bug,解决了性能权衡问题,通过MTP4在128K上下文下实现了约24 tok/s。
一位用户询问服务GLM-5.2(NVFP4格式)所需的硬件要求,该格式现已被vLLM支持,具有减少的内存占用和保持的准确性。
NVIDIA 发布了 GLM-5.2 的 NVFP4 量化检查点,这是一个 744B MoE 模型(40B 激活),针对推理和编码进行了优化,并在 SGLang 中提供 Day-0 支持。
NVIDIA 发布了基于智谱 GLM-5.2 模型量化而来的 NVFP4 精度版本,可通过 Hugging Face 免费层级 API 使用。
NVIDIA 发布了 GLM-5.2-NVFP4,这是 ZAI 的 GLM-5.2 MoE 语言模型的量化版本,使用 Model Optimizer 进行了优化,适用于 NVIDIA Blackwell GPU 上的推理。
一条推文介绍了微缩放/块量化格式(如NVFP4和MXFP4)的可视化工具,解释了这些低精度浮点数的工作原理以及它们在LLM推理中减少内存带宽需求的应用。
Luke Alonso 上传了一个 NVFP4 量化版本的 GLM 5.2(467GB),可适配 4 块 DGX Sparks 硬件,成本约 2 万美元。
在sm120上使用NVFP4 KV缓存量化显著提高了大语言模型的内存效率,使32GB VRAM系统在196k上下文大小下使用Qwen3.6-27B实现约60 tok/秒的推理速度。
一套现成的Docker配置,用于在4块RTX PRO 6000 Blackwell GPU上通过vLLM部署GLM-5.2-NVFP4-REAP-469B模型,包含详细说明和配置选项。
@onusoz 展示了在单一 DGX Spark(128GB统一内存)上运行16个并行实例的 NVIDIA 量化版 Gemma-4-26B-A4B-NVFP4 模型,合计达到300 tok/s,展示高并发能力且未使用 flashinfer。
对nvfp4和mxfp4格式的技术比较,强调nvfp4使用额外的张量级缩放因子来克服fp4的范围限制,从而可以在块级缩放因子上获得更高的精度。
一个对 vLLM 的拉取请求为 MiniMax M3 增加了张量并行度 3 的支持(使用其 NVFP4 量化),使得该模型可以在 3 台 DGX Sparks(每台 87GB 显存)上运行。
一条推文指出,经过 abliterated 处理、NVFP4 量化的 Gemma-4-12B 模型(7.7 GB)在实际任务中能够与 Qwen 3.6-35B 相媲美,同时在 Blackwell GPU 上运行快速,展现了显著的效率提升。
ScaleSweep提出了一种针对LLM的NVFP4训练后量化的新型块缩放初始化方法,通过遍历可行的块缩放候选值来提高精度。在Llama和Qwen模型上的实验表明,在激进量化下,该方法保留了超过93%的全精度性能。
对Google的Gemma-4-12B-it模型进行混合精度量化,使用NVFP4用于MLP权重,FP8用于注意力层,实现了25%更小的存储占用和更快的吞吐量,同时保持质量。
在RTX 5090上对Qwen3.6-27B进行的NVFP4基准测试显示,与同等比特的Q4_K_M相比,预填速度提升32-42%,与Q6_K相比提升52-68%,但解码速度提升有限(相比Q4提升+9%),因为解码受内存带宽限制。与Q6相比,质量损失极小(平均-0.8),使得NVFP4成为本地推理的不错选择。
作者介绍了一款开源的 GGUF 量化工具,用于 llama.cpp,能够创建 NVFP4 和 MXFP6 量化模型,并采用 RSF、张量提升、动态量化等先进技术,质量优于现有方法(如 ModelOpt)。