nvfp4

标签

Cards List
#nvfp4

GLM-5.2在8×B200上的部署数学:没人详细说明的部分——NVFP4 + 2个TP=4副本比TP=8快约2倍,内含完整配置指导。

Reddit r/LocalLLaMA · 2026-07-07

本文为GLM-5.2在8×B200节点上提供了最佳部署配置,展示了使用两个TP=4副本的NVFP4方案相比FP8 TP=8方案可实现约2倍的吞吐量,并附有详细的性能数据和注意事项。

0 人收藏 0 人点赞
#nvfp4

@basecampbernie: https://x.com/basecampbernie/status/2074262192304832535

X AI KOLs Timeline · 2026-07-06 缓存

本文详细介绍了作者在GIGABYTE AI TOP ATOM(DGX Spark)工作站上运行NVFP4量化图像和视频生成模型的设置与基准测试,使用FLUX.2、Qwen-Image和LTX-2.3等模型(含同步音频的视频)取得了令人印象深刻的性能。

0 人收藏 0 人点赞
#nvfp4

@hotschmoe: 在阅读了这篇文章后,我决定让 nvfp4 在我的 Intel Arc B70s 上运行看看,12小时后,它的运行速度……

X AI KOLs Following · 2026-07-04 缓存

一位用户成功在 Intel Arc B70s GPU 上运行了 nvfp4 量化,相比其最佳的 int4 配置,实现了近乎两倍的速度和更高的精度,挑战了硬件特定的格式假设。

0 人收藏 0 人点赞
#nvfp4

后续:在四块DGX Spark上运行GLM-5.2 NVFP4——MTP谜题已解,现可在128K上下文下达到约24 tok/s

Reddit r/LocalLLaMA · 2026-07-03

修复了vLLM中为四块DGX Spark配置GLM-5.2 NVFP4时的一个推测解码bug,解决了性能权衡问题,通过MTP4在128K上下文下实现了约24 tok/s。

0 人收藏 0 人点赞
#nvfp4

@RayFernando1337:我需要什么硬件才能以不错的每秒token数跑通这个庞然大物?

X AI KOLs Following · 2026-06-27 缓存

一位用户询问服务GLM-5.2(NVFP4格式)所需的硬件要求,该格式现已被vLLM支持,具有减少的内存占用和保持的准确性。

0 人收藏 0 人点赞
#nvfp4

@lmsysorg:NVIDIA 刚刚发布了来自 @Zai_org 的 GLM-5.2 的 NVFP4 检查点,这是一个用于推理和编码的 744B MoE(40B 激活)模型。Day-…

X AI KOLs Following · 2026-06-26 缓存

NVIDIA 发布了 GLM-5.2 的 NVFP4 量化检查点,这是一个 744B MoE 模型(40B 激活),针对推理和编码进行了优化,并在 SGLang 中提供 Day-0 支持。

0 人收藏 0 人点赞
#nvfp4

@geekbb: 通过 Hugging Face 用上了 nvidia/GLM-5.2-NVFP4,这是 NVIDIA 基于智谱 GLM-5.2 模型量化而来的 NVFP4 精度版本。我在想它至少应该比 deepseek-v4-flash 更强吧。 Hug…

X AI KOLs Timeline · 2026-06-26 缓存

NVIDIA 发布了基于智谱 GLM-5.2 模型量化而来的 NVFP4 精度版本,可通过 Hugging Face 免费层级 API 使用。

0 人收藏 0 人点赞
#nvfp4

nvidia/GLM-5.2-NVFP4

Hugging Face Models Trending · 2026-06-22 缓存

NVIDIA 发布了 GLM-5.2-NVFP4,这是 ZAI 的 GLM-5.2 MoE 语言模型的量化版本,使用 Model Optimizer 进行了优化,适用于 NVIDIA Blackwell GPU 上的推理。

0 人收藏 0 人点赞
#nvfp4

@charles_irl: 低精度浮点数很奇怪。我一直在推理/训练之外使用它们来建立直觉…

X AI KOLs Following · 2026-06-22 缓存

一条推文介绍了微缩放/块量化格式(如NVFP4和MXFP4)的可视化工具,解释了这些低精度浮点数的工作原理以及它们在LLM推理中减少内存带宽需求的应用。

0 人收藏 0 人点赞
#nvfp4

@TheAhmadOsman: Luke Alonso 已上传了一个 NVFP4 量化版本的 GLM 5.2,大小为 467GB,可适配 4 块 DGX Sparks(约 2 万美元)

X AI KOLs Following · 2026-06-20 缓存

Luke Alonso 上传了一个 NVFP4 量化版本的 GLM 5.2(467GB),可适配 4 块 DGX Sparks 硬件,成本约 2 万美元。

0 人收藏 0 人点赞
#nvfp4

在sm120上使用NVFP4 KV缓存量化将使32GB VRAM系统变得非常强大

Reddit r/LocalLLaMA · 2026-06-18

在sm120上使用NVFP4 KV缓存量化显著提高了大语言模型的内存效率,使32GB VRAM系统在196k上下文大小下使用Qwen3.6-27B实现约60 tok/秒的推理速度。

0 人收藏 0 人点赞
#nvfp4

@0xSero: 欢呼吧,各位6000系列爱好者。我们家里有GLM了

X AI KOLs Following · 2026-06-18 缓存

一套现成的Docker配置,用于在4块RTX PRO 6000 Blackwell GPU上通过vLLM部署GLM-5.2-NVFP4-REAP-469B模型,包含详细说明和配置选项。

0 人收藏 0 人点赞
#nvfp4

@onusoz: 16路并行 Gemma-4-26B-A4B-NVFP4 运行,每路18输出 token/s,合计300 tok/s 🫪 一台配备128GB统一内存的DGX Spark…

X AI KOLs Timeline · 2026-06-18 缓存

@onusoz 展示了在单一 DGX Spark(128GB统一内存)上运行16个并行实例的 NVIDIA 量化版 Gemma-4-26B-A4B-NVFP4 模型,合计达到300 tok/s,展示高并发能力且未使用 flashinfer。

0 人收藏 0 人点赞
#nvfp4

@zcbenz: nvfp4与mxfp4不仅仅是块大小和缩放格式的不同选择,nvfp4还使用了额外的张量级缩放因子…

X AI KOLs Timeline · 2026-06-17 缓存

对nvfp4和mxfp4格式的技术比较,强调nvfp4使用额外的张量级缩放因子来克服fp4的范围限制,从而可以在块级缩放因子上获得更高的精度。

0 人收藏 0 人点赞
#nvfp4

@MiaAI_lab: 一个针对 vLLM 的 PR,允许 MiniMax M3 使用 TP=3。它的 NVFP4 量化版本大小为 260GB - lukealonso/MiniMax-M3-NVFP4 希望这能...

X AI KOLs Timeline · 2026-06-14 缓存

一个对 vLLM 的拉取请求为 MiniMax M3 增加了张量并行度 3 的支持(使用其 NVFP4 量化),使得该模型可以在 3 台 DGX Sparks(每台 87GB 显存)上运行。

0 人收藏 0 人点赞
#nvfp4

@Tono_Ken3: 我注意到可能有另一个人也意识到,在实际工作中 gemma-4-12b 能够与 qwen3.6-35b 相媲美。是的……

X AI KOLs Timeline · 2026-06-14 缓存

一条推文指出,经过 abliterated 处理、NVFP4 量化的 Gemma-4-12B 模型(7.7 GB)在实际任务中能够与 Qwen 3.6-35B 相媲美,同时在 Blackwell GPU 上运行快速,展现了显著的效率提升。

0 人收藏 0 人点赞
#nvfp4

ScaleSweep:通过块缩放初始化实现LLM的NVFP4训练后量化精度提升

arXiv cs.LG · 2026-06-09 缓存

ScaleSweep提出了一种针对LLM的NVFP4训练后量化的新型块缩放初始化方法,通过遍历可行的块缩放候选值来提高精度。在Llama和Qwen模型上的实验表明,在激进量化下,该方法保留了超过93%的全精度性能。

0 人收藏 0 人点赞
#nvfp4

@SpaceTimeViking: 我有一个版本保持BF16注意力层,另一个混合精度量化使用NVFP4权重和FP8 At…

X AI KOLs Following · 2026-06-06 缓存

对Google的Gemma-4-12B-it模型进行混合精度量化,使用NVFP4用于MLP权重,FP8用于注意力层,实现了25%更小的存储占用和更快的吞吐量,同时保持质量。

0 人收藏 0 人点赞
#nvfp4

@witcheer:大家都说NVFP4让黑伟德显卡“更快”。我在我的5090上对Qwen3.6-27B进行了三种方式的基准测试:>NVFP4 >普通Q4_K…

X AI KOLs Timeline · 2026-06-05 缓存

在RTX 5090上对Qwen3.6-27B进行的NVFP4基准测试显示,与同等比特的Q4_K_M相比,预填速度提升32-42%,与Q6_K相比提升52-68%,但解码速度提升有限(相比Q4提升+9%),因为解码受内存带宽限制。与Q6相比,质量损失极小(平均-0.8),使得NVFP4成为本地推理的不错选择。

0 人收藏 0 人点赞
#nvfp4

这是我的 llama.cpp NVFP4/MXFP6 GGUF 量化工具

Reddit r/LocalLLaMA · 2026-06-05

作者介绍了一款开源的 GGUF 量化工具,用于 llama.cpp,能够创建 NVFP4 和 MXFP6 量化模型,并采用 RSF、张量提升、动态量化等先进技术,质量优于现有方法(如 ModelOpt)。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈