nvfp4

标签

Cards List
#nvfp4

@lmsysorg:NVIDIA 刚刚发布了来自 @Zai_org 的 GLM-5.2 的 NVFP4 检查点,这是一个用于推理和编码的 744B MoE(40B 激活)模型。Day-…

X AI KOLs Following ↗ · 2026-06-26 缓存

NVIDIA 发布了 GLM-5.2 的 NVFP4 量化检查点,这是一个 744B MoE 模型(40B 激活),针对推理和编码进行了优化,并在 SGLang 中提供 Day-0 支持。

0 人收藏 0 人点赞
#nvfp4

@geekbb: 通过 Hugging Face 用上了 nvidia/GLM-5.2-NVFP4,这是 NVIDIA 基于智谱 GLM-5.2 模型量化而来的 NVFP4 精度版本。我在想它至少应该比 deepseek-v4-flash 更强吧。 Hug…

X AI KOLs Timeline ↗ · 2026-06-26 缓存

NVIDIA 发布了基于智谱 GLM-5.2 模型量化而来的 NVFP4 精度版本,可通过 Hugging Face 免费层级 API 使用。

0 人收藏 0 人点赞
#nvfp4

nvidia/GLM-5.2-NVFP4

Hugging Face Models Trending ↗ · 2026-06-22 缓存

NVIDIA 发布了 GLM-5.2-NVFP4,这是 ZAI 的 GLM-5.2 MoE 语言模型的量化版本,使用 Model Optimizer 进行了优化,适用于 NVIDIA Blackwell GPU 上的推理。

0 人收藏 0 人点赞
#nvfp4

@charles_irl: 低精度浮点数很奇怪。我一直在推理/训练之外使用它们来建立直觉…

X AI KOLs Following ↗ · 2026-06-22 缓存

一条推文介绍了微缩放/块量化格式(如NVFP4和MXFP4)的可视化工具,解释了这些低精度浮点数的工作原理以及它们在LLM推理中减少内存带宽需求的应用。

0 人收藏 0 人点赞
#nvfp4

@TheAhmadOsman: Luke Alonso 已上传了一个 NVFP4 量化版本的 GLM 5.2,大小为 467GB,可适配 4 块 DGX Sparks(约 2 万美元)

X AI KOLs Following ↗ · 2026-06-20 缓存

Luke Alonso 上传了一个 NVFP4 量化版本的 GLM 5.2(467GB),可适配 4 块 DGX Sparks 硬件,成本约 2 万美元。

0 人收藏 0 人点赞
#nvfp4

在sm120上使用NVFP4 KV缓存量化将使32GB VRAM系统变得非常强大

Reddit r/LocalLLaMA ↗ · 2026-06-18

在sm120上使用NVFP4 KV缓存量化显著提高了大语言模型的内存效率,使32GB VRAM系统在196k上下文大小下使用Qwen3.6-27B实现约60 tok/秒的推理速度。

0 人收藏 0 人点赞
#nvfp4

@0xSero: 欢呼吧,各位6000系列爱好者。我们家里有GLM了

X AI KOLs Following ↗ · 2026-06-18 缓存

一套现成的Docker配置,用于在4块RTX PRO 6000 Blackwell GPU上通过vLLM部署GLM-5.2-NVFP4-REAP-469B模型,包含详细说明和配置选项。

0 人收藏 0 人点赞
#nvfp4

@onusoz: 16路并行 Gemma-4-26B-A4B-NVFP4 运行,每路18输出 token/s,合计300 tok/s 🫪 一台配备128GB统一内存的DGX Spark…

X AI KOLs Timeline ↗ · 2026-06-18 缓存

@onusoz 展示了在单一 DGX Spark(128GB统一内存)上运行16个并行实例的 NVIDIA 量化版 Gemma-4-26B-A4B-NVFP4 模型,合计达到300 tok/s,展示高并发能力且未使用 flashinfer。

0 人收藏 0 人点赞
#nvfp4

@zcbenz: nvfp4与mxfp4不仅仅是块大小和缩放格式的不同选择,nvfp4还使用了额外的张量级缩放因子…

X AI KOLs Timeline ↗ · 2026-06-17 缓存

对nvfp4和mxfp4格式的技术比较,强调nvfp4使用额外的张量级缩放因子来克服fp4的范围限制,从而可以在块级缩放因子上获得更高的精度。

0 人收藏 0 人点赞
#nvfp4

@MiaAI_lab: 一个针对 vLLM 的 PR,允许 MiniMax M3 使用 TP=3。它的 NVFP4 量化版本大小为 260GB - lukealonso/MiniMax-M3-NVFP4 希望这能...

X AI KOLs Timeline ↗ · 2026-06-14 缓存

一个对 vLLM 的拉取请求为 MiniMax M3 增加了张量并行度 3 的支持(使用其 NVFP4 量化),使得该模型可以在 3 台 DGX Sparks(每台 87GB 显存)上运行。

0 人收藏 0 人点赞
#nvfp4

@Tono_Ken3: 我注意到可能有另一个人也意识到,在实际工作中 gemma-4-12b 能够与 qwen3.6-35b 相媲美。是的……

X AI KOLs Timeline ↗ · 2026-06-14 缓存

一条推文指出,经过 abliterated 处理、NVFP4 量化的 Gemma-4-12B 模型(7.7 GB)在实际任务中能够与 Qwen 3.6-35B 相媲美,同时在 Blackwell GPU 上运行快速,展现了显著的效率提升。

0 人收藏 0 人点赞
#nvfp4

ScaleSweep:通过块缩放初始化实现LLM的NVFP4训练后量化精度提升

arXiv cs.LG ↗ · 2026-06-09 缓存

ScaleSweep提出了一种针对LLM的NVFP4训练后量化的新型块缩放初始化方法,通过遍历可行的块缩放候选值来提高精度。在Llama和Qwen模型上的实验表明,在激进量化下,该方法保留了超过93%的全精度性能。

0 人收藏 0 人点赞
#nvfp4

@SpaceTimeViking: 我有一个版本保持BF16注意力层,另一个混合精度量化使用NVFP4权重和FP8 At…

X AI KOLs Following ↗ · 2026-06-06 缓存

对Google的Gemma-4-12B-it模型进行混合精度量化,使用NVFP4用于MLP权重,FP8用于注意力层,实现了25%更小的存储占用和更快的吞吐量,同时保持质量。

0 人收藏 0 人点赞
#nvfp4

@witcheer:大家都说NVFP4让黑伟德显卡“更快”。我在我的5090上对Qwen3.6-27B进行了三种方式的基准测试:>NVFP4 >普通Q4_K…

X AI KOLs Timeline ↗ · 2026-06-05 缓存

在RTX 5090上对Qwen3.6-27B进行的NVFP4基准测试显示,与同等比特的Q4_K_M相比,预填速度提升32-42%,与Q6_K相比提升52-68%,但解码速度提升有限(相比Q4提升+9%),因为解码受内存带宽限制。与Q6相比,质量损失极小(平均-0.8),使得NVFP4成为本地推理的不错选择。

0 人收藏 0 人点赞
#nvfp4

这是我的 llama.cpp NVFP4/MXFP6 GGUF 量化工具

Reddit r/LocalLLaMA ↗ · 2026-06-05

作者介绍了一款开源的 GGUF 量化工具,用于 llama.cpp,能够创建 NVFP4 和 MXFP6 量化模型,并采用 RSF、张量提升、动态量化等先进技术,质量优于现有方法(如 ModelOpt)。

0 人收藏 0 人点赞
#nvfp4

@nrehiew_:献给视觉学习者

X AI KOLs Timeline ↗ · 2026-06-05 缓存

一条推文线程,回顾了论文《使用NVFP4预训练大型语言模型》并讨论了NVFP4预训练,特别是针对NVIDIA Blackwell。

0 人收藏 0 人点赞
#nvfp4

@TheAhmadOsman: 我的朋友Jensen正在提供前沿开源智能(极其高效),正如他所说…

X AI KOLs Following ↗ · 2026-06-01 缓存

Jensen Huang暗示将发布更多Nemotron模型,强调通过NVFP4训练实现的开源前沿智能和成本效益。

0 人收藏 0 人点赞
#nvfp4

@vllm_project: vLLM v0.22.0 发布了!来自 230 位贡献者(63 位新人)的 459 次提交。亮点:DeepSeek V4 加固(NVFP4 融合 MoE,fu…

X AI KOLs Timeline ↗ · 2026-05-30 缓存

vLLM v0.22.0 发布,包含 459 次提交,主要特点包括 DeepSeek V4 加固、实验性 Rust 前端、以及批次不变的 Cutlass FP8,端到端延迟降低 28.9%。

0 人收藏 0 人点赞
#nvfp4

@mr_r0b0t:官方 @NVIDIAAI GLM5.1-NVFP4 在 @huggingface 上被发现

X AI KOLs Timeline ↗ · 2026-05-28 缓存

NVIDIA 发布了 GLM-5.1-NVFP4,这是 ZAI 的 GLM-5.1 模型的量化版本,总参数 754B(激活参数 40B),在 Hugging Face 上以 MIT 许可证提供。

0 人收藏 0 人点赞
#nvfp4

@mr_r0b0t: 16个本地AI代理同时流式传输!MiniMax M2.7 NVFP4 — 2x GB10,没有云API。

X AI KOLs Timeline ↗ · 2026-05-25 缓存

演示展示了使用MiniMax M2.7 NVFP4在两个Nvidia GB10芯片上同时流式传输16个本地AI代理,无需云API。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈