nvfp4

标签

Cards List
#nvfp4

baseten/GLM-5.2-Vision-NVFP4

Hugging Face Models Trending ↗ · 2026-07-20 缓存

Baseten 发布了 GLM-5.2-Vision,这是一个视觉语言模型,通过训练好的 PatchMerger 投影器将 MoonViT 视觉编码器添加到 GLM-5.2,同时保持文本主干和视觉塔冻结。该模型被量化到 NVFP4,以在 Blackwell 硬件上进行高效推理。

0 人收藏 0 人点赞
#nvfp4

QUADS:通过量化误差双侧对齐稳定MoE的NVFP4强化学习

arXiv cs.LG ↗ · 2026-07-20 缓存

本文提出QUADS,一种通过对齐训练端和推理生成端的量化误差来稳定混合专家大语言模型的NVFP4强化学习的方法,实现了BF16级别的精度,并且吞吐量高于FP8。

0 人收藏 0 人点赞
#nvfp4

@MiaAI_lab: 运行更高效的 Gemma 4 31B IT NVFP4,轻松获得更强的智能体推理与工具调用能力 • 256k 上下文 • MTP • …

X AI KOLs Timeline ↗ · 2026-07-16 缓存

MiaAI Lab 发布了一份指南,用于通过 vLLM 以 NVFP4 量化方式运行 Google 的 Gemma 4 31B IT,支持 256k 上下文、MTP 推测解码、智能体推理、原生工具调用以及图像/视频支持。

0 人收藏 0 人点赞
#nvfp4

@MiaAI_lab: 刚刚为您的 2 台 DGX Sparks 升级了 DeepSeek v4 Flash。单次每秒 66.6 tokens,6 个并发会话时可达 153.7 tokens/秒……

X AI KOLs Timeline ↗ · 2026-07-15 缓存

MiaAI Lab 发布了一项升级方案,用于在两台 DGX Spark 节点上使用 vLLM 结合 DSpark 推测解码和 NVFP4 KV-cache 来部署 DeepSeek V4 Flash,在六个并发会话中实现了高达 153.7 tokens/秒 的吞吐量。

0 人收藏 0 人点赞
#nvfp4

@MichaelGannotti: https://x.com/MichaelGannotti/status/2076024719371841537

X AI KOLs Timeline ↗ · 2026-07-11 缓存

一份详细报告,关于在 NVIDIA DGX Spark 上优化生产环境 vLLM 服务配置,纠正了导致 MTP acceptance 降低 34% 的标志设置。该结论基于对 90 多份 NVIDIA 官方文档的审阅以及一次包含 69 个场景的工具评估。

0 人收藏 0 人点赞
#nvfp4

@no_stp_on_snek: 当所有人都在讨论 @SpaceXAI、@AnthropicAI 和 @OpenAI 的更新(但 @GoogleAI 呢?)... 我去测试了…

X AI KOLs Timeline ↗ · 2026-07-11 缓存

Unsloth 的 NVFP4 量化模型在 vLLM 和 llama.cpp 之间推理性能的详细比较,重点说明了 vLLM 在预填充速度上的优势,但 llama.cpp 在单流智能体工作负载中的解码和缓存优势。

0 人收藏 0 人点赞
#nvfp4

在 PrismaQuant 上对 RTX Pro 4500(使用 Oculink)的 INT4 Autoround 和 NVFP4 W4A4 量化模型的一些测试

Reddit r/LocalLLaMA ↗ · 2026-07-11

报告了在 PrismaQuant 上使用 Oculink 对 RTX Pro 4500 GPU 进行 INT4 Autoround 和 NVFP4 W4A4 量化模型的测试。

0 人收藏 0 人点赞
#nvfp4

在4块RTX 5060 Ti上,使用P2P和PP=4,对新的unslooth/Qwen3.6-27B-NVFP4在并发数为1、4、8、12和16下的基准测试

Reddit r/LocalLLaMA ↗ · 2026-07-11

unslooth/Qwen3.6-27B-NVFP4模型在4块RTX 5060 Ti GPU上,使用点对点(P2P)和流水线并行(PP)在不同并发级别下的基准测试结果。

0 人收藏 0 人点赞
#nvfp4

4-Bitter的教训:在NVFP4 RL中平衡稳定性与性能

Hacker News Top ↗ · 2026-07-10 缓存

本文介绍了一种低精度(NVFP4)强化学习训练的方法,平衡了吞吐量和稳定性,解决了前向和后向传播量化误差的问题。

0 人收藏 0 人点赞
#nvfp4

@0xkeenz: 有意思,昨天刚好还在研究 Unsloth 和 NVIDIA 的 Qwen3.6 27B NVFP4 有什么区别,结果今天 Unsloth 就更新了! 新版 Unsloth 的量化思路和 NVIDIA 官方方案很类似:不再从 BF16 和 …

X AI KOLs Timeline ↗ · 2026-07-10 缓存

Unsloth 发布新版 Qwen3.6 27B NVFP4 量化方案,引入 FP8_E4M3 中间精度层并细化权重保护,在 24GB VRAM 上实现 2.5 倍速度提升,同时改进准确性和工具调用能力。

0 人收藏 0 人点赞
#nvfp4

@mr_r0b0t: 叫上兄弟们,新的 @UnslothAI NVFP4 刚刚发布

X AI KOLs Following ↗ · 2026-07-10 缓存

Unsloth AI 发布了新的 NVFP4 量化 Qwen3.6 模型,在 GPU 上运行速度提升 2.5 倍,并提高了准确性和工具调用能力。

0 人收藏 0 人点赞
#nvfp4

2.5倍更快的Qwen3.6 NVFP4 Unsloth量化版本

Reddit r/LocalLLaMA ↗ · 2026-07-10

Unsloth推出使用NVFP4格式的量化Qwen3.6模型,推理速度提升2.5倍。

0 人收藏 0 人点赞
#nvfp4

@VukRosic99: NVFP4端到端训练发散。当前方案通过Hadamard变换、随机舍入、高精度层等方式修补,但牺牲了大部分加速优势。

X AI KOLs Timeline ↗ · 2026-07-10 缓存

Four Over Six(4/6)为NVFP4量化引入了自适应块缩放,以最小开销降低量化误差,同时改善了大语言模型的训练和训练后量化。

0 人收藏 0 人点赞
#nvfp4

@WescheNex1q: 16人同时与Qwen3.6-35B聊天,仅用一台DGX Spark。这是真实截图,并非模拟:您看到的每个token均…

X AI KOLs Timeline ↗ · 2026-07-09 缓存

一个实时演示展示了16个并发用户在同一台DGX Spark上与Qwen3.6-35B聊天,使用vLLM上的NVFP4 + MTP-3,达到总峰值440 tok/s,每用户105 tok/s。

0 人收藏 0 人点赞
#nvfp4

@RedHat_AI:红帽AI团队已为GLM-5.2创建量化检查点!https://huggingface.co/RedHatAI/GLM-5.2-NVF…

X AI KOLs Following ↗ · 2026-07-08 缓存

红帽AI团队使用NVFP4和FP8量化发布了GLM-5.2的量化检查点,模型体积减小超过70%,同时在GPQA上保持高精度。该量化模型与DSpark推测器配合使用,可实现vLLM上的高效部署。

0 人收藏 0 人点赞
#nvfp4

GLM-5.2在8×B200上的部署数学:没人详细说明的部分——NVFP4 + 2个TP=4副本比TP=8快约2倍,内含完整配置指导。

Reddit r/LocalLLaMA ↗ · 2026-07-07

本文为GLM-5.2在8×B200节点上提供了最佳部署配置,展示了使用两个TP=4副本的NVFP4方案相比FP8 TP=8方案可实现约2倍的吞吐量,并附有详细的性能数据和注意事项。

0 人收藏 0 人点赞
#nvfp4

@basecampbernie: https://x.com/basecampbernie/status/2074262192304832535

X AI KOLs Timeline ↗ · 2026-07-06 缓存

本文详细介绍了作者在GIGABYTE AI TOP ATOM(DGX Spark)工作站上运行NVFP4量化图像和视频生成模型的设置与基准测试,使用FLUX.2、Qwen-Image和LTX-2.3等模型(含同步音频的视频)取得了令人印象深刻的性能。

0 人收藏 0 人点赞
#nvfp4

@hotschmoe: 在阅读了这篇文章后,我决定让 nvfp4 在我的 Intel Arc B70s 上运行看看,12小时后,它的运行速度……

X AI KOLs Following ↗ · 2026-07-04 缓存

一位用户成功在 Intel Arc B70s GPU 上运行了 nvfp4 量化,相比其最佳的 int4 配置,实现了近乎两倍的速度和更高的精度,挑战了硬件特定的格式假设。

0 人收藏 0 人点赞
#nvfp4

后续:在四块DGX Spark上运行GLM-5.2 NVFP4——MTP谜题已解,现可在128K上下文下达到约24 tok/s

Reddit r/LocalLLaMA ↗ · 2026-07-03

修复了vLLM中为四块DGX Spark配置GLM-5.2 NVFP4时的一个推测解码bug,解决了性能权衡问题,通过MTP4在128K上下文下实现了约24 tok/s。

0 人收藏 0 人点赞
#nvfp4

@RayFernando1337:我需要什么硬件才能以不错的每秒token数跑通这个庞然大物?

X AI KOLs Following ↗ · 2026-06-27 缓存

一位用户询问服务GLM-5.2(NVFP4格式)所需的硬件要求,该格式现已被vLLM支持,具有减少的内存占用和保持的准确性。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈