nvfp4

标签

Cards List
#nvfp4

[2606.05682] 超越输出匹配:在NVFP4 LLM蒸馏中保持内部几何结构

Reddit r/LocalLLaMA · 21小时前 缓存

本文研究了针对NVFP4低精度大语言模型的量化感知蒸馏,并发现仅使用KL损失的输出匹配可能掩盖内部表征漂移。作者提出了CKA-QAD,通过CKA引导的对齐来保持内部几何结构,从而提升了紧凑模型在推理和编码任务上的准确性。

0 人收藏 0 人点赞
#nvfp4

sakamakismile/Qwen3-VL-32B-Heretic-MiniMax-H3-NVFP4

Hugging Face Models Trending · 6天前 缓存

发布一个NVFP4量化的无审查MiniMax-H3文本编码器(Qwen3-VL-32B Heretic),可适配在单张16GB GPU上,并可作为ComfyUI工作流中的直接替代品。

0 人收藏 0 人点赞
#nvfp4

unsloth/Qwen3.6-27B-NVFP4 vs. Intel/Qwen3.6-27B-int4-AutoRound vs. nvidia/Qwen3.6-27B-NVFP4 —— 该选哪一个?

Reddit r/LocalLLaMA · 2026-07-30

本文比较了 Qwen3.6-27B 的三种量化变体(Unsloth 和 Nvidia 的 NVFP4,Intel 的 int4-AutoRound),并向社区请求基准测试和幻觉数据。

0 人收藏 0 人点赞
#nvfp4

I benchmarked Unsloth's Qwen3.6-27B NVFP4 on 1x/2x 5090s. MTP is great until it really isn't.

Reddit r/LocalLLaMA · 2026-07-21

详细基准测试:Unsloth的Qwen3.6-27B NVFP4模型在RTX 5090 GPU上的表现,显示MTP(多令牌预测)在短上下文的单次请求中能显著加速,但在批量并发或长上下文场景下则会带来不利影响。

0 人收藏 0 人点赞
#nvfp4

nota-ai/Solar-Open2-250B-Nota-NVFP4

Hugging Face Models Trending · 2026-07-21 缓存

Nota AI 发布了 Upstage 的 Solar Open2 250B MoE 模型的 4 位量化版本,使用专有的 NVFP4 量化技术,需要 NVIDIA Blackwell GPU。

0 人收藏 0 人点赞
#nvfp4

baseten/GLM-5.2-Vision-NVFP4

Hugging Face Models Trending · 2026-07-20 缓存

Baseten 发布了 GLM-5.2-Vision,这是一个视觉语言模型,通过训练好的 PatchMerger 投影器将 MoonViT 视觉编码器添加到 GLM-5.2,同时保持文本主干和视觉塔冻结。该模型被量化到 NVFP4,以在 Blackwell 硬件上进行高效推理。

0 人收藏 0 人点赞
#nvfp4

QUADS:通过量化误差双侧对齐稳定MoE的NVFP4强化学习

arXiv cs.LG · 2026-07-20 缓存

本文提出QUADS,一种通过对齐训练端和推理生成端的量化误差来稳定混合专家大语言模型的NVFP4强化学习的方法,实现了BF16级别的精度,并且吞吐量高于FP8。

0 人收藏 0 人点赞
#nvfp4

@MiaAI_lab: 运行更高效的 Gemma 4 31B IT NVFP4,轻松获得更强的智能体推理与工具调用能力 • 256k 上下文 • MTP • …

X AI KOLs Timeline · 2026-07-16 缓存

MiaAI Lab 发布了一份指南,用于通过 vLLM 以 NVFP4 量化方式运行 Google 的 Gemma 4 31B IT,支持 256k 上下文、MTP 推测解码、智能体推理、原生工具调用以及图像/视频支持。

0 人收藏 0 人点赞
#nvfp4

@MiaAI_lab: 刚刚为您的 2 台 DGX Sparks 升级了 DeepSeek v4 Flash。单次每秒 66.6 tokens,6 个并发会话时可达 153.7 tokens/秒……

X AI KOLs Timeline · 2026-07-15 缓存

MiaAI Lab 发布了一项升级方案,用于在两台 DGX Spark 节点上使用 vLLM 结合 DSpark 推测解码和 NVFP4 KV-cache 来部署 DeepSeek V4 Flash,在六个并发会话中实现了高达 153.7 tokens/秒 的吞吐量。

0 人收藏 0 人点赞
#nvfp4

@MichaelGannotti: https://x.com/MichaelGannotti/status/2076024719371841537

X AI KOLs Timeline · 2026-07-11 缓存

一份详细报告,关于在 NVIDIA DGX Spark 上优化生产环境 vLLM 服务配置,纠正了导致 MTP acceptance 降低 34% 的标志设置。该结论基于对 90 多份 NVIDIA 官方文档的审阅以及一次包含 69 个场景的工具评估。

0 人收藏 0 人点赞
#nvfp4

@no_stp_on_snek: 当所有人都在讨论 @SpaceXAI、@AnthropicAI 和 @OpenAI 的更新(但 @GoogleAI 呢?)... 我去测试了…

X AI KOLs Timeline · 2026-07-11 缓存

Unsloth 的 NVFP4 量化模型在 vLLM 和 llama.cpp 之间推理性能的详细比较,重点说明了 vLLM 在预填充速度上的优势,但 llama.cpp 在单流智能体工作负载中的解码和缓存优势。

0 人收藏 0 人点赞
#nvfp4

在 PrismaQuant 上对 RTX Pro 4500(使用 Oculink)的 INT4 Autoround 和 NVFP4 W4A4 量化模型的一些测试

Reddit r/LocalLLaMA · 2026-07-11

报告了在 PrismaQuant 上使用 Oculink 对 RTX Pro 4500 GPU 进行 INT4 Autoround 和 NVFP4 W4A4 量化模型的测试。

0 人收藏 0 人点赞
#nvfp4

在4块RTX 5060 Ti上,使用P2P和PP=4,对新的unslooth/Qwen3.6-27B-NVFP4在并发数为1、4、8、12和16下的基准测试

Reddit r/LocalLLaMA · 2026-07-11

unslooth/Qwen3.6-27B-NVFP4模型在4块RTX 5060 Ti GPU上,使用点对点(P2P)和流水线并行(PP)在不同并发级别下的基准测试结果。

0 人收藏 0 人点赞
#nvfp4

4-Bitter的教训:在NVFP4 RL中平衡稳定性与性能

Hacker News Top · 2026-07-10 缓存

本文介绍了一种低精度(NVFP4)强化学习训练的方法,平衡了吞吐量和稳定性,解决了前向和后向传播量化误差的问题。

0 人收藏 0 人点赞
#nvfp4

@0xkeenz: 有意思,昨天刚好还在研究 Unsloth 和 NVIDIA 的 Qwen3.6 27B NVFP4 有什么区别,结果今天 Unsloth 就更新了! 新版 Unsloth 的量化思路和 NVIDIA 官方方案很类似:不再从 BF16 和 …

X AI KOLs Timeline · 2026-07-10 缓存

Unsloth 发布新版 Qwen3.6 27B NVFP4 量化方案,引入 FP8_E4M3 中间精度层并细化权重保护,在 24GB VRAM 上实现 2.5 倍速度提升,同时改进准确性和工具调用能力。

0 人收藏 0 人点赞
#nvfp4

@mr_r0b0t: 叫上兄弟们,新的 @UnslothAI NVFP4 刚刚发布

X AI KOLs Following · 2026-07-10 缓存

Unsloth AI 发布了新的 NVFP4 量化 Qwen3.6 模型,在 GPU 上运行速度提升 2.5 倍,并提高了准确性和工具调用能力。

0 人收藏 0 人点赞
#nvfp4

2.5倍更快的Qwen3.6 NVFP4 Unsloth量化版本

Reddit r/LocalLLaMA · 2026-07-10

Unsloth推出使用NVFP4格式的量化Qwen3.6模型,推理速度提升2.5倍。

0 人收藏 0 人点赞
#nvfp4

@VukRosic99: NVFP4端到端训练发散。当前方案通过Hadamard变换、随机舍入、高精度层等方式修补,但牺牲了大部分加速优势。

X AI KOLs Timeline · 2026-07-10 缓存

Four Over Six(4/6)为NVFP4量化引入了自适应块缩放,以最小开销降低量化误差,同时改善了大语言模型的训练和训练后量化。

0 人收藏 0 人点赞
#nvfp4

@WescheNex1q: 16人同时与Qwen3.6-35B聊天,仅用一台DGX Spark。这是真实截图,并非模拟:您看到的每个token均…

X AI KOLs Timeline · 2026-07-09 缓存

一个实时演示展示了16个并发用户在同一台DGX Spark上与Qwen3.6-35B聊天,使用vLLM上的NVFP4 + MTP-3,达到总峰值440 tok/s,每用户105 tok/s。

0 人收藏 0 人点赞
#nvfp4

@RedHat_AI:红帽AI团队已为GLM-5.2创建量化检查点!https://huggingface.co/RedHatAI/GLM-5.2-NVF…

X AI KOLs Following · 2026-07-08 缓存

红帽AI团队使用NVFP4和FP8量化发布了GLM-5.2的量化检查点,模型体积减小超过70%,同时在GPQA上保持高精度。该量化模型与DSpark推测器配合使用,可实现vLLM上的高效部署。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈