nvfp4

标签

Cards List
#nvfp4

在单张 AMD Radeon R9700 上运行 Qwen3.8 27b NVFP4 达 153 tok/s,8 并发请求下 470 tok/s,预填充速度 3,619 tok/s

Reddit r/LocalLLaMA ↗ · 2026-09-17

优化了在单张 AMD Radeon R9700 GPU 上运行 Qwen3.8 27b NVFP4 模型的性能,解码速度高达每秒 153 个令牌,预填充速度达每秒 3,619 个令牌,并提升了并发性能。

0 人收藏 0 人点赞
#nvfp4

为什么Gated DeltaNet能承受4位量化:针对混合27B LLM中循环部分的NVFP4 W4A4方案

Hugging Face Daily Papers ↗ · 2026-09-03 缓存

本文解释了为什么将混合LLM中循环Gated DeltaNet层完全量化为4位NVFP4能在长上下文基准测试中保持精度,详细阐述了异常值定位和鲁棒delta规则动态等机制。

0 人收藏 0 人点赞
#nvfp4

OCGQuant:针对NVFP4量化的异常值伴随分组方法

arXiv cs.CL ↗ · 2026-09-02 缓存

OCGQuant提出了一种用于NVFP4量化的异常值伴随分组方法,以减少激活块误差,提升LLM推理效率。在Llama3和Qwen3上的实验表明,其性能优于现有的后训练量化技术。

0 人收藏 0 人点赞
#nvfp4

@PyTorch:NVIDIA(@nvidia)的Anjulie Agrusa、Ryan Spring和Bruce Zitelli将展示最新的NVFP4预训练配方如何……

X AI KOLs Following ↗ · 2026-08-31 缓存

NVIDIA研究人员将在2026年PyTorch北美会议上介绍如何使用NVFP4预训练配方来加速大规模LLM训练,同时保持与BF16相当的质量,并集成到PyTorch工具如TorchAO和TorchTitan中。

0 人收藏 0 人点赞
#nvfp4

Qwen3.8-Flash-Next NVFP4 第3天对4xV100的支持

Reddit r/LocalLLaMA ↗ · 2026-08-30

RadixArk/Qwen3.8-Flash-Next-NVFP4 现已在 SGLang-V100 中得到支持,使得在 4xV100 GPU 上能够进行全上下文操作,性能指标显示高吞吐量,上下文处理能力高达 256k tokens。

0 人收藏 0 人点赞
#nvfp4

Qwen 3.8 Flash Next n-gram查找表卸载至SSD并在SGLang中流式传输

Reddit r/LocalLLaMA ↗ · 2026-08-29 缓存

Qwen3.8 Flash-Next的一个新检查点能将n-gram查找表卸载至SSD,在保持SGLang推理速度的同时,减少48 GB的内存使用。

0 人收藏 0 人点赞
#nvfp4

本地智能体编码基准测试:Qwen3.8-Flash-Next NVFP4 对比 27B(以及其他...)

Reddit r/LocalLLaMA ↗ · 2026-08-28

基准测试显示,Qwen3.8-Flash-Next-NVFP4 在本地模型中取得了接近最高分数,在请求处理和令牌生成方面表现出卓越效率,尽管训练不足,但速度仍然显著。

0 人收藏 0 人点赞
#nvfp4

@shantanugoel: 我通过两天对众多超参数和补丁进行系统搜索后得到的配置

X AI KOLs Following ↗ · 2026-08-28 缓存

Shantanu Goel 分享了一个优化 Qwen 3.8 Flash Next 在单个 DGX Spark 上的配置方案,已针对实际任务进行测试,并计划进一步进行基准测试。

0 人收藏 0 人点赞
#nvfp4

@PyTorch:在NVIDIA NeMo框架内使用PyTorch原生库自定义模型以满足您对延迟、速度、内存和计算的严格要求…

X AI KOLs Timeline ↗ · 2026-08-27 缓存

NVIDIA展示了如何使用NVIDIA模型优化器进行量化感知蒸馏(QAD)来改进Nemotron 3.5 Lightning模型,在保持代理基准准确性的同时减少内存使用并提高吞吐量。

0 人收藏 0 人点赞
#nvfp4

采用 QUASAR QAD 的完全量化 NVFP4 Qwen3.8-27B

Reddit r/LocalLLaMA ↗ · 2026-08-26 缓存

这是 Qwen3.8-27B AI 模型的完全量化 4-bit NVFP4 版本,采用 QUASAR 方法进行训练,以在保持高质量的同时减小模型大小。

0 人收藏 0 人点赞
#nvfp4

NVFP4 在 Volta 上!尽管是为 Blackwell 设计的,我让四个 2017 年的 V100 原生运行 Qwen 3.8 NVFP4,并匹配我的 6000 美元 RTX 5090。

Reddit r/LocalLLaMA ↗ · 2026-08-19

作者在使用自定义软件优化(如 QPN 内核)进行高效推理时,实现了四个 2017 年 Tesla V100 GPU 与现代 RTX 5090 在运行 Qwen 3.8 模型时的性能均等。

0 人收藏 0 人点赞
#nvfp4

@ivanfioravanti: 如果您拥有DGX Spark,请专注于nvfp4,忘掉其他一切。

X AI KOLs Following ↗ · 2026-08-15

一条推文,建议NVIDIA DGX Spark的所有者优先使用nvfp4以获得最佳性能。

0 人收藏 0 人点赞
#nvfp4

@TheAhmadOsman: 顺便说一下,Qwen 3.8 27B 的 NVFP4 版本可以在单个 RTX 5090 上运行。

X AI KOLs Following ↗ · 2026-08-14 缓存

Qwen 3.8 27B 模型已推出 NVFP4 量化版本,使其能在单个 RTX 5090 GPU 上运行,并在编码、智能任务和视觉语言理解方面有所增强。

0 人收藏 0 人点赞
#nvfp4

Motif 3(314B A13B,支持NVFP4)看起来不错!?你们目前的使用体验如何?

Reddit r/LocalLLaMA ↗ · 2026-08-12

新发布的大型MoE模型Motif 3(314B总参数,13B激活参数,支持NVFP4)似乎很有前景;作者想听听社区的使用体验。

0 人收藏 0 人点赞
#nvfp4

v100s上Qwen3.6 27B NVFP4达366 t/s

Reddit r/LocalLLaMA ↗ · 2026-08-11

介绍了v100-skinny,一个自定义内核库,支持在V100(sm70)GPU上进行快速NVFP4推理,在最佳情况下的抽取中为Qwen3.6 27B实现366 t/s,而结构化生成和代码生成的速度较低。

0 人收藏 0 人点赞
#nvfp4

[2606.05682] 超越输出匹配:在NVFP4 LLM蒸馏中保持内部几何结构

Reddit r/LocalLLaMA ↗ · 2026-08-09 缓存

本文研究了针对NVFP4低精度大语言模型的量化感知蒸馏,并发现仅使用KL损失的输出匹配可能掩盖内部表征漂移。作者提出了CKA-QAD,通过CKA引导的对齐来保持内部几何结构,从而提升了紧凑模型在推理和编码任务上的准确性。

0 人收藏 0 人点赞
#nvfp4

sakamakismile/Qwen3-VL-32B-Heretic-MiniMax-H3-NVFP4

Hugging Face Models Trending ↗ · 2026-08-04 缓存

发布一个NVFP4量化的无审查MiniMax-H3文本编码器(Qwen3-VL-32B Heretic),可适配在单张16GB GPU上,并可作为ComfyUI工作流中的直接替代品。

0 人收藏 0 人点赞
#nvfp4

unsloth/Qwen3.6-27B-NVFP4 vs. Intel/Qwen3.6-27B-int4-AutoRound vs. nvidia/Qwen3.6-27B-NVFP4 —— 该选哪一个?

Reddit r/LocalLLaMA ↗ · 2026-07-30

本文比较了 Qwen3.6-27B 的三种量化变体(Unsloth 和 Nvidia 的 NVFP4,Intel 的 int4-AutoRound),并向社区请求基准测试和幻觉数据。

0 人收藏 0 人点赞
#nvfp4

I benchmarked Unsloth's Qwen3.6-27B NVFP4 on 1x/2x 5090s. MTP is great until it really isn't.

Reddit r/LocalLLaMA ↗ · 2026-07-21

详细基准测试:Unsloth的Qwen3.6-27B NVFP4模型在RTX 5090 GPU上的表现,显示MTP(多令牌预测)在短上下文的单次请求中能显著加速,但在批量并发或长上下文场景下则会带来不利影响。

0 人收藏 0 人点赞
#nvfp4

nota-ai/Solar-Open2-250B-Nota-NVFP4

Hugging Face Models Trending ↗ · 2026-07-21 缓存

Nota AI 发布了 Upstage 的 Solar Open2 250B MoE 模型的 4 位量化版本,使用专有的 NVFP4 量化技术,需要 NVIDIA Blackwell GPU。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈