标签
优化了在单张 AMD Radeon R9700 GPU 上运行 Qwen3.8 27b NVFP4 模型的性能,解码速度高达每秒 153 个令牌,预填充速度达每秒 3,619 个令牌,并提升了并发性能。
本文解释了为什么将混合LLM中循环Gated DeltaNet层完全量化为4位NVFP4能在长上下文基准测试中保持精度,详细阐述了异常值定位和鲁棒delta规则动态等机制。
OCGQuant提出了一种用于NVFP4量化的异常值伴随分组方法,以减少激活块误差,提升LLM推理效率。在Llama3和Qwen3上的实验表明,其性能优于现有的后训练量化技术。
NVIDIA研究人员将在2026年PyTorch北美会议上介绍如何使用NVFP4预训练配方来加速大规模LLM训练,同时保持与BF16相当的质量,并集成到PyTorch工具如TorchAO和TorchTitan中。
RadixArk/Qwen3.8-Flash-Next-NVFP4 现已在 SGLang-V100 中得到支持,使得在 4xV100 GPU 上能够进行全上下文操作,性能指标显示高吞吐量,上下文处理能力高达 256k tokens。
Qwen3.8 Flash-Next的一个新检查点能将n-gram查找表卸载至SSD,在保持SGLang推理速度的同时,减少48 GB的内存使用。
基准测试显示,Qwen3.8-Flash-Next-NVFP4 在本地模型中取得了接近最高分数,在请求处理和令牌生成方面表现出卓越效率,尽管训练不足,但速度仍然显著。
Shantanu Goel 分享了一个优化 Qwen 3.8 Flash Next 在单个 DGX Spark 上的配置方案,已针对实际任务进行测试,并计划进一步进行基准测试。
NVIDIA展示了如何使用NVIDIA模型优化器进行量化感知蒸馏(QAD)来改进Nemotron 3.5 Lightning模型,在保持代理基准准确性的同时减少内存使用并提高吞吐量。
这是 Qwen3.8-27B AI 模型的完全量化 4-bit NVFP4 版本,采用 QUASAR 方法进行训练,以在保持高质量的同时减小模型大小。
作者在使用自定义软件优化(如 QPN 内核)进行高效推理时,实现了四个 2017 年 Tesla V100 GPU 与现代 RTX 5090 在运行 Qwen 3.8 模型时的性能均等。
一条推文,建议NVIDIA DGX Spark的所有者优先使用nvfp4以获得最佳性能。
Qwen 3.8 27B 模型已推出 NVFP4 量化版本,使其能在单个 RTX 5090 GPU 上运行,并在编码、智能任务和视觉语言理解方面有所增强。
新发布的大型MoE模型Motif 3(314B总参数,13B激活参数,支持NVFP4)似乎很有前景;作者想听听社区的使用体验。
介绍了v100-skinny,一个自定义内核库,支持在V100(sm70)GPU上进行快速NVFP4推理,在最佳情况下的抽取中为Qwen3.6 27B实现366 t/s,而结构化生成和代码生成的速度较低。
本文研究了针对NVFP4低精度大语言模型的量化感知蒸馏,并发现仅使用KL损失的输出匹配可能掩盖内部表征漂移。作者提出了CKA-QAD,通过CKA引导的对齐来保持内部几何结构,从而提升了紧凑模型在推理和编码任务上的准确性。
发布一个NVFP4量化的无审查MiniMax-H3文本编码器(Qwen3-VL-32B Heretic),可适配在单张16GB GPU上,并可作为ComfyUI工作流中的直接替代品。
本文比较了 Qwen3.6-27B 的三种量化变体(Unsloth 和 Nvidia 的 NVFP4,Intel 的 int4-AutoRound),并向社区请求基准测试和幻觉数据。
详细基准测试:Unsloth的Qwen3.6-27B NVFP4模型在RTX 5090 GPU上的表现,显示MTP(多令牌预测)在短上下文的单次请求中能显著加速,但在批量并发或长上下文场景下则会带来不利影响。
Nota AI 发布了 Upstage 的 Solar Open2 250B MoE 模型的 4 位量化版本,使用专有的 NVFP4 量化技术,需要 NVIDIA Blackwell GPU。