在sm120上使用NVFP4 KV缓存量化将使32GB VRAM系统变得非常强大
摘要
在sm120上使用NVFP4 KV缓存量化显著提高了大语言模型的内存效率,使32GB VRAM系统在196k上下文大小下使用Qwen3.6-27B实现约60 tok/秒的推理速度。
我在我的32GB VRAM(2 x 5060)上从Qwen3.6-27B获得的最佳结果是大约60 tok/秒的生成速度,上下文大小为196608。(sakamakismile text nvfp4)。Fp8 KV量化。NVFP4 KV缓存量化来得不够快。让我想起有一次,我在我的第一台电脑上无法玩一个游戏,因为它至少需要640KB的内存。
相似文章
量化MTP KV缓存 = 免费午餐?
在llama.cpp中将Qwen模型的多令牌预测(MTP)KV缓存量化为q8_0,可以减少VRAM使用,同时不影响推理速度或接受率,实际上为内存受限的配置提供了'免费午餐'。
您可以将Qwen3.8-Flash-Next模型的大部分KV缓存卸载到RAM中,而不会明显影响解码速度。 在使用8bit量化的Qwen3.8-Flash-Next模型时,KV缓存大小约为每token 12.5MB。通过将大部分KV缓存从显存移至RAM,并只在显存中保留少量热数据,可以显著扩大显存能够支持的上下文长度。这种混合存储方式仅会增加约1.2ms的延迟,对实际推理速度影响微乎其微,为处理超长上下文提供了一种高效且低成本的解决方案。
演示了将Qwen3.8-Flash-Next模型的KV缓存卸载至系统内存的技术,通过利用该模型高效架构,可在最大程度减少解码速度下降的情况下支持长上下文推理。
2.5倍更快的Qwen3.6 NVFP4 Unsloth量化版本
Unsloth推出使用NVFP4格式的量化Qwen3.6模型,推理速度提升2.5倍。
在32GB显存上以Q8量化使用Qwen3.6-27,接近100K上下文
用户分享了他们在拥有32GB显存的RTX 5090上,使用Q8量化的Qwen3.6-27B模型尝试达到115K上下文长度的配置与实验过程,并给出了基准测试结果,以及上下文长度与kv-cache量化之间的权衡。
KVarN:华为推出的原生 vLLM KV 缓存量化后端
华为 CSL 发布 KVarN,这是一个原生 vLLM 注意力后端,专为 KV 缓存量化设计。它无需校准即可实现 3-5 倍的 KV 缓存容量提升,以及高达约 1.3 倍于 FP16 的吞吐量。在 Qwen3-32B 等模型上,其吞吐量最高可达 TurboQuant 的约 2.4 倍,同时保持与 FP16 相当的精度。