@sakurayukiai: 通过计算推测模型的KV缓存字节数(而非将其隐藏在平坦的显存缓冲中),Unsloth将Qwen…
摘要
Unsloth通过精确计算推测模型的KV缓存字节数(而非使用平坦的显存缓冲),将Qwen3.6-27B Q6_K在单张32GB显卡上的上下文长度从23K提升至64K。
计算推测模型的KV缓存字节数,而不是将其隐藏在平坦的显存缓冲中,这就是Unsloth将Qwen3.6-27B Q6_K在单张32GB显卡上从23K上下文提升至64K的方法。没有新的量化器,只是诚实的分配器计算。这太棒了。
相似文章
在32GB显存上以Q8量化使用Qwen3.6-27,接近100K上下文
用户分享了他们在拥有32GB显存的RTX 5090上,使用Q8量化的Qwen3.6-27B模型尝试达到115K上下文长度的配置与实验过程,并给出了基准测试结果,以及上下文长度与kv-cache量化之间的权衡。
太棒了。令牌速度翻倍 + KV缓存现在需要低显存 - Qwen 27B
一种名为kvflash的新型KV缓存优化,可在单张RTX 3090上使Qwen 3.6-27B的生成速度翻倍并降低显存使用,同时保持准确性。
Unsloth的Daniel Han验证Qwen3.8-27B仅需17GB显存即可运行
Unsloth的Daniel Han验证了Qwen3.8-27B仅需17GB显存即可运行,使其能够用于本地推理。
在sm120上使用NVFP4 KV缓存量化将使32GB VRAM系统变得非常强大
在sm120上使用NVFP4 KV缓存量化显著提高了大语言模型的内存效率,使32GB VRAM系统在196k上下文大小下使用Qwen3.6-27B实现约60 tok/秒的推理速度。
7900XTX 24GB 显存,终于能够在 131k 上下文下容纳 Q6K+MTP 和 Qwen 3.6 27B
在 AMD 7900XTX 上优化显存使用的指南,通过编译带有 OpenBLAS 和 CUDA_FA_ALL_QUANTS 的 llama.cpp,并使用 q5_0/q4_0 的 KVCache 量化,以运行使用 Q6K 量化和 131k 上下文的 27B Qwen 模型。