@sakurayukiai: 通过计算推测模型的KV缓存字节数(而非将其隐藏在平坦的显存缓冲中),Unsloth将Qwen…

X AI KOLs Timeline 工具

摘要

Unsloth通过精确计算推测模型的KV缓存字节数(而非使用平坦的显存缓冲),将Qwen3.6-27B Q6_K在单张32GB显卡上的上下文长度从23K提升至64K。

计算推测模型的KV缓存字节数,而不是将其隐藏在平坦的显存缓冲中,这就是Unsloth将Qwen3.6-27B Q6_K在单张32GB显卡上从23K上下文提升至64K的方法。没有新的量化器,只是诚实的分配器计算。这太棒了。
查看原文

相似文章

在32GB显存上以Q8量化使用Qwen3.6-27,接近100K上下文

Reddit r/LocalLLaMA

用户分享了他们在拥有32GB显存的RTX 5090上,使用Q8量化的Qwen3.6-27B模型尝试达到115K上下文长度的配置与实验过程,并给出了基准测试结果,以及上下文长度与kv-cache量化之间的权衡。