@ClementDelangue:这有用吗?
摘要
Buun 推出了 VBR(可变比特率),这是一种新的 KV 缓存格式,可动态量化各层以在 VRAM 限制下优化质量,现已可在 master 上使用。
查看缓存全文
缓存时间: 2026/07/15 09:49
buun (@spiritbuun): 介绍一种新的 KV 格式:VBR(可变比特率) VBR 会随着会话增长,逐层动态量化您的 KV 缓存,在 VRAM 限制内提供尽可能高的质量。这是我梦想中的格式。 已推送至主分支。现已可用。1/15 🧵
相似文章
Spiritbuun 的 VBR(可变比特率)KV 缓存 —— 初印象
一篇对 Spiritbuun 的 llama.cpp 分支的赞赏文章,重点介绍了其新的可变比特率(VBR)KV 缓存功能,该功能动态降低缓存精度以适应 VRAM,从而实现更大的自动适配上下文大小且速度损失极小。
KVarN:华为推出的原生 vLLM KV 缓存量化后端
华为 CSL 发布 KVarN,这是一个原生 vLLM 注意力后端,专为 KV 缓存量化设计。它无需校准即可实现 3-5 倍的 KV 缓存容量提升,以及高达约 1.3 倍于 FP16 的吞吐量。在 Qwen3-32B 等模型上,其吞吐量最高可达 TurboQuant 的约 2.4 倍,同时保持与 FP16 相当的精度。
PolyKV: 异构保留与分配的KV缓存压缩
PolyKV是一种逐层的KV缓存压缩框架,为每一层分配异构的驱逐策略和非均匀的预算,在LongBench上使用LLaMA-3.1-8B和Qwen3-8B相比统一基线有显著提升。
这是我的KV缓存量化基准测试:TurboQuant被高估但被TCQ拯救,q5值得更多关注,对称q8可能浪费显存
一项详细的基准测试,使用PPL和KLD指标在Qwen 3.6 27B上比较KV缓存量化方法(TurboQuant、TCQ、q4、q5、q8),发现TCQ改进了低位量化,不对称KV在相同大小下优于对称KV,且q8通常过于夸张。包含分析和数据,见链接文章。
@QuixiAI: 教训总结:始终使用BF16 KV缓存。我之前用的是turboquant。是的,VRAM消耗很糟糕——所以另一个技巧是…
作者分享了使用BF16 KV缓存而非turboquant进行AI模型优化的技术经验,并在SlimServe中为Qwen模型实现了CPU卸载以管理VRAM消耗。