@anirudhbv_ce: 介绍 SpectralQuant.. 来拯救您的 KV 缓存 :)

X AI KOLs Timeline 工具

摘要

SpectralQuant 是一种新的 KV 缓存量化技术,在 Mistral 7B 上实现了 5.95 倍压缩,仅带来 7.5% 的困惑度开销,显著优于 TurboQuant,且每个模型只需 15 秒校准。

介绍 SpectralQuant.. 来拯救您的 KV 缓存 :)
查看原文
查看缓存全文

缓存时间: 2026/05/20 04:26

介绍 SpectralQuant.. 来拯救你的 KV 缓存 :)

Ashwin Gopinath (@ashwingop): @sentra_app 刚刚干掉了 @GoogleResearch 的 TurboQuant。

SpectralQuant — 在 Mistral 7B 上实现 5.95 倍 KV 缓存压缩,困惑度仅增加 7.5%。

同等压缩率下,TurboQuant 的困惑度增加 22%。

性能下降减少了 3 倍。15 秒校准。每个模型只需一次操作,即可无缝适配任何 HuggingFace 模型。

相似文章

KV缓存压缩的消融、统计推断与验证

arXiv cs.LG

本文对KV缓存压缩方案(TurboQuant和SpectralQuant)进行了系统的比较研究,介绍了一种统计验证方法,并针对高效Transformer推理提供了特定场景下的建议。

KVarN:华为推出的原生 vLLM KV 缓存量化后端

Hacker News Top

华为 CSL 发布 KVarN,这是一个原生 vLLM 注意力后端,专为 KV 缓存量化设计。它无需校准即可实现 3-5 倍的 KV 缓存容量提升,以及高达约 1.3 倍于 FP16 的吞吐量。在 Qwen3-32B 等模型上,其吞吐量最高可达 TurboQuant 的约 2.4 倍,同时保持与 FP16 相当的精度。