@no_stp_on_snek: 始终从未压缩的k和压缩的V开始,然后更激进地进行。模型家族对k压缩的敏感性不同……
摘要
关于Transformer模型KV缓存压缩的提示:从未压缩的键和压缩的值开始,然后根据模型家族的敏感性进行调整;先尝试非对称压缩,再尝试对称压缩。
始终从未压缩的k和压缩的V开始,然后更激进地进行。
模型家族尤其对K压缩的敏感性不同。
先进行非对称压缩,再进行对称压缩。
查看缓存全文
缓存时间: 2026/05/23 18:11
始终从未压缩的 K 和压缩的 V 开始,并在此基础上更激进地推进。模型家族对 K 压缩尤为敏感。不对称压缩优先于对称压缩。
相似文章
KV缓存压缩的风险
本文从理论上刻画了变压器中KV缓存压缩的极小极大风险,为因果掩码下的精确压缩提供了设计原则,并将其实例化到实用算法中,在LongBench上取得了有前景的结果。
Codec-Gauge:为Transformer KV缓存学习压缩友好的变换框架
Codec-Gauge 为Transformer KV缓存学习小型正交通道变换(度量),以在固定比特率下提高压缩保真度,显著降低多个模型和后端上的KL散度。
@VukRosic99: 大多数KV缓存压缩仅对键进行SVD,或者联合嵌入查询和键。两者都忽略了显而易见的目标…
KQ-SVD是一种新的KV缓存压缩方法,它通过最优低秩分解直接近似注意力矩阵,在LLaMA和Mistral模型上实现了比仅键SVD低5-10倍的误差。
KV缓存压缩的消融、统计推断与验证
本文对KV缓存压缩方案(TurboQuant和SpectralQuant)进行了系统的比较研究,介绍了一种统计验证方法,并针对高效Transformer推理提供了特定场景下的建议。
KV缓存压缩比TurboQuant与逐向量香农极限高出900000倍
一篇新论文提出了一种基于概率语言Trie树和预测差分编码的顺序KV缓存压缩方法。该方法通过利用语言模型Token的序列结构而非对向量进行独立处理,实现了超越TurboQuant约91.4万倍的理论压缩比。