标签
PuzzleKV是一种无需训练的方法,用于压缩大语言模型中的键值缓存,采用基于页面的低秩分解,以约60%的存储实现超过96%的性能。
本文首次从数学上证明,低秩分解与量化在结合用于LLM压缩时并非正交,会导致性能下降,并提出了一种新颖的对角粘合方法(DAM)来减轻这种损失。
介绍SigmaScale,一种为基于SVD的LLM压缩学习辅助缩放矩阵的方法,在Llama 3.1 8B和Qwen3-8B基准测试上展现出具有竞争力的性能。