标签
GLIDE 引入一种逐层自适应机制,策略性地整合滑动窗口 softmax 注意力和线性循环聚合,实现高效 LLM 推理,在处理长上下文时减少 KV 缓存 I/O 和延迟,同时不牺牲质量。
MM-ShiftKV是一种无需训练的方法,通过在预填充阶段近似解码时的查询行为来改进多模态大语言模型的KV缓存选择,减少内存占用同时保持性能。
本文首次对多头潜在注意力(MLA)进行机械可解释性研究,分析其低秩瓶颈如何分离内容与位置信息,并重塑Transformer电路。
介绍Latent Briefing,一种通过KV缓存压缩实现多智能体系统通信的方法,在保持相同准确率的情况下减少31%的令牌使用,并实现高达20倍的加速。
LMCache 是一个开源的 KV 缓存管理层,它将缓存 I/O 与计算分离,可插入 vLLM、SGLang 和 TensorRT-LLM,通过并行化缓存查找和共享 GPU 内存,实现高达 14 倍的首 token 延迟降低和 4 倍的解码加速。
BeeLlama.cpp v0.4.1引入了KVarN、KV精度尾部以及改进的KV缓存支持。基准测试表明,使用尾部1024可使kvarn5和q6_0达到与q8_0相当的精度,同时显存占用更低。
本文研究了稀疏事件键值(KV)服务中的内存契约,表明被驱逐的源事件仍可通过缓存行影响答案,并且刻意措辞的事件可以在不提及数值的情况下实现与捐赠者对齐的恢复。
DKV是一个开源框架,用于在本地LLM推理过程中压缩KV-cache,提供CLI和技术报告。
Kimi发布了K3,一个2.8T参数的开源模型,采用delta attention避免KV缓存增长,实现了百万token上下文窗口,内存成本线性增长。
CachyLLama是llama.cpp的一个分支,它增加了基于SSD的持久化KV缓存和多层缓存,显著减少了在较慢硬件上长时间本地代理会话的提示重新处理时间。
Codec-Gauge 为Transformer KV缓存学习小型正交通道变换(度量),以在固定比特率下提高压缩保真度,显著降低多个模型和后端上的KL散度。
DogukanUrker演示了在单张RTX 3060上使用推测解码和KV缓存拆分运行Gemma 4 12B,拥有完整262,144上下文,速度约100 tok/s,实现了接近满GPU利用率且无需CPU卸载。
精心整理的资源列表,用于掌握LLM缓存管理,包括关于KV缓存、前缀缓存及相关技术的解释、教程和研究论文。
本文发现低位KV缓存量化会因logits的结构化局部误排名而降低大语言模型精度,提出DGAP方法,通过恢复Top-K候选的局部分布,在Llama-3.1-8B模型上将RULER准确率从47.8%恢复至83.2%,且仅增加极小的开销。
SelKV 是一个无需训练的 KV 缓存压缩框架,它使用软余弦门进行选择性合并,并通过注意力比例补偿机制纠正 softmax 不平衡,在仅保留 25% 缓存大小的情况下实现近乎无损的生成,在 LongBench 上取得 3.3 倍解码加速。
一位研究者质疑在相同KV缓存下MLA优于GQA的可重复性,分享了早期小规模消融实验结果,并计划进行规模扩展实验以决定下一次大规模运行的架构。
CacheBlend,EuroSys 2025 最佳论文,解决了由于提示缓存中严格的前缀匹配导致 90% 的 KV 缓存从未被重用的问题。通过选择性地仅重新计算文档之间的边界令牌,它在不损失质量的情况下实现了 2-4 倍的多文档处理速度提升,并在开源 LMCache 层中实现。
介绍VarRate,一种无训练的KV缓存压缩方法,根据查询显著性为每个令牌分配可变低秩预算,避免了不可逆的令牌驱逐,并且在LongBench上以匹配的内存预算优于均匀秩方法。
提出循环隐注意力(LLA),一种训练后编解码器,通过利用递归步骤间的低秩结构压缩循环变压器中的KV缓存,在保持性能的同时实现显著压缩比。