DKV: 用于本地LLM推理的开源KV-cache压缩框架(CLI + 技术报告)
摘要
DKV是一个开源框架,用于在本地LLM推理过程中压缩KV-cache,提供CLI和技术报告。
暂无内容
相似文章
CompressKV:语义检索引导的KV缓存压缩方法,用于资源高效的长上下文大语言模型推理
CompressKV针对基于GQA的大语言模型,提出了一种语义检索引导的KV缓存压缩方法,通过识别语义检索头来保留关键令牌。在LongBench任务中,仅使用3%的KV缓存即可实现超过97%的全缓存性能。
SemKV:基于质量悬崖引导的语义混合精度KV缓存量化,用于长上下文LLM推理
SemKV引入了一个基于经验测量的质量悬崖引导的KV缓存混合精度量化框架,在长上下文LLM推理中实现了显著的存储减少,且没有可检测的质量损失。
MosaicKV:使用动态二维KV缓存压缩服务长上下文LLM
MosaicKV引入了用于长上下文LLM服务的动态二维KV缓存压缩,实现了高达16倍的注意力加速和3倍的内存减少,且精度损失极小。
PolyKV: 异构保留与分配的KV缓存压缩
PolyKV是一种逐层的KV缓存压缩框架,为每一层分配异构的驱逐策略和非均匀的预算,在LongBench上使用LLaMA-3.1-8B和Qwen3-8B相比统一基线有显著提升。
SGD-KV: 摘要引导的KV缓存压缩
SGD-KV是一个框架,利用摘要来指导大型语言模型中的KV缓存压缩,在上下文长度高达100万token时,将内存使用量减少高达75%,同时在长上下文基准测试中实现最先进的性能。