DKV: 用于本地LLM推理的开源KV-cache压缩框架(CLI + 技术报告)

Reddit r/LocalLLaMA 工具

摘要

DKV是一个开源框架,用于在本地LLM推理过程中压缩KV-cache,提供CLI和技术报告。

暂无内容
查看原文

相似文章

PolyKV: 异构保留与分配的KV缓存压缩

arXiv cs.LG

PolyKV是一种逐层的KV缓存压缩框架,为每一层分配异构的驱逐策略和非均匀的预算,在LongBench上使用LLaMA-3.1-8B和Qwen3-8B相比统一基线有显著提升。

SGD-KV: 摘要引导的KV缓存压缩

arXiv cs.CL

SGD-KV是一个框架,利用摘要来指导大型语言模型中的KV缓存压缩,在上下文长度高达100万token时,将内存使用量减少高达75%,同时在长上下文基准测试中实现最先进的性能。