long-context-llm

标签

Cards List
#long-context-llm

Minima-KV:基于混合格式分页注意力的保持保留KV缓存压缩

arXiv cs.AI · 2026-08-26 缓存

Minima-KV 提出了一种基于混合格式分页注意力的保持保留KV缓存压缩方法,旨在减少长上下文LLM服务中的内存占用,并在基准测试中评估了其性能。

0 人收藏 0 人点赞
#long-context-llm

FreqDepthKV: 频率引导的深度共享实现长上下文LLM推理中鲁棒的KV缓存压缩

arXiv cs.AI · 2026-07-08 缓存

提出FreqDepthKV,一种用于长上下文LLM推理中KV缓存压缩的频率引导深度共享方法。该方法将相邻层的KV状态分解为共享的低频成分和稀疏的高频残差,在保证基准测试精度的同时提升内存效率和吞吐量。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈