kv-cache

标签

Cards List
#kv-cache

GLIDE: 引导的逐层混合注意力实现高效LLM推理

arXiv cs.AI · 2026-07-29 缓存

GLIDE 引入一种逐层自适应机制,策略性地整合滑动窗口 softmax 注意力和线性循环聚合,实现高效 LLM 推理,在处理长上下文时减少 KV 缓存 I/O 和延迟,同时不牺牲质量。

0 人收藏 0 人点赞
#kv-cache

MM-ShiftKV: 解码感知的预填充阶段KV选择用于多模态大语言模型

arXiv cs.AI · 2026-07-28 缓存

MM-ShiftKV是一种无需训练的方法,通过在预填充阶段近似解码时的查询行为来改进多模态大语言模型的KV缓存选择,减少内存占用同时保持性能。

0 人收藏 0 人点赞
#kv-cache

穿越瓶颈:多头潜在注意力如何在语言模型中分离内容与位置

arXiv cs.LG · 2026-07-28 缓存

本文首次对多头潜在注意力(MLA)进行机械可解释性研究,分析其低秩瓶颈如何分离内容与位置信息,并重塑Transformer电路。

0 人收藏 0 人点赞
#kv-cache

PorTAL(1分钟阅读)

TLDR AI · 2026-07-28 缓存

介绍Latent Briefing,一种通过KV缓存压缩实现多智能体系统通信的方法,在保持相同准确率的情况下减少31%的令牌使用,并实现高达20倍的加速。

0 人收藏 0 人点赞
#kv-cache

@akshay_pachaar:每个推理引擎都犯了同样的错误。像 vLLM 或 SGLang 这样的推理引擎,是位于你的请求与模型权重之间的软件……

X AI KOLs Following · 2026-07-27 缓存

LMCache 是一个开源的 KV 缓存管理层,它将缓存 I/O 与计算分离,可插入 vLLM、SGLang 和 TensorRT-LLM,通过并行化缓存查找和共享 GPU 内存,实现高达 14 倍的首 token 延迟降低和 4 倍的解码加速。

0 人收藏 0 人点赞
#kv-cache

BeeLlama.cpp v0.4.1:KVarN、KV精度尾部、q2_0-q3_1 KV缓存,改进支持。KLD基准测试:尾部1024使kvarn5和q6_0匹配q8_0,且显存占用大幅降低

Reddit r/LocalLLaMA · 2026-07-26

BeeLlama.cpp v0.4.1引入了KVarN、KV精度尾部以及改进的KV缓存支持。基准测试表明,使用尾部1024可使kvarn5和q6_0达到与q8_0相当的精度,同时显存占用更低。

0 人收藏 0 人点赞
#kv-cache

全局计算,局部物化:稀疏事件键值缓存的内存契约

Hugging Face Daily Papers · 2026-07-26 缓存

本文研究了稀疏事件键值(KV)服务中的内存契约,表明被驱逐的源事件仍可通过缓存行影响答案,并且刻意措辞的事件可以在不提及数值的情况下实现与捐赠者对齐的恢复。

0 人收藏 0 人点赞
#kv-cache

DKV: 用于本地LLM推理的开源KV-cache压缩框架(CLI + 技术报告)

Reddit r/LocalLLaMA · 2026-07-25

DKV是一个开源框架,用于在本地LLM推理过程中压缩KV-cache,提供CLI和技术报告。

0 人收藏 0 人点赞
#kv-cache

@akshay_pachaar: 一个矩阵取代了KV缓存。(该技术100%开源)Kimi刚刚发布了K3,一个前沿规模的开源模型…

X AI KOLs Following · 2026-07-24 缓存

Kimi发布了K3,一个2.8T参数的开源模型,采用delta attention避免KV缓存增长,实现了百万token上下文窗口,内存成本线性增长。

0 人收藏 0 人点赞
#kv-cache

CachyLLama:一个带有持久化KV缓存的llama.cpp分支,让长时间本地代理会话不再那么痛苦

Reddit r/LocalLLaMA · 2026-07-24

CachyLLama是llama.cpp的一个分支,它增加了基于SSD的持久化KV缓存和多层缓存,显著减少了在较慢硬件上长时间本地代理会话的提示重新处理时间。

0 人收藏 0 人点赞
#kv-cache

Codec-Gauge:为Transformer KV缓存学习压缩友好的变换框架

arXiv cs.LG · 2026-07-24 缓存

Codec-Gauge 为Transformer KV缓存学习小型正交通道变换(度量),以在固定比特率下提高压缩保真度,显著降低多个模型和后端上的KL散度。

0 人收藏 0 人点赞
#kv-cache

代理中的提示缓存

Lobsters Hottest · 2026-07-23 缓存

本文解释了提示缓存在大语言模型代理中的工作原理,涵盖 KV 缓存机制、预填充和解码阶段,以及其对延迟、成本和代理设计的影响。

0 人收藏 0 人点赞
#kv-cache

@DogukanUrker: 单张RTX 3060上运行Gemma 4 12B:完整262,144上下文,速度约100 tok/s。(配置如下)密集模型 -> MTP推测…

X AI KOLs Timeline · 2026-07-21 缓存

DogukanUrker演示了在单张RTX 3060上使用推测解码和KV缓存拆分运行Gemma 4 12B,拥有完整262,144上下文,速度约100 tok/s,实现了接近满GPU利用率且无需CPU卸载。

0 人收藏 0 人点赞
#kv-cache

@Alacritic_Super: 想要掌握LLM缓存管理?从这些资源开始。KV缓存:https://huggingface.co/docs/transformers/mai…

X AI KOLs Timeline · 2026-07-21 缓存

精心整理的资源列表,用于掌握LLM缓存管理,包括关于KV缓存、前缀缓存及相关技术的解释、教程和研究论文。

0 人收藏 0 人点赞
#kv-cache

基于局部分布还原的高精度低位KV缓存量化

arXiv cs.LG · 2026-07-21 缓存

本文发现低位KV缓存量化会因logits的结构化局部误排名而降低大语言模型精度,提出DGAP方法,通过恢复Top-K候选的局部分布,在Llama-3.1-8B模型上将RULER准确率从47.8%恢复至83.2%,且仅增加极小的开销。

0 人收藏 0 人点赞
#kv-cache

SelKV:基于逐标记合并或丢弃及注意力补偿的选择性 KV 缓存合并

arXiv cs.AI · 2026-07-21 缓存

SelKV 是一个无需训练的 KV 缓存压缩框架,它使用软余弦门进行选择性合并,并通过注意力比例补偿机制纠正 softmax 不平衡,在仅保留 25% 缓存大小的情况下实现近乎无损的生成,在 LongBench 上取得 3.3 倍解码加速。

0 人收藏 0 人点赞
#kv-cache

@classiclarryd: 向LLM研究社区提问:是否有人知道完全可重复的实验结果表明MLA能……

X AI KOLs Following · 2026-07-20 缓存

一位研究者质疑在相同KV缓存下MLA优于GQA的可重复性,分享了早期小规模消融实验结果,并计划进行规模扩展实验以决定下一次大规模运行的架构。

0 人收藏 0 人点赞
#kv-cache

@akshay_pachaar:你的 KV 缓存中 90% 从未被重用。(提示缓存从未旨在解决此问题)如果你的系统提示和工具定义…

X AI KOLs Following · 2026-07-20 缓存

CacheBlend,EuroSys 2025 最佳论文,解决了由于提示缓存中严格的前缀匹配导致 90% 的 KV 缓存从未被重用的问题。通过选择性地仅重新计算文档之间的边界令牌,它在不损失质量的情况下实现了 2-4 倍的多文档处理速度提升,并在开源 LMCache 层中实现。

0 人收藏 0 人点赞
#kv-cache

VarRate: 无训练的可变速率KV缓存压缩用于长上下文大语言模型

arXiv cs.CL · 2026-07-20 缓存

介绍VarRate,一种无训练的KV缓存压缩方法,根据查询显著性为每个令牌分配可变低秩预算,避免了不可逆的令牌驱逐,并且在LongBench上以匹配的内存预算优于均匀秩方法。

0 人收藏 0 人点赞
#kv-cache

Looped Latent Attention: Cross-Loop KV Compression for Looped Transformers

arXiv cs.LG · 2026-07-20 缓存

提出循环隐注意力(LLA),一种训练后编解码器,通过利用递归步骤间的低秩结构压缩循环变压器中的KV缓存,在保持性能的同时实现显著压缩比。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈