kv-cache-compression

标签

Cards List
#kv-cache-compression

🤡 如何让任何稀疏注意力/KV压缩看起来更好?🤡

Reddit r/ArtificialInteligence · 3天前

这篇文章批判了AI研究中的常见做法,通过利用基准测试缺陷和实现细节,使稀疏注意力和KV缓存压缩技术看起来比实际更有效。

0 人收藏 0 人点赞
#kv-cache-compression

更少Token,更小缓存:奖励协调的高效推理

arXiv cs.AI · 2026-08-06 缓存

本文提出ReCo,一种奖励协调的压缩框架,利用过程奖励估计器自适应压缩KV缓存、控制反思Token并启用早停,在保持准确率的同时,将推理模型的生成Token减少37%–65%,延迟降低约2倍。

0 人收藏 0 人点赞
#kv-cache-compression

@no_stp_on_snek: 还有人谈论 mlx-swift-lm 吗?说我在休息一天……清理了鸡舍,锻炼了一下,然后…

X AI KOLs Following · 2026-07-16 缓存

作者描述了将 TurboQuant KV-cache 压缩集成到 Apple 的 mlx-swift-lm 中,实现了 2.7 倍压缩,质量与 8-bit 相当,并通过融合 Metal 内核将解码速度提升了 3-4 倍。

0 人收藏 0 人点赞
#kv-cache-compression

REAL:面向长上下文KV缓存压缩的检索-推理与逻辑构建注意力行为

arXiv cs.CL · 2026-07-13 缓存

REAL引入了一种注意力行为矩阵,用于分析成功与失败案例中注意力头的行为,从而实现更有效的KV缓存驱逐。它在达到与最强基线相当准确度的同时,所需空间减少32倍。

0 人收藏 0 人点赞
#kv-cache-compression

保留什么,遗忘什么:大语言模型与智能体中内存压缩的率失真视角

arXiv cs.LG · 2026-07-10 缓存

本文在率失真框架下统一了大语言模型和智能体中的内存压缩技术,提出了一个用于评估不同层压缩的分类法和基准。

0 人收藏 0 人点赞
#kv-cache-compression

DepthWeave-KV:用于长上下文KV缓存压缩的令牌自适应跨层残差分解方法

arXiv cs.AI · 2026-07-08 缓存

DepthWeave-KV 是一种令牌自适应跨层残差分解方法,用于在长上下文Transformer推理中压缩KV缓存。该方法在64K上下文下实现8.3倍内存缩减和72.8令牌/秒的吞吐量,同时在各项基准测试中保持了接近完整缓存的任务质量。

0 人收藏 0 人点赞
#kv-cache-compression

FreqDepthKV: 频率引导的深度共享实现长上下文LLM推理中鲁棒的KV缓存压缩

arXiv cs.AI · 2026-07-08 缓存

提出FreqDepthKV,一种用于长上下文LLM推理中KV缓存压缩的频率引导深度共享方法。该方法将相邻层的KV状态分解为共享的低频成分和稀疏的高频残差,在保证基准测试精度的同时提升内存效率和吞吐量。

0 人收藏 0 人点赞
#kv-cache-compression

Kara: 通过滑动窗口KV缓存压缩实现高效推理LLM服务

arXiv cs.CL · 2026-07-03 缓存

本文提出了Kara,一种滑动窗口KV缓存压缩方法,用于高效服务推理型大语言模型。该方法通过使用双向注意力和Token2Chunk模块,解决了现有压缩技术中的局限性。该方法被集成到基于vLLM构建的KvLLM推理框架中,在保持性能的同时提高了输出吞吐量。

0 人收藏 0 人点赞
#kv-cache-compression

CompressKV:语义检索引导的KV缓存压缩方法,用于资源高效的长上下文大语言模型推理

arXiv cs.AI · 2026-06-24 缓存

CompressKV针对基于GQA的大语言模型,提出了一种语义检索引导的KV缓存压缩方法,通过识别语义检索头来保留关键令牌。在LongBench任务中,仅使用3%的KV缓存即可实现超过97%的全缓存性能。

0 人收藏 0 人点赞
#kv-cache-compression

PolyKV: 异构保留与分配的KV缓存压缩

arXiv cs.LG · 2026-06-16 缓存

PolyKV是一种逐层的KV缓存压缩框架,为每一层分配异构的驱逐策略和非均匀的预算,在LongBench上使用LLaMA-3.1-8B和Qwen3-8B相比统一基线有显著提升。

0 人收藏 0 人点赞
#kv-cache-compression

Tangram:解锁非均匀KV缓存压缩,实现高效的多轮LLM服务

Hugging Face Daily Papers · 2026-06-15 缓存

本文介绍了Tangram,一个服务框架,它静态解析多轮LLM服务中的非均匀KV缓存压缩,相比全KV基线实现了高达2.6倍的吞吐量提升,同时消除了运行时开销。

0 人收藏 0 人点赞
#kv-cache-compression

[基准测试] RTX 5090上的DFlash推测解码与KV缓存压缩 — 3.26倍加速

Reddit r/LocalLLaMA · 2026-06-08

在 RTX 5090 上对 DFlash 推测解码结合 KV 缓存压缩进行的基准测试显示,针对 Qwen3.6-27B 模型最高可实现 3.26 倍加速,且困惑度下降极小,其中 q4_0/turbo4 提供了最佳平衡。

0 人收藏 0 人点赞
#kv-cache-compression

@NFTCPS: 本地跑大模型的注意了! 有人把llama.cpp改造成了性能怪兽——BeeLlama.cpp,同样的显存,推理速度直接干到3倍,上下文容量扩展7.5倍,这不是PPT,是实测数据。 它把三个顶级优化方案塞进一个代码库: DFlash推测解码…

X AI KOLs Timeline · 2026-05-16 缓存

BeeLlama.cpp is a fork of llama.cpp that integrates DFlash speculative decoding, TurboQuant/TCQ KV-cache compression, and adaptive draft control, achieving up to 3x faster inference and 7.5x context expansion on the same hardware.

0 人收藏 0 人点赞
#kv-cache-compression

如何在强化学习后训练中压缩 KV 缓存?用于内存高效对齐的阴影掩码蒸馏

arXiv cs.LG · 2026-05-11 缓存

本文提出了阴影掩码蒸馏(SMD),旨在解决大语言模型在强化学习后训练中因 KV 缓存压缩而导致的离策略偏差。该方法引入了一种机制,确保在策略上的对齐,并提高长上下文推理任务的内存效率。

0 人收藏 0 人点赞
#kv-cache-compression

Forcing-KV:面向高效自回归视频扩散模型的混合KV缓存压缩策略

Hugging Face Daily Papers · 2026-05-10 缓存

本文介绍了Forcing-KV,这是一种针对自回归视频扩散模型的混合KV缓存压缩策略,它将注意力头分为静态和动态两类,在1080P分辨率下实现了高达2.82倍的加速,同时保持了输出质量。

0 人收藏 0 人点赞
#kv-cache-compression

OjaKV: 上下文感知的在线低秩KV缓存压缩

arXiv cs.CL · 2026-04-20 缓存

OjaKV 引入了一种上下文感知的在线低秩KV缓存压缩框架,该框架利用混合存储策略和Oja算法进行增量子空间自适应,以减少长上下文大语言模型推理中的GPU内存瓶颈,且无需模型微调。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈