@akshay_pachaar: NVIDIA的精彩论文。他们找到了一种使KV缓存可在模型间转移的方法。目标模型跳过预填充…
摘要
NVIDIA的论文介绍了一种在LLM模型间传输KV缓存的方法,使目标模型能够跳过预填充,实现比重新处理上下文快2.7到25倍的转换。
查看缓存全文
缓存时间: 2026/09/09 05:45
NVIDIA的这篇论文非常出色。
他们发现了一种在模型间转移KV缓存的方法。
目标模型完全跳过预填充阶段,转换速度比重新处理上下文快2.7到25倍。
让我们理解这在当下的重要性。
LLM API是无状态的,因此每轮对话都会将完整对话重新发送给模型。模型在生成新token前会重新读取所有内容,而这些都计为输入费用。
提示缓存允许提供商为稳定的前缀保留KV缓存,并以大约基础输入费率的10%对缓存命中收费,因为这些计算已完成。
这90%的减少是LLM服务中最大的杠杆之一。
但缓存仅对生成它的模型有效。由于键和值依赖于该模型的权重,另一个模型无法直接复用。
这在LLM路由中会成为问题。
如果流量因成本或能力原因切换到另一个模型,累积的KV缓存将失效。
整个上下文必须重新处理并按全价计费。
NVIDIA最近的论文将其视为表示问题。
预填充的主要输出是KV缓存,因此转移它意味着将一个模型的缓存转换为另一个模型所期望的表示形式。
他们首先检查这种转换是否有足够的结构可供利用。
对于Qwen3 14B → 32B,单个源层的线性回归可以重建目标模型键中56%的方差。
由于模型可能具有不同的层数,不存在自然的一对一层映射。
因此,对于每个目标层,他们按预测能力对源层进行排名,并结合使用前八个。
这将重建率提升至79%。
映射器包含三个部分:
每个目标层和注意力头都有自己的线性映射,通过闭式解而非梯度下降求解。
跨层选择挑选出能最佳预测每个目标层的源层。他们的消融研究表明这部分贡献最大。
RoPE为键添加位置相关的旋转。他们先移除RoPE,在无位置空间拟合映射,然后在推理时重新应用目标模型的旋转。
在来自Qwen3、Llama 3.1和Ministral 3的六对模型中,有四对保留了接收模型独立准确率的73%到98%。
转换速度也比重新处理上下文快3到25倍。
先前的跨模型KV复用方法要么为每对模型训练神经适配器,要么要求模型架构完全相同。
这种方法是闭式且无需训练的,但仍存在重要限制。
所有测试对都属于同一模型家族,例如Qwen → Qwen或Llama → Llama。
跨家族转移仍是未来的工作。
测试对还共享KV头数和每头维度。不匹配的配置尚未测试。
该工作目前仅涵盖密集全注意力模型,不包括滑动窗口或注意力循环混合模型。
论文链接:https://arxiv.org/abs/2608.03893
我写了一篇关于KV缓存工作原理的原理性解析
文章引用如下。
LLM家族中的跨模型KV缓存转移:用于预填充复用的闭式线性映射
来源:https://arxiv.org/abs/2608.03893 查看PDF(https://arxiv.org/pdf/2608.03893)HTML(实验性)(https://arxiv.org/html/2608.03893v1)
摘要:生产环境中经常在不同规模的模型之间切换以实现成本-质量级联、会话中途切换和路由,而每次切换都迫使接收方重新处理预填充。我们提出跨模型KV缓存转移,即接收方复用源的KV缓存以跳过预填充。我们发现跨模型KV在匹配的KV对(源和目标共享KV头数和每头维度)之间具有显著的线性结构。在Qwen3 14B->32B上,单个源层能解释目标键中56%的方差和值中32%的方差,使用多个源层后分别提升至79%和65%。基于此,我们设计了一个闭式岭映射器,它按注意力头操作并分三步进行。首先,对于每个目标层,我们选择最具预测性的前k个源层,并将它们的KV拼接作为输入。其次,我们在映射前从键中剥离RoPE,使得拟合与位置无关且可跨上下文长度复用。第三,我们在包含500个长度为1,024 token的FineWeb-Edu序列的小型校准集上拟合岭回归。令人惊讶的是,在三个家族的六对模型中,该线性映射器在四对模型上保留了接收方独立预填充准确率的73-98%,而另外两对则显著下降。非线性MLP在失败案例中最多恢复了+37个百分点的HellaSwag保留率。该映射器运行速度比重新预填充快2.7-25倍,并在多轮交接中保持稳定,使得跨模型KV缓存转移变得实用。
提交历史
来自:Taekyung Heo [查看邮件 (https://arxiv.org/show-email/ad08aa72/2608.03893)] [v1] 2026年8月4日(周二)16:26:47 UTC(1,193 KB)
相似文章
@somi_ai: 如果这个有效,你就不用每个应用都选一个模型了。便宜的模型处理无聊的任务。遇到困难的任务时,你把整个对话交给大模型,它不需要重新阅读。
NVIDIA的论文介绍了一种在AI模型之间传输KV缓存的方法,使目标模型可以完全跳过预填充阶段,并实现2.7到25倍更快的转换速度,这可能会提高多模型应用的效率。
@akshay_pachaar: https://x.com/akshay_pachaar/status/2074502882812952666
一份关于KV缓存管理的实践指南,介绍开源LMCache架构,该架构通过消除代理工作流中的冗余上下文处理,将输入令牌成本降低90%,并将LLM推理速度提升高达14倍。
@yukangchen_: 我们很高兴分享一篇新的技术文章《KV缓存压缩及其基础设施问题》。https://research.nvidia.…
NVIDIA Research发布了一篇技术博客,探讨KV缓存压缩技术及其基础设施问题,包括FlashAttention和paged attention如何为长上下文LLM的生产部署带来实际障碍,并提出了一个使用RoPE的几何解决方案。
为扩散语言模型启用共享前缀的KV缓存
本文提出BiCache,一种面向扩散语言模型共享前缀的新型KV缓存技术,通过动态重用浅层中缓存的键和值来避免精度崩溃,并实现36.3%–98.3%的吞吐量提升。
@Michaelzsguo: KV缓存是模型在生成期间的工作记忆。随着上下文窗口变长,模型必须保留更多…
DeepSeek的KV缓存压缩创新,包括MLA和CSA/HCA,将KV缓存大小减少了93%,实现了高效的长上下文推理和基于SSD的缓存,正如antirez的ds4.c项目所展示的那样。