@akshay_pachaar: NVIDIA的精彩论文。他们找到了一种使KV缓存可在模型间转移的方法。目标模型跳过预填充…

X AI KOLs Timeline 论文

摘要

NVIDIA的论文介绍了一种在LLM模型间传输KV缓存的方法,使目标模型能够跳过预填充,实现比重新处理上下文快2.7到25倍的转换。

NVIDIA的精彩论文。 他们找到了一种使KV缓存可在模型间转移的方法。 目标模型完全跳过预填充,转换过程比重新处理上下文快2.7到25倍。 让我们理解一下为什么这在今天如此重要。 LLM API是无状态的,因此每轮对话都会将整个对话发送回模型。模型在生成新令牌之前会重新读取所有内容,所有这些都作为输入计费。 提示缓存允许提供商为稳定的前缀保存KV缓存,并将缓存命中计费为基础输入费率的大约10%,因为该计算已经完成。 这种90%的减少是LLM服务中最大的杠杆之一。 但缓存仅适用于产生它的模型。由于键和值取决于该模型的权重,另一个模型无法直接重用它们。 这在LLM路由中成为一个问题。 如果由于成本或能力原因流量转移到另一个模型,累积的KV缓存将变得无效。 整个上下文必须重新处理,并按全价计费。 NVIDIA最近的论文将其视为表示问题。 预填充的主要输出是KV缓存,因此传输它意味着将一个模型的缓存转换为另一个模型期望的表示。 他们首先检查了这种转换是否有足够的结构可以利用。 对于Qwen3 14B → 32B,从单个源层的线性回归重建了目标模型键中方差的56%。 由于模型可能具有不同的层数,因此没有自然的的一对一层映射。 因此,对于每个目标层,他们按预测能力对源层进行排名,并一起使用前八个。 这将重建提高到79%。 映射器有三个部分: > 每个目标层和头都有自己的线性映射,以封闭形式求解,而不是使用梯度下降。 > 跨层选择选择最能预测每个目标层的源层。他们的消融研究表明这贡献最大。 > RoPE向键添加位置相关的旋转。他们移除它,在无位置空间中拟合映射,然后在推理时再次应用目标模型的旋转。 在来自Qwen3、Llama 3.1和Ministral 3的六对模型中,有四对保留了接收模型独立准确性的73%到98%。 转换也比重新处理上下文快3到25倍。 先前的跨模型KV重用方法要么为每对训练神经适配器,要么需要架构相同的模型。 这种方法是封闭形式且无需训练的,但仍然存在重要的限制。 每个测试对都属于同一模型家族,例如Qwen → Qwen或Llama → Llama。 跨家族传输仍然是未来的工作。 测试对还共享KV头数和每头维度。不匹配的配置尚未测试。 目前,这项工作仅涵盖密集全注意力模型,不包括滑动窗口或注意力循环混合模型。 论文链接:https://arxiv.org/abs/2608.03893 我写了关于KV缓存工作原理的第一性原理分析 文章引用如下。
查看原文
查看缓存全文

缓存时间: 2026/09/09 05:45

NVIDIA的这篇论文非常出色。

他们发现了一种在模型间转移KV缓存的方法。

目标模型完全跳过预填充阶段,转换速度比重新处理上下文快2.7到25倍。

让我们理解这在当下的重要性。

LLM API是无状态的,因此每轮对话都会将完整对话重新发送给模型。模型在生成新token前会重新读取所有内容,而这些都计为输入费用。

提示缓存允许提供商为稳定的前缀保留KV缓存,并以大约基础输入费率的10%对缓存命中收费,因为这些计算已完成。

这90%的减少是LLM服务中最大的杠杆之一。

但缓存仅对生成它的模型有效。由于键和值依赖于该模型的权重,另一个模型无法直接复用。

这在LLM路由中会成为问题。

如果流量因成本或能力原因切换到另一个模型,累积的KV缓存将失效。

整个上下文必须重新处理并按全价计费。

NVIDIA最近的论文将其视为表示问题。

预填充的主要输出是KV缓存,因此转移它意味着将一个模型的缓存转换为另一个模型所期望的表示形式。

他们首先检查这种转换是否有足够的结构可供利用。

对于Qwen3 14B → 32B,单个源层的线性回归可以重建目标模型键中56%的方差。

由于模型可能具有不同的层数,不存在自然的一对一层映射。

因此,对于每个目标层,他们按预测能力对源层进行排名,并结合使用前八个。

这将重建率提升至79%。

映射器包含三个部分:

每个目标层和注意力头都有自己的线性映射,通过闭式解而非梯度下降求解。

跨层选择挑选出能最佳预测每个目标层的源层。他们的消融研究表明这部分贡献最大。

RoPE为键添加位置相关的旋转。他们先移除RoPE,在无位置空间拟合映射,然后在推理时重新应用目标模型的旋转。

在来自Qwen3、Llama 3.1和Ministral 3的六对模型中,有四对保留了接收模型独立准确率的73%到98%。

转换速度也比重新处理上下文快3到25倍。

先前的跨模型KV复用方法要么为每对模型训练神经适配器,要么要求模型架构完全相同。

这种方法是闭式且无需训练的,但仍存在重要限制。

所有测试对都属于同一模型家族,例如Qwen → Qwen或Llama → Llama。

跨家族转移仍是未来的工作。

测试对还共享KV头数和每头维度。不匹配的配置尚未测试。

该工作目前仅涵盖密集全注意力模型,不包括滑动窗口或注意力循环混合模型。

论文链接:https://arxiv.org/abs/2608.03893

我写了一篇关于KV缓存工作原理的原理性解析

文章引用如下。


LLM家族中的跨模型KV缓存转移:用于预填充复用的闭式线性映射

来源:https://arxiv.org/abs/2608.03893 查看PDF(https://arxiv.org/pdf/2608.03893)HTML(实验性)(https://arxiv.org/html/2608.03893v1)

摘要:生产环境中经常在不同规模的模型之间切换以实现成本-质量级联、会话中途切换和路由,而每次切换都迫使接收方重新处理预填充。我们提出跨模型KV缓存转移,即接收方复用源的KV缓存以跳过预填充。我们发现跨模型KV在匹配的KV对(源和目标共享KV头数和每头维度)之间具有显著的线性结构。在Qwen3 14B->32B上,单个源层能解释目标键中56%的方差和值中32%的方差,使用多个源层后分别提升至79%和65%。基于此,我们设计了一个闭式岭映射器,它按注意力头操作并分三步进行。首先,对于每个目标层,我们选择最具预测性的前k个源层,并将它们的KV拼接作为输入。其次,我们在映射前从键中剥离RoPE,使得拟合与位置无关且可跨上下文长度复用。第三,我们在包含500个长度为1,024 token的FineWeb-Edu序列的小型校准集上拟合岭回归。令人惊讶的是,在三个家族的六对模型中,该线性映射器在四对模型上保留了接收方独立预填充准确率的73-98%,而另外两对则显著下降。非线性MLP在失败案例中最多恢复了+37个百分点的HellaSwag保留率。该映射器运行速度比重新预填充快2.7-25倍,并在多轮交接中保持稳定,使得跨模型KV缓存转移变得实用。

提交历史

来自:Taekyung Heo [查看邮件 (https://arxiv.org/show-email/ad08aa72/2608.03893)] [v1] 2026年8月4日(周二)16:26:47 UTC(1,193 KB)

相似文章

为扩散语言模型启用共享前缀的KV缓存

arXiv cs.LG

本文提出BiCache,一种面向扩散语言模型共享前缀的新型KV缓存技术,通过动态重用浅层中缓存的键和值来避免精度崩溃,并实现36.3%–98.3%的吞吐量提升。