模型在预填充阶段做笔记:KV缓存可编辑且可组合

arXiv cs.LG 论文

摘要

本文提出,Transformer中的KV缓存充当了记忆化结论的笔记本,使得无需完全重计算即可进行精确编辑和组合。该方法在保持跨模型规模决策等价性的同时,实现了显著的延迟降低。

arXiv:2606.17107v1 公告类型:新论文 摘要:前缀缓存仅能在完全共享的前缀上复用预填充结果,因此只要某个字段发生变化,就会导致整个下游缓存失效。然而,覆盖该字段本身的键值向量并复用其余部分,会导致模型依然基于旧值进行运算。原因(在四个模型系列中通过因果分析确立)在于:在预填充阶段,模型已经将基于该字段条件得出的结论写入了下游笔记;该字段本身的键值对决策的贡献不足1%。如果将KV缓存视为一份记录已记忆结论的笔记本,那么就会引申出两种能力。(1)可编辑性:一个显著的勘误可以修正笔记;在使用思维链时,仅编辑该字段即可恢复决策(8B模型上准确率1.00,计算开销约1%),而不使用思维链时该编辑会被忽略。(2)可组合性:笔记具有位置可移植性,因此可以将预编译的技能通过RoPE重新定位后拼接到任意上下文中,效果与完全重计算无法区分(十二个模型上的logit余弦相似度0.90-0.999),并且首token延迟从O(L^2)降至O(L)。一个统一的编辑+组合智能体在保持与重计算决策一致的前提下,延迟降低多达14.9倍。该方法适用于任何基于逐token注意力机制的KV缓存,并在不同规模、量化、混合专家模型和多模态缓存上得到验证,还能通过小型适配器扩展到多种注意力变体。由于勘误仅追加写入,因此可以与生产环境中的前缀缓存结合使用:在在线vLLM基准测试中,前缀缓存对齐率达到98.5%,p90首token延迟降低53-398倍。
查看原文
查看缓存全文

缓存时间: 2026/06/17 05:35

# KV 缓存可编辑且可组合 来源:https://arxiv.org/html/2606.17107 ## 模型在预填充时记笔记:KV 缓存可编辑且可组合 ###### 摘要 前缀缓存仅能在完全共享的前缀上复用预填充结果,因此一旦某个字段发生变化,整个下游缓存就会失效。然而,仅覆盖该字段自身的键/值向量并复用其余部分,会导致模型基于*旧*值进行推理。原因在于(经四个模型系列因果验证):在预填充阶段,模型已将*字段条件化的结论*写入了下游*笔记*中;而字段自身的键/值对决策的驱动贡献不足1%1\\%。将 KV 缓存视为一份已记忆结论的笔记,则会引出两种能力。\(1\) 它是可编辑的。一个显著的*勘误*可修正这些笔记;借助*思维链*,仅编辑字段即可恢复决策 \(1.001.00,8B8B模型,约∼1%\{\\sim\}1\%计算量\),而无 CoT 时编辑会被忽略。\(2\) 它是可组合的。笔记是位置可移植的,因此预编译的技能可以通过 RoPE 重定位并拼接到任意上下文中,与完全重计算无法区分(logit 余弦相似度0.900.90–0.9990.999,十二个模型),且首 Token 延迟为O(L)O(L)而非O(L2)O(L^\{2\})。一个统一的编辑+组合代理在决策上与重计算保持一致,延迟最多降低14.9×14.9\\times。该方法适用于任意逐 Token 注意力 KV 缓存,并已在不同规模、量化、混合专家和多模态缓存上得到验证,还可通过小型适配器扩展至多种注意力变体。由于勘误是追加式的,它能与生产环境中的前缀缓存组合:在在线 vLLM 基准测试中保持了前缀缓存对齐(98.5%98.5\\%命中率),将p90p90首 Token 延迟降低了5353–398×398\\times倍。

## 1 引言

现代 LLM 代理在每次轮次中都会重新读取长且大部分静态的指令——系统策略、工具规范、检索文档。键/值(KV)缓存通过跨轮次复用预填充结果使得这一过程成本可负担,但仅能复用*完全*共享的前缀。一旦复用区域内部的一个 token 发生变化——例如时间戳、用户 ID、订单状态——*每个*后续 token 的键和值都会失效,因为每个 token 都曾关注过那个发生变化的 token。实际采用的变通方法——将*所有*可变内容*提升*至末尾,使静态前缀保持缓存对齐——将推理层的约束推到了应用层:多个位置引用的字段、嵌套的子代理提示、以及动态拼接的上下文都无法干净地全部提升,而且应用必须预先列举每个可变字段。

本文从一个具体谜题出发。缓存中*在字段之前*的区域,根据构造与字段值无关——当字段变化时,我们测量到键/值偏差恰好为0.00.0。因此,人们可能希望*精准地*仅刷新字段自身的键和值,保持缓存其余部分过时,并以几乎为零的成本完成。我们发现这完全失败:模型的决策恢复到*旧*字段值,仿佛编辑从未发生过(图̃1 (https://arxiv.org/html/2606.17107#S1.F1)b)。

### 发现。
其原因(我们通过因果分析确立)在于,Transformer 并非将推理推迟到解码阶段。在*预填充*阶段,模型已经计算出了*字段条件化的结论*并将其写入了下游 token——不成比例地写入聚合器/分隔符 token,后续位置通过它们进行注意力。决策随后读取这些*笔记*,而非字段本身:在模型中,字段自身的 KV 对决策的因果驱动占比小于1%1\\%,而下游笔记则驱动了几乎所有决策。KV 缓存最好被理解为一份*已记忆结论的笔记*(图̃1 (https://arxiv.org/html/2606.17107#S1.F1)a)。

参见图注
图1:模型在预填充时记笔记。\(a\) 在预填充阶段,模型将字段条件化的结论记忆到下游聚合器 token 上(橙色);在解码阶段,决策读取这些笔记(蓝色)。\(b\) 因此,仅编辑字段自身的 KV 会被忽略(若无推理链),但决策可以通过低成本方式恢复:重新计算*受影响*的下游后缀,或者——更便宜且更稳健——追加一个显著的*勘误*(新决策,无 CoT 模型;若使用思维链,仅刷新字段也可工作,图̃2 (https://arxiv.org/html/2606.17107#S1.F2)c)。\(c\) 由于笔记是位置可移植的,预编译的技能可以以O(L)O(L)而非O(L2)O(L^\{2\})时间粘贴到新上下文中。

### 一个机制衍生两种能力。
一旦 KV 缓存被理解为笔记,我们就可以直接操作这些结论——编辑或复用而非重计算——通过两种方式。\(1\) 如果结论已经写入下游,那么*编辑*一个字段就意味着修改笔记,而非重计算它们。廉价且稳健的修复是添加一行显著的*勘误*来覆盖过时的笔记;另一种方法是重新计算受影响的下游笔记(对整个受影响后缀可靠,对 top-KK 的字段+选择性@KK 则廉价但不可靠)。更便宜的就地刷新(仅刷新字段)受限于*思维链*:存在推理链时模型会重新读取字段,编辑即可生效;无推理链时编辑被忽略。\(2\) 如果笔记是局部化且位置可移植的,那么可复用的技能可以通过重定位并拼接其缓存的笔记*组合*到新上下文中——无需重计算。一个*统一*实验——在移植的技能*内部*编辑字段——表明这两个操作作用于同一套笔记。图̃2 (https://arxiv.org/html/2606.17107#S1.F2)预览了这两种能力。更广泛地,我们将编辑和组合视为*可编程* KV 缓存的首批实例——一种结构化内存,系统(以及最终训练来暴露它的模型)可以读取、写入和重新排列,而不仅仅是线性扩展。

参见图注
图2:编辑与组合预览(Qwen3-8B,除非另有说明;详见第̃3 (https://arxiv.org/html/2606.17107#S3)、第̃4 (https://arxiv.org/html/2606.17107#S4) 和第̃6 (https://arxiv.org/html/2606.17107#S6)节)。\(a\) *KV 编辑全景图*:朴素编辑(过时、仅字段无 CoT、CacheBlend)失败,而仅追加的勘误/字段+勘误能廉价且稳健地达到完全重预填充的正确性(提升方法也有效但需要提示手术)。\(b\) *重计算受影响的笔记*:随着更多后字段*受影响后缀*被重计算,恢复率上升——极限情况下可靠,但廉价的 top-KK版本(字段+选择性@KK)不可靠(图̃5 (https://arxiv.org/html/2606.17107#S4.F5))。\(c\) *思维链(而非模型大小)是最廉价编辑的门控*:使用 CoT 时,近乎免费的仅字段刷新即可恢复决策(1.001.00);无 CoT 时被忽略(0.000.00);勘误对两者都有效。\(d\) *组合+编辑无损*:统一代理在多个模型上与完全重计算在决策上保持一致。

### 论文结构。
- •**机制**(第̃3 (https://arxiv.org/html/2606.17107#S3)节)——*注意力介导的记忆化推理*——通过四种因果探测(局部性补丁、后缀浓度、线性探测、电路消融)以及四种进一步控制(内容/结论分离、层时间、特异性、笔记注入;附录̃C (https://arxiv.org/html/2606.17107#A3))建立,在*四个模型家族*(Qwen3、Llama-3.1、Gemma-2、Mistral)中复现,解析为*组件级电路*——命名读写头、因果结论方向、SAE 特征、注意力 vs. MLP、因果擦洗(附录̃D (https://arxiv.org/html/2606.17107#A4))——并连接到可解释性中观察到的分隔符 token 聚合。
- •**编辑能力**(第̃4 (https://arxiv.org/html/2606.17107#S4)节):朴素 KV 编辑失败;勘误 / 字段+勘误修复匹配提升至末尾的 oracle 方法,无需提示手术;分析何时∼1%\{\\sim\}1\%计算量的就地编辑有效(需要推理且强烈依赖于模型);与*权重*编辑(ROME、LoRA)的正面比较显示,它不适合处理可变每请求状态(全局污染、附带损伤,慢3030–50×50\\times倍)。
- •**组合能力**(第̃5 (https://arxiv.org/html/2606.17107#S5)节):位置可移植地移植预编译技能,O(L)O(L)vs.O(L2)O(L^\{2\})首 Token 延迟(32k32k时13.9×13.9\\times),带有接缝修复旋钮——建立在前序缓存工作基础上(第̃2 (https://arxiv.org/html/2606.17107#S2)节),我们的新增内容是解释其背后的机制以及正确性视角。
- •**统一**(第̃6 (https://arxiv.org/html/2606.17107#S6)节):该实验及一个统一的编辑+组合代理,涵盖十三个模型。
- •**应用:用户记忆**(第̃7 (https://arxiv.org/html/2606.17107#S7)节):大型、可变的用户记忆文档同时被组合(预编译、重定位、拼接)和编辑(就地/勘误)为一套笔记——在决策上忠实于完全重计算,首 Token 延迟降低2.32.3–4.3×4.3\\times倍,经验证至7070B模型及真实长对话记忆(LoCoMo,移植≡\\equiv完全重计算在 QA 精度上)——带有预注册、统计控制的评估。
- •**适用于多模态和新注意力机制**(第̃8 (https://arxiv.org/html/2606.17107#S8)节):该机制从小模型到 MoE、低比特量化再到多模态图像缓存均成立;轻量适配器将其扩展到 MLA 和交织 M-RoPE;基于掩码的补救方法处理滑动窗口注意力;我们还标明了其在2026年稀疏/压缩注意力前沿上的失效边界。
- •**系统收益**(第̃9 (https://arxiv.org/html/2606.17107#S9)节):一个真实代理环境及全面的在线 vLLM 服务基准测试(V1引擎、连续批处理、泊松负载)——98.5%98.5\\%vs.1%1\\%前缀缓存命中率,p90p90首 Token 延迟降低5353–398×398\\times倍,且吞吐量随负载增长至14.5×14.5\\times。

## 2 相关工作

### 计算存储的位置及如何编辑。
一系列可解释性工作将*知识*的存储定位在 Transformer 权重中并进行编辑:ROME 和 MEMIT[22 (https://arxiv.org/html/2606.17107#bib.bib1),23 (https://arxiv.org/html/2606.17107#bib.bib2)]定位并重写 MLP 权重中的事实关联,而电路分析(如间接目标识别研究[32 (https://arxiv.org/html/2606.17107#bib.bib4)])追踪特定计算如何由注意力头承载。权重编辑针对*持久、全局*的事实;我们在表̃1 (https://arxiv.org/html/2606.17107#S4.T1)中与忠实的 ROME 和 LoRA 微调进行了经验对比,发现它们不适合*可变每请求*状态——全局编辑会污染并发请求并损害无关决策——而这正是可编辑 KV 缓存填补的空白。最接近的精神是Lindsey等人[17 (https://arxiv.org/html/2606.17107#bib.bib5)]发现模型在前向传播中将*计划*提交到特定 token(例如,将计划好的韵律存储在换行 token 上)。我们研究一个互补的对象:不是权重也不是解码时的计算,而是*KV 缓存*——推理系统已经存储、编辑器可以直接操作的激活——并展示它持有集中在聚合器/分隔符 token 上的*记忆化结论*。据我们所知,这是首次对为什么就地 KV 字段编辑失败以及应该怎么做进行因果解释。

### KV 复用与可组合缓存。
重用超出精确前缀的预计算 KV 是一个活跃的系统主题,我们的*组合*能力直接建立在其之上;我们不声称任何缓存机制是新颖的。Prompt Cache[7 (https://arxiv.org/html/2606.17107#bib.bib6)]预先计算可重用的提示模块,带有位置占位符并拼接使用。CacheBlend[35 (https://arxiv.org/html/2606.17107#bib.bib7)]重用非前缀块 KV 并选择性重计算∼15%\{\\sim\}15\%的 token 以修复交叉注意力。EPIC[11 (https://arxiv.org/html/2606.17107#bib.bib8)]引入了位置无关缓存和AttnLink,仅重计算少量块边界 token(利用注意力汇点),实现接近线性的重计算。CacheSlide[18 (https://arxiv.org/html/2606.17107#bib.bib9)]通过相对位置依赖的缓存以位置*感知*的方式重用 KV,而 MPIC[40 (https://arxiv.org/html/2606.17107#bib.bib10)]将位置无关缓存扩展到多模态设置,通过重计算图像边界 token;KVLink[34 (https://arxiv.org/html/2606.17107#bib.bib11)]是另一个重用系统。用我们的术语来说,我们的 RoPE 重定位是 CacheSlide 的相对位置重用,我们的接缝修复是 CacheBlend/EPIC/MPIC 的边界重计算,而我们的图像 KV 移植是 MPIC 的思想(我们*重新旋转* M-RoPE 而非重计算)。我们在这条线上的贡献是正交的:\(i\) *机制*——解释*为什么*边界重计算是必要的;\(ii\) *决策治理*评估——移植的技能是否仍然*治理工具决策*,而不仅仅是保持困惑度或吞吐量;\(iii\) *编辑*维度以及编辑+组合的统一;\(iv\) 将操作扩展到新注意力表示(MLA、交织 M-RoPE、滑动窗口)的适配器。我们诚实地指出,这个可编辑/可组合缓存的方向直接源于 EPIC 和 CacheSlide[11 (https://arxiv.org/html/2606.17107#bib.bib8),18 (https://arxiv.org/html/2606.17107#bib.bib9)]的位置无关和位置感知缓存,以及与胡俊豪(EPIC 的第一作者;见致谢)的讨论。

### 前缀缓存、KV 压缩与重用系统。
生产环境中的前缀缓存(vLLM 自动前缀缓存、SGLang RadixAttention)重用精确前缀。大量文献转而*压缩*或*淘汰*缓存:StreamingLLM 保留注意力汇点[33 (https://arxiv.org/html/2606.17107#bib.bib12)];H2O[39 (https://arxiv.org/html/2606.17107#bib.bib13)]、Scissorhands[20 (https://arxiv.org/html/2606.17107#bib.bib16)] 和 SnapKV[16 (https://arxiv.org/html/2606.17107#bib.bib14)] 淘汰低重要性 token;Quest[29 (https://arxiv.org/html/2606.17107#bib.bib15)] 保留所有 token 但稀疏地参与注意力。服务系统跨请求流式传输或共享缓存的 KV——CacheGen[19 (https://arxiv.org/html/2606.17107#bib.bib17)] 用于快速加载,RAGCache[14 (https://arxiv.org/html/2606.17107#bib.bib18)] 用于检索复用。这些方法改变了*哪些* token 存在,并且仅与我们的编辑/移植操作在保留的 token 上兼容;我们在第̃8 (https://arxiv.org/html/2606.17107#S8)节中将它们、多头潜在注意力[2 (https://arxiv.org/html/2606.17107#bib.bib29),3 (https://arxiv.org/html/2606.17107#bib.bib30)]的潜在/解耦 RoPE 表示,以及2026年的稀疏/压缩注意力设计视为范围边界。我们的重定位依赖于旋转位置嵌入[28 (https://arxiv.org/html/2606.17107#bib.bib27)]及其扩展[25 (https://arxiv.org/html/2606.17107#bib.bib28)]。

### 激活层面的干预。
除了权重编辑,还有一系列工作对*激活*进行干预:引导和推理时干预[15 (https://arxiv.org/html/2606.17107#bib.bib19)]、任务和函数向量[12 (https://arxiv.org/html/2606.17107#bib.bib20),30 (https://arxiv.org/html/2606.17107#bib.bib21)],以及我们改编的因果中介/激活补丁方法论[31 (https://arxiv.org/html/2606.17107#bib.bib22)]。这些方法编辑残差流方向以改变行为;我们则直接读取和写入*KV 缓存*本身——服务系统已经持久化的逐 token 激活——这使得干预既可解释又高效。

相似文章

KV缓存压缩的风险

arXiv cs.LG

本文从理论上刻画了变压器中KV缓存压缩的极小极大风险,为因果掩码下的精确压缩提供了设计原则,并将其实例化到实用算法中,在LongBench上取得了有前景的结果。