Latent Cache Flow:无需文本的模型间通信

arXiv cs.LG 论文

摘要

本文介绍了 Latent Cache Flow(LCF),一种通过交换压缩后的KV缓存而非文本来实现高效模型间通信的方法,从而减少了适配器大小并实现了跨上下文通信。

arXiv:2605.22863v1 Announce Type: new 摘要:目前,LLM代理通过文本进行通信,由于需要自回归解码共享模型的状态并在接收模型处进行编码,这会导致显著的延迟和信息丢失。最近的工作如Cache-to-Cache(C2C;Fu等人,2026)尝试通过学习适配器来交换KV缓存,该适配器将共享模型的KV矩阵转换为接收模型。然而,这些适配器体积大且训练成本高,并且只能翻译单个token,这就要求目标上下文必须完全相同。这对于LLM具有不同上下文的代理通信是不合适的。 我们引入了Latent Cache Flow(LCF)。为了解决效率问题,我们观察到键和值可以联合翻译和压缩,从而将适配器大小减少到C2C的约4%。为了解决上下文不同的问题,我们设计了适配器来传输目标模型所没有的新信息摘要。我们的初步实验表明,一个13 MB的LCF适配器在共享上下文设置中可以比956 MB的C2C适配器更准确;对于不同上下文,LCF比基于文本的通信准确率提高了23%,速度提升了8.5倍。
查看原文
查看缓存全文

缓存时间: 2026/05/25 08:54

# 潜在缓存流:无需文本的模型间通信
来源:https://arxiv.org/html/2605.22863
###### 摘要

如今的LLM智能体通过文本进行通信,这会导致显著的延迟和信息损失,因为需要自回归解码共享模型的状态并在接收模型处编码。最近的研究如Cache-to-Cache(C2C;Fu et al., 2026 (https://arxiv.org/html/2605.22863#bib.bib6))尝试通过学习适配器将共享者的KV矩阵转换为接收模型,从而交换KV缓存。然而,这些适配器体积庞大且训练成本高昂,并且是对单个token进行转换,要求目标上下文必须相同。这对于LLM上下文不同的智能体通信场景不适用。

我们引入潜在缓存流(Latent Cache Flow, LCF)。为解决效率问题,我们观察到键和值可以联合转换并压缩,从而将适配器大小缩减至C2C的约4%。为解决上下文不同的问题,我们将适配器设计为传输目标模型所不具备的新信息的摘要。我们的初步实验表明,在共享上下文中,13MB的LCF适配器比956MB的C2C适配器更准确;在上下文不同的情况下,LCF比基于文本的通信准确度高出23%,速度提升8.5倍。

潜在缓存流, LCF, Cache-to-Cache, C2C, KV缓存, 缓存通信, 跨模型通信, 跨上下文通信, 多模型系统, LLM通信, LLM推理, 参数效率, 适配器效率, 瓶颈压缩, 键值压缩, 多头潜在注意力, 文本到文本通信

## 1 引言

语言模型工作流涉及多个具有不同角色、工具和上下文的模型(Yao et al., 2023 (https://arxiv.org/html/2605.22863#bib.bib1); Du et al., 2024 (https://arxiv.org/html/2605.22863#bib.bib2); Wu et al., 2024 (https://arxiv.org/html/2605.22863#bib.bib3); Chen et al., 2024 (https://arxiv.org/html/2605.22863#bib.bib4))。这些模型必须相互通信以整合其工作,通常通过生成的文本来实现。例如,一个模型可能总结文档片段,另一个模型则利用该总结来回答关于不同片段的问题。这种基于文本的通道速度较慢,因为接收方必须等待发送方解码,并且信息有损失,因为发送方的许多内部状态被压缩为离散的token。

Cache-to-Cache(C2C)(Fu et al., 2026 (https://arxiv.org/html/2605.22863#bib.bib6); Dery et al., 2026 (https://arxiv.org/html/2605.22863#bib.bib11))通过直接交换KV缓存来解决文本瓶颈问题。在C2C中,共享者和接收者处理相同的输入,学习到的适配器在匹配的token位置上融合它们的缓存。这绕过了中间文本生成,但也使C2C设计上具有位置依赖性。这种假设对于部署的多模型系统来说是限制性的,因为这些系统中模型因处理不同的子任务、工具或上下文而被使用。当它们的上下文不同时,token位置不再对齐,基于位置的缓存交换不再适用。C2C还引入了显著的适配器开销:对于一个1.1B参数的共享者-接收者对,其适配器大小为956MB。

我们引入潜在缓存流(LCF)来解决这两个限制。LCF将缓存传输视为压缩通信,而非逐token的转换。它用共享的低维缓存通道替换了独立的键和值融合器,并使用层剪枝移除那些无法从缓存更新中受益的接收者层。我们将LCF扩展到跨上下文通信,称为LCF-X。LCF-X不是将每个共享者token转换为接收者对齐的缓存更新,而是将共享者的完整KV缓存总结为一个固定大小的张量,接收者可以以此作为条件。

文本到文本(T2T)和C2C代表了两个极端。T2T灵活,因为共享者可以发送自由形式的文本,但需要付出解码延迟和token投影损失。C2C通过在匹配位置交换缓存避免了解码,但要求输入对齐。图1 (https://arxiv.org/html/2605.22863#S1.F1) 展示了LCF和LCF-X所瞄准的中间地带:压缩的缓存级通信,在提高效率的同时放宽了共享上下文的约束。

图注图1:概念上的效率-灵活性权衡。LCF提高了先前缓存级传输的效率,同时将C2C的对齐约束放宽到接近T2T的灵活性。
## 2 背景:Cache-to-Cache

跨模型传输的自然目标是KV缓存。该缓存是共享者前向传播的残差,包含逐层的键和值张量,这些张量总结了其对提示内容的读取。然而,直接重用缓存对于不同架构是不可行的。共享者和接收者在层数、注意力头数、头维度或学习到的潜在空间几何形状上可能不同。因此,接收者无法直接使用共享者的KV张量。Cache-to-Cache (C2C) 通过将共享者的缓存视为学习到的语义条件信号来解决这一挑战。C2C训练一个融合模块,该模块以两个模型的缓存作为输入,生成一个残差更新,该更新在解码前被添加到接收者缓存中。

图2 (https://arxiv.org/html/2605.22863#S2.F2) 展示了C2C融合器,它包含两个独立的重复模块,分别用于键和值张量。我们描述键侧;值侧的处理类似。

在共享者和接收者处理完提示后,它们输出逐层对齐的多头键 \(S_K\) 和 \(R_K\)。融合器将这些键拼接起来,并沿头维度展平,形成一个联合的逐token特征向量。然后,一个线性层将此向量投影到接收者的隐藏维度。一个MLP执行特征融合,将共享者和接收者的投影混合成一个联合编码。

融合后的特征分裂为两个并行路径。投影路径产生一个形状为接收者 \((H_t, D_h)\) 的逐头缓存更新 \(\Delta_K\)。动态权重路径产生一个逐头的标量 \(\alpha_K\),用于重新加权该更新。它们的逐元素乘积由一个学习的Gumbel-sigmoid门控进行掩码,这是一种可微分的开/关决策松弛,在推理时退火为二进制的层选择。最后,结果作为残差添加到 \(R_K\) 上,得到增强后的缓存 \(R'_K\)。

图注图2:C2C流程。黄色表示投影和维度变换操作;蓝色表示共享者输出;绿色表示接收者状态。
## 3 潜在缓存流

在本节中,我们首先描述潜在缓存流(LCF)的设计如何在上下文匹配时提高KV传输的效率。然后,我们描述一个名为LCF-X的扩展,它预处理共享者模型的KV缓存,以支持不同上下文之间的通信。

### 3.1 精确上下文共享的潜在缓存流

我们解决了C2C中两个主要的低效来源。首先,C2C独立处理键和值,为每个缓存复制融合器流程。然而,键和值是同一隐藏状态的投影。最近的架构,如Gemma 4(Google, 2026 (https://arxiv.org/html/2605.22863#bib.bib9)),通过全局注意力层的统一键值张量展示了这种冗余性。LCF用单个共享的键值流程替换了C2C的双流程。

其次,C2C在接收者的高维缓存空间中保持通信。它将共享者和接收者的缓存拼接、在全宽下融合,并输出接收者形状的残差。这使得传输成本高昂:每种缓存类型都需要自己的全宽融合器。

LCF转而通过一个低维的潜在瓶颈来传输信息。这个瓶颈基于两个观察:KV状态可以在模型内部被压缩(DeepSeek-AI, 2024 (https://arxiv.org/html/2605.22863#bib.bib7)),并且跨模型的表示可以近似线性对齐(Chen et al., 2025 (https://arxiv.org/html/2605.22863#bib.bib8); Dery et al., 2026 (https://arxiv.org/html/2605.22863#bib.bib11))。LCF结合了这些观察,将联合的键值表示投影到一个紧凑的潜在空间中,进行混合,然后将结果上投影回接收者缓存的残差。

图注图3:LCF/LCF-X架构。蓝色表示仅共享者状态,绿色表示仅接收者状态,黄色表示投影/压缩操作。共享者端的池化实现了跨上下文摘要;共享的LCF投影器压缩KV输入并上投影接收者缓存残差。图3 (https://arxiv.org/html/2605.22863#S3.F3) 展示了完整的架构,分为两部分:顶部的LCF-X池化模块和底部的核心LCF投影器。本节关注核心LCF投影器,它假设共享者和接收者缓存是token对齐的。

1. 输入。每个接收者Transformer层接收一对共享者缓存 \((S_K, S_V)\) 和接收者缓存 \((R_K, R_V)\)。

2. 拼接与展平。来自共享者和接收者的KV缓存张量被拼接,并沿头维度展平为单个张量。

3. 共享潜在流程。拼接后的张量 \(\mathbf{x}\) 线性下投影到 \(d\) 维:\(\mathbf{z} = W_{\mathrm{down}} \mathbf{x}\),接着是一个两层MLP。我们根据下游准确率(图4 (https://arxiv.org/html/2605.22863#S4.F4))选择 \(d \in \{64, 128, 256, 512\}\) 作为超参数。

4. 潜在分裂。潜在张量随后分裂为独立的键张量和值张量:\([\mathbf{z}_K, \mathbf{z}_V] = \mathbf{z}\),其中 \(\mathbf{z}_i \in \mathbb{R}^{B \times N \times d/2}\)。此时,键和值将被独立重建。

5. 门控。从完整的潜在张量 \(\mathbf{z}\) 生成逐头门控 \(\alpha_i \in \mathbb{R}^{h_r}\),使得K和V更新可以使用共享的潜在特征独立缩放。

6. 上投影。键和值张量被投影回接收者缓存大小:

\[
\Delta_i = W_{\mathrm{up}}^i \mathbf{z}_i, \quad i \in \{K, V\}.
\]

我们采用C2C的逐层Gumbel-sigmoid门控,在推理时产生 \(g_i \in \{0, 1\}\)。接收者缓存更新如下:

\[
\mathbf{R}'_i = \mathbf{R}_i + g_i \cdot (\alpha_i \odot \Delta_i), \quad i \in \{K, V\}.
\]

7. 增强的接收者KV。经过门控的残差更新了接收者的K和V缓存。

适配器参数。对于一对1.1B参数的模型,C2C需要477.8M参数的适配器模型。在 \(d=128\) 时,LCF在28层中仅需19.4M参数(每层693K)——比C2C少24.6倍。

### 3.2 LCF-X:跨上下文通信

LCF减少了C2C的适配器开销,但它仍假设共享上下文:共享者和接收者必须处理相同的提示,以便每个接收者token都有匹配的共享者token。这种基于位置的要求阻止了跨上下文通信。LCF-X通过用共享者从其自身上下文中学习到的无位置摘要替换匹配的共享者token来移除这一要求。如图3 (https://arxiv.org/html/2605.22863#S3.F3) 所示,LCF-X在标准LCF投影器之前添加了一个共享者端池化模块;因此,接收者以共享者学习到的上下文为条件,而不是以其自身提示的token对齐变体为条件。

我们将共享者的上下文划分为 \(P\) 个跨度 \(S_1, ..., S_P\)。一个跨度是源token的连续块,例如一个段落、篇章或固定大小的块。图3 (https://arxiv.org/html/2605.22863#S3.F3) 的第一部分展示了此池化步骤。LCF-X使用注意力作为池化操作:在每个跨度内,一个学习到的查询仅关注该跨度内的token,并产生一个键值摘要。在所有跨度上,这给出:

\[
\tilde{\mathbf{K}}, \tilde{\mathbf{V}} \in \mathbb{R}^{B \times H \times P \times D}.
\]

这些 \(P\) 个摘要保留了全局池化之前的跨度身份。更大的 \(P\) 为跨跨度注意力提供更多局部的摘要进行加权;更小的 \(P\) 则提供更少、更粗略的摘要。由于相同的池化查询被每个跨度重用,\(P\) 可以在推理时变化;同一个检查点可以总结一个段落、五个段落或一组滑动窗口的块。附录E.4 (https://arxiv.org/html/2605.22863#A5.SS4) 给出了跨度不变性分析。

然后,LCF-X对跨度进行池化。第二步注意力将 \(P\) 个跨度摘要聚合为一个逐头的共享者摘要:

\[
\mathbf{K}^*, \mathbf{V}^* \in \mathbb{R}^{B \times H \times 1 \times D}.
\]

该摘要被广播到接收者序列的所有位置,并替换LCF中共享者的匹配位置缓存。图3 (https://arxiv.org/html/2605.22863#S3.F3) 的下半部分显示,在此替换之后,标准的LCF投影器和接收者缓存保持不变。

LCF和LCF-X解决了C2C的不同限制。LCF将C2C的高维、特定缓存融合器替换为压缩的共享键值流程。LCF-X通过用池化的、无位置摘要替换匹配位置的共享者缓存,移除了共享上下文的假设。下一节将测试这些改变是否能在减少适配器开销的同时保持缓存传输的准确性。

## 4 实验

我们首先在共享上下文设置下评估LCF与C2C的比较,然后在跨上下文设置下评估LCF-X与T2T通信的比较,其中模型观察不同的上下文,并且必须分享新颖的信息。

### 4.1 共享上下文

#### 4.1.1 实验设置

共享上下文设置假设模型之间的token位置对齐。它测试了LCF的压缩主张:一个更小的潜在融合器是否能匹配或改进C2C的全宽缓存融合。

共享者是Qwen2.5-0.5B-Instruct,接收者是Qwen3-0.6B。我们使用OpenHermes 2.5(Teknium, 2023 (https://arxiv.org/html/2605.22863#bib.bib12)),与C2C的训练数据匹配,并保持两个基模型冻结。对于C2C,我们使用发布的完整调度检查点 `nics-efc/C2C_Fuser`。我们在相同的公开C2C方案下训练LCF,仅改变融合器架构。完整的超参数、过滤和计算细节见附录B (https://arxiv.org/html/2605.22863#A2)。

我们使用瓶颈维度 \(d=\{64,128,256,512\}\) 评估LCF对瓶颈维度的敏感性。我们还评估了层剪枝,即移除那些学到的门控接近零的接收者层。这测试了LCF是否能在不损失下游准确率的情况下进一步减小适配器大小。

我们在四个基于logit的零样本多项选择基准上进行评估。我们使用来自C2C基准套件的MMLU-Redux (MMLU-R)、ARC-Challenge (ARC-C) 和OpenBookQA (OBQA),并将C-Eval替换为MMLU-Pro以获得更强的英文覆盖。基于logit的评分通过直接从模型对答案选项的logits中读取预测答案,避免了自由形式解析的噪声。我们还与最优路由前沿(ORF)进行比较,这是一个逐问题预言机,当任一基模型正确时选择正确答案。

#### 4.1.2 训练成本

在匹配的流程下,训练时间由冻结模型的预填充主导,而非适配器计算。每个优化器步骤执行一次共享者预填充、一次接收者预填充、缓存融合以及一次适配器反向传播。这种方法为两个适配器固定了通信工作量,而不是围绕LCF进行优化。

(由于用户只提供了前四个部分,翻译到此结束。后续内容需要用户提供才能继续。)

相似文章

大规模端到端上下文压缩

Hugging Face Daily Papers

本文提出隐上下文语言模型(LCLMs),这是一系列编码器-解码器压缩器,通过架构搜索和大规模预训练高效处理长上下文,在准确性、速度和内存使用上优于传统KV缓存方法。

为扩散语言模型启用共享前缀的KV缓存

arXiv cs.LG

本文提出BiCache,一种面向扩散语言模型共享前缀的新型KV缓存技术,通过动态重用浅层中缓存的键和值来避免精度崩溃,并实现36.3%–98.3%的吞吐量提升。

KV Packet: 免重计算的上下文无关KV缓存用于大语言模型

Hugging Face Daily Papers

KV Packet 提出了一种免重计算的缓存复用框架,用于大语言模型。该框架使用可训练的软标记适配器来弥合上下文不连续性,消除了开销,同时在 Llama-3.1 和 Qwen2.5 上的性能与完全重计算基线相当。