FlexComp: 用于上下文中每种压缩比率的单一模型
摘要
FlexComp 是一个与方法无关的框架,它将压缩比率与训练和部署解耦,使得单一模型能够使用 Matryoshka 风格训练和基于每个输入的预算选择,在任何比率下压缩 LLM 上下文,以实现高效推理。
arXiv:2609.11192v1 公告类型:新
摘要:软上下文压缩将上下文浓缩为少数内存令牌,由冻结的 LLM 消费以替代原始文本,但现有的压缩器在训练和推理中固定了压缩比率:每个部署的比率都需要单独训练的模型,并且所选比率均匀应用于所有输入,而这些输入的实际需求差异很大。我们提出 FlexComp,一个与方法无关的框架,将比率与训练和部署都解耦:Matryoshka 风格训练对每个实例采样内存预算 $K$,将一个模型转变为任意比率压缩器,然后预算通过以下方式为每个输入选择:(1) 基于置信度的级联路由或 (2) 轻量级学习 $K$ 预测器。在 ICAE、500xCompressor 和 MRQA 上的 SAC 中,单一 FlexComp 模型以最小的性能下降匹敌单独训练的固定比率专家模型。级联路由在高达 266 倍平均压缩下保留超过 98% 的最温和比率的准确性;$K$ 预测器在单个压缩-解码过程中,达到 158-236 倍压缩,且 F1 分数与最温和比率相比在 0.7 以内。在服务级批量大小下,$K$ 预测器将上下文 KV 缓存减少 50%,并将解码吞吐量提高 47%。
查看缓存全文
缓存时间: 2026/09/11 08:25
# FlexComp:上下文压缩中的全能比率模型
来源:https://arxiv.org/html/2609.11192
作者:Kaiyan Zhao(东京大学 | 国立情报学研究所)\{kaiyan1006, miao, tsuruoka\}@logos\.t\.u\-tokyo\.ac\.jp, aizawa@nii\.ac\.jp
Akiko Aizawa(国立情报学研究所)\{kaiyan1006, miao, tsuruoka\}@logos\.t\.u\-tokyo\.ac\.jp, aizawa@nii\.ac\.jp
Yoshimasa Tsuruoka(东京大学)
###### 摘要
软上下文压缩将上下文浓缩为少量记忆标记,供冻结的大语言模型直接消费,取代原始文本。但现有压缩器在训练和推理时均固定压缩比率:每个部署比率需单独训练模型,且所选比率被统一对待所有输入,而实际需求差异巨大。我们提出**FlexComp**,一个与具体方法无关的解耦框架,将比率从训练和部署中分离:**套娃式训练**为每个实例采样记忆预算$K$,使单一模型成为任意比率压缩器;随后预算可通过两种方式按输入选择:(1) 基于置信度的级联路由或 (2) 轻量级$K$预测器。在MRQA数据集上的ICAE、500xCompressor和SAC实验中,单一FlexComp模型与分别训练的固定比率专用模型匹配度极高,性能衰减极小。级联路由在高达266倍平均压缩下仍保留超98%的最宽松比率准确率;$K$预测器在单次压缩-解码流程内达到158-236倍压缩,F1分数损失仅0.7(所有F1分数按0-100尺度报告)。在服务规模批量处理下,$K$预测器减少50%的上下文KV缓存,提升47%的解码吞吐量。
## 1 引言
大语言模型(LLMs)极少仅凭问题作答:在大多数应用中,除提示外还需*上下文*(如检索段落、工具输出、文档或对话历史)进行生成(Lewis et al., 2020;Yuan et al., 2025;Zhao et al., 2026)。提供这些上下文标记成本高昂,因为每次查询都需预填充,且其键值(KV)缓存会在整个生成过程中占据内存,常主导推理内存开销(Liu et al., 2025)。**上下文压缩**提供了一种有吸引力的解决方案:压缩器将上下文浓缩为少量软**记忆标记**,LLM基于压缩的软标记而非原始上下文进行推理(Ge et al., 2024;Li et al., 2025;Zhao et al., 2025;Liu et al., 2026;Miao et al., 2026)。尽管压缩质量持续进步,现有方法共享一个结构性限制:**压缩比率在训练和推理时均被固定**。如图1(https://arxiv.org/html/2609.11192#S1.F1)所示(上图),支持多种操作模式(例如对困难输入进行轻度压缩,内存稀缺时进行激进压缩)需要为每个比率训练、存储和部署单独模型。此外,部署的比率对所有输入**统一适用**,忽略各输入的实际需求。这种统一性是低效的,因为不同输入所需预算差异巨大。
图1:固定比率压缩 vs. FlexComp。上图:现有软标记压缩器中,每个部署的压缩比率需单独训练模型,模型对所有输入统一定用固定比率。下图:FlexComp训练单一模型支持任意比率,并在推理时通过级联路由或$K$预测器按输入选择预算。
图2(https://arxiv.org/html/2609.11192#S1.F2)显示,在MRQA(Fisch et al., 2019)的领域内子集中,大多数输入已通过单个记忆标记(软标记长度$K=1$)解决,但仍有显著部分输入需更大预算。固定$K$因此在两端都表现不佳:它为众多简单输入浪费标记,同时剥夺了少数困难输入的资源。更糟的是,最佳固定选择因领域而异,故单一比率无法良好服务所有部署。
图2:各输入所需预算差异巨大。对于每个子集,我们展示了**最小充足预算**的分布:SAC套娃模型正确回答所需的最小$K\in\{1,10,34\}$(记忆标记数)。大量输入在$K=1$(510倍压缩)时已可解,因此任何固定比率都可能非最优。
为此,我们提出**FlexComp**,一个将压缩比率从训练和部署中解耦的框架(图1(https://arxiv.org/html/2609.11192#S1.F1),下图)。FlexComp包含两个组件。首先,我们引入用于上下文压缩的**套娃式训练**,灵感来自套娃表示学习(Kusupati et al., 2022)。具体而言,训练时每个实例的软提示长度$K$随机采样,使**单一**模型学会在支持范围内将上下文编码为任意预算$K$的记忆标记。因此一个模型可替代整个固定比率压缩器家族,无需对底层方法进行架构更改。其次,由于预算现为推理时自由变量,我们引入两种互补策略按输入选择:**级联路由**从最激进预算开始,仅当解码器不确定时才重新编码为更大预算;以及轻量级**$K$预测器**,在压缩前承诺预算,从而在单次压缩-解码流程中作答。FlexComp与方法无关;我们在三种代表性压缩器上实例化:ICAE(Ge et al., 2024)、500xCompressor(Li et al., 2025)和SAC(Liu et al., 2026)。在MRQA(Fisch et al., 2019)的领域内(ID)和跨领域(OOD)问答任务中,单一套娃训练模型在各原生比率下匹配分别训练的固定比率专用模型(最坏情况下F1差距在1.3以内,且常在OOD上更优),将训练模型数从$n$个缩减至一个。在同一模型基础上,自适应预算选择提升了任何固定比率的准确率-压缩权衡:级联路由将平均压缩从15倍提升至最高266倍的同时,保留超98%最宽松比率的准确率;$K$预测器在单次压缩-解码流程中达到158-236倍压缩,F1损失最多仅0.7。这些节约并非名义上的:在服务规模批量处理下,预测器减少50%的上下文KV缓存,相比始终以最宽松比率运行,提升47%的聚合解码吞吐量。
总结,我们的贡献如下:
- • 我们展示套娃训练将固定比率上下文压缩器转变为单一**任意比率**压缩器,在三种不同方法上验证性能衰减可忽略。
- • 我们引入两种按输入的软上下文压缩预算选择策略:基于置信度的级联路由,以及压缩前承诺预算的$K$预测器;对于预测器,我们进一步证明这些节约转化为KV内存和解码吞吐量的提升。
- • 我们系统分析准确率-压缩权衡,发现在实例层面存在非单调性:在显著部分输入上,更大预算保留的表层细节可能误导解码器,而单个记忆标记在全额预算失败时可正确回答。
## 2 相关工作
上下文压缩方法分为两类:**软压缩**,将上下文编码为连续记忆标记;**硬压缩**,通过过滤或重写离散文本缩短提示的标记空间。我们的工作基于前者。
#### 软上下文压缩。
日益增多的研究将上下文压缩为少量连续记忆标记供冻结LLM消费,包括核心标记(gist tokens)(Mu et al., 2023)、AutoCompressors(Chevalier et al., 2023)、ICAE(Ge et al., 2024)、500xCompressor(Li et al., 2025)、EPL(Zhao et al., 2025)和SAC(Liu et al., 2026)。这些方法在软标记获取和监督信号上不同,但核心思想——通过软标记表示上下文——保持一致。此外,它们共享相同限制:压缩比率统一为训练时常数,每个部署比率需其训练模型,且所有输入获得相同预算。FlexComp正针对此维度,且与所有基础架构互补。
#### 硬上下文压缩。
另一正交类别通过过滤或总结离散文本来缩短提示的标记空间,例如Selective Context(Li et al., 2023)、LLMLingua系列(Jiang et al., 2024; Pan et al., 2024)和RECOMP(Xu et al., 2024)。硬压缩保持可解释性,但可实现的比率相比软压缩方法通常较温和。与软压缩方法类似,给定输入应压缩多少仍是开放问题,我们的预算选择策略旨在解决此问题。
#### 嵌套与预算条件表示。
套娃表示学习训练嵌入,其前缀在多维度下保持有效(Kusupati et al., 2022),该原则可扩展至模型宽度和其他容量维度(Devvrit et al., 2024)。我们将“一模型多预算”原则迁移至上下文压缩,结构差异在于:预算通过条件化编码器的记忆槽数量实现,而非截断固定表示(§3.2)。
#### 自适应计算与级联。
按输入分配推理成本有悠久历史,从早退出(Miao et al., 2024)到基于置信度从廉价模型升级至昂贵模型的LLM级联(Yue et al., 2024)。我们的级联在单模型内应用此方案,针对压缩预算而非模型升级;我们的$K$预测器类似于路由方法,在执行前承诺计算水平(Stripelis et al., 2024)。相关地,KV缓存驱逐与量化(Zhang et al., 2023; Li et al., 2024)在全上下文预填充后减少内存;软标记压缩则首先避免全上下文缓存的实现。
## 3 方法
图3:FlexComp概览。左:微调中的套娃训练。对于每个实例,随机采样预算$K$。LoRA适配的编码器将上下文压缩为$K$个记忆标记,冻结的解码器基于记忆标记和提示生成答案。右:两种利用由此产生的自由度的推理时预算选择策略。(a)级联路由从最激进预算开始,仅当解码器置信度低于阈值$\tau$时,重新编码为下一个更大预算。(b)$K$预测器是轻量级MLP头,将无预算编码器特征映射至$\mathcal{K}$上的分布,并在压缩前承诺预算,在单次压缩-解码流程中作答。
图3(https://arxiv.org/html/2609.11192#S3.F3)展示了FlexComp概览。我们首先固定符号和所基于的压缩器类别(§3.1),然后描述套娃训练——将固定比率压缩器转换为单个任意预算压缩器(§3.2),最后介绍两种推理时策略:基于置信度的级联路由(§3.3)和学习的$K$预测器(§3.4)。
### 3.1 预备知识:软标记上下文压缩
我们首先考虑编码器LLM $E_{\phi}$,将包含$L$个标记的上下文$c$压缩为$K \ll L$个连续**记忆标记**:$\mathbf{m}_{1:K} = E_{\phi}(c; K)$,冻结的解码器LLM $D$随后消费这些标记代替$c$以回答查询$q$,即$\hat{a} = D(\mathbf{m}_{1:K}, q)$。实践中,编码器$E_{\phi}$是$D$的LoRA适配副本,处理上下文连同$K$个可训练记忆标记。解码器在编码器后消费这些记忆标记的表示作为即插即用前缀,从而上下文在$D$的KV缓存中的占用从$L$个条目缩减至$K$个。此表述涵盖ICAE(Ge et al., 2024)、500xCompressor(Li et al., 2025)和SAC(Liu et al., 2026),它们在记忆标记位置和编码器监督方式上不同,但共享相同接口:训练前固定记忆槽数$K$,所得模型仅支持该预算。全文中,我们称$K$为**预算**;给定$|c|=L$,对应压缩比率为$L/K$。
#### 训练目标。
现有压缩器在固定$K$下经历两阶段训练。**预训练**阶段教编码器将通用文本打包为记忆标记:ICAE和500xCompressor监督解码器从$\mathbf{m}_{1:K}$重建或续写上下文(自编码或文本续写目标),而SAC直接优化基于其语义锚点的条件语言建模。抽象地,$\mathcal{L}_{\mathrm{PT}}(\phi) = \mathbb{E}_{c}\!\left[\ell\!\left(D\left(E_{\phi}(c;K)\right),\,t(c)\right)\right]$,(1)其中目标$t(c)$为上下文本身或其续写。随后的**微调**阶段将模型适配至下游用途,监督基于压缩上下文给出的答案:$\mathcal{L}_{\mathrm{SFT}}(\phi) = \mathbb{E}_{(c,q,a)}\!\left[\ell\!\left(D\left(E_{\phi}(c;K),q\right),\,a\right)\right]$。(2)
FlexComp保持两个目标不变,仅改变$K$的设定方式:套娃采样(公式3)包装$\mathcal{L}_{\mathrm{SFT}}$,而预训练刻意保持固定预算。相似文章
上下文压缩应该保留什么?我观察了六种智能体的处理方式[D]
分析六种AI编程智能体(Claude Code、Codex CLI、OpenCode、Cline、Cursor、Amp)如何趋同于分层渐进式压缩以处理长上下文,它们在保护内容(用户消息、有状态工具输出)以及是否告知模型压缩方面存在差异,并在成本与准确性之间进行权衡。
大规模端到端上下文压缩
本文提出隐上下文语言模型(LCLMs),这是一系列编码器-解码器压缩器,通过架构搜索和大规模预训练高效处理长上下文,在准确性、速度和内存使用上优于传统KV缓存方法。
长时段LLM智能体服务的并行上下文压缩
介绍了用于长时间范围LLM智能体的并行上下文压缩,实现了对摘要量的细粒度控制,并相比多个骨干模型上的顺序同步压缩,降低了端到端延迟。
如果上下文压缩是扩散噪声函数会怎样?提案 + 未经训练模型实验的真实结果 [R]
提议将语义压缩视为一种扩散噪声函数,用于处理超出模型窗口的庞大上下文,采用多遍读取并以递减的压缩级别进行。未经训练模型的实验表明,各组件在隔离状态下工作良好,但完整链条需要训练来解决绑定瓶颈。
FairCompressAgent: 一个用于FPGA部署的公平感知模型压缩智能体框架
本文提出了FairCompressAgent,一个智能体框架,它使用语言模型规划器来优化用于FPGA部署的公平感知模型压缩,平衡准确性、公平性和效率。