压缩中的迷失:抽取式提示压缩器的跨语言可控审计

arXiv cs.CL 论文

摘要

本文对十种语言的抽取式提示压缩器进行了审计,揭示了经过英语训练的模型在高压缩率下对非英语文本存在显著性能差距,并提出了一种更有效的“先翻译再压缩”流程作为替代方案。

arXiv:2608.26175v1 公告类型:新 摘要:抽取式提示压缩通过移除低信息量令牌来降低大型语言模型的推理成本,诸如LLMLingua-2等学习型压缩器在英语基准测试中报告了强劲的结果。大多数其他语言本就支付着“令牌溢价”:相同内容消耗的令牌数量是英语的1.3-1.8倍。我们提出疑问:压缩是缩小还是扩大了这一差距?通过使用涵盖五种文字、十种语言的完全平行数据,并在目标模型的分词器中进行预算匹配控制,我们审计了四个学习型压缩器与四个确定性基线方法在十家供应商的十一个目标模型(超过250,000次评估调用)上的表现。其中三个压缩器使用英语监督进行训练(LLMLingua-2的XLM-R/mBERT;来自生产级Headroom技术栈的Kompress-v2);第四个,XProvence,则是多语言训练的。首先,迁移差距是真实存在的,它在不同的目标模型和压缩器主干网络上均可复现,并且与压缩率强烈相关:在0.33的保留率下,英语能保留57-62%的归一化上下文利用率,而立陶宛语仅保留10-24%,中文则几乎没有保留,尽管中文的令牌溢价最小。其次,差距的根源在于压缩器的监督数据,而非其架构。所有三个英语训练的压缩器都表现出此差距,确定性方法没有显示出可比的差距,而多语言训练的XProvence v1则没有此问题。然而,其v2版本在翻译数据上重新训练后,在其激进的阈值下,会清空92%的中文上下文,且没有任何警告。第三,在更具挑战性的长上下文设置中,激进的学习型压缩会将压缩后的上下文驱使至无上下文效用水平或以下,在五种非英语语言中有三种语言出现此情况。在三种已测试的语言中,“先翻译再压缩”流程以大约一半的令牌成本达到或超越了原生压缩的效果。我们已发布所有代码、压缩结果和模型输出。在英语之外,安全的压缩预算要小得多。
查看原文
查看缓存全文

缓存时间: 2026/08/28 09:23

# 抽取式提示压缩器的跨语言可控审计  
来源:https://arxiv.org/html/2608.26175  
###### 摘要

抽取式提示压缩通过移除上下文中低信息量的词元来降低大语言模型的推理成本,而诸如 LLMLingua-2 之类的学习型压缩器在英文基准测试中表现优异。其他大多数语言本就面临*词元溢价*问题:相同内容的词元数量是英文的1.3–1.8倍。我们探究压缩技术是缩小还是扩大了这一差距。本研究使用涵盖五种文字系统的十种语言的完全平行数据,在目标模型分词器的预算匹配控制下,针对来自十家供应商的十一个目标模型(超过25万次评估调用),对四种学习型压缩器与四种确定性基线进行了审计。其中三种学习型压缩器采用英文监督训练(LLMLingua-2 XLM-R/mBERT;来自生产级 Headroom 技术栈的 Kompress-v2);第四种 XProvence 则是基于查询感知的多语言剪枝器。我们报告三项发现:第一,迁移差距真实存在,可在不同目标模型和压缩器骨干网络中复现,且具有强烈的比率依赖性——在0.75的保留率下各语言表现相近,但在0.33保留率下,英文能保持57–62%的标准化上下文利用率,立陶宛语仅保持10–24%,而中文几乎为零,尽管中文在九种语言中的词元溢价最小。第二,该差距与压缩监督数据相关而非架构。三种英文训练的压缩器均显现该差距(在主要模型上0.5保留率时平均差距达+0.23至+0.31,9种语言中有9种显著),确定性方法未见类似差距,多语言训练的 XProvence v1 版本则完全无此现象。其 v2 版本基于翻译数据重训后,在激进阈值下会清空92%的中文上下文且无任何预警。第三,在更具挑战性的长上下文场景中,激进的学习型压缩会将五种非英文语言中的三种压缩至无上下文效用水平,而英文仍可用。在五种测试语言中,三种语言的“先翻译后压缩”流程以约一半的词元成本匹配或超越原生压缩效果。我们公开所有代码、压缩结果和模型输出。安全压缩预算在非英文语言外要小得多。

## 1 引言

长提示占据了部署大语言模型应用的主要成本。检索文档、工具输出和对话历史往往比问题本身长数个数量级。*提示压缩*通过在到达目标模型前缩短上下文来解决这一问题。最实用的抽取式方法中,小型模型决定保留哪些词元或句子,其余部分被丢弃,压缩后的提示仍为纯文本,可与任何API兼容[11,20,14]。

这些方法的开发、训练和评估几乎完全基于英文。然而分词经济学已使其他语言处于劣势:子词词表将大部分容量分配给英文,因此资源较少的语言和非拉丁文字持续承受词元溢价[21,1]。在我们的平行语料库中,九种非英文语言的相同段落比英文多消耗1.3–1.8倍词元(图6),在Qwen2.5的分词器下甚至达到4.5倍(印地语)。正因如此,压缩技术在测试最少的语言中潜力最大。若采用英文监督训练的压缩器在非英文文本上性能不成比例地下降,其用户将面临双重惩罚:词元成本更高,压缩质量损失更大。

据我们所知,本文提供了首个抽取式提示压缩的可控跨语言审计。我们固定语义内容(十种语言的完全平行评估项),固定*目标模型*分词器的词元预算,并在来自十家供应商的十一个目标模型上,将四种学习型压缩器(三种英文监督,一种多语言训练)与确定性基线(匹配相同实现预算)进行比较。

我们的贡献包括:

1. **可控审计协议**:通过配对平行项、预算匹配锚点和完整/无上下文/打乱上下文锚点,将压缩器质量与任务难度、分词器效应和模型行为分离(第3节)。
2. **迁移差距的比率依赖性与监督语言关联性证据**(第4节):在0.33保留率下,8种非英文语言存在显著差距(主要目标模型),该现象在另外九个目标模型和所有三种英文监督压缩器(XLM-R/mBERT/ModernBERT骨干)中复现;确定性方法未显示可比差距(仅在一个模型的最深预算处出现孤立显著案例),多语言训练的 XProvence v1 亦无此现象。
3. **长上下文压力测试**:学习型压缩将非英文上下文性能降低至无上下文水平(第5节)。
4. **翻译套利分析**:证明“先翻译后压缩”可主导原生压缩(第6节),并讨论翻译腔问题。

本文结构如下:第2节回顾相关工作;第3节描述审计协议的语言、条件、指标和目标模型;第4节呈现主要结果;第5节报告长上下文压力测试和任务依赖性分析;第6节进行翻译套利分析;第7节讨论机制、实践建议与局限性;最后在第8节给出结论。

## 2 相关工作

### 提示压缩

基于困惑度的词元剪枝[11]、蒸馏词元分类[20]、查询感知重排序[12]和自信息过滤[14]构成我们审计的抽取式技术家族,同时包括生产系统(Headroom 的 Kompress-v2[5])和用于RAG的查询感知上下文剪枝器[4,17];综述参见Li等[15]。其他公开的抽取式系统(RECOMP[22]、CPC[16]、EXIT[10]和基于注意力探测的 Sentinel[23])均提供英文监督检查点(符合我们记录的模式);因它们是针对LLM规模的查询感知句子选择器或代理语言模型探针,不符合我们任务无关、预算匹配的协议,故被排除在审计之外。一项部署端研究[13]在大规模英文环境中测量了 LLMLingua 系列的延迟和*比率遵守度*;我们发现同样的遵守失败具有强烈的语言依赖性。另一条路线将压缩为连续表示(gist token[18]、上下文内自编码[8]、KV缓存驱逐或量化[24]),但这些方法需要访问模型内部结构,无法与商业API配合使用,故我们将审计限制为文本到文本的抽取式方法。LLMLingua-2 的迁移性审计已在其他维度展开,例如向扩散LLM目标[9]的迁移,其中压缩失败同样归因于遗漏任务关键信息;据我们所知,跨语言维度尚未被审计。

### 分词器不平等

Petrov等[21]和Ahia等[1]证实了子词分词器会抬高非英文文本的定价。我们将溢价视为已测量的上下文(非贡献),并研究其与压缩技术的交互作用。

### 多语言压缩

几乎所有的抽取式压缩器都基于英文构建和调优:LLMLingua-2 在英文 MeetingBank 上蒸馏 GPT-4 判断,Provence[4] 在英文 MS MARCO 上训练。近期的例外是 XProvence[17],它基于 BGE-M3 重排序器将 Provence 扩展至多语言;我们审计的 v1 检查点在16种语言的 MS MARCO 和 MIRACL 上训练,使用多语言LLM(aya-expanse-8b)生成的银句子标签;后续 v2 改为在翻译的 MS MARCO 上训练(我们对两个版本均进行审计)。该工作报告了强大的多语言剪枝效果,但未在共享目标模型上测量相对于英文的跨语言*迁移差距*,而这正是我们的研究对象。我们将 XProvence 作为审计中唯一多语言监督的代表,发现它是唯一能消除差距的压缩器。同期,Headroom 的中文社区分支(headroom-zh)因上游英文压缩器对汉字文本无效而添加了专用中文通道,此后上游已将CJK感知分词整合到其非学习文本通道中(我们审计的学习型 Kompress-v2 通道在v0.32版本中仍基于空格分词)。这独立从部署端证实了我们量化的问题。

### 多语言评估

Belebele[2]提供122种语言的平行阅读理解选择题;MultiEURLEX[3]提供带EUROVOC标签的平行法律文档。LLMLingua-2 尽管采用多语言 XLM-R 骨干[7],其评估仅限于英文;其训练监督(MeetingBank上的GPT-4蒸馏)完全基于英文。我们的审计测试了骨干网络的多语言预训练是否足以支撑压缩技能的迁移。答案是否定的。

## 3 审计协议

### 语言与数据

十种语言完全平行:EN、PL、FI、ET、LV、LT、UK、ZH(简体)、AR(现代标准)、HI。涵盖四大语系(印欧、乌拉尔、汉藏、亚非)的七个分支(日耳曼、斯拉夫、波罗的海、芬兰、汉语、闪米特、印度-雅利安)和五种文字(拉丁、西里尔、汉字、阿拉伯、天城文),词元溢价范围从1.28(ZH)到1.83(LV)。主要任务:Belebele阅读理解(每语言300个平行项)。长文档任务:MultiEURLEX一级EUROVOC分类(24篇平行文档)。长上下文任务:目标段落嵌入七个同语言干扰项中(约2-3k词元;150项);后两项辅助任务使用六种核心欧洲语言。

### 条件

每个评估项包含:完整上下文(未压缩)、无上下文(污染/先验锚点)、LLMLingua-2[20](保留率ρ∈{0.75,0.5,0.33})、相同请求比率的TF-IDF句子抽取、确定性词形还原+停用词移除(其自然预算经测量而非控制),以及两个与LLMLingua-2*实现*的每项预算匹配的控制组:前缀截断和种子随机词删除。LLMLingua-1[11]因未通过技术门槛被排除:它完全无法压缩立陶宛语(实现率0.99),这本身就证明基于小代理语言模型的困惑度剪枝无法可靠迁移。我们还审计了另外两种学习型压缩器:Kompress-v2[5](Headroom生产层内置的ModernBERT散文压缩器,采用跨越17个文本领域(包括智能体轨迹和会议记录)的英文主导监督训练;在中文上其学习通道实质上无效,每个请求比率下返回的文本几乎未变(实现保留率0.91–0.96),该故障已被社区 headroom-zh 分支独立证实,上游现已在其*非学习*文本通道添加CJK感知分词,而我们审计的 Kompress-v2 通道在v0.32版本中未作更改),以及 XProvence[4,17](基于BGE-M3重排序器构建、采用多语言LLM银标签在16种语言上训练的查询感知多语言上下文剪枝器,通过骨干网络的跨语言迁移覆盖100+种语言;采用CC BY-NC-ND 4.0许可,仅限研究用途)。XProvence是我们集合中唯一为多语言使用设计的压缩器,可用于测试多语言压缩训练是否能消除差距。我们审计了其发布的两个检查点:v1(原生多语言MIRACL训练数据)和v2(在翻译的MS MARCO上重训练),二者在中文上表现截然不同(第4节)。

### 指标

准确率针对两个锚点进行归一化:

Ul,c=accl,c−accl,no‑contextaccl,full−accl,no‑context

即语言ℓ在条件c下保留的可用上下文价值比例。*迁移差距*为τl,c=UEN,c−Ul,c。分母(完整准确率减去无上下文准确率)在各语言间具有可比性(在主要模型上为25.7–31.7百分点),因此归一化不会系统性放大任何特定语言的噪声。不确定性采用项目级配对自助法(2000次重采样),各语言使用相同项目。我们报告每次比较的95%置信区间(未进行多重性校正);由于涉及跨语言、方法、比率和模型的数百次测试,孤立显著结果应审慎看待。因此我们强调跨模型、方法和比率复现的模式,而非单一区间。

### 目标模型

压缩是成本削减技术,我们审计具有经济相关性的成本高效部署层级(迷你/快速/轻量级类别);按生产环境词元流量计算,这也是大多数实际流量运行的层级。主要目标模型:gpt-5.4-mini和claude-haiku-4-5(完整网格,n=300)。在简化网格上进行复制验证(n=150;完整上下文、无上下文、LLMLingua-2、TF-IDF、截断,保留率ρ∈{0.5,0.33}):新一代模型gpt-5.6-luna、gemini-3.5-flash,通过网关服务的五个开源权重模型(Llama 4 Maverick、Mistral Medium 3.5、DeepSeek V4 Flash、Kimi K2.6、MiniMax M3),以及两个专有网关服务模型:Amazon的Nova

相似文章

衡量跨语言理解差距:证据语言如何影响语言模型的理解

arXiv cs.CL

本文引入了跨语言理解差距(CLCG)指标,用于衡量当内容以非英语语言呈现时,LLM响应质量的下降程度。通过对18种语言和多个模型的评估,研究发现性能显著下降,尤其是在低资源语言上,这对以英语为中心的能力迁移假设提出了质疑。