CAVEWOMAN: 大型语言模型在语言输入和输出压缩下的行为研究

arXiv cs.CL 论文

摘要

本文介绍了CAVEWOMAN,一种双通道评估协议,用于评估语言输入和输出压缩对LLM的影响。研究发现,输出压缩可降低成本,而输入压缩则会增加成本并降低准确性,挑战了常见的“穴居人风格”建议。

arXiv:2606.24083v1 公告类型:新 摘要:“说话简短。忽略语法。节省令牌。”这种穴居人风格被广泛推崇为降低推理成本的方式,但它是否真的能节省成本,取决于被压缩的是哪个通道(用户的提示还是模型的响应)。我们提出了Cavewoman,一种双通道评估协议,对每次生成,在任务准确性、实现的逐项成本以及与模型无约束参考文本的一致性上进行评分。我们评估了八个模型在五个数据集上的表现,采用五个缩减级别,并在相同项目上测量两个通道。输出压缩降低了大多数API模型的实际成本(每个模型1.4-2.4倍,最佳情况可达3倍),并且在公共定价下对所有四个开放权重模型也有效。输入压缩则产生相反效果,是严格的双输:它实际上提高了净成本而非降低(五个基准平均值约1.15倍,最差数据集可达1.8倍,更强压缩下可达2.7倍),因为模型用更长的响应来补偿,即使准确性崩溃。在相同设置下,表面文本与无约束参考文本出现分歧:对于非推理模型,大约一半的生成结果正确,但其表面文本不再蕴含模型自身的无约束基线生成。这种分歧在长度控制重新评分、多重比较校正以及补充语义度量下依然存在。代码和数据可于 https://github.com/danielle34/cavewoman 获取。
查看原文
查看缓存全文

缓存时间: 2026/06/24 07:45

# CAVEWOMAN:大语言模型在语言输入与输出压缩下的行为表现
来源:https://arxiv.org/html/2606.24083
Morayo Danielle Adeyemi
独立研究者
morayo\.danielle@gmail\.com
&Ryan A\. Rossi
Adobe Research
ryrossi@adobe\.com
&Franck Dernoncourt
Adobe Research
franck\.dernoncourt@adobe\.com

###### 摘要
"讲短点。省略语法。省token。"
这种穴居人风格被广泛推崇为降低推理成本的手段,但它是否真的能省钱,取决于被压缩的是哪个通道(用户提示词还是模型响应)。我们提出 **Cavewoman**,一种双通道评估协议,对每次生成在任务准确率、实际单项成本和参考文本一致性(与模型无约束参考输出对比)三个维度上进行评分。我们在五个数据集上、五个压缩级别下评估了八个模型,并在相同项目上同时测量两个通道。输出压缩降低了大多数 API 模型的实际成本(每个模型 1.4–2.4 倍,最佳情况下可达 3 倍),并且在公开定价下对所有四个开源权重模型同样有效。输入压缩则产生相反效果,是严格的双输:它非但没有降低成本,反而增加了净成本(五个基准平均约 1.15 倍,在最差数据集上可达 1.8 倍,在更强压缩下可达 2.7 倍),因为模型即使准确率崩溃,也会用更长的响应来补偿。在相同设置下,表面文本偏离了无约束参考:在非推理模型上,大约一半的生成是正确的,但其表面文本不再蕴含模型自身的无约束基线生成。这种偏离在长度控制重新评分、多重比较校正以及补充语义度量下的重复实验中依然存在。代码和数据可在 https://github.com/danielle34/cavewoman 获取。

CAVEWOMAN:大语言模型在语言输入与输出压缩下的行为表现
Morayo Danielle Adeyemi
独立研究者
morayo\.danielle@gmail\.com
&Ryan A\. Rossi
Adobe Research
ryrossi@adobe\.com
&Franck Dernoncourt
Adobe Research
franck\.dernoncourt@adobe\.com

参见图注
图 1:Cavewoman 框架。**输入压缩**通道在五个压缩级别上对用户提示词应用确定性词性过滤器,系统提示词保持不变。**输出压缩**通道保持提示词不变,并将系统提示词替换为级别特定的指令,要求响应也进行相同的缩减。每次生成都根据任务准确率、参考文本一致性(通过双向 NLI 及十一种补充度量与模型无约束参考对比)以及单项输入/输出 token 成本进行评分。

## 1 引言

大语言模型的推理成本随输入和输出 token 数量增加而增加,而输出 token 的定价通常比输入 token 高 4–8 倍(Ahia 等,2023(https://arxiv.org/html/2606.24083#bib.bib60);Nag 等,2024(https://arxiv.org/html/2606.24083#bib.bib59))。现有压缩方法要么减少提示词一侧(Jiang 等,2023(https://arxiv.org/html/2606.24083#bib.bib1);Pan 等,2024(https://arxiv.org/html/2606.24083#bib.bib3);Brussee,2026(https://arxiv.org/html/2606.24083#bib.bib57);Peltomäki,2026(https://arxiv.org/html/2606.24083#bib.bib58)),要么减少响应一侧(Xia 等,2025(https://arxiv.org/html/2606.24083#bib.bib15);Song 等,2025(https://arxiv.org/html/2606.24083#bib.bib14)),但两者被分开研究,并且几乎完全通过减少的 token 数量下的任务准确率来评估。在 token 数量上的准确率是一个错误的衡量指标,原因有二。它无法将实际成本与提示词 token 减少分开(当模型回答更长时,更短的提示词并不会降低实际成本),并且它将每次生成简化为一个二元结果,无法区分一个压缩后的答案是否与模型无约束推理一致,还是偏离了它。我们通过 **Cavewoman** 解决了这两个空白,这是一种双通道评估协议,在每个生成上从三个维度进行评分:任务准确率、定价通道上的实际单项成本,以及参考文本一致性(与模型自身的无约束生成对比)。该协议在五个压缩级别上测量**输入压缩**(提示词在模型看到之前被过滤)和**输出压缩**(模型被指示以受约束的语域回答),保持模型和项目不变。我们评估了八个模型(Qwen2.5-VL-7B、Qwen3.5-9B、DeepSeek-R1-Distill-Qwen-7B、Gemma-4-E4B、GPT-4o、GPT-5.4、Claude Haiku 4.5、Claude Sonnet 4.6)在五个基准(GSM8K、BoolQ、ARC-Easy、CommonsenseQA、MMLU-STEM)上的表现,完整覆盖了所有五个级别的两个通道。

##### 贡献。
1. 1. 我们提出了一种双通道评估协议,通过审计的答案提取率和包含十二项度量的语义电池(§3(https://arxiv.org/html/2606.24083#S3)),对压缩后的实际成本进行评分。
2. 2. 我们在相同项目上测量了输入压缩与输出压缩之间的成本不对称性(§4.1(https://arxiv.org/html/2606.24083#S4.SS1))。
3. 3. 我们测量了输出压缩下正确答案与模型无约束参考之间的表面文本偏离,并通过补充语义度量进行了重复验证(§4.2(https://arxiv.org/html/2606.24083#S4.SS2))。

## 2 相关工作

##### 输入压缩。
输入压缩沿着“硬–软”轴分解(Li 等,2025(https://arxiv.org/html/2606.24083#bib.bib9))。硬方法通过自信息(Li 等,2023(https://arxiv.org/html/2606.24083#bib.bib2))、困惑度(Jiang 等,2023(https://arxiv.org/html/2606.24083#bib.bib1))、问题感知评分(Jiang 等,2024(https://arxiv.org/html/2606.24083#bib.bib4))或蒸馏 token 分类(Pan 等,2024(https://arxiv.org/html/2606.24083#bib.bib3))来剪枝 token,并在文档级别通过检索上下文摘要(Xu 等,2024(https://arxiv.org/html/2606.24083#bib.bib5))应用相同逻辑。软方法将提示词编码为要点 token(Mu 等,2023(https://arxiv.org/html/2606.24083#bib.bib6))、递归摘要向量(Chevalier 等,2023(https://arxiv.org/html/2606.24083#bib.bib7))或自动编码器槽(Ge 等,2024(https://arxiv.org/html/2606.24083#bib.bib8)),并遵循 Nagle 等人(2024(https://arxiv.org/html/2606.24083#bib.bib10))中的率失真界限。没有方法测量响应是否说出了与没有压缩时相同的内容。

##### 输出压缩。
输出侧方法通过修改解码(长度控制(Kikuchi 等,2016(https://arxiv.org/html/2606.24083#bib.bib12))、预算信号位置编码(Takase and Okazaki,2019(https://arxiv.org/html/2606.24083#bib.bib13))、倒计时机制(Song 等,2025(https://arxiv.org/html/2606.24083#bib.bib14)))或通过后训练和提示(token 跳过链(Xia 等,2025(https://arxiv.org/html/2606.24083#bib.bib15))、认知启发路由(Aytes 等,2025(https://arxiv.org/html/2606.24083#bib.bib16))、难度感知提示(Han 等,2025(https://arxiv.org/html/2606.24083#bib.bib17))、RL 驱动的演示压缩(Huang 等,2024(https://arxiv.org/html/2606.24083#bib.bib18)))来约束生成。穴居人语域所利用的内容词/功能词区分在语言学中由来已久,但这一研究方向仍然只报告给定 token 预算下的任务准确率。

##### 语义保真度、冗长性和成本。
双向 NLI 蕴含关系将命题内容与词汇形式分开(Kuhn 等,2023(https://arxiv.org/html/2606.24083#bib.bib19)),并已用于评分摘要忠实度(Maynez 等,2020(https://arxiv.org/html/2606.24083#bib.bib20))和跨系统一致性(Laban 等,2022(https://arxiv.org/html/2606.24083#bib.bib21));相关地,思维链可能看似合理却与预测因果断开(Turpin 等,2023(https://arxiv.org/html/2606.24083#bib.bib22);Lanham 等,2023(https://arxiv.org/html/2606.24083#bib.bib23))。长度本身也很重要:冗长输出得分较低(Zhang 等,2025(https://arxiv.org/html/2606.24083#bib.bib24)),冗长性带来成本(Borisov 等,2026(https://arxiv.org/html/2606.24083#bib.bib25)),无关填充会降低推理能力(Levy 等,2024(https://arxiv.org/html/2606.24083#bib.bib26)),而思维链长度能独立于轨迹正确性跟踪准确率(Jin 等,2024(https://arxiv.org/html/2606.24083#bib.bib27);Sun 等,2025(https://arxiv.org/html/2606.24083#bib.bib28);Wang 等,2024(https://arxiv.org/html/2606.24083#bib.bib29))。成本–质量前沿本身就是一个设计面,体现在选择性路由(Chen 等,2024(https://arxiv.org/html/2606.24083#bib.bib30))、质量阈值(Ding 等,2024(https://arxiv.org/html/2606.24083#bib.bib31))和偏好路由器(Ong 等,2025(https://arxiv.org/html/2606.24083#bib.bib32))中;有效的基准测试需要多度量测量(Bowman and Dahl,2021(https://arxiv.org/html/2606.24083#bib.bib33);Liang 等,2023(https://arxiv.org/html/2606.24083#bib.bib34);Gehrmann 等,2021(https://arxiv.org/html/2606.24083#bib.bib35))。

##### 定位。
最接近的先前工作只压缩一侧:LLMLingua(Jiang 等,2023(https://arxiv.org/html/2606.24083#bib.bib1);Pan 等,2024(https://arxiv.org/html/2606.24083#bib.bib3);Jiang 等,2024(https://arxiv.org/html/2606.24083#bib.bib4))在输入侧;TokenSkip(Xia 等,2025(https://arxiv.org/html/2606.24083#bib.bib15))、Hansel(Song 等,2025(https://arxiv.org/html/2606.24083#bib.bib14))和 Sketch-of-Thought(Aytes 等,2025(https://arxiv.org/html/2606.24083#bib.bib16))在输出侧,均报告压缩后 token 预算下的任务准确率。**Cavewoman** 在相同项目上测量两个通道,报告实际单项成本而非 token 减少,在声称准确率前审计答案提取率,并在补充语义标准下评分参考文本一致性。输入通道的偏离在 LLMLingua-2 下可复现(附录 D(https://arxiv.org/html/2606.24083#A4))。

## 3 方法论

### 3.1 实验设计

##### 设置。
设 M 为固定语言模型,x = (w₁, ..., wₙ) 为一个问题,是来自 spaCy 分词器的 n 个 token 序列。每个 token w 携带一个由 spaCy 使用 en_core_web_sm 模型分配的 Penn Treebank 词性标签 g(w);g 在给定固定 spaCy 版本和模型的情况下是确定性的。对于一组词性标签 S,记 (wᵢ)_{ i : g(wᵢ) ∈ S } 为 x 的子序列,该子序列恰好保留标签属于 S 的 token,索引 i 按递增顺序排列。设 truncₖ(z) 表示序列 z 长度为 min(|z|, k) 的前缀,设 NN∗ 和 VB∗ 表示 Penn Treebank 名词和动词标签族。

我们研究一个单一的缩减参数,即级别 ℓ ∈ {0, 1, 2, 3, 4},命名为 L0 到 L4。该级别从族 φ₀, …, φ₄ 中选择一个过滤器,定义如下:
φ₀(x) = x,                                                                                (1)
φ₁(x) = (wᵢ)_{ i : g(wᵢ) ∉ {DT, IN, CC, RP, TO, MD} },
φ₂(x) = (wᵢ)_{ i : g(wᵢ) ∈ NN∗ ∪ VB∗ ∪ {CD} },
φ₃(x) = (wᵢ)_{ i : g(wᵢ) ∈ NN∗ ∪ {CD} },
φ₄(x) = trunc₁₅(φ₃(x)).

该族是嵌套的:对于每个问题 x 和每个 ℓ ≥ 1,φₗ(x) 是 φₗ₋₁(x) 的子序列;因此较大的 ℓ 意味着更严格的缩减。下表给出了每个级别的语言学解释。

##### 两个条件。
Cavewoman 保持 M 和 x 固定,在其中一个点(图 1(https://arxiv.org/html/2606.24083#S0.F1))应用相同的缩减 φₗ。问题与系统提示词使用模型的聊天模板格式化,并始终保持不变。L0 基线是条件特定的:条件 A 使用下面给出的中性系统提示词,而条件 B 使用附录 H.2(https://arxiv.org/html/2606.24083#A8.SS2)中的无约束逐步提示词;这种差异是设计使然,后面对 L0-A/L0-B 噪声底线限制很重要。

**条件 A(输入压缩)。** 模型接收经过过滤的问题 φₗ(x),并附带中性系统提示词。条件 A 测试 M 是否需要完整的语法问题。

**条件 B(输出约束)。** 模型接收未经修改的问题 x,系统提示词指示它以 φₗ 产生的缩减形式回答。提示词是任务中性的:M 从 x 和最后一行的 "Answer:" 约定推断出答案格式。条件 B 测试 M 是否需要在响应中具有表达自由度。

因此,级别 ℓ 通过一个过滤器族索引两个条件:条件 A 减少模型读取的内容,条件 B 减少模型可以写的内容。

### 3.2 语言缩减级别

我们定义了五个语言缩减级别,并给出全文中使用的简短名称:**无约束基线**(L0)、**电报纸条**语域(L1)、**仅关键词**语域(L2)、**名词短语骨架**(L3)和 **15-token 预算**(L4)。每个级别从前一个级别中移除更多的词类,形成一个单调层级,其中相邻级别间准确率的变化可归因于在该步骤移除的词语。POS 过滤器是一种确定性的、透明的缩减,旨在测量清晰度;具有任务感知 token 评分的学习型压缩器(附录 D(https://arxiv.org/html/2606.24083#A4))会做出不同的权衡。

**缩减级别**
L0:无约束基线。φ₀ 是恒等映射,保留所有标签。条件 A 逐字呈现 x,条件 B 要求以完整句子进行逐步推理。
L1:电报纸条。φ₁ 移除封闭类标签 DT、IN、CC、RP、TO 和 MD:限定词、介词、连词、小品词、不定式 to 和情态动词。
L2:仅关键词。φ₂ 仅保留名词、动词和基数词。
L3:名词短语骨架。φ₃ 仅保留名词和基数词。
L4:15-token 预算。φ₄ 应用 φ₃ 然后将结果截断至其前 15 个 token。

相同的五个级别适用于两个条件,但在流水线中的不同点进入。在条件 A(输入压缩)中,φₗ 通过确定性 POS 标签过滤器重写用户消息。在条件 B(输出约束)中,特定级别的系统提示词指示模型以匹配的语域生成其响应;用户消息保持不变。每个级别的解码器预算为 `max_new_tokens ∈ {400, 300, 200, 150, 20}`,跨 L0–L4,两个条件相同。逐字逐句的每级过滤器规则(条件 A)和每级系统提示词(条件 B)均列在附录 H(https://arxiv.org/html/2606.24083#A8)中。L4

相似文章

大型语言模型有多像人类?一个关注语域的语言评估框架

arXiv cs.CL

本文提出了一种关注语域的语言评估框架,通过使用最大均值差异(MMD)比较人类与LLM生成文本中67个词汇语法特征的分布,来评估大型语言模型(LLM)的人类相似度。在七个经过指令微调的开源模型和五个语域上的实验表明,没有模型能完美匹配人类基线,且与人类语言的接近程度因语域而异,而非模型规模。

大型语言模型中的类人回指消解

arXiv cs.CL

本文研究了五个开放权重的大型语言模型在回指消解中是否表现出对心理语言学因素的人类类似敏感性,使用惊奇度和理解准确率作为行为指标。结果显示选择性认知对齐:一些模型在回指消解中匹配了人类的话语敏感性,但对语义干扰效应的敏感性较弱或缺失。