LLM压缩的非对称危害

arXiv cs.CL 论文

摘要

本文系统评估了LLM压缩方法,并揭示了非对称危害,例如头部知识的不成比例损失和错误答案的置信度增加,这些被标准聚合指标所掩盖。

arXiv:2608.19670v1 公告类型:新 摘要:大语言模型(LLMs)压缩可以降低部署成本,但标准聚合指标如困惑度和准确率往往会掩盖潜在的行为变化。在本工作中,我们系统评估了3个LLMs在11种压缩方法下的表现,以研究压缩对知识保留、模型置信度和社会偏见的影响。我们发现,压缩不成比例地减少了头部知识相对于尾部知识的相对保留。此外,压缩模型在错误答案上通常保持较高的置信度,即使这些知识是新丢失的。最后,我们证明稳定的聚合偏见分数可能掩盖人口统计子群之间刻板印象偏好的显著对立变化。总之,这些发现揭示了聚合性能指标无法捕捉的非对称行为变化,强调了在部署前对压缩模型进行细粒度评估的必要性。
查看原文
查看缓存全文

缓存时间: 2026/08/21 10:08

# 大语言模型压缩的非对称危害  
来源:https://arxiv.org/html/2608.19670  
Mairui Li¹  
¹ 脚注标记:1  
隶属机构:北卡罗来纳大学教堂山分校  
邮箱:[mairuili@unc\.edu](mailto:)  
Lesia Semenova  
隶属机构:罗格斯大学  
邮箱:[lesia\.semenova@rutgers\.edu](mailto:)  
Chudi Zhong  
隶属机构:北卡罗来纳大学教堂山分校  
邮箱:[chudi@unc\.edu](mailto:)  

###### 摘要  
大语言模型(LLMs)压缩可降低部署成本,但标准聚合指标(如困惑度和准确率)常掩盖潜在的行为变化。本研究系统评估了3个大语言模型在11种压缩方法下的表现,以探究压缩对知识保留、模型置信度和社会偏见的影响。我们发现,压缩会不成比例地减少对头部知识的相对保留,而对尾部知识的影响相对较小。此外,压缩后的模型在面对新近遗忘的知识时,仍常对其错误答案保持较高置信度。最后,我们证明稳定的聚合偏见分数可能掩盖人口统计子群体中刻板印象偏好的大幅对立变化。这些发现共同揭示了聚合性能指标未能捕捉的非对称行为变化,强调了在部署前需对压缩模型进行细粒度评估的必要性。  

## 1 引言  
大语言模型(LLMs)正日益在有限的内存、延迟和能耗预算下部署,模型压缩已成为满足这些约束的标准工具。具体而言,两类方法主导实践:**量化**——以降低精度存储权重和激活值[Frantar et al. 2023 (https://arxiv.org/html/2608.19670#bib.bib10);Lin et al. 2026 (https://arxiv.org/html/2608.19670#bib.bib28);Shao et al. 2024 (https://arxiv.org/html/2608.19670#bib.bib44);Egiazarian et al. 2024 (https://arxiv.org/html/2608.19670#bib.bib7)];**剪枝**——如层丢弃,移除单个权重或更大结构单元[Frantar and Alistarh 2023 (https://arxiv.org/html/2608.19670#bib.bib9);Sun et al. 2024b (https://arxiv.org/html/2608.19670#bib.bib47);Ashkboos et al. 2024 (https://arxiv.org/html/2608.19670#bib.bib2)]。这些方法因在显著提升效率的同时看似保持模型质量而备受青睐。然而,这种表面的保持常通过困惑度和平均下游准确率等聚合指标验证,这些指标在低压缩率下通常接近全精度模型的表现[Sun et al. 2024b (https://arxiv.org/html/2608.19670#bib.bib47);Men et al. 2024 (https://arxiv.org/html/2608.19670#bib.bib36)]。  

越来越多的研究开始探究这些聚合指标未捕捉的行为,报告称压缩可能以依赖于模型、任务和指标的方式损害模型的可信度和公平性。然而,这些结果仍然零散且常相互矛盾:部分研究显示剪枝和量化在所有压缩率下均会加剧对代表性不足子群体的误差[Hooker et al. 2020 (https://arxiv.org/html/2608.19670#bib.bib16);Tran et al. 2022 (https://arxiv.org/html/2608.19670#bib.bib50)],而其他报告则指出适度量化模型的公平性有所提高[Kamal and Talbert 2024 (https://arxiv.org/html/2608.19670#bib.bib22);Hong et al. 2024 (https://arxiv.org/html/2608.19670#bib.bib15)]。衡量方式也因指标或方法而异:在两种不同的公平性构建下,量化被报告可降低*内在*刻板印象分数[Gonçalves and Strubell 2023 (https://arxiv.org/html/2608.19670#bib.bib11)],却恶化*外在*任务级公平性[Ramesh et al. 2023 (https://arxiv.org/html/2608.19670#bib.bib39)]。此外,压缩如何影响不同事实流行度水平的知识保留仍知之甚少——即压缩模型是否比罕见事实更好地保留熟知事实。现有研究稀少,大多局限于评估单一压缩方法在单一位宽下仅基于准确率的表现[Chang et al. 2025a (https://arxiv.org/html/2608.19670#bib.bib3)]。然而,仅凭准确率是一个盲点,需与校准、偏见,尤其在不同压缩方法和水平下联合审视。  

**缺失的是**关于模型在压缩时*是否*以及*在何处*失败的系统研究。聚合偏见分数可能掩盖在不同人口子群体中不均等的危害[Hua et al. 2026 (https://arxiv.org/html/2608.19670#bib.bib19);Marcuzzi et al. 2026 (https://arxiv.org/html/2608.19670#bib.bib35)];准确率下降未揭示模型是否自信地出错[Zhang et al. 2024 (https://arxiv.org/html/2608.19670#bib.bib61)];平均效用未说明模型遗忘的事实是常见还是罕见[Mallen et al. 2023 (https://arxiv.org/html/2608.19670#bib.bib34);Sun et al. 2024a (https://arxiv.org/html/2608.19670#bib.bib46)]。由于先前研究孤立地、以不一致的指标衡量这些效应,无法回答它们是否共存或指向同一方向[Rath and Maliakkal 2026a (https://arxiv.org/html/2608.19670#bib.bib40)]。  

本研究通过涵盖量化和剪枝的11种压缩方法,在统一协议下直接研究这些问题,提出三个研究问题(RQs):  
**RQ1(流行度子群体准确率)**:模型压缩是否比广泛知晓(“头部”)实体更不成比例地降低对较不知名(“尾部”)实体的知识保留?  
**RQ2(丢失知识上的置信度)**:压缩导致模型丧失其先前拥有的知识后,模型是否对其现在不正确的答案保持置信度,且这种置信度是否随知识流行度变化?  
**RQ3(偏见)**:压缩是否改变整体及跨人口子群体的刻板印象偏好?  

为回答这些问题,我们评估三个广泛使用的基础模型(**Llama-3.1-8B-Instruct**、**Qwen-3-8B** 和 **Gemma-2-9B-it**),使用按流行度划分的知识保留基准(PopQA[Mallen et al. 2023 (https://arxiv.org/html/2608.19670#bib.bib34)]、Head-to-Tail[Sun et al. 2024a (https://arxiv.org/html/2608.19670#bib.bib46)])和偏见基准WinoBias[Zhao et al. 2018 (https://arxiv.org/html/2608.19670#bib.bib63)]与BBQ[Parrish et al. 2022 (https://arxiv.org/html/2608.19670#bib.bib38)]。我们引入评估协议,将相同度量应用于量化、剪枝,以便在共同基础上比较。分析显示,压缩的行为效应确实是非对称的,且常对聚合指标不可见。  

针对RQ1,我们发现压缩效应在不同流行度组别中未遵循一致模式:适度压缩以相当速率保留头部、中部和尾部知识,而更激进的压缩则在流行度组别间非均匀地重新分配保留率,而非简单降解尾部。针对RQ2,我们发现模型常对压缩后变得不正确的答案保持中到高置信度,尽管模式因模型、压缩方法和水平而异。特别是在严重压缩下,尽管准确率显著下降,置信度可能崩塌或保持高位。探究RQ3,我们发现压缩引起的刻板印象偏好变化因人口子群体、模型和基准而异。  

## 2 相关工作  
主要有两方面相关工作:**大语言模型压缩**(我们关注训练后量化和剪枝)和**压缩下的社会偏见**,下文讨论。总体而言,大语言模型压缩旨在降低部署大语言模型时的存储、内存和计算成本,同时保持其预测效用。  

**量化**:量化通过以较低精度表示权重和激活值来降低内存和计算成本。训练后量化方法通过优化重构、损失或敏感度感知校准目标来提高准确率[Frantar et al. 2023 (https://arxiv.org/html/2608.19670#bib.bib10);Shao et al. 2024 (https://arxiv.org/html/2608.19670#bib.bib44);Ding et al. 2025 (https://arxiv.org/html/2608.19670#bib.bib6);Wang et al. 2026 (https://arxiv.org/html/2608.19670#bib.bib53);Zhang and Shrivastava 2024 (https://arxiv.org/html/2608.19670#bib.bib62);Kim et al. 2025 (https://arxiv.org/html/2608.19670#bib.bib24)];保护显著权重或组免受量化误差影响[Lin et al. 2026 (https://arxiv.org/html/2608.19670#bib.bib28);Huang et al. 2024 (https://arxiv.org/html/2608.19670#bib.bib21)];或通过缩放、通道重组、旋转或仿射变换重塑权重和激活分布[Xiao et al. 2023 (https://arxiv.org/html/2608.19670#bib.bib55);Liu et al. 2024 (https://arxiv.org/html/2608.19670#bib.bib30);Ma et al. 2024 (https://arxiv.org/html/2608.19670#bib.bib33);Liu et al. 2025b (https://arxiv.org/html/2608.19670#bib.bib31);Hu et al. 2025b (https://arxiv.org/html/2608.19670#bib.bib18);Sun et al. 2024c (https://arxiv.org/html/2608.19670#bib.bib48);Liang et al. 2025 (https://arxiv.org/html/2608.19670#bib.bib27)]。其他方法开发专门的码本、帧、格点、向量、二进制或三进制公式,用于极低比特压缩[Egiazarian et al. 2024 (https://arxiv.org/html/2608.19670#bib.bib7);Adepu et al. 2024 (https://arxiv.org/html/2608.19670#bib.bib1);Savkin et al. 2025 (https://arxiv.org/html/2608.19670#bib.bib43);Xu et al. 2026 (https://arxiv.org/html/2608.19670#bib.bib57);Chong et al. 2026 (https://arxiv.org/html/2608.19670#bib.bib5);Huang et al. 2025 (https://arxiv.org/html/2608.19670#bib.bib20)]。  

**剪枝**:剪枝删除模型中对输出贡献最小的部分,保留更小的网络[Zhu et al. 2024 (https://arxiv.org/html/2608.19670#bib.bib66)]。**结构化**剪枝移除整个构建块,如整个神经元、层或隐藏维度,使模型物理上变小并运行更快[Ma et al. 2023 (https://arxiv.org/html/2608.19670#bib.bib32);Xia et al. 2024 (https://arxiv.org/html/2608.19670#bib.bib54);Li et al. 2025 (https://arxiv.org/html/2608.19670#bib.bib26);Guo et al. 2025 (https://arxiv.org/html/2608.19670#bib.bib14)]。例如,层丢弃利用了大语言模型许多中间层仅略微改变隐藏表示的发现,这些层可被丢弃而损失甚微[Gromov et al. 2025 (https://arxiv.org/html/2608.19670#bib.bib13);Hu et al. 2025a (https://arxiv.org/html/2608.19670#bib.bib17)]。先前工作通常基于校准数据计算重要性分数来决定丢弃哪些块,然后在单次通过中移除得分最低的块而不重训练[Zhong et al. 2025 (https://arxiv.org/html/2608.19670#bib.bib65);Sandri et al. 2025 (https://arxiv.org/html/2608.19670#bib.bib42);Men et al. 2024 (https://arxiv.org/html/2608.19670#bib.bib36)]。**非结构化**剪枝在总体稀疏预算内单独选择权重[Yang et al. 2025b (https://arxiv.org/html/2608.19670#bib.bib59);Zhao et al. 2025 (https://arxiv.org/html/2608.19670#bib.bib64)],而**半结构化**剪枝要求每个小组保留固定数量的权重。例如,常见的2:4模式每4个连续权重保留2个[Fang et al. 2024 (https://arxiv.org/html/2608.19670#bib.bib8);Liu et al. 2025a (https://arxiv.org/html/2608.19670#bib.bib29)]。  

在本研究中,我们使用上述量化和剪枝类别中的代表性压缩方法,以审视压缩的行为效应。  

**大语言模型压缩的行为效应**:关于量化和剪枝的研究表明,它们对社会偏见的影响是异质的,而非统一有害或有益[Ramesh et al. 2023 (https://arxiv.org/html/2608.19670#bib.bib39);Hong et al. 2024 (https://arxiv.org/html/2608.19670#bib.bib15);Xu et al. 2024 (https://arxiv.org/html/2608.19670#bib.bib56)]。近期工作显示,聚合偏见分数可能掩盖人口统计组间的更精细变化,包括量化或剪枝后的对立子群体变化和新放大的刻板印象[Hua et al. 2026 (https://arxiv.org/html/2608.19670#bib.bib19);Marcuzzi et al. 2026 (https://arxiv.org/html/2608.19670#bib.bib35);Rath and Maliakkal 2026a (https://arxiv.org/html/2608.19670#bib.bib40);Rath and Maliakkal 2026b (https://arxiv.org/html/2608.19670#bib.bib41)]。这些发现表明,评估压缩不仅需考察整体模型行为,还需审视其效应如何在子群体和压缩水平间变化。因此,我们研究不同压缩方法如何影响流行度组间的知识保留、丢失知识上的置信度以及人口子群体间的刻板印象偏好。  

## 3 评估框架与研究问题  
我们研究模型压缩如何影响知识保留、模型置信度和社会偏见。首先介绍共享符号,然后呈现每个RQ及其相应评估。  

### 3.1 符号  
令 \(M_0\) 表示全精度基础模型,\(M_c\) 表示同一模型的压缩版本。当定义适用于任一模型时,我们写作 \(M \in \{M_0, M_c\}\)。令 \(\mathcal{D} = \{x_i\}_{i=1}^{N}\) 表示评估数据集,其中 \(x_i \in \mathcal{X}\) 为自然语言输入。令 \(\mathcal{I} \subseteq \{1, \ldots, N\}\) 表示有参考答案可用的索引,令 \(y_i \in \mathcal{Y}\) 表示 \(i \in \mathcal{I}\) 的任务特定参考答案,其中 \(\mathcal{Y}\) 为答案空间。令 \(M(x_i) \in \mathcal{R}\) 表示模型对 \(x_i\) 的响应,其中 \(\mathcal{R}\) 为响应空间且 \(\mathcal{Y} \subseteq \mathcal{R}\)。令 \(\mathrm{Match}(M(x_i), y_i) \in \{0, 1\}\) 表示任务特定评估函数,若响应 \(M(x_i)\) 在任务特定评估规则下与参考答案 \(y_i\) 匹配,则 \(\mathrm{Match}(M(x_i), y_i) = 1\),否则为 \(0\)。该规则可能使用精确、子串或多项选择匹配,具体取决于任务。  

给定模型 \(M \in \{M_0, M_c\}\),我们评估其困惑度和整体准确率。对于包含 \(T\) 个标记的语料库,困惑度计算为 \(PPL(M) = \exp\left(-\frac{1}{T}\sum_{t=1}^{T}\log p_M(w_t | w_{<t})\right)\)。整体准确率为 \(\mathrm{Acc}(M) = \frac{1}{N}\sum_{i=1}^{N}\mathrm{Match}(M(x_i), y_i)\)。  

为分析知识保留随事实流行度的变化,我们遵循先前工作[Mallen et al. 2023 (https://arxiv.org/html/2608.19670#bib.bib34);Sun et al. 2024a (https://arxiv.org/html/2608.19670#bib.bib46)],根据参考答案在维基百科中的提及频率将问题分为流行度组(头部、中部、尾部)。对于每组 \(g\),我们计算保留率 \(R_g(M) = \frac{1}{N_g}\sum_{i \in \mathcal{I}_g}\mathrm{Match}(M(x_i), y_i)\),其中 \(\mathcal{I}_g\) 为属于组 \(g\) 的索引集,\(N_g\) 为组大小。压缩诱导的保留率变化为 \(\Delta R_g(M_c) = R_g(M_c) - R_g(M_0)\)。  

为研究置信度,我们提取模型对自身响应的置信度分数。对于多项选择任务(如PopQA),我们将置信度定义为分配给所选选项的softmax概率;对于生成任务(如Head-to-Tail),我们采用生成序列的平均对数概率作为置信度代理。给定输入 \(x_i\),令 \(s_i(M)\) 表示置信度分数。对于压缩模型 \(M_c\),我们计算其在最初正确但压缩后不正确的答案上的置信度,即对于 \(i\) 满足 \(\mathrm{Match}(M_0(x_i), y_i) = 1\) 但 \(\mathrm{Match}(M_c(x_i), y_i) = 0\)。  

为评估偏见,我们使用WinoBias和BBQ基准。在WinoBias中,每个样本要求完成一个句子,且存在符合刻板印象和违反刻板印象的两种补全方式。我们计算模型更倾向刻板印象答案的比例。具体而言,对于每个项目 \(i\),令 \(s_i^{\mathrm{st}}(M)\) 和 \(s_i^{\mathrm{ref}}(M)\) 分别为模型分配给刻板印象和反刻板印象补全的分数。我们定义二元指示器 \(z_i(M) = \mathbf{1}\left[s_i^{\mathrm{st}}(M) > s_i^{\mathrm{ref}}(M)\right]\),其中 \(z_i(M) = 1\) 表示偏好刻板印象答案。为总结整个数据集中这些项目级偏好的普遍程度,我们定义整体偏见分数为 \(B(M) = \frac{1}{N}\sum_{i=1}^{N}z_i(M)\)。最后,为隔离压缩的具体影响,我们计算相对于原始基础模型的偏见变化:\(\Delta B(M_c) = B(M_c) - B(M_0)\)。正 \(\Delta B(M_c)\) 表示压缩后刻板印象偏好增加,负值表示减少。为量化不确定性,我们报告 \(\Delta B(M_c)\) 和 \(\Delta B_g(M_c)\) 的95%置信区间。整体变化可能掩盖跨人口群体的异质效应。我们还计算组级偏见分数 \(B_g(M) = \frac{1}{N_g}\sum_{i \in \mathcal{I}_g}z_i(M)\) 及其压缩诱导的变化。

相似文章