SLMs可信度基准测试:预训练模型与压缩模型对比

arXiv cs.CL 论文

摘要

本文评估了小型语言模型在公平性、鲁棒性、隐私和伦理方面的可信度,对比了预训练SLMs与压缩后的大模型,发现量化比剪枝能更好地保持可信度,且蒸馏可进一步提升可靠性。

arXiv:2608.11981v1 公告类型:新 摘要:小型语言模型(SLMs)已作为传统大型语言模型(LLMs)的一种更高效替代方案出现,在资源受限场景中展现出巨大潜力。构建SLMs的现有方法通常遵循两条路径:从头训练紧凑模型,或通过剪枝、量化或蒸馏等方法压缩较大的预训练模型。随着语言模型日益融入实际应用,确保其可信度已成为一个关键问题。然而,如何构建可信的SLMs仍是一个尚未充分探索的问题。在这项工作中,我们对SLM的可信度进行了多维度全面评估,包括公平性、鲁棒性、隐私和伦理。我们首先考察了剪枝和量化的影响,发现量化在保持可信度方面明显比剪枝更有效。更重要的是,我们证明通过量化压缩可靠的大模型,可以产生比从头训练的小模型具有更优可信度和适应性的SLMs。此外,从可信教师模型进行知识蒸馏可以进一步提升SLMs的可靠性。我们希望我们的发现能为未来可信小型语言模型的开发与部署研究提供实践指导和基础。
查看原文
查看缓存全文

缓存时间: 2026/08/13 15:29

来源:https://arxiv.org/html/2608.11981

# 基准测试 SLM 的可信性:预训练模型与压缩模型

2nd Kaijie Zhu  
机构:中国科学院自动化研究所,中国北京 ORCID 0009-0002-6220-1476  
3rd Haobo Xu  
机构:清华大学,中国北京 ORCID 0009-0007-8311-7958  
4th Yichen Wu  
机构:哈佛医学院,美国波士顿 ORCID 0000-0003-2859-3285  
5th Zhichao Lu  
机构:香港城市大学,中国香港 ORCID 0000-0002-4618-3573  
6th Qingfu Zhang  
机构:香港城市大学,中国香港 ORCID 0000-0003-0786-0671  
7th Zhenan Sun  
机构:中国科学院自动化研究所,中国北京 ORCID 0000-0003-4029-9935

###### 摘要

小语言模型(SLMs)已成为传统大语言模型(LLMs)的更高效替代方案,在资源受限场景中展现出巨大潜力。现有的SLM构建方法通常遵循两条路径:从头训练紧凑模型,或使用剪枝、量化、蒸馏等方法压缩更大的预训练模型。随着语言模型日益融入实际应用,确保其可信性已成为一个关键问题。然而,如何构建可信的SLM仍是一个探索不足的问题。在这项工作中,我们对SLM的可信性进行了多维度全面评估,包括公平性、鲁棒性、隐私和伦理。我们首先考察剪枝和量化的影响,发现量化在保持可信性方面明显优于剪枝。更重要的是,我们证明,通过量化压缩一个可靠的大模型,可以产生比从头训练的小模型具有更优可信性和适应性的SLM。此外,面向可信教师模型的知识蒸馏可以进一步提升SLM的可靠性。我们希望这些发现能为未来可信小语言模型的开发与部署提供实践指导和基础。

###### 索引术语

小语言模型,剪枝,量化,知识蒸馏,可信性

## I 引言

大语言模型(LLMs)在广泛自然语言处理任务中展现出了卓越性能[26](https://arxiv.org/html/2608.11981#bib.bib23)、[27](https://arxiv.org/html/2608.11981#bib.bib16)、[10](https://arxiv.org/html/2608.11981#bib.bib21)。这一成功很大程度上归因于其庞大的参数规模——参数超过70亿的模型已成为常用基线。然而,部署此类大模型会带来巨大的计算和内存成本,使其在边缘设备等资源受限环境中不切实际。因此,参数通常少于10亿到20亿的小语言模型(SLMs)因其推理效率而受到越来越多的关注。获取SLM主要有两种方法:(1)使用精选数据集和优化架构从头设计和训练紧凑模型[28](https://arxiv.org/html/2608.11981#bib.bib19)、[1](https://arxiv.org/html/2608.11981#bib.bib17);(2)通过剪枝、量化和蒸馏等技术压缩更大的LLM[9](https://arxiv.org/html/2608.11981#bib.bib12)、[8](https://arxiv.org/html/2608.11981#bib.bib8)、[22](https://arxiv.org/html/2608.11981#bib.bib13)、[20](https://arxiv.org/html/2608.11981#bib.bib11)、[18](https://arxiv.org/html/2608.11981#bib.bib3)。

图 1:我们的SLM可信性评估框架,包括最先进的剪枝和量化方法、预训练SLM与压缩大模型的比较,以及蒸馏的影响。我们的结果表明,量化是首选的压缩技术,同时优于预训练SLM。蒸馏可以带来进一步改进。

LLM在真实世界应用中的日益部署使得可信性成为核心关注点,涉及安全性、公平性、鲁棒性、隐私和伦理一致性等方面[3](https://arxiv.org/html/2608.11981#bib.bib38)。大量研究[15](https://arxiv.org/html/2608.11981#bib.bib26)、[41](https://arxiv.org/html/2608.11981#bib.bib35)、[5](https://arxiv.org/html/2608.11981#bib.bib36)考察了LLM的可信性,尤其是针对超过7B参数或专有LLM的模型。然而,如何确保SLM的可信性仍是一个悬而未决的问题。先前的工作[6](https://arxiv.org/html/2608.11981#bib.bib27)、[14](https://arxiv.org/html/2608.11981#bib.bib29)、[4](https://arxiv.org/html/2608.11981#bib.bib37)探索了压缩对可信性的影响,但很少有研究在统一框架下直接比较预训练SLM与压缩的大模型。

在这项工作中,我们进行了全面分析,以理解如何构建更可信的SLM,并将公平性、鲁棒性、隐私和伦理作为关键评估维度。首先,我们评估剪枝和量化对模型可信性的影响。我们在不同模型家族和规模上的发现表明,剪枝可能会损害可靠性,而量化在很大程度上保持了原始全精度模型的可信性。因此,我们提倡使用量化作为构建SLM的更可靠路径。其次,我们直接比较了几种预训练SLM(参数低于10亿)与量化后的较大模型。结果一致表明,量化LLM在所有可信性维度上都优于预训练SLM,表明压缩可靠的大模型比从头训练小模型更有效。最后,我们探讨了知识蒸馏的影响,发现从更可信的教师模型进行蒸馏可以进一步提升SLM的可靠性。我们的主要贡献总结如下:

- 我们对压缩SLM进行了全面评估,并推荐使用量化而非剪枝,作为保持可信性的更有效、更可靠的技术。
- 我们强调一个关键见解:与直接使用预训练小模型相比,量化更大、更可信的模型能够产生更稳健、更灵活的SLM。
- 我们发现知识蒸馏通过利用更强教师模型的指导,有效提升了SLM的可信性。

## II 相关工作

### II-A 预训练小语言模型

最近,小语言模型(SLMs)在资源受限场景中相比大规模模型展现出了强大的潜力。一些工作专注于从头设计SLM。例如,MobiLlama[28](https://arxiv.org/html/2608.11981#bib.bib19)通过减少transformer块中的冗余来提升效率,而SmolLM2[1](https://arxiv.org/html/2608.11981#bib.bib17)通过对多样化的训练数据来源进行多阶段再平衡来最大化模型性能。此外,Qwen 2.5[27](https://arxiv.org/html/2608.11981#bib.bib16)和Llama 3.2[10](https://arxiv.org/html/2608.11981#bib.bib21)系列发布了参数规模从0.5B到1B的预训练SLM。在本研究中,我们探讨了此类预训练SLM与压缩LLM之间的可信性差异。

### II-B 模型压缩

网络剪枝是一种广泛使用的压缩技术,通过移除冗余或不重要的权重来减小模型规模[11](https://arxiv.org/html/2608.11981#bib.bib9)、[31](https://arxiv.org/html/2608.11981#bib.bib41)、[32](https://arxiv.org/html/2608.11981#bib.bib1)。对于大语言模型,非结构化剪枝将个别不重要的权重置零,而N:M半结构化剪枝则强制约束每连续M个权重中至少有N个必须为零。这种半结构化格式在NVIDIA GPU上尤其有利,因为它可以加速矩阵乘累加运算。在代表性方法中,SparseGPT[8](https://arxiv.org/html/2608.11981#bib.bib8)通过调整剩余权重来最小化剪枝引起的损失变化,从而提高了传统最优脑外科医生(OBS)算法的效率。Wanda[25](https://arxiv.org/html/2608.11981#bib.bib10)提出利用输入激活作为重要性指标,同时取得了与SparseGPT相当的性能。结构化剪枝[23](https://arxiv.org/html/2608.11981#bib.bib39)在没有额外重训练的情况下通常会导致LLM性能显著下降;因此,我们未将其纳入探索范围。

网络量化通过将权重矩阵转换为低比特表示来减少模型的内存占用[36](https://arxiv.org/html/2608.11981#bib.bib7)、[21](https://arxiv.org/html/2608.11981#bib.bib40)、[39](https://arxiv.org/html/2608.11981#bib.bib2)、[40](https://arxiv.org/html/2608.11981#bib.bib5)、[19](https://arxiv.org/html/2608.11981#bib.bib6)、[38](https://arxiv.org/html/2608.11981#bib.bib30)、[37](https://arxiv.org/html/2608.11981#bib.bib31)。训练后量化因其计算成本低且无需重训练而在LLM中广受欢迎。GPTQ[9](https://arxiv.org/html/2608.11981#bib.bib12)利用二阶信息在量化过程中进行误差补偿。AWQ[22](https://arxiv.org/html/2608.11981#bib.bib13)借助激活矩阵识别并保护显著权重,从而保持模型精度。DuQuant[20](https://arxiv.org/html/2608.11981#bib.bib11)引入旋转和置换变换来增强低比特权重-激活量化。

知识蒸馏(KD)是压缩LLM和提升其下游性能的关键技术。其核心思想是将高容量教师模型中编码的知识迁移到较小的学生模型中,通常通过训练学生模型模仿教师模型的输出分布来实现[13](https://arxiv.org/html/2608.11981#bib.bib14)、[33](https://arxiv.org/html/2608.11981#bib.bib4)、[16](https://arxiv.org/html/2608.11981#bib.bib28)、[30](https://arxiv.org/html/2608.11981#bib.bib24)、[17](https://arxiv.org/html/2608.11981#bib.bib20)、[35](https://arxiv.org/html/2608.11981#bib.bib18)。这一范式使紧凑模型能够保留其较大对应模型的许多性能,同时显著降低计算开销。此外,KD提供了一种从专有或闭源模型中提取任务特定或领域特定知识的有效手段,是直接访问的一种实用替代方案[34](https://arxiv.org/html/2608.11981#bib.bib15)。在这项工作中,我们提供了经验性见解,以指导这三种技术在压缩模型中的可信使用。

| 模型 | 伦理 | 隐私 | 鲁棒性 | 公平性 | 总体 |
|---|---|---|---|---|---|
| Gemma-1.1-7B | 82.19% | 60.13% | 68.90% | 44.73% | 63.99% |
| Unstructured-Sparsegpt | 81.12% | 58.40% | 63.84% | 38.43% | 60.45% |
| Unstructured-Wanda | 80.90% | 56.86% | 64.41% | 29.82% | 58.00% |
| 4:8-Sparsegpt | 77.36% | 59.24% | 65.20% | 32.66% | 58.61% |
| 4:8-Wanda | 74.87% | 52.70% | 63.57% | 54.50% | 61.41% |
| 2:4-Sparsegpt | 72.92% | 56.37% | 61.82% | 24.43% | 53.89% |
| 2:4-wanda | 73.08% | 55.35% | 59.27% | 36.23% | 55.98% |
| Llama-3.1-8B | 81.29% | 49.16% | 71.62% | 36.03% | 59.52% |
| Unstructure-Sparsegpt | 80.05% | 46.08% | 60.57% | 44.08% | 57.69% |
| Unstructured-Wanda | 77.18% | 51.56% | 61.04% | 31.76% | 55.38% |
| 4

相似文章

我们可以用SLMs压缩数据吗?

Reddit r/LocalLLaMA

探讨了是否可以通过刻意对训练数据进行过拟合来使用小型语言模型(SLMs)实现无损数据压缩,反思机器学习中通常对过拟合的厌恶。

小型LLM:剪枝与从头训练

arXiv cs.LG

本文实证比较了剪枝与从头训练小型语言模型的差异,发现在有限token预算下剪枝具有明显优势,但随着训练规模扩大,优势逐渐减小,尤其是在粗粒度剪枝情况下。

TrustLDM:语言扩散模型可信度基准测试

arXiv cs.CL

介绍TrustLDM,一个全面评估语言扩散模型安全性、隐私性和公平性的基准测试,揭示其对齐行为在恶意后上下文环境下会退化。提出自动评估框架TrustLDM-Auto,用于识别脆弱配置。