校准保持剪枝:压缩作为可靠性合约

arXiv cs.LG 论文

摘要

本文介绍了校准保持剪枝(CPP),一种增强剪枝以保持保形预测效率的方法,在如DBpedia-14等基准测试上,使用Qwen2.5-1.5B等模型,显示了预测集大小减小和准确度提高。

arXiv:2608.23744v1 公告类型:新 \n摘要:一旦剪枝模型被固定,与保形校准划分无关,分割保形预测而非剪枝规则提供有限样本边际覆盖。我们研究单独的效率问题:剪枝能否保持分数几何结构,从而获得更小的有效预测集?校准保持剪枝(CPP)通过非共形梯度显著性增强基础剪枝分数,并使用不相交的剪枝、验证选择、保形校准和测试划分。有界分数扰动意味着有界的保形分位数偏移和受控的集合膨胀,但不会使通用覆盖定理特定于CPP。最终在50\\%稀疏性下的五次种子Qwen2.5-1.5B结果显示,在大标签任务上收益最大。在DBpedia-14上,CPP-SparseGPT将平均集合大小从 \\(10.1\\) 减少到 \\(8.6\\),同时准确度从 \\(0.347\\) 变为 \\(0.366\\);CPP-Wanda将 \\(11.2\\) 减少到 \\(9.0\\),准确度权衡从 \\(0.310\\) 到 \\(0.295\\)。在15个数据集--稀疏性单元中,CPP-SparseGPT在13个中产生更小的集合,在11个中提高准确度。匹配对照显示,通用监督梯度解释了大部分收益:真标签CPP在统计上与匹配的Wanda+SNIP无法区分,而阈值感知候选标签CPP在显式准确度和离线计算成本下达到 \\(7.8\\) 平均集合大小。RoBERTa-base和Llama-3-8B诊断支持迁移,但我们的声明仍限于可靠性敏感的分类。
查看原文
查看缓存全文

缓存时间: 2026/08/26 09:22

# 校准保持剪枝:作为可靠性契约的压缩  
来源:https://arxiv.org/html/2608.23744  
Ibne Farabi Shihab  
Adria Binte Habib  
附属机构:孟加拉国独立大学计算机科学与工程系,孟加拉国  
Anuj Sharma  
附属机构:美国爱荷华州立大学土木、建筑与环境工程系  

###### 摘要  
分裂保形预测而非剪枝规则,在剪枝模型独立于保形校准分割固定后,提供有限样本边际覆盖率。我们研究独立效率问题:剪枝能否充分保持分数几何特性以获得更小的有效预测集?校准保持剪枝(CPP)通过不一致性梯度显著性增强基础剪枝分数,并使用不相交的剪枝、验证选择、保形校准和测试分割。有界分数扰动意味着有界的保形分位数偏移和受控集合膨胀,但不会使通用覆盖率定理成为CPP特定的。在50%稀疏度下,最终五种子Qwen2.5-1.5B结果显示在大标签任务上获得最大增益。在DBpedia-14上,CPP-SparseGPT将平均集大小从10.1降至8.6,同时准确率从0.347变为0.366;CPP-Wanda将11.2降至9.0,准确率权衡从0.310变为0.295。在15个数据集-稀疏度单元中,CPP-SparseGPT在13个中产生更小集合,在11个中提高准确率。匹配对照显示通用有监督梯度解释了大部分增益:真实标签CPP在统计上与匹配的Wanda+SNIP无显著差异,而阈值感知候选标签CPP在明确准确率和离线计算成本下达到7.8平均集大小。RoBERTa-base和Llama-3-8B诊断支持迁移性,但我们的主张仍限于可靠性敏感分类。  

## 1 引言  
压缩后的语言模型可能在保持顶级标签准确性的同时,对可靠性敏感的下游系统变得不那么有用。问题不仅在于最可能标签是否改变。分诊、检索验证和辅助决策通常消耗校准概率或保形预测集。返回十个标签且覆盖率为90%的预测器,其信息量实质性地少于返回八个标签且覆盖率相同的预测器,即使它们的顶级标签准确率相似。  

本文将剪枝研究容易混淆的两个主张分开。首先,在可交换性下,独立分裂保形重新校准为*任何*固定的剪枝分类器提供有限样本边际覆盖率(Vovk等,2005;Angelopoulos和Bates,2023)。CPP既不创建也不改进该通用有效性结果。其次,剪枝决定了有效预测器保持多少信息性。如果压缩使合理标签之间的分离坍塌,重新校准只能通过扩大预测集来恢复覆盖率。我们针对的特定目标是第二个数量:有效重新校准后的保形效率。  

现有一次性剪枝器优化其他目标。幅度剪枝移除小权重(Han等,2015);Wanda将权重幅度与激活范数结合(Sun等,2024);SparseGPT最小化逐层重建误差(Frantar和Alistarh,2023);梯度增强变体使用有监督或区域梯度。这些是强大的基线,但都没有直接表示保形阈值周围的不一致性分数几何。温度缩放(Guo等,2017;Platt,1999)可以调整全局置信度偏移,但无法重建剪枝已移除的类别特定分离。  

校准保持剪枝(CPP)为基础剪枝重要性添加分数敏感性项。对于权重θⱼ,真实标签CPP使用Ical(θⱼ)=θⱼ²E[(∂s(X,Y,θ)/∂θⱼ)²],其中s是不一致性分数。该因子度量将该坐标设置为零引起的一阶位移。由于真实标签敏感性仅为包含多个候选标签的预测集的代理,我们还评估前3、阈值感知和全标签构造。每个梯度都在剪枝分割上评估。验证校准半分割仅提供阈值感知构造所需的初步阈值和模型选择的临时分位数。最终保形分割在选定的稀疏模型冻结之前保持不变。  

响应阶段控制实质性地限制了主张。仅梯度、Wanda++、SNIP式和Wanda⊕SNIP基线表明,通用有监督梯度信息解释了CPP改进的大部分。真实标签CPP-Wanda相对于匹配的Wanda⊕SNIP将DBpedia-14集大小从9.2降至9.0,但准确率较低且区间重叠;我们不声称该差异在统计上显著。阈值感知CPP提供更大的效率改进,CPP-Wanda达到8.4,CPP-SparseGPT达到7.8,具有明确的准确率和梯度计算成本。  

证据支持目标特定效率效应,而非优于梯度剪枝的均匀优势。我们的贡献有四部分。首先,我们将可靠性保持压缩公式化为受约束比较:覆盖率由独立保形校准提供,平均集大小是主要效率结果,准确率度量效用,ECE是诊断性的。然后,我们定义真实标签和候选标签CPP,并具有精确验证规则和不相交数据角色。第三,我们仅保留与这些角色匹配的理论:覆盖率定理是标准的剪枝规则无关分裂保形结果,而单独的扰动结果将分数移动与分位数和集大小膨胀联系起来。最后,我们报告一条权威结果路径,包含最终五种子Qwen比较、匹配梯度对照、候选标签消融、离线成本、独立分裂重抽样、RoBERTa-base迁移和范围限定的Llama-3-8B诊断。我们研究使用完整序列动词化器分数的固定标签分类,而非自由形式保形生成。  

## 2 相关工作  
#### 训练后剪枝  
一次性语言模型剪枝包括幅度方法(Han等,2015)、SparseGPT(Frantar和Alistarh,2023)、Wanda(Sun等,2024)、结构化LLM-Pruner(Ma等,2023)以及更广泛的综述和缩放分析(Shi等,2024;Wang等,2024;Frantar等,2025)。结构化剪枝后继续预训练处理与本文研究的无需重训练设置不同的计算范围。持续学习中的参数重要性和保留方法提供相关梯度信号(Mallya和Lazebnik,2018;Li和Hoiem,2017;Kirkpatrick等,2017;Zenke等,2017;Wang等,2022;Wang等,2023)。因此,我们匹配的SNIP式和Wanda⊕SNIP对照是必要的:它们测试CPP是否增加了超过通用有监督梯度信息的内容。  

#### 校准与保形预测  
温度和Platt缩放在训练后校正置信度(Guo等,2017;Platt,1999),而稀疏子网络研究报告校准作为剪枝副产品(Kuhn等,2026;Zhou等,2022)。归纳保形预测下的神经网络剪枝是最接近的直接前身(Zhao和Bellotti,2022)。CPP的不同之处在于针对训练后语言模型剪枝,并使验证选择独立于最终保形校准。  

分裂保形预测在可交换性下提供无分布边际覆盖率(Vovk等,2005;Angelopoulos和Bates,2023);语言模型应用包括生成、事实性和信息相对证书(Quach等,2024;Mohri和Hashimoto,2024;Sanjeda Akter和Sharma,2026)。其他工作优化保形分数函数或答案选择集而非模型权重(Vishwakarma等,2025)。移位感知和风险控制扩展(Park等,2020;Gibbs和Candes,2021;Bates等,2021)处理不同的假设。Learn-Then-Test(Angelopoulos等,2022)是有效的可选选择工具,但未用于本文报告的任何结果;第5.2节给出精确的实施规则。  

## 3 压缩下的可靠性契约  
设fθ:X→Δ(Y)为具有有限标签空间Y,|Y|=K的分类器。对于解码器模型,每个标签y具有固定动词化器v(y)=(v₁,…,v_{T_y})。我们对整个教师强制序列评分,而非逐令牌应用保形预测:log pθ(y|x)=∑_{t=1}^{T_y} log pθ(vₜ|x,v_{<ₜ})。给定校准分数集合Q={s(xᵢ,yᵢ,θ)}_{i=1}^n,保形分位数q̂_α(θ)是第⌈(1-α)(n+1)⌉个最小分数。如果该索引超过n,我们设置为+∞。预测集为Cα(x,θ)={y∈Y:s(x,y,θ)≤q̂_α(θ)}。  

可靠性契约具有严格层次。边际覆盖率P{Y∈Cα(X;θ)}是有效性约束。平均集大小C̄_P(θ)=E_X|Cα(X,θ)|是主要的保形效率结果。准确率度量任务效用,ECE是互补的校准诊断。  

对于剪枝模型θ′=P(θ),具有效率松弛ε_{size}的契约保留意味着P{Y∈Cα(X;θ′)} ≥ 1-α,C̄_P(θ′) ≤ C̄_P(θ) + ε_{size}。独立分裂保形为任何固定θ′提供第一行。CPP针对第二行,同时验证护栏限制准确率损失。  

## 4 为何仅重新校准不够  
剪枝后重新校准在最终保形分割独立时有效,但有效性不蕴含信息性。Top-1准确率取决于最大类别分数。集大小取决于校准阈值周围的所有候选标签分数。标量温度可以全局移动置信度(Guo等,2017;Li和Hoiem,2017),但无法恢复稀疏模型不再表示的标签特定分离。可靠性退化也可能随稀疏度非单调变化(Junhao Zheng和Ma,2025)。因此,我们直接度量每个报告的稀疏度,而不插值未观察单元。  

来源审计揭示了一个有用的可行性检查。对于任何预测集C⊆Y,E|C| ≤ P(Y∈C) + (K-1)。因此,每个示例返回所有K个标签的方法必须具有覆盖率1。几个提交的试点对将|C|=K与低于1的覆盖率结合,不可能来自共同评估路径。我们淘汰这些条目,仅使用最终清单结果。  

图1显示在50%稀疏度下校正的Qwen2.5-1.5B/DBpedia-14比较。所有四个剪枝预测器的经验覆盖率在0.901和0.902之间;差异在于集大小效率,以及单独的准确率。  
WandaCPP-WSparseGPTCPP-SG0055101011.211.29910.110.18.68.6平均集大小  
图1:最终五种子Qwen2.5-1.5B/DBpedia-14在50%稀疏度下的集大小。覆盖率在0.901–0.902匹配。CPP-SparseGPT也提高准确率;CPP-Wanda以1.5个准确率点换取更小的集。  

## 5 校准保持剪枝  
CPP修改基础重要性而非替换基础剪枝器。令I_{acc}(θⱼ)表示由幅度剪枝(Han等,2015)、Wanda(Sun等,2024)或SparseGPT重建过程(Frantar和Alistarh,2023)提供的坐标重要性。对于有标签的剪枝分割,真实标签CPP首先计算G_{cal}(θⱼ)=1/|D_{prune}| ∑_{(x,y)∈D_{prune}} (∂s(x,y,θ)/∂θⱼ)²。当s=-log pθ(y|x)时,这是对角经验Fisher样因子;对于一般s,我们使用更窄的术语不一致性梯度敏感性(Kirkpatrick等,2017;Zenke等,2017)。  

由于剪枝将θⱼ改为零,相关的一阶位移包含权重:I_{cal}(θⱼ)=θⱼ² G_{cal}(θⱼ)=1/|D_{prune}| ∑_{(x,y)∈D_{prune}} (θⱼ ∂s(x,y,θ)/∂θⱼ)²。需要每个示例的梯度。对批次均值的梯度平方将引入跨示例项,并且不会估计公式6。在每个合格模块内,CPP将基础和校准分数归一化为单位ℓ₂范数,并使用I_{CPP}(θⱼ)=(1-λ)Ĩ_{acc}(θⱼ)+λĨ_{cal}(θⱼ)。

相似文章