推理感知压缩:识别并保护脆弱推理电路以实现能效LLM部署
摘要
本文提出了一种推理感知压缩框架,用于识别和保护大型推理模型中的脆弱推理电路,以提高能效,实现了优于均匀量化方法的帕累托最优性能。
arXiv:2609.05512v1 公告类型:新
摘要:大型推理模型在部署过程中产生巨大的能源消耗,然而当前的压缩方法对所有组件应用均匀量化,可能损害关键推理电路。我们提出了一种推理感知压缩框架,该框架通过硬件级GPU能耗测量,在五个推理基准测试中评估量化条件:GSM8K、FOLIO、MATH-500、ProofWriter和MuSiQue;通过在保留校准集上进行扰动扫描,分析所有196-224(层、投影)对的每模块INT4脆弱性,然后选择性地将最敏感的电路恢复到FP16。得出三个发现。首先,INT4量化可能通过延长推理链来增加能耗;在GSM8K上,25%的功率降低变为净能耗增加。其次,脆弱性依赖于任务:注意力投影对数学推理更为关键,且敏感性模式在逻辑推理中因架构而异。第三,选择性压缩实现了均匀方法无法达到的帕累托最优点:R1-Qwen-7B在ProofWriter上Top-10%的性能在能耗降低9.7%的情况下相比FP16提升了12个百分点,并在五个推理基准测试的保留数据上得到验证。
查看缓存全文
缓存时间: 2026/09/10 08:37
# 识别并保护脆弱的推理电路以实现能源高效的LLM部署
来源:https://arxiv.org/html/2609.05512
Leonard Twagirayezu
隶属机构:卡内基梅隆大学非洲校区
隶属机构:基加利,卢旺达
邮箱:[ltwagira@andrew\.cmu\.edu](mailto:)
Prasenjit Mitra
隶属机构:卡内基梅隆大学非洲校区
隶属机构:基加利,卢旺达
邮箱:[prasenjm@andrew\.cmu\.edu](mailto:)
###### 摘要
大型推理模型(LRMs)在部署过程中会产生巨大的能源消耗,然而当前的压缩方法对所有组件施加统一的量化,存在损害关键推理电路的风险。我们提出了一个推理感知压缩框架,该框架在五个推理基准(GSM8K、FOLIO、MATH-500、ProofWriter 和 MuSiQue)上对量化条件进行基准测试,并结合硬件级 GPU 能耗测量;通过在校准集上对所有 196–224(层,投影)对进行扰动扫描,对每个模块的 INT4 脆弱性进行剖析,然后选择性地将最敏感的电路恢复到 FP16 精度。研究得出三点发现。首先,INT4 量化可能通过延长推理链来*增加*能耗;在 GSM8K 上,25% 的功耗降低可能变成净能耗增加。其次,脆弱性取决于任务:注意力投影对数学推理更为关键,并且不同架构在逻辑推理中的敏感性模式存在差异。第三,选择性压缩实现了均匀方法无法达到的帕累托最优:R1-Qwen-7B 在 ProofWriter 上 Top-10% 的性能比 FP16 提升了 +12 个百分点,同时能耗降低了 -9.7%,这一结果在五个推理基准的留出数据上得到了验证。
论文当前状态:审稿中
## 1 引言
### 1.1 研究问题与问题定义
像 DeepSeek-R1(Guo et al. (2025) (https://arxiv.org/html/2609.05512#bib.bib1))和 OpenAI 的 o1 系列(Zhao et al. (2025) (https://arxiv.org/html/2609.05512#bib.bib3))这样的大型推理模型(LRMs)已经彻底改变了数学、逻辑和多阶段推理任务的复杂问题解决方式。这些模型采用链式思维推理,系统地分解问题,在遇到不一致性时回溯,并估计不确定性,这些是标准语言模型所不具备的能力(Xu et al. (2025) (https://arxiv.org/html/2609.05512#bib.bib12))。然而,这种推理代价高昂:DeepSeek-R1 系列在 FP16 精度下消耗数十甚至数百 GB 的 GPU 内存,并且每个查询生成数千个推理 token,这使得在资源受限的应用中部署变得极其昂贵(Zhao et al. (2025) (https://arxiv.org/html/2609.05512#bib.bib3))。模型压缩,如量化,通过使用 4 位或 3 位等低精度整数表示权重和激活来减少内存占用和计算成本(Choudhary et al. (2020) (https://arxiv.org/html/2609.05512#bib.bib13))。虽然像 AWQ(Lin et al. (2024) (https://arxiv.org/html/2609.05512#bib.bib7))和 GPTQ(Frantar et al. (2022) (https://arxiv.org/html/2609.05512#bib.bib4))这样的方法成功地压缩了标准 LLM,但 Zhang 等人最近的研究(Zhang et al. (2025) (https://arxiv.org/html/2609.05512#bib.bib5))揭示了推理模型表现出独特的脆弱性:对 R1-Distill-Llama-8B 进行 3 位 AWQ 量化会导致 AIME 2024 的准确率从 42.2% 下降到 10.0%,这是灾难性的 76% 相对下降。然而,同一研究表明,选择性地保护仅 2% 的参数(最终层 MLP)就能恢复 6.57% 的准确率,这表明量化损害高度局部化于特定的模型组件(Zhang et al. (2025) (https://arxiv.org/html/2609.05512#bib.bib5))。Zhang 等人的观察激发了我们的核心研究问题:哪些特定的(层,投影)对——处理推理的基本电路——最容易受到量化的影响,保护它们与节能之间如何权衡?
当前的量化方法对所有层或投影类型一视同仁,错失了优化准确率-能耗前沿的机会。考虑一个具体的例子:量化第 15 层的 gate_proj 可能只造成最小的准确率损失,同时节省大量能源;而量化第 31 层的 up_proj 可能保持能源节省,但却会严重损害准确率。没有逐模块的脆弱性剖面图,从业者无法做出明智的保护决策。
### 1.2 动机与影响
逐模块的脆弱性对于两个关键的部署场景至关重要。首先,边缘 AI 和移动推理代理需要模型适配 8-16GB 移动 RAM,同时保持推理准确率。当前的均匀量化以牺牲显著的准确率下降为代价来实现内存压缩。识别并保护最脆弱的模块可以在较小的准确率损失下实现显著的压缩(Husom et al. (2025) (https://arxiv.org/html/2609.05512#bib.bib8);Frantar et al. (2022) (https://arxiv.org/html/2609.05512#bib.bib4);Lin et al. (2024) (https://arxiv.org/html/2609.05512#bib.bib7))。其次,能源受限的数据中心面临巨大的推理成本:GPT-3 训练排放了 552 吨二氧化碳(Patterson et al. (2021) (https://arxiv.org/html/2609.05512#bib.bib6)),而现在推理占据了生命周期能耗的主导地位。每天数百万请求中每查询能耗减少 1%,可能相当于每年节省数兆瓦时的能源。
### 1.3 新颖性与相关工作
量化方法如 AWQ(Lin et al. (2024) (https://arxiv.org/html/2609.05512#bib.bib7))和 GPTQ(Frantar et al. (2022) (https://arxiv.org/html/2609.05512#bib.bib4))实现了 4 位压缩,但它们在校准数据集(如 WikiText-2)上进行,这些数据集不代表推理工作负载。能耗剖析工作将模型视为黑盒,未将成本归因于特定模块。Zhang 等人(https://arxiv.org/html/2609.05512#bib.bib5)的机制可解释性工作识别了重要模块,但未测量压缩脆弱性或能耗影响。我们的工作针对的是现有方法未解决的场景:大型推理模型(LRMs)(DeepSeek-AI (2025) (https://arxiv.org/html/2609.05512#bib.bib2))生成扩展的思维链序列,其中量化噪声会在数百个推理步骤中传播,并且能耗主要由输出长度而非模型大小主导。基于困惑度或梯度范数的标准敏感性度量无法捕捉这些特性。我们的贡献包括:(1)首次系统性的逐模块扰动扫描,针对推理任务识别每个模型所有 196–224(层,投影)对的脆弱性剖面,并使用留出的校准集消除脆弱性剖析与评估之间的循环性;(2)经验证据表明 INT4 量化可能通过延长思维链输出而*增加*推理任务的能耗;(3)发现模块脆弱性是*任务依赖*的:注意力投影对算术推理更关键,而不同架构在逻辑推理中的敏感性模式不同;(4)一个脆弱性引导的选择性压缩框架,仅恢复最敏感的层-投影对至 FP16,实现了均匀 INT4 量化无法达到的准确率-能耗权衡。
## 2 实验设置
### 2.1 模型
评估了来自 DeepSeek-R1 系列的两个蒸馏指令调优推理模型:DeepSeek-R1-Distill-Llama-8B(80 亿参数,Llama 架构)和 DeepSeek-R1-Distill-Qwen-7B(70 亿参数,Qwen 架构)(DeepSeek-AI (2025) (https://arxiv.org/html/2609.05512#bib.bib2))。DeepSeek-R1 模型采用包含在 `` 和 `</think>` 分隔符中的链式思维推理,能够检查在最终答案之前的完整推理轨迹(Zhu et al. (2025) (https://arxiv.org/html/2609.05512#bib.bib9))。选择来自两个不同架构族的模型,使我们能够评估大型推理模型的能耗是否因脆弱性模式和架构而异,还是在不同蒸馏目标间具有普遍性。
### 2.2 数据集与推理技能
表 1:数据集配置摘要
### 2.3 压缩条件
每个模型在五种压缩条件下进行评估,如表 2 所述 (https://arxiv.org/html/2609.05512#S2.T2)。
表 2:压缩条件
对于量化,模块恢复通过加载 CPU FP16 副本、将选定模块传输到 GPU(使用显式 float16 类型转换以防止 INT4-FP16 边界处的 dtype 不匹配)并替换 INT4 模型中的相应模块来执行。剩余的 float32 参数被转换为 float16 以消除隐藏的转换开销。
### 2.4 硬件与能耗测量
实验在匹兹堡超级计算中心(PSC)Bridges-2 集群的 Tesla V100-SXM2 GPU(32GB HBM2)上进行。通过 NVML(pynvml)在专用后台线程中以 100 毫秒间隔采样 GPU 功率。每查询能耗计算为 \(E = \bar{P} \times \Delta t\) (1),其中 \(\bar{P}\) 是采样平均功率,\(\Delta t\) 是使用 `time.perf_counter()` 测量的墙钟推理时间。在每种条件之前执行一次预热(最多 20 个 token),以确保 CUDA 内核编译和内存分配稳定。
### 2.5 评估协议
每个(模型,数据集,条件)三元组使用贪心解码(`do_sample=False`)。我们报告每个模型-数据集对在 8 次重复实验中(每次 30 个样本)的平均值 ± 标准差,包括准确率、能耗(焦耳)、输出 token 数和功率(瓦特)。准确率按任务特定方式计算:GSM8K 和 MATH-500 为数值相等(±0.01);FOLIO 和 ProofWriter 为字符串匹配(True/False/Unknown);MuSiQue 为归一化精确匹配。答案通过正则表达式级联从 `</think>` 区域后提取。检查点功能允许恢复中断的运行;并且为了消除循环性,每个数据集被分为 50/50,一个校准集(仅用于脆弱性评分)和一个留出评估集(所有报告的指标)。
### 2.6 可重复性
模型权重从 Hugging Face Hub(`deepseek-ai/DeepSeek-R1-Distill-Llama-8B` 和 `deepseek-ai/DeepSeek-R1-Distill-Qwen-7B`)加载并本地缓存。BitsAndBytes 设置在所有 INT4 条件下固定:NF4 量化类型,float16 计算数据类型,禁用双重量化。
## 3 方法论
### 3.1 带模块类型保护的分组量化
在应用逐层选择性压缩之前,我们首先评估粗粒度保护策略,这些策略将整个投影组恢复至 FP16,而其余部分保持 INT4。这确定了对于每个推理任务,哪种投影类型(注意力或 MLP)更为关键,并为第 3.2 节 (https://arxiv.org/html/2609.05512#S3.SS2) 中更细粒度的扰动扫描提供了动机。评估两种分组条件:INT4 + Attention:注意力投影(q, k, v, o)恢复至 FP16;MLP 投影(gate, up, down)保持 INT4;以及 INT4 + MLP:MLP 投影(gate, up, down)恢复至 FP16;注意力投影(q, k, v, o)保持 INT4。所有分组量化结果均在留出评估集(每个数据集的后 50%)上进行评估,该集与用于脆弱性评分的校准集互不相交。
### 3.2 用于脆弱性剖析的扰动扫描
分组量化揭示了哪种投影类型对每种任务更关键,但无法识别该类型内哪些特定层最容易受到攻击。为了生成细粒度的逐模块脆弱性分数 \(V(m)\),我们使用校准集(每个数据集的前 50%)进行系统扰动扫描,确保脆弱性分数来自与留出评估集互不相交的数据。FP16 模型加载一次并保留在 GPU 内存中。对于每一对 \((l, p)\):
1. 使用 BitsAndBytes NF4 量化将模块 \((l, p)\) 就地量化为 INT4。
2. 在 30 个校准样本(每个数据集的前 50%)上进行评估,记录准确率。
3. 使用保存的权重将模块 \((l, p)\) 恢复至 FP16。
4. 记录 \(V(l, p) = \text{baseline\_acc} - \text{quantized\_acc}\)。
完整的扫描覆盖 Qwen-7B 的所有 196 对和 Llama-8B 的 224 对,在所有五个基准(FOLIO、GSM8K、MATH-500、ProofWriter、MuSiQue)上进行。脆弱性分数在所有数据集(不包括 MuSiQue,其近乎零的准确率使得逐模块分数与噪声无法区分)上取平均,生成用于选择性压缩的综合排名。
### 3.3 基于脆弱性引导保护的选择性压缩
给定来自扰动扫描的排名脆弱性分数,我们应用选择性混合精度压缩,仅保护最敏感的电路。形式化地,令 \(M = \{(l, p) : l \in [1, L], p \in \{q, k, v, o, \text{gate}, \text{up}, \text{down}\}\}\) 为所有模块对的集合。在保护级别 \(K\) 下的受保护集为:
\[ P_{K} = \{m \in M : \operatorname{rank}(V(m)) \leq K \cdot |M|\} \]
(2)
选择性模型为所有模块加载 INT4,然后使用第 3.2 节 (https://arxiv.org/html/2609.05512#S3.SS2) 中描述的相同模块恢复程序将 \(P_{K}\) 恢复至 FP16。我们评估四个保护级别:\(K \in \{0.10, 0.20, 0.30, 0.40\}\),对应于保护最脆弱的 Top 10%、20%、30% 和 40% 的层-投影对。为验证脆弱性排名是否提供了超越任意模块选择的真实信号,我们将 Top-K% 与 Random-K%(三个随机种子的平均值)和 Bottom-K%(最不脆弱的对)基线进行比较;结果在附录 B (https://arxiv.org/html/2609.05512#A2) 中报告。
## 4 结果
量化、扰动引导的脆弱性剖析和选择性压缩的结果在两种架构(Qwen-7B 和 Llama-8B)和五个推理基准(FOLIO、GSM8K、MATH-500、ProofWriter 和 MuSiQue)上报告。所有实验均在 PSC Bridges-2 的 Tesla V100-SXM2 GPU 上使用 NVML 能耗测量(100 毫秒采样间隔)进行。除非另有说明,否则报告 8 次重复实验(每次 30 个样本)的平均准确率。
### 4.1 分组量化结果
表 3 (https://arxiv.org/html/2609.05512#S4.T3) 展示了在留出评估集上四种量化条件下的准确率、能耗、输出 token 数和功率。得出几点发现。
表 3:分组保护结果(留出评估集,50/50 划分)。**粗体**=每个模型-数据集对的最佳 INT4 条件。*=相对于 FP16 能耗增加。8 次实验(每次 30 个样本)的平均值。
| 条件 | DeepSeek-R1-Distill-Llama-8B | | | | DeepSeek-R1-Distill-Qwen-7B | | | |
| :--- | :--- | :--- | :--- | :--- | :--- | :--- | :--- | :--- |
| | **准确率 (%)** | **能耗 (焦耳)** | **Token 数** | **功率 (瓦)** | **准确率 (%)** | **能耗 (焦耳)** | **Token 数** | **功率 (瓦)** |
| **FOLIO** | | | | | | | | |
| FP16 | 32.50 | 2,759 | 500 | 182.7 | 45.83 | 2,196 | 454 | 171.3 |
| 完整 INT4 | 36.25 | 2,824* | 504 | 135.4 | 44.17 | 2,043 | 423 | 134.3 |
| INT4 + Attention | 35.42 | 2,649 | 488 | 152.0 | 45.00 | 2,079 | 439 | 144.6 |
| INT4 + MLP | 34.58 | 3,000* | 502 | 162.1 | 42.92 | 2,206* | 430 | 150.7 |
| **GSM8K** | | | | | | | | |
| FP16 | 80.42 | 4,955 | 891 | 171.5 | 92.92 | 3,681 | 695 | 184.5 |
| 完整 INT4 | 74.17 | 6,090* | 1,094 | 134.1 | 92.50 | 3,662 | 691 | 141.4 |
| INT4 + Attention | 79.17 | 5,462* | 1,021 | 146.8 | 91.67 | 3,494 | 679 | 152.8 |
| INT4 + MLP | 77.08 | 6,565* | 1,127 | 154.8 | 92.50 | 3,936* | 708 | 162.0 |
| **MATH-500** | | | | | | | | |
| FP16 | 57.50 | 8,092 | 1,396 | 175.3 | 66.25 | 7,934 | 1,467 | 184.9 |
| 完整 INT4 | 56.67 | 8,469* | 1,508 | 139.2 | 66.25 | 7,519 | 1,443 | 145.6 |
| INT4 + Attention | 60.00 | 8,024 | 1,474 | 150.2 | 70.00 | 7,372 | 1,435 | 156.1 |
| INT4 + MLP | 58.75 | 8,702* | 1,452 | 155.7 | 65.42 | 8,143* | 1,467 | 167.1 |
| **ProofWriter** | | | | | | | | |
| FP16 | 39.17 | 2,578 | 497 | 169.5 | 69.58 | 2,007 | 400 | 177.9 |
| 完整 INT4 | 41.67 | 2,630* | 503 | 127.4 | 77.08 | 1,876 | 376 | 134.5 |
| INT4 + Attention | 40.00 | 2,489 | 506 | 140.7 | 76.67 | 1,793 | 384 | 144.5 |
| INT4 + MLP | (数据缺失) | | | | | | | |相似文章
压缩递归推理模型用于边缘设备时,什么得以保留?
对压缩递归推理模型用于边缘硬件进行系统研究发现,激进量化会破坏全局推理,同时保留局部预测。该论文引入每通道校准的INT4以恢复推理能力,并提供了适配8 MB SoC和4 MB MCU目标的部署方案。
[研究/模型] Flint:无损压缩推理过程
本研究引入了针对推理轨迹的章节感知压缩,训练模型舍弃填充性叙述,同时保留计算和验证片段,在比原始推理少用2-3倍词元的情况下,达到或超越原始准确率。
通过推理空间压缩的结构化理由蒸馏
本文提出了 D-RPC,一种通过将推理路径压缩为可复用库,从而将大型语言模型的推理能力蒸馏给较小模型的方法,该方法在数学和常识基准测试中实现了更好的性能和一致性。
Kara: 通过滑动窗口KV缓存压缩实现高效推理LLM服务
本文提出了Kara,一种滑动窗口KV缓存压缩方法,用于高效服务推理型大语言模型。该方法通过使用双向注意力和Token2Chunk模块,解决了现有压缩技术中的局限性。该方法被集成到基于vLLM构建的KvLLM推理框架中,在保持性能的同时提高了输出吞吐量。
隐式压缩正则化:通过强化学习后训练中的内部短分布实现简洁推理
本文提出了隐式压缩正则化(ICR),一种旨在解决大语言模型在强化学习后训练期间过度思考问题的方法,引导模型生成简洁且准确的推理轨迹。