NANQ:面向模拟存内计算的噪声底感知混合精度非均匀量化
摘要
本文提出了NANQ,一种面向模拟存内计算(CIM)系统的噪声底感知混合精度非均匀量化框架,它根据硬件噪声特性调整量化精度,并在低位宽约束下提高模型精度。
arXiv:2608.02700v1 公告类型:新
摘要:模拟存内计算(CIM)能够实现节能的神经网络推理,但器件变异和读取噪声会严重降低低位宽量化模型的性能。现有的面向CIM的量化方法主要最小化理想量化误差,忽略了硬件噪声底,从而导致精度分配效率低下。我们提出了NANQ,一种面向模拟CIM的噪声感知混合精度非均匀量化框架。NANQ根据eFlash CIM阵列的实测响应对与幅度相关的权重噪声进行建模,并将噪声分布转换为自适应量化密度,在低噪声区域分配更精细的分辨率,同时避免在噪声主导区域进行无效的精度分配。它进一步通过统一阈值识别硬件噪声下每一层的精度饱和点,来分配逐层位宽。在eFlash CIM SoC上的片上实验表明,在2位权重幅度量化下,与PowerQuant相比,NANQ将视觉模型精度平均提高了8.05个百分点,并将语言模型困惑度(PPL)平均降低了54.7%。混合精度NANQ仅用3.2-3.8等效位即可获得额外量化资源所带来的大部分收益。
查看缓存全文
缓存时间: 2026/08/05 07:41
# NANQ:面向模拟存内计算的环境噪声感知混合精度非均匀量化
来源:https://arxiv.org/html/2608.02700
作者:AAAI Press Staff¹ AAAI Style 贡献者 Peter Patel Schneider, Sunil Issar, J. Scott Penberthy, George Ferguson, Hans Guesgen, Francisco Cruz\equalcontrib\corresponding, Marc Pujol-Gonzalez\equalcontrib\corresponding;Yizhe Chen¹\equalcontrib, Wenshuai Yao²\equalcontrib, Saiya Wang¹, Yuannuo Feng¹, Wenbo Qi³, Kechao Tang², Ngai Wong³, Wenyong Zhou³\corresponding, Wang Kang¹\corresponding
###### 摘要
模拟存内计算(CIM)能够实现高能效的神经网络推理,但器件变异和读出噪声会严重降低低位宽量化模型的精度。现有的面向CIM的量化方法主要最小化理想量化误差,而忽略了硬件噪声基底,从而导致精度分配效率低下。我们提出NANQ,一种面向模拟CIM的噪声感知混合精度非均匀量化框架。NANQ利用从eFlash CIM阵列实测响应中提取的幅值相关权重噪声,将该噪声分布转化为自适应的量化密度,在低噪声区域分配更精细的分辨率,同时避免在噪声主导区域进行无效的精度分配。它进一步通过统一的阈值识别各层在硬件噪声下的精度饱和点,从而分配逐层位宽。在eFlash CIM SoC上的片上实验表明,在2比特权重幅值量化下,NANQ在视觉模型上的准确率平均比PowerQuant提高8.05个百分点,在语言模型上的困惑度(PPL)平均降低54.7%。混合精度NANQ仅用约3.2–3.8等效比特即可获得额外量化资源所能带来的大部分收益。
## 引言
深度神经网络(DNN)复杂度的指数级增长推动了对高能效推理加速器的需求(Liu等,2025 (https://arxiv.org/html/2608.02700#bib.bib9))。模拟存内计算(CIM)架构已成为一种有前景的解决方案,它利用存储阵列内的原位计算,相比传统数字处理器在能效和计算密度方面实现了显著提升(Mao等,2025 (https://arxiv.org/html/2608.02700#bib.bib8);Chen等,2025 (https://arxiv.org/html/2608.02700#bib.bib6))。通过将神经网络权重直接存储在存储单元中,并利用模拟运算执行矩阵–向量乘法,CIM系统能够减少数据搬运开销并实现大规模并行计算(Guo等,2017 (https://arxiv.org/html/2608.02700#bib.bib7))。
然而,模拟CIM实现面临的根本性挑战限制了其实际部署(Wang等,2025 (https://arxiv.org/html/2608.02700#bib.bib10))。模拟电路固有的器件变异、热噪声和非线性会引入计算误差,从而严重降低神经网络精度(Liu等,2019 (https://arxiv.org/html/2608.02700#bib.bib15))。这些噪声源导致期望权重与CIM阵列中实际编程的权重之间存在偏差(Wang等,2023 (https://arxiv.org/html/2608.02700#bib.bib16);Xiang等,2019 (https://arxiv.org/html/2608.02700#bib.bib17))。
参见图注 图1:固定的量化电平在模拟硬件上扩展为带噪声的分布,导致更高精度带来的收益递减。
由于存储单元状态的离散性以及模拟读出电路的有限精度,CIM架构本质上需要模型量化(Bai等,2023 (https://arxiv.org/html/2608.02700#bib.bib3);Sun等,2024 (https://arxiv.org/html/2608.02700#bib.bib4);Chen等,2024 (https://arxiv.org/html/2608.02700#bib.bib5))。以往的面向CIM的量化方案已经充分探索了均匀量化的潜力,包括混合精度量化以及极端的二值或三值量化,但对非均匀量化的探索较少,而非均匀量化非常适合处理硬件非理想性引起的分布偏移。
如图1 (https://arxiv.org/html/2608.02700#Sx1.F1) 所示,在理想的数字量化过程中,连续的权重值被映射到其两侧最近的离散量化电平。然而,在模拟CIM上编程之后,每个量化电平都会扩展为一个带噪声的分布,其宽度取决于硬件噪声强度。
为应对这些挑战,我们提出噪声感知非均匀量化(NANQ),这是一种面向模拟CIM加速器上鲁棒DNN推理的硬件感知框架。NANQ联合考虑权重区域间和网络层间的噪声变化,以优化层内量化电平和层间位宽。主要贡献总结如下:
- •我们分析了模拟CIM中量化误差与芯片实测的幅值相关权重噪声之间的相互作用,表明一旦量化误差低于硬件噪声基底,增加位宽的收益便会饱和。
- •我们提出NANQ,一种免训练的非均匀量化方法,它将硬件噪声分布转化为自适应量化密度,并通过累积密度划分构建量化边界。
- •我们引入一种噪声感知的混合精度分配策略,利用统一阈值从硬件感知的损失曲线中确定每一层的饱和位宽,无需重训练或组合搜索即可避免冗余精度。
在CNN、ViT和语言模型上的片上评估表明,在45种模型–位宽配置中,NANQ在38种配置下取得了最佳量化结果,尤其在低位宽下表现出一致且稳定的优势。在相同量化资源下,混合精度NANQ在所有测试模型上进一步超越了所有评估的基线方法。
## 相关工作
参见图注 图2:基于非易失存储器(NVM-CIM)的模拟存内计算阵列示意图。
##### 模拟CIM与器件非理想性
如图2 (https://arxiv.org/html/2608.02700#Sx2.F2) 所示,模拟CIM将神经网络权重映射为器件电导状态,并将输入激活转换为字线电压。各单元电流沿每一列累加,从而在模拟域实现并行的矩阵–向量乘法。该计算原理可通过磁性、阻变和浮栅存储器件实现。
然而,实际器件偏离理想线性计算。工艺变异、随机编程、氧化物缺陷和电荷俘获会引入准静态的单元间电导变异,这种变异在推理运算期间持续存在(Georgiev等,2014 (https://arxiv.org/html/2608.02700#bib.bib25))。非线性权重编码、输入电压转换和器件I–V特性进一步产生系统性的输入相关和权重相关失真,这些失真在固定工作条件下可重复,并可通过校准部分缓解(Serm等,2025 (https://arxiv.org/html/2608.02700#bib.bib24))。此外,热噪声、闪烁噪声和外围读出噪声会引起随推理次数变化的时间波动(Feng等,2026 (https://arxiv.org/html/2608.02700#bib.bib26))。这些非理想性共同导致累加的列输出偏离理想的矩阵–向量乘法。
##### 非均匀量化
非均匀量化通过在权重范围内重新分配量化电平来改进低位宽表示。APoT利用2的幂之和构建结构化电平,以更好地表示长尾权重分布(Li等,2020 (https://arxiv.org/html/2608.02700#bib.bib2));PowerQuant则搜索逐层幂变换以实现无数据非均匀量化(Yvinec等,2023 (https://arxiv.org/html/2608.02700#bib.bib27))。SqueezeLLM进一步利用二阶敏感性构建非均匀码本,并以稀疏高精度表示保留敏感离群点(Kim等,2023 (https://arxiv.org/html/2608.02700#bib.bib28))。然而,这些方法主要优化权重分布、数字重建误差或模型敏感性,而未考虑模拟CIM的幅值相关硬件噪声。
##### 混合精度量化
混合精度量化为网络各层分配不同的位宽,以更好地平衡模型精度与资源消耗。PNMQ在指定压缩预算下联合优化参数化非均匀量化网格和逐层位宽,无需重训练(Chikin and Antiukh,2022 (https://arxiv.org/html/2608.02700#bib.bib23))。OMPQ利用网络正交性作为层重要性的高效代理,并通过线性规划确定位宽配置(Ma等,2023 (https://arxiv.org/html/2608.02700#bib.bib29))。最近,InfoQ衡量逐层量化对信息流的全局影响,并将精度分配表述为整数线性规划问题(Akbulut等,2026 (https://arxiv.org/html/2608.02700#bib.bib30))。尽管这些方法能够高效捕捉层相关的精度需求,但其分配准则源于理想的数字量化,未考虑模拟CIM的硬件噪声基底。
## 方法
参见图注 图3:不同噪声条件下输出信噪比(SNR)与权重量化位宽的关系。
### 动机
如图3 (https://arxiv.org/html/2608.02700#Sx3.F3) 所示,传统量化主要通过最小化理想权重域重建误差来确定量化电平。然而,量化权重被映射到物理电导状态后,每个电平还会受到幅值相关硬件噪声的进一步扰动。一旦局部量化误差低于硬件噪声基底,更精细的量化所带来的有效改进十分有限。因此,仅由理想重建误差推导出的量化边界可能在噪声主导区域浪费分辨率,而在更可靠的区域却分辨率不足。这种失配促使我们根据实测的硬件噪声分布自适应地重新分配层内量化电平。
我们进一步研究不同层是否从提高权重精度中获得的收益相同。使用均匀量化,我们在硬件噪声下独立评估每一层。令\(\mathcal{L}_{l}(b)\)表示当第\(l\)层使用\(b\)比特权重精度时的验证损失,令\(N_{l}\)表示该层的权重数量。由于将该层精度提高一比特会引入\(N_{l}\)个额外权重比特,我们将每增加一个权重比特所产生的边际损失降低定义为
\(G_{l}(b)=\frac{\max\left(\mathcal{L}_{l}(b)-\mathcal{L}_{l}(b+1),0\right)}{N_{l}}.\)(1)
如图4 (https://arxiv.org/html/2608.02700#Sx3.F4) 所示,不同层在相同位宽下表现出显著不同的边际收益,而每层的收益通常随精度提高而下降。某些层在低位宽下就已接近饱和,而另一些层则继续从额外比特中获益。这种异质性在CNN和LLM中均一致观察到,表明均匀位宽可能将冗余精度分配给已经饱和的层。这一观察促使我们确定层特定的饱和位宽,并避免向硬件感知收益已经减弱的层分配冗余精度。
### 理论分析
我们分析为什么在模拟硬件噪声下,提高量化位宽带来的收益递减。对于权重\(w\)附近的区域,总误差方差可近似为
\(\sigma_{\mathrm{tot}}^{2}(b,w)=\sigma_{q}^{2}(b,w)+\sigma_{h}^{2}(w),\)(2)
其中\(\sigma_{q}^{2}(b,w)\)和\(\sigma_{h}^{2}(w)\)分别表示局部量化误差方差和硬件噪声方差。假设在位宽\(b\)下的局部量化步长为\(\Delta_{b}(w)\),则量化误差方差可近似为
\(\sigma_{q}^{2}(b,w)\approx\frac{\Delta_{b}^{2}(w)}{12}\propto 2^{-2b}.\)(3)
相应的输出SNR因此表示为
\(\mathrm{SNR}(b,w)=\frac{P_{\mathrm{sig}}(w)}{\sigma_{q}^{2}(b,w)+\sigma_{h}^{2}(w)},\)(4)
其中\(P_{\mathrm{sig}}(w)\)表示所考虑权重区域对应的信号功率。
增加\(b\)会以指数方式减小\(\sigma_{q}^{2}(b,w)\),但不会减小硬件噪声项。一旦\(\sigma_{q}^{2}(b,w)\ll\sigma_{h}^{2}(w)\),SNR趋近于\(P_{\mathrm{sig}}(w)/\sigma_{h}^{2}(w)\),此时额外比特带来的改进非常有限。此外,硬件噪声更强的权重区域或网络层会在更低位宽下达到这一精度饱和点。因此,量化分辨率应集中在相对可靠的权重区域,而额外比特应仅分配给仍然表现出有意义的边际收益的层。
上述分析确立了精度饱和效应,但并未唯一确定最优量化密度。受此观察启发,我们在下一节中采用一种轻量级的逆噪声密度。
参见图注 图4:在模拟CIM噪声下提高权重精度带来的逐层边际收益:ResNet-20在CIFAR-100 (Krizhevsky等,2009 (https://arxiv.org/html/2608.02700#bib.bib31))(上)和Llama-3.2-3B在WikiText-2 (Merity等,2016 (https://arxiv.org/html/2608.02700#bib.bib33))(下)。
参见图注 图5:我们的NANQ方法概览。在现有量化方法的基础上,NANQ根据量化前值的噪声敏感性指标调整量化点。
### 自适应量化算法
如图5 (https://arxiv.org/html/2608.02700#Sx3.F5) 所示,NANQ将幅值相关的硬件噪声分布转化为非均匀量化密度,并据此构建噪声自适应量化边界。
图5 (https://arxiv.org/html/2608.02700#Sx3.F5) (a) 和 (b) 分别展示了归一化的权重幅值域及其对应的噪声强度分布。我们使用噪声强度函数\(\sigma(w)\)来刻画该分布,其中\(\sigma(w)\geq 0\)表示在幅值\(w\)处的相对噪声强度。对于所评估的基于eFlash的CIM SoC,\(\sigma(w)\)是通过在不同编程权重幅值下进行重复片上回读测量直接获得的。这里,\(\sigma(w)\)为构建量化器提供了器件表征先验,而非作为显式的推理噪声模拟器。量化器校准和端到端评估均使用真实芯片响应进行。该公式不对底层噪声模型施加特定的解析形式,因此可以适应不同的模拟CIM器件和技术。基于\(\sigma(w)\),我们定义如图5 (https://arxiv.org/html/2608.02700#Sx3.F5) (c) 所示的逆量化密度函数:
\(\rho(w)=\frac{1}{\left(\sigma(w)+\epsilon\right)^{\gamma}},\)(5)
其中\(\gamma\geq 0\)控制自适应相似文章
MixQuant:大语言模型的自适应混合精度量化
MixQuant提出了一种针对大语言模型的自适应混合精度量化框架,通过边缘化随机上游配置下的层失真来处理可变内存预算,在多个模型和预算下均优于现有方法。
NanoQuant的一种实现:一种灵活的二进制量化方法
NanoQuant是一种灵活的二进制量化方法,可将稠密Transformer压缩至每个权重低于1比特。本仓库提供了一个PyTorch实现,仍在开发中,能够量化Qwen3-0.6B和Qwen3-4B等模型。
Quant.npu:通过全静态量化实现端侧大语言模型的高效移动NPU推理
Quant.npu 提出了一种面向移动 NPU 的全静态量化框架,利用可学习参数和旋转矩阵,无需运行时重新计算即可实现高效的低比特大语言模型推理,延迟最高降低 15.1%。
Mix-Quant: 量化预填充,精准解码的智能体大语言模型
Mix-Quant 提出了一种面向智能体大语言模型的阶段感知量化框架,在预填充阶段使用 NVFP4 量化以加速计算,同时在解码阶段保持 BF16 精度以维持准确性。该方法在智能体基准测试中实现了预填充速度提升最高 3 倍,且性能下降极小。
通过联合优化架构与量化策略实现 LLM 压缩
来自 UiT 和奥斯陆大学的研究人员提出了一种可微分 NAS 框架,能够联合优化 LLM 压缩中的架构配置与混合精度量化策略。与先 NAS 后量化的顺序基线方法相比,该框架在七项推理任务中可实现最高 1.4 倍的推理加速,或最高 6% 的精度提升。