SQS:通过稀疏量化子分布的贝叶斯深度神经网络压缩

Hugging Face Daily Papers 论文

摘要

论文介绍了一个统一的贝叶斯变分框架,结合 spike-and-slab 稀疏性和高斯混合量化,用于在大神经网络中实现高压缩率,同时最小化精度损失。

压缩大规模神经网络对于在资源受限设备上部署模型至关重要。大多数现有方法单独采用权重剪枝或低比特量化,通常导致次优的压缩率以保持可接受的性能下降。我们引入了一个统一的框架,通过贝叶斯变分学习(\method)同时进行剪枝和低比特量化,该方法实现了比先前基线更高的压缩率,同时保持可比的性能。关键思想是使用 spike-and-slab 先验来诱导稀疏性,并使用高斯混合模型(GMMs)对量化权重建模以实现低比特精度。由于涉及 spike-and-slab 先验与 GMMs 的目标函数难以处理,我们推导出一种有效的近似方法,从而在最小化精度损失的情况下实现有效压缩。在理论上,我们为提出的变分方法应用于稀疏量化深度神经网络提供了一致性结果。在压缩 ResNet、BERT-base、Llama3.2 和 Qwen2.5 模型的大量实验中,我们的方法实现了比一系列现有方法更高的压缩率,同时性能下降可比。项目页面:https://comeusr.github.io/SQS_Webpage。
查看原文
查看缓存全文

缓存时间: 2026/09/09 08:30

论文页面 - SQS: 通过稀疏量化子分布实现的贝叶斯DNN压缩

来源: https://huggingface.co/papers/2510.08999

摘要

一个统一的贝叶斯变分框架结合了尖峰-平板稀疏性和高斯混合量化,以最小的精度损失实现了对大规模神经网络的高压缩率。

压缩大规模神经网络对于在资源受限设备上部署模型至关重要。大多数现有方法单独采用权重剪枝 (https://huggingface.co/papers?q=pruning) 或低比特量化 (https://huggingface.co/papers?q=low-bit%20quantization),通常为了保持可接受的性能下降而导致压缩率次优。我们引入了一个统一的框架,通过贝叶斯变分学习 (https://huggingface.co/papers?q=Bayesian%20variational%20learning) (\method) 同时进行剪枝 (https://huggingface.co/papers?q=pruning) 和低比特量化 (https://huggingface.co/papers?q=low-bit%20quantization),该框架在保持相当性能的同时,实现了比先前基线更高的压缩率。关键思想是采用尖峰-平板先验 (https://huggingface.co/papers?q=spike-and-slab%20prior) 来诱导稀疏性,并使用高斯混合模型 (https://huggingface.co/papers?q=Gaussian%20Mixture%20Models) (GMMs) 对量化权重进行建模,以实现低比特精度。由于目标函数涉及尖峰-平板先验 (https://huggingface.co/papers?q=spike-and-slab%20prior) 和GMM的难以处理性,我们推导了一种有效的近似方法,从而促进以最小的精度损失进行有效压缩。理论上,我们为所提出的针对稀疏和量化深度神经网络 (https://huggingface.co/papers?q=sparse%20and%20quantized%20deep%20neural%20network) 的变分方法提供了一致性结果。在压缩ResNet、BERT-base、Llama3.2和Qwen2.5模型的大量实验中,我们的方法在性能损失相当的情况下,实现了比一系列现有方法更高的压缩率。项目页面:https://comeusr.github.io/SQS_Webpage\。

查看arXiv页面 (https://arxiv.org/abs/2510.08999)查看PDF (https://arxiv.org/pdf/2510.08999)项目页面 (https://comeusr.github.io/SQS_Webpage/)GitHub0 (https://github.com/comeusr/SQS_TMLR)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2510.08999)

在您的代理中获取此论文:

hf papers read 2510\.08999

没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接此论文

在模型README.md中引用arxiv.org/abs/2510.08999,以从此页面链接它。

引用此论文的数据集0

没有数据集链接此论文

在数据集README.md中引用arxiv.org/abs/2510.08999,以从此页面链接它。

引用此论文的Spaces0

没有Space链接此论文

在Space README.md中引用arxiv.org/abs/2510.08999,以从此页面链接它。

包含此论文的收藏集0

没有包含此论文的收藏集

将此论文添加到收藏集 (https://huggingface.co/new-collection)以从此页面链接它。

相似文章

序贯稀疏高斯过程分位数回归

arXiv cs.LG

本文提出了一种用于分位数回归的稀疏高斯过程框架,该框架采用拉普拉斯近似进行后验推断,并利用基于方差的机制实现自适应诱导输入放置和数据获取。

通过联合优化架构与量化策略实现 LLM 压缩

arXiv cs.LG

来自 UiT 和奥斯陆大学的研究人员提出了一种可微分 NAS 框架,能够联合优化 LLM 压缩中的架构配置与混合精度量化策略。与先 NAS 后量化的顺序基线方法相比,该框架在七项推理任务中可实现最高 1.4 倍的推理加速,或最高 6% 的精度提升。

KV缓存压缩比TurboQuant与逐向量香农极限高出900000倍

Hacker News Top

一篇新论文提出了一种基于概率语言Trie树和预测差分编码的顺序KV缓存压缩方法。该方法通过利用语言模型Token的序列结构而非对向量进行独立处理,实现了超越TurboQuant约91.4万倍的理论压缩比。

CubicQuant:面向1-8位权重高吞吐量LLM推理的参数化非均匀码本

arXiv cs.LG

CubicQuant提出了一种用于LLM权重的参数化非均匀标量量化格式,利用单调三次曲线在1-8位宽度下自适应重建水平,同时保留密集整数码流以提升GPU执行效率。实验表明,与均匀基线和浮点基线相比,RMSE有所降低,并给出了初步的H200内核测量结果。