SQS:通过稀疏量化子分布的贝叶斯深度神经网络压缩
摘要
论文介绍了一个统一的贝叶斯变分框架,结合 spike-and-slab 稀疏性和高斯混合量化,用于在大神经网络中实现高压缩率,同时最小化精度损失。
查看缓存全文
缓存时间: 2026/09/09 08:30
论文页面 - SQS: 通过稀疏量化子分布实现的贝叶斯DNN压缩
来源: https://huggingface.co/papers/2510.08999
摘要
一个统一的贝叶斯变分框架结合了尖峰-平板稀疏性和高斯混合量化,以最小的精度损失实现了对大规模神经网络的高压缩率。
压缩大规模神经网络对于在资源受限设备上部署模型至关重要。大多数现有方法单独采用权重剪枝 (https://huggingface.co/papers?q=pruning) 或低比特量化 (https://huggingface.co/papers?q=low-bit%20quantization),通常为了保持可接受的性能下降而导致压缩率次优。我们引入了一个统一的框架,通过贝叶斯变分学习 (https://huggingface.co/papers?q=Bayesian%20variational%20learning) (\method) 同时进行剪枝 (https://huggingface.co/papers?q=pruning) 和低比特量化 (https://huggingface.co/papers?q=low-bit%20quantization),该框架在保持相当性能的同时,实现了比先前基线更高的压缩率。关键思想是采用尖峰-平板先验 (https://huggingface.co/papers?q=spike-and-slab%20prior) 来诱导稀疏性,并使用高斯混合模型 (https://huggingface.co/papers?q=Gaussian%20Mixture%20Models) (GMMs) 对量化权重进行建模,以实现低比特精度。由于目标函数涉及尖峰-平板先验 (https://huggingface.co/papers?q=spike-and-slab%20prior) 和GMM的难以处理性,我们推导了一种有效的近似方法,从而促进以最小的精度损失进行有效压缩。理论上,我们为所提出的针对稀疏和量化深度神经网络 (https://huggingface.co/papers?q=sparse%20and%20quantized%20deep%20neural%20network) 的变分方法提供了一致性结果。在压缩ResNet、BERT-base、Llama3.2和Qwen2.5模型的大量实验中,我们的方法在性能损失相当的情况下,实现了比一系列现有方法更高的压缩率。项目页面:https://comeusr.github.io/SQS_Webpage\。
查看arXiv页面 (https://arxiv.org/abs/2510.08999)查看PDF (https://arxiv.org/pdf/2510.08999)项目页面 (https://comeusr.github.io/SQS_Webpage/)GitHub0 (https://github.com/comeusr/SQS_TMLR)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2510.08999)
在您的代理中获取此论文:
hf papers read 2510\.08999
没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接此论文
在模型README.md中引用arxiv.org/abs/2510.08999,以从此页面链接它。
引用此论文的数据集0
没有数据集链接此论文
在数据集README.md中引用arxiv.org/abs/2510.08999,以从此页面链接它。
引用此论文的Spaces0
没有Space链接此论文
在Space README.md中引用arxiv.org/abs/2510.08999,以从此页面链接它。
包含此论文的收藏集0
没有包含此论文的收藏集
将此论文添加到收藏集 (https://huggingface.co/new-collection)以从此页面链接它。
相似文章
序贯稀疏高斯过程分位数回归
本文提出了一种用于分位数回归的稀疏高斯过程框架,该框架采用拉普拉斯近似进行后验推断,并利用基于方差的机制实现自适应诱导输入放置和数据获取。
通过联合优化架构与量化策略实现 LLM 压缩
来自 UiT 和奥斯陆大学的研究人员提出了一种可微分 NAS 框架,能够联合优化 LLM 压缩中的架构配置与混合精度量化策略。与先 NAS 后量化的顺序基线方法相比,该框架在七项推理任务中可实现最高 1.4 倍的推理加速,或最高 6% 的精度提升。
Compression Trinity:探索用于LLM压缩的稀疏性、量化与低秩近似
本文介绍了“Compression Trinity”框架,该框架联合应用稀疏性、量化与低秩近似来压缩大型语言模型,以提高效率和性能。
KV缓存压缩比TurboQuant与逐向量香农极限高出900000倍
一篇新论文提出了一种基于概率语言Trie树和预测差分编码的顺序KV缓存压缩方法。该方法通过利用语言模型Token的序列结构而非对向量进行独立处理,实现了超越TurboQuant约91.4万倍的理论压缩比。
CubicQuant:面向1-8位权重高吞吐量LLM推理的参数化非均匀码本
CubicQuant提出了一种用于LLM权重的参数化非均匀标量量化格式,利用单调三次曲线在1-8位宽度下自适应重建水平,同时保留密集整数码流以提升GPU执行效率。实验表明,与均匀基线和浮点基线相比,RMSE有所降低,并给出了初步的H200内核测量结果。