[论文] EdgeRazor:一种基于混合精度量化感知蒸馏的大语言模型轻量级框架

Reddit r/LocalLLaMA 论文

摘要

EdgeRazor 是一个轻量级框架,用于通过熵引导的混合精度量化感知蒸馏来压缩大语言模型,实现每参数 1.88 比特,同时保持教师模型的能力,且无需更改 llama.cpp 等推理实现。该方法在 MobileLLM 和 Qwen 变体等小型模型上进行了演示。

EdgeRazor 方法使用熵引导的蒸馏过程,更好地将教师模型的 logit 概率分布转化为学生模型的低比特/混合精度隐藏层特征,而不试图保留教师模型的参数结构。这比现有量化方法计算成本更高,但远低于 QAT,并且取得了更好的结果。学生模型在极低参数精度下保留了更多教师模型的能力(作者展示了每参数 1.88 比特)。由于它不像传统量化那样使用不同的内部表示,因此无需修改像 llama.cpp 这样的推理实现即可利用它。希望这意味着未来会出现更有用的高参数/低内存模型,这样我们就能从消费级 GPU 中榨取更强的推理能力。论文:https://arxiv.org/abs/2605.04062 作者代码:https://github.com/zhangsq-nju/EdgeRazor 作者将该技术应用于几个模型并上传到 Huggingface:https://huggingface.co/collections/zhangsq-nju/edgerazor-nbit 不幸的是,由于 EdgeRazor 计算量较大,他们的示例模型都很小:MobileLLM、Qwen3-0.6B、Qwen3-1.7B 和 Qwen2.5-Omni-7B
查看原文

相似文章

MixQuant:大语言模型的自适应混合精度量化

arXiv cs.LG

MixQuant提出了一种针对大语言模型的自适应混合精度量化框架,通过边缘化随机上游配置下的层失真来处理可变内存预算,在多个模型和预算下均优于现有方法。

通过蒸馏和量化扩展Apertus LLM系列

arXiv cs.LG

本文验证了蒸馏和量化作为经济高效的方法,用于将Apertus LLM系列扩展到新的规模和硬件格式,生成了Apertus-v1.1模型,参数高达4B,在1.7T tokens上训练。