[论文] EdgeRazor:一种基于混合精度量化感知蒸馏的大语言模型轻量级框架
摘要
EdgeRazor 是一个轻量级框架,用于通过熵引导的混合精度量化感知蒸馏来压缩大语言模型,实现每参数 1.88 比特,同时保持教师模型的能力,且无需更改 llama.cpp 等推理实现。该方法在 MobileLLM 和 Qwen 变体等小型模型上进行了演示。
EdgeRazor 方法使用熵引导的蒸馏过程,更好地将教师模型的 logit 概率分布转化为学生模型的低比特/混合精度隐藏层特征,而不试图保留教师模型的参数结构。这比现有量化方法计算成本更高,但远低于 QAT,并且取得了更好的结果。学生模型在极低参数精度下保留了更多教师模型的能力(作者展示了每参数 1.88 比特)。由于它不像传统量化那样使用不同的内部表示,因此无需修改像 llama.cpp 这样的推理实现即可利用它。希望这意味着未来会出现更有用的高参数/低内存模型,这样我们就能从消费级 GPU 中榨取更强的推理能力。论文:https://arxiv.org/abs/2605.04062 作者代码:https://github.com/zhangsq-nju/EdgeRazor 作者将该技术应用于几个模型并上传到 Huggingface:https://huggingface.co/collections/zhangsq-nju/edgerazor-nbit 不幸的是,由于 EdgeRazor 计算量较大,他们的示例模型都很小:MobileLLM、Qwen3-0.6B、Qwen3-1.7B 和 Qwen2.5-Omni-7B
相似文章
MixQuant:大语言模型的自适应混合精度量化
MixQuant提出了一种针对大语言模型的自适应混合精度量化框架,通过边缘化随机上游配置下的层失真来处理可变内存预算,在多个模型和预算下均优于现有方法。
[论文] 大语言模型的统计无损量化
本文提出了一种针对大语言模型的统计无损量化方法,旨在在不损失信息的情况下减小模型大小。
重新思考小型VLM量化:从组件分析到硬件感知的边缘部署
本文系统性地评估了Jetson边缘设备上小型视觉语言模型的组件级量化,发现模型架构(MoE vs 稠密)显著影响量化敏感性,且量化误差在大体上是累加的,除了模态对齐路径之外。
CompactQE: 通过小型开放权重LLMs实现可解释的翻译质量评估
本文证明,小型开放权重LLMs(参数小于30B)能够实现具有竞争力的可解释翻译质量评估,包括MQM错误标注和修正,与更大的专有模型相媲美,同时保护数据隐私。
通过蒸馏和量化扩展Apertus LLM系列
本文验证了蒸馏和量化作为经济高效的方法,用于将Apertus LLM系列扩展到新的规模和硬件格式,生成了Apertus-v1.1模型,参数高达4B,在1.7T tokens上训练。