[论文] 大语言模型的统计无损量化
摘要
本文提出了一种针对大语言模型的统计无损量化方法,旨在在不损失信息的情况下减小模型大小。
暂无内容
相似文章
雅可比引导噪声注入:提升大语言模型量化鲁棒性
本文提出雅可比引导噪声注入,一种通过向预注意力logits注入噪声来增强大语言模型量化鲁棒性的训练策略,噪声方差源自雅可比范数,在低比特量化设置中实现显著的性能增益。
MixQuant:大语言模型的自适应混合精度量化
MixQuant提出了一种针对大语言模型的自适应混合精度量化框架,通过边缘化随机上游配置下的层失真来处理可变内存预算,在多个模型和预算下均优于现有方法。
压缩重要部分:神经元重要性与数据感知低秩逼近相结合的语言模型压缩
本文提出了一种通过结合神经元重要性和数据感知低秩逼近来压缩大型语言模型的方法,同时采用高效的动态压缩率分配算法,性能与之前的最先进水平相当或更优。
量化如何改变可解释特征:语言模型的稀疏自编码器分析
本文研究了在全精度语言模型中由稀疏自编码器识别的可解释特征在量化后是否仍然忠实,发现系统性的退化,而像困惑度这样的行为指标可能无法捕捉到这种退化。
[论文] EdgeRazor:一种基于混合精度量化感知蒸馏的大语言模型轻量级框架
EdgeRazor 是一个轻量级框架,用于通过熵引导的混合精度量化感知蒸馏来压缩大语言模型,实现每参数 1.88 比特,同时保持教师模型的能力,且无需更改 llama.cpp 等推理实现。该方法在 MobileLLM 和 Qwen 变体等小型模型上进行了演示。