呼吁量化感知训练成为标准!!!
摘要
这篇文章质疑为什么量化感知训练没有成为开放权重AI模型的标准实践,并询问了如计算成本或性能影响等潜在障碍。
我想知道为什么量化感知训练还不是标准!??尤其是对于即将发布为开放权重的模型。说真的,如果一个模型要开放权重,我们知道社区当天就会把它量化到4位,这样人们才能实际运行它。所以为什么不从一开始就把它融入训练中?量化感知训练(QAT)并不是新技术。但每次发布仍然是全精度,好像大多数用户会以这种方式体验它。是训练时的额外计算成本吗?它会影响基准测试分数吗?还是说相比训练后量化,其收益并不那么显著?我是真心在问,有什么陷阱吗?从外部看,这对社区来说似乎是免费的胜利,那么我错过了什么?
相似文章
2-bit QAT 模型发布
关于2位量化感知训练(QAT)在更大规模MoE模型上的潜力的讨论,比较其与4位QAT及三元LLM的性能,并探讨在消费级硬件上的可行性。
对QAT模型使用替代量化有意义吗?[D]
讨论对像Gemma-4这样的量化感知训练(QAT)模型使用替代量化方法是否合理,质疑unsloth的基准测试显示其更接近QAT微调的性能是有益还是适得其反。
QUASAR:通过损失感知重建降低量化感知训练的损失下限
QUASAR是一种量化感知训练方法,通过使用损失感知重建来降低损失下限,提升大型语言模型中低比特模型的性能,在2-4比特时实现显著的精度增益。
K-Quantization 及其对输出性能的影响
本文研究了不同量化级别(2位到8位)对八个大型语言模型在推理、代码理解和阅读理解任务上的性能影响,发现虽然更高精度通常带来更好的性能,但激进量化通常能保持可接受的准确率,且更大的模型展现出更强的韧性。
相同的预测,不同的原因:量化对模型解释的影响
本文系统评估了后训练量化如何影响使用Grad-CAM和LIME的CNN模型的可解释性,揭示分类准确性并非可解释性稳定性的可靠指标,并且架构选择对于可信部署至关重要。