标签
一个使用三元3:4权重的1.6 MB模型在浏览器中通过WebGPU运行,玩四子棋的效果与7.8 MB的int8模型相当,展示了三元格式在轻量级AI部署中的有效性。
本文回顾了基于Kashin分解的大型语言模型权重量化方法,并提出一种使用结构化正交变换的改进算法,相比OPTQ和QuIP等方法,降低了计算成本并确保了数值稳定性。
CubicQuant提出了一种用于LLM权重的参数化非均匀标量量化格式,利用单调三次曲线在1-8位宽度下自适应重建水平,同时保留密集整数码流以提升GPU执行效率。实验表明,与均匀基线和浮点基线相比,RMSE有所降低,并给出了初步的H200内核测量结果。
介绍了QAM-W,一种针对LLM权重的联合二维码本量化方法,采用哈达玛旋转和激活感知缩放,在每权重5–6比特下实现接近BF16的困惑度,并以减少32%的权重比特达到与SmoothQuant W8A8相当的质量。