weight-quantization

标签

Cards List
#weight-quantization

Sherry的3:4三元格式(每权重1.375位)在WebGPU上运行:一个1.6 MB模型玩四子棋效果等同于其7.8 MB int8版本

Reddit r/LocalLLaMA ↗ · 23小时前

一个使用三元3:4权重的1.6 MB模型在浏览器中通过WebGPU运行,玩四子棋的效果与7.8 MB的int8模型相当,展示了三元格式在轻量级AI部署中的有效性。

0 人收藏 0 人点赞
#weight-quantization

语言模型低开销量化的结构化变换

arXiv cs.CL ↗ · 2026-09-11 缓存

本文回顾了基于Kashin分解的大型语言模型权重量化方法,并提出一种使用结构化正交变换的改进算法,相比OPTQ和QuIP等方法,降低了计算成本并确保了数值稳定性。

0 人收藏 0 人点赞
#weight-quantization

CubicQuant:面向1-8位权重高吞吐量LLM推理的参数化非均匀码本

arXiv cs.LG ↗ · 2026-08-10 缓存

CubicQuant提出了一种用于LLM权重的参数化非均匀标量量化格式,利用单调三次曲线在1-8位宽度下自适应重建水平,同时保留密集整数码流以提升GPU执行效率。实验表明,与均匀基线和浮点基线相比,RMSE有所降低,并给出了初步的H200内核测量结果。

0 人收藏 0 人点赞
#weight-quantization

QAM-W:基于哈达玛旋转和激活感知缩放的LLM权重联合二维码本量化

arXiv cs.LG ↗ · 2026-05-27 缓存

介绍了QAM-W,一种针对LLM权重的联合二维码本量化方法,采用哈达玛旋转和激活感知缩放,在每权重5–6比特下实现接近BF16的困惑度,并以减少32%的权重比特达到与SmoothQuant W8A8相当的质量。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈