标签
本研究报告评估了Qwen3-4B模型的训练后三值化处理,实现了1.641位的有效权重表示与显著的存储压缩,同时指出了性能折衷及尚未解决的部署加速问题。
QTEA是一种面向大语言模型的亚2比特训练后量化框架,通过稀疏残差显著权重与按列优化,实现了三值权重压缩,并提升了准确率与硬件效率。
本文提出REAL-Q,一种新颖的端到端对齐训练后量化方法,用于大语言模型,该方法利用动态梯度下降来减轻量化误差,在KL散度降低方面相较于最先进方法实现了显著改进。
OCGQuant提出了一种用于NVFP4量化的异常值伴随分组方法,以减少激活块误差,提升LLM推理效率。在Llama3和Qwen3上的实验表明,其性能优于现有的后训练量化技术。
HyGenQ是一个针对混合迭代生成模型的训练后量化框架,解决了过度离群值和放大异常等挑战,实现了8位精度量化,同时保持生成质量。
ReRound是一种训练后量化方法,使用条件扩散模型来引导接近中点的权重的舍入,在3位和4位量化下提高小型LLM的准确性,且不引入推理开销。
ReQuant introduces a backpropagation-free, fixed-grid discrete refinement stage for post-training quantization (PTQ) that iteratively improves initial quantized models while preserving the quantized format, showing consistent gains across various LLMs and bit-widths.
提出了递归残差量化(RRQ),这是一种训练后量化框架,通过加法式残差细化,从单个LLM检查点获得多种有效精度,从而提高了灵活性和构建速度。
ExTernD引入了一种扩展秩三值分解用于LLM训练后量化,通过使用具有自由内秩的因子化表示,使精度接近bf16。在Gemma-4和Qwen3.5等模型上,它以每个权重5.2-5.5有效比特达到Q4_K的精度。
KronQ是一种后训练量化框架,通过Kronecker分解的海森矩阵近似引入梯度协方差,实现了双向非相干处理和改进的混合精度分配灵敏度度量。即使在LLaMA-3-70B等大模型上进行2比特权重量化,也能实现低困惑度。
OrbitQuant提出了一种数据无关的扩散Transformer量化方法,消除了跨时间步和模态进行重新校准的需求,在FLUX.1和CogVideoX等模型的低位宽设置下实现了最先进的后训练量化水平。
CAT-Q 提出了一种面向LLM的训练后三值量化方法,该方法使用可学习调制和软化三值化技术,仅需512个校准样本即可实现优于BitNet 1.58-bit的性能,并可扩展到235B参数规模。
一种新颖的端到端大语言模型压缩框架,联合优化结构化剪枝与混合精度量化,在超低位宽精度下,相比于现有最先进方法实现了显著的困惑度降低和加速效果。
ScaleSweep提出了一种针对LLM的NVFP4训练后量化的新型块缩放初始化方法,通过遍历可行的块缩放候选值来提高精度。在Llama和Qwen模型上的实验表明,在激进量化下,该方法保留了超过93%的全精度性能。
本文提出了FAIR-Calib,一种用于扩散大语言模型的两阶段训练后量化框架,解决了迭代精炼过程中令牌提交的不稳定性问题。在低比特量化下,它在LLaDA和Dream模型上取得了最先进的结果。
本文提出VSRAQ,一种针对混合专家模型的训练后量化方法,通过对齐路由相关logits和专家排序来保持专家选择行为,从而减少量化引起的性能下降,且无推理开销。
本文介绍了Qift,一种固定的无零点两位权重量化层级集,专为Hadamard旋转的大语言模型设计,通过利用旋转权重的近零中心高斯类分布,实现了改进的W2A4/KV4推理。在LLaMA-2-7B和LLaMA-3.1-8B上的实验显示,相比于标准W2量化,困惑度持续提升。
介绍了QAM-W,一种针对LLM权重的联合二维码本量化方法,采用哈达玛旋转和激活感知缩放,在每权重5–6比特下实现接近BF16的困惑度,并以减少32%的权重比特达到与SmoothQuant W8A8相当的质量。
本文介绍了Tail-Aware HiFloat4,这是一种针对Wan2.2文本到视频扩散模型的W4A4训练后量化方法,该方法采用激活尾感知百分位校准来缓解异常值的影响,同时保持HiFloat4算术运算不变。
InfoQuant 提出了一种无需训练的方法——峰值抑制正交变换(PSOT),用于重塑低比特大语言模型量化中的激活分布,在 W4A4KV4 设置下保留了 97% 的浮点精度,并优于之前的 PTQ 方法。