weight-quantization

Tag

Cards List
#weight-quantization

Sherry's 3:4 ternary format (1.375 bits per weight) running on WebGPU: a 1.6 MB model that plays Connect Four as well as its 7.8 MB int8 version

Reddit r/LocalLLaMA ↗ · 14h ago

A 1.6 MB model using ternary 3:4 weights runs on WebGPU in the browser, playing Connect Four as well as a 7.8 MB int8 model, demonstrating the effectiveness of ternary formats for lightweight AI deployment.

0 favorites 0 likes
#weight-quantization

Structured Transforms for Low-Overhead Quantization of Language Models

arXiv cs.CL ↗ · 2026-09-11 Cached

This paper revisits Kashin-decomposition-based weight quantization for large language models and proposes an improved algorithm using structured orthogonal transforms, reducing computational cost and ensuring numerical stability compared to methods like OPTQ and QuIP.

0 favorites 0 likes
#weight-quantization

CubicQuant: Parametric Non-Uniform Codebooks for High-Throughput LLM Inference with 1-8-Bit Weights

arXiv cs.LG ↗ · 2026-08-10 Cached

CubicQuant proposes a parametric non-uniform scalar quantization format for LLM weights, using a monotonic cubic curve to adapt reconstruction levels at 1-8 bit widths while retaining dense integer code streams for GPU efficiency. Experiments show RMSE reductions over uniform and floating-point baselines, with preliminary H200 kernel measurements.

0 favorites 0 likes
#weight-quantization

QAM-W: Joint 2D Codebook Quantization for LLM Weights via Hadamard Rotation and Activation-Aware Scaling

arXiv cs.LG ↗ · 2026-05-27 Cached

Introduces QAM-W, a joint 2D codebook quantization method for LLM weights using Hadamard rotation and activation-aware scaling, achieving near BF16 perplexity at 5–6 bits per weight and matching SmoothQuant W8A8 quality with 32% fewer weight bits.

0 favorites 0 likes
← Back to home

Submit Feedback