[Paper] Statistically-Lossless Quantization of Large Language Models

Reddit r/LocalLLaMA Papers

Summary

This paper presents a statistically-lossless quantization method for large language models, aiming to reduce model size without information loss.

No content available
Original Article

Similar Articles

Theory-optimal Quantization Based on Flatness

arXiv cs.LG

Introduces Flatness metric and Bidirectional Diagonal Quantization (BDQ) for post-training quantization of large language models, achieving near-lossless 4-bit weight and activation quantization and substantial improvements at extreme low-bit settings.