标签
Qwen3.5 0.8B使用SpectralQuant的校准感知Q4_K_M量化版,与标准llama.cpp Q4_K_M量化版相比,恢复了96.5%的BF16性能差距。
SpectralQuant 是一种新的 KV 缓存量化技术,在 Mistral 7B 上实现了 5.95 倍压缩,仅带来 7.5% 的困惑度开销,显著优于 TurboQuant,且每个模型只需 15 秒校准。