标签
介绍Tritium,一个开源的Rust/CUDA引擎,用于在消费级GPU上对LLM进行三值(1.58位)量化、服务与训练。它声称在三值模型上推理速度比llama.cpp更快,并引入了一种名为SALT的新量化方法。
Prism ML 发布了 Ternary-Bonsai-27B,这是 Qwen3.6-27B 的三元量化版本,在约 7.2 GB 的占用下保留了 FP16 智能的 95%,能够在笔记本电脑和单 GPU 上实现完整的 27B 级推理,在 Apple M5 Pro 上速度可达 26 tok/s。
Clark Labs 发布了 Clark Air Sana 1.6B,这是 Sana 1.6B 文本到图像转换器的三值量化版本,体积比 FP16 小 8.6 倍,同时保持接近 FP16 的质量,从而实现高效部署。
CAT-Q 提出了一种面向LLM的训练后三值量化方法,该方法使用可学习调制和软化三值化技术,仅需512个校准样本即可实现优于BitNet 1.58-bit的性能,并可扩展到235B参数规模。
OpenBMB 发布了 BitCPM4-CANN,这是一套原生训练的三元量化1.58位LLM集合(参数规模0.5B到8B),通过CANN针对昇腾NPU进行了优化,推理时内存减少6倍,训练开销极低。
本文介绍了Tequila,这是一种针对大语言模型的无陷阱量化方法,通过将陷入死区的权重重新利用为动态偏置,提高了三元量化的准确性和推理速度。