三元(1.58位)大语言模型正在卷土重来吗?
摘要
近期来自小型实验室的三元1.58位大语言模型发布展示了速度和医疗专业性,但在长期任务上表现不佳,乐观地认为未来模型能与像Qwen这样的大型架构竞争。
我只是在想,自从微软宣布BitNet以来,这个社区(和我自己)一直在期待大规模的三元模型。仅在过去一个月里,prismML发布了27B三元模型(尽管我读到社区体验表明它有时未能达到基准),Deepgrove发布了他们的三元maple-20b-a1b,根据我的经验,它在iPhone上运行得非常好,速度约为100 token/s,Doses AI发布了pestle-27b-ternary医疗专业模型,在几乎所有方面都击败了medgemma-27b。它们共同的问题在于长期代理式编码/工作,但我真的认为这是因为所有这些新兴的小型实验室还没有优先考虑强化学习最大化——他们已经表示这是他们的下一步。我很有希望,看来我们可能非常接近一个真正能在编码和代理工作上与qwen3.8竞争的大规模三元模型MoE。还是说大多数人都对三元架构失去了信心?
相似文章
ExTernD: 扩展秩三值分解——精度逼近任意量化水平的LLM训练后量化
ExTernD引入了一种扩展秩三值分解用于LLM训练后量化,通过使用具有自由内秩的因子化表示,使精度接近bf16。在Gemma-4和Qwen3.5等模型上,它以每个权重5.2-5.5有效比特达到Q4_K的精度。
开源三值LLM引擎:基于Rust/CUDA,用于消费级GPU上的模型量化、服务与训练,名为Tritium(Apache 2.0)
介绍Tritium,一个开源的Rust/CUDA引擎,用于在消费级GPU上对LLM进行三值(1.58位)量化、服务与训练。它声称在三值模型上推理速度比llama.cpp更快,并引入了一种名为SALT的新量化方法。
CAT-Q: 用于LLM的高效且准确的三值量化
CAT-Q 提出了一种面向LLM的训练后三值量化方法,该方法使用可学习调制和软化三值化技术,仅需512个校准样本即可实现优于BitNet 1.58-bit的性能,并可扩展到235B参数规模。
prism-ml/Ternary-Bonsai-27B-mlx-2bit
Prism ML 发布了 Ternary-Bonsai-27B-mlx-2bit,这是一个三元量化的 27B 参数语言模型,在约 7.2 GB 内存下实现了 FP16 性能的约 95%,使笔记本电脑能够进行完整推理。
如何在8位字节中打包三进制数
一篇博客文章,描述了一种高效的方法,使用SIMD友好的解包将三进制数打包到8位字节中,实现了每trit 1.6比特,并应用于LLM权重量化如BitNet b1.58。