三元(1.58位)大语言模型正在卷土重来吗?

Reddit r/LocalLLaMA 新闻

摘要

近期来自小型实验室的三元1.58位大语言模型发布展示了速度和医疗专业性,但在长期任务上表现不佳,乐观地认为未来模型能与像Qwen这样的大型架构竞争。

我只是在想,自从微软宣布BitNet以来,这个社区(和我自己)一直在期待大规模的三元模型。仅在过去一个月里,prismML发布了27B三元模型(尽管我读到社区体验表明它有时未能达到基准),Deepgrove发布了他们的三元maple-20b-a1b,根据我的经验,它在iPhone上运行得非常好,速度约为100 token/s,Doses AI发布了pestle-27b-ternary医疗专业模型,在几乎所有方面都击败了medgemma-27b。它们共同的问题在于长期代理式编码/工作,但我真的认为这是因为所有这些新兴的小型实验室还没有优先考虑强化学习最大化——他们已经表示这是他们的下一步。我很有希望,看来我们可能非常接近一个真正能在编码和代理工作上与qwen3.8竞争的大规模三元模型MoE。还是说大多数人都对三元架构失去了信心?
查看原文

相似文章

CAT-Q: 用于LLM的高效且准确的三值量化

arXiv cs.CL

CAT-Q 提出了一种面向LLM的训练后三值量化方法,该方法使用可学习调制和软化三值化技术,仅需512个校准样本即可实现优于BitNet 1.58-bit的性能,并可扩展到235B参数规模。

prism-ml/Ternary-Bonsai-27B-mlx-2bit

Hugging Face Models Trending

Prism ML 发布了 Ternary-Bonsai-27B-mlx-2bit,这是一个三元量化的 27B 参数语言模型,在约 7.2 GB 内存下实现了 FP16 性能的约 95%,使笔记本电脑能够进行完整推理。

如何在8位字节中打包三进制数

Hacker News Top

一篇博客文章,描述了一种高效的方法,使用SIMD友好的解包将三进制数打包到8位字节中,实现了每trit 1.6比特,并应用于LLM权重量化如BitNet b1.58。