标签
A developer trained a tiny Mamba-based autoregressive language model and built an inference engine to run it on the 6502 processor inside a BBC Micro, demonstrating modern machine learning on 1975 hardware with only 25KB of user memory.
作者优化了BitNet三值模型在CPU上的矩阵乘法内核,单独测试实现了29倍加速,但发现模型是内存密集型,端到端仅提升6-10%。推理引擎已开源。
Project Zero 是一个从零构建的 C99 LLM推理引擎,可在 CPU 上运行 BitNet 与 Qwen Bonsai-27B,拥有零外部依赖,在 Xeon 上相比 bitnet.cpp 实现 1.8 倍加速。该项目诚邀社区为这两种模型提供基准测试结果。
一位用户发布了微软从未公开发布的 BitNet 训练器,以及用于训练和推理的自定义内核,同时强调了微软的 bitnet.cpp 推理框架,该框架可在 CPU 和 GPU 上实现快速 1 位 LLM 推理。
一篇博客文章,描述了一种高效的方法,使用SIMD友好的解包将三进制数打包到8位字节中,实现了每trit 1.6比特,并应用于LLM权重量化如BitNet b1.58。
本文介绍了 BitEmbed,一个用于基于 LLM 的文本嵌入的极低位宽框架,它将预训练的 LLM 骨干转换为具有三值权重和量化激活的 BitNet 风格编码器。该框架在显著降低编码和存储成本的同时,实现了与全精度模型相当的性能。
微软开源了bitnet.cpp,这是一个1位LLM推理框架,可以在没有GPU的本地CPU上运行100B参数模型,实现6.17倍的更快推理和82.2%的能耗降低。
文章质疑为何像BitNet这样的三进制语言模型在初期显示出潜力后,却未能扩展到超过2B参数,并讨论了开放权重AI实验室明显缺乏进展的情况。
关于缺乏一个社区项目来在消费级硬件(8GB显存)上使用BitNet和Muon等现代技术从头训练LLM的讨论,提议合作构建这样一个项目。
OpenBMB发布的新BitCPM4-CANN模型(1B、3B、8B),已上架Hugging Face;等待llamacpp支持以进行测试。
Bitnet.cpp 提出了一个混合精度矩阵乘法库,用于高效边缘推理三值大语言模型(如 BitNet b1.58),相比全精度基线实现了高达 6.25 倍的加速。该系统已在 GitHub 上开源。