Bitnet.cpp:面向三值大语言模型的高效边缘推理
摘要
Bitnet.cpp 提出了一个混合精度矩阵乘法库,用于高效边缘推理三值大语言模型(如 BitNet b1.58),相比全精度基线实现了高达 6.25 倍的加速。该系统已在 GitHub 上开源。
查看缓存全文
缓存时间: 2026/06/25 11:09
论文页面 - Bitnet.cpp:三元LLMs的高效边缘推理
来源:https://huggingface.co/papers/2502.11880 发布于2025年2月17日
摘要
Bitnet.cpp 通过一种新颖的混合精度矩阵乘法库增强三元LLMs的边缘推理,相比基线实现了显著的加速效果。
以 BitNet b1.58 (https://huggingface.co/papers?q=BitNet%20b1.58) 为首的1比特大语言模型(LLMs)的兴起,激发了人们对三元LLMs (https://huggingface.co/papers?q=ternary%20LLMs) 的兴趣。尽管如此,专注于三元LLMs (https://huggingface.co/papers?q=ternary%20LLMs) 高效边缘推理的研究和实际应用仍然稀少。为填补这一空白,我们推出了 Bitnet.cpp (https://huggingface.co/papers?q=Bitnet.cpp),一个专为 BitNet b1.58 (https://huggingface.co/papers?q=BitNet%20b1.58) 和三元LLMs (https://huggingface.co/papers?q=ternary%20LLMs) 优化的推理系统。鉴于混合精度矩阵乘法(mpGEMM)占用了三元LLMs (https://huggingface.co/papers?q=ternary%20LLMs) 推理的大部分时间,Bitnet.cpp (https://huggingface.co/papers?q=Bitnet.cpp) 集成了一个全新的 mpGEMM 库,以实现每权重低于2比特、高效且无损的推理。该库包含两种核心方案:Ternary Lookup Table (https://huggingface.co/papers?q=Ternary%20Lookup%20Table) (TL),解决了先前逐位方法的空间效率低下问题;以及 Int2 with a Scale (https://huggingface.co/papers?q=Int2%20with%20a%20Scale) (I2_S),确保无损边缘推理,两者均能实现高速推理。实验表明,Bitnet.cpp (https://huggingface.co/papers?q=Bitnet.cpp) 相比全精度基线实现了高达6.25倍的加速,相比低比特基线实现了高达2.32倍的加速,为该领域树立了新的标杆。此外,我们在附录中将 TL 扩展为逐元素查找表(ELUT),适用于低比特LLMs,并提供了理论和实证证据证明其巨大潜力。Bitnet.cpp (https://huggingface.co/papers?q=Bitnet.cpp) 已公开于 https://github.com/microsoft/BitNet/tree/paper,为边缘LLMs的高效实用部署提供了成熟的解决方案。
查看 arXiv 页面 (https://arxiv.org/abs/2502.11880) 查看 PDF (https://arxiv.org/pdf/2502.11880) GitHub 39.5k (https://github.com/microsoft/BitNet) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2502.11880)
在您的代理中获取本文:
hf papers read 2502.11880
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本文的模型 1
Lgr54HFi/chimera (https://huggingface.co/Lgr54HFi/chimera)
引用本文的数据集 0
没有与本文链接的数据集
请在数据集的 README.md 中引用 arxiv.org/abs/2502.11880,以便从本页面链接它。
引用本文的 Space 2
包含本文的合集 2
相似文章
突破三元LLM的1.58位存储壁垒
本文介绍了BITCOS,一种分布自适应布局,用于更高效地存储三元LLM权重,在GPU上实现矩阵-向量乘法高达1.28倍加速和推理吞吐量1.27倍提升。
BitNet 文本嵌入
本文介绍了 BitEmbed,一个用于基于 LLM 的文本嵌入的极低位宽框架,它将预训练的 LLM 骨干转换为具有三值权重和量化激活的 BitNet 风格编码器。该框架在显著降低编码和存储成本的同时,实现了与全精度模型相当的性能。
用纯C语言从零构建了一个BitNet推理引擎——在Xeon上比bitnet.cpp快1.8倍(36 tok/s),零依赖 [招募BitNet和Bonsai CPU测试者]
Project Zero 是一个从零构建的 C99 LLM推理引擎,可在 CPU 上运行 BitNet 与 Qwen Bonsai-27B,拥有零外部依赖,在 Xeon 上相比 bitnet.cpp 实现 1.8 倍加速。该项目诚邀社区为这两种模型提供基准测试结果。
花了两周时间写了个内核,基准测试快了29倍。但端到端可能只有6-10%,而且还没接进去。
作者优化了BitNet三值模型在CPU上的矩阵乘法内核,单独测试实现了29倍加速,但发现模型是内存密集型,端到端仅提升6-10%。推理引擎已开源。
BitNet是个死胡同吗?三进制大语言模型发生了什么?
文章质疑为何像BitNet这样的三进制语言模型在初期显示出潜力后,却未能扩展到超过2B参数,并讨论了开放权重AI实验室明显缺乏进展的情况。