Bitnet.cpp:面向三值大语言模型的高效边缘推理

Papers with Code Trending 论文

摘要

Bitnet.cpp 提出了一个混合精度矩阵乘法库,用于高效边缘推理三值大语言模型(如 BitNet b1.58),相比全精度基线实现了高达 6.25 倍的加速。该系统已在 GitHub 上开源。

以 BitNet b1.58 为代表的 1 比特大语言模型(LLM)的出现,激发了对三值大语言模型的兴趣。尽管如此,专注于三值大语言模型高效边缘推理的研究和实际应用仍然稀缺。为了填补这一空白,我们引入了 Bitnet.cpp,这是一个针对 BitNet b1.58 和三值大语言模型优化的推理系统。鉴于混合精度矩阵乘法(mpGEMM)构成了三值大语言模型推理时间的大部分,Bitnet.cpp 集成了一个新颖的 mpGEMM 库,以支持每权重小于 2 比特的高效且无损推理。该库包含两个核心方案:三值查找表(TL),解决了以往逐位方法在空间上的低效问题;以及带缩放的 Int2(I2_S),确保了边缘推理的无损性,两者均实现了高速推理。我们的实验表明,Bitnet.cpp 相比全精度基线实现了高达 6.25 倍的加速,相比低比特基线实现了高达 2.32 倍的加速,在该领域树立了新的基准。此外,我们在附录中将 TL 扩展为适用于低比特大语言模型的逐元素查找表(ELUT),并提供了其巨大潜力的理论和实证证据。Bitnet.cpp 已在 https://github.com/microsoft/BitNet/tree/paper 公开发布,为边缘大语言模型的高效实用部署提供了精巧的解决方案。
查看原文
查看缓存全文

缓存时间: 2026/06/25 11:09

论文页面 - Bitnet.cpp:三元LLMs的高效边缘推理

来源:https://huggingface.co/papers/2502.11880 发布于2025年2月17日

摘要

Bitnet.cpp 通过一种新颖的混合精度矩阵乘法库增强三元LLMs的边缘推理,相比基线实现了显著的加速效果。

以 BitNet b1.58 (https://huggingface.co/papers?q=BitNet%20b1.58) 为首的1比特大语言模型(LLMs)的兴起,激发了人们对三元LLMs (https://huggingface.co/papers?q=ternary%20LLMs) 的兴趣。尽管如此,专注于三元LLMs (https://huggingface.co/papers?q=ternary%20LLMs) 高效边缘推理的研究和实际应用仍然稀少。为填补这一空白,我们推出了 Bitnet.cpp (https://huggingface.co/papers?q=Bitnet.cpp),一个专为 BitNet b1.58 (https://huggingface.co/papers?q=BitNet%20b1.58) 和三元LLMs (https://huggingface.co/papers?q=ternary%20LLMs) 优化的推理系统。鉴于混合精度矩阵乘法(mpGEMM)占用了三元LLMs (https://huggingface.co/papers?q=ternary%20LLMs) 推理的大部分时间,Bitnet.cpp (https://huggingface.co/papers?q=Bitnet.cpp) 集成了一个全新的 mpGEMM 库,以实现每权重低于2比特、高效且无损的推理。该库包含两种核心方案:Ternary Lookup Table (https://huggingface.co/papers?q=Ternary%20Lookup%20Table) (TL),解决了先前逐位方法的空间效率低下问题;以及 Int2 with a Scale (https://huggingface.co/papers?q=Int2%20with%20a%20Scale) (I2_S),确保无损边缘推理,两者均能实现高速推理。实验表明,Bitnet.cpp (https://huggingface.co/papers?q=Bitnet.cpp) 相比全精度基线实现了高达6.25倍的加速,相比低比特基线实现了高达2.32倍的加速,为该领域树立了新的标杆。此外,我们在附录中将 TL 扩展为逐元素查找表(ELUT),适用于低比特LLMs,并提供了理论和实证证据证明其巨大潜力。Bitnet.cpp (https://huggingface.co/papers?q=Bitnet.cpp) 已公开于 https://github.com/microsoft/BitNet/tree/paper,为边缘LLMs的高效实用部署提供了成熟的解决方案。

查看 arXiv 页面 (https://arxiv.org/abs/2502.11880) 查看 PDF (https://arxiv.org/pdf/2502.11880) GitHub 39.5k (https://github.com/microsoft/BitNet) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2502.11880)

在您的代理中获取本文:

hf papers read 2502.11880

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本文的模型 1

Lgr54HFi/chimera (https://huggingface.co/Lgr54HFi/chimera)

引用本文的数据集 0

没有与本文链接的数据集

请在数据集的 README.md 中引用 arxiv.org/abs/2502.11880,以便从本页面链接它。

引用本文的 Space 2

包含本文的合集 2

相似文章

突破三元LLM的1.58位存储壁垒

arXiv cs.AI

本文介绍了BITCOS,一种分布自适应布局,用于更高效地存储三元LLM权重,在GPU上实现矩阵-向量乘法高达1.28倍加速和推理吞吐量1.27倍提升。

BitNet 文本嵌入

arXiv cs.CL

本文介绍了 BitEmbed,一个用于基于 LLM 的文本嵌入的极低位宽框架,它将预训练的 LLM 骨干转换为具有三值权重和量化激活的 BitNet 风格编码器。该框架在显著降低编码和存储成本的同时,实现了与全精度模型相当的性能。