@QuixiAI: @MicrosoftAI 从未发布过 BitNet 训练器。我修复了那个 bug。https://github.com/QuixiAI/bitnet 训练了我自己的 BitNe…
摘要
一位用户发布了微软从未公开发布的 BitNet 训练器,以及用于训练和推理的自定义内核,同时强调了微软的 bitnet.cpp 推理框架,该框架可在 CPU 和 GPU 上实现快速 1 位 LLM 推理。
查看缓存全文
缓存时间: 2026/07/15 19:58
usage: setup_env.py [-h] [–hf-repo {1bitLLM/bitnet_b1_58-large,1bitLLM/bitnet_b1_58-3B,HF1BitLLM/Llama3-8B-1.58-100B-tokens,tiiuae/Falcon3-1B-Instruct-1.58bit,tiiuae/Falcon3-3B-Instruct-1.58bit,tiiuae/Falcon3-7B-Instruct-1.58bit,tiiuae/Falcon3-10B-Instruct-1.58bit}] [–model-dir MODEL_DIR] [–log-dir LOG_DIR] [–quant-type {i2_s,tl1}] [–quant-embd] [–use-pretuned] 设置推理环境
可选参数: -h, –help 显示此帮助信息并退出 –hf-repo {1bitLLM/bitnet_b1_58-large,1bitLLM/bitnet_b1_58-3B,HF1BitLLM/Llama3-8B-1.58-100B-tokens,tiiuae/Falcon3-1B-Instruct-1.58bit,tiiuae/Falcon3-3B-Instruct-1.58bit,tiiuae/Falcon3-7B-Instruct-1.58bit,tiiuae/Falcon3-10B-Instruct-1.58bit}, -hr {1bitLLM/bitnet_b1_58-large,1bitLLM/bitnet_b1_58-3B,HF1BitLLM/Llama3-8B-1.58-100B-tokens,tiiuae/Falcon3-1B-Instruct-1.58bit,tiiuae/Falcon3-3B-Instruct-1.58bit,tiiuae/Falcon3-7B-Instruct-1.58bit,tiiuae/Falcon3-10B-Instruct-1.58bit} 用于推理的模型 –model-dir MODEL_DIR, -md MODEL_DIR 保存/加载模型的目录 –log-dir LOG_DIR, -ld LOG_DIR 保存日志信息的目录 –quant-type {i2_s,tl1}, -q {i2_s,tl1} 量化类型 –quant-embd 将嵌入层量化为 f16 –use-pretuned, -p 使用预调优的内核参数
usage: run_inference.py [-h] [-m MODEL] [-n N_PREDICT] -p PROMPT [-t THREADS] [-c CTX_SIZE] [-temp TEMPERATURE] [-cnv] 运行推理
可选参数: -h, –help 显示此帮助信息并退出 -m MODEL, –model MODEL 模型文件的路径 -n N_PREDICT, –n-predict N_PREDICT 生成文本时预测的 token 数量 -p PROMPT, –prompt PROMPT 用于生成文本的提示 -t THREADS, –threads THREADS 使用的线程数 -c CTX_SIZE, –ctx-size CTX_SIZE 提示上下文的大小 -temp TEMPERATURE, –temperature TEMPERATURE 温度,控制生成文本随机性的超参数 -cnv, –conversation 是否启用聊天模式(针对 instruct 模型)。(启用此选项后,由 -p 指定的提示将用作系统提示。)
相似文章
用纯C语言从零构建了一个BitNet推理引擎——在Xeon上比bitnet.cpp快1.8倍(36 tok/s),零依赖 [招募BitNet和Bonsai CPU测试者]
Project Zero 是一个从零构建的 C99 LLM推理引擎,可在 CPU 上运行 BitNet 与 Qwen Bonsai-27B,拥有零外部依赖,在 Xeon 上相比 bitnet.cpp 实现 1.8 倍加速。该项目诚邀社区为这两种模型提供基准测试结果。
Bitnet.cpp:面向三值大语言模型的高效边缘推理
Bitnet.cpp 提出了一个混合精度矩阵乘法库,用于高效边缘推理三值大语言模型(如 BitNet b1.58),相比全精度基线实现了高达 6.25 倍的加速。该系统已在 GitHub 上开源。
花了两周时间写了个内核,基准测试快了29倍。但端到端可能只有6-10%,而且还没接进去。
作者优化了BitNet三值模型在CPU上的矩阵乘法内核,单独测试实现了29倍加速,但发现模型是内存密集型,端到端仅提升6-10%。推理引擎已开源。
又是Bitnet?
微软在HuggingFace上发布了一个名为bitnet-embedding-0.6b的新嵌入模型,但模型卡缺失。
@Oluwaphilemon1: Claude Fable 5 已死,GPT-5.6 推迟发布…微软改变了游戏规则,他们开源了bitnet.cpp,一个1…
微软开源了bitnet.cpp,这是一个1位LLM推理框架,可以在没有GPU的本地CPU上运行100B参数模型,实现6.17倍的更快推理和82.2%的能耗降低。