1位 / 2位 / 三值 / Bitnet 模型 - 更新与跟踪
摘要
本文追踪各种低比特AI模型的更新,包括Bonsai、BitCPM等,涵盖性能改进及对llama.cpp等后端的兼容性更新。
Bonsai / 三值 Bonsai 在四月份,Bonsai 推出了一系列模型……包括1位和1.58位(三值)版本。而上个月(七月),他们发布了相同版本的27B模型。就在上个月,Bonsai-27B 已经能在所有主流后端上运行。但三值-Bonsai-27B 还未在所有后端上就绪。本月,针对 CUDA 和 Vulkan 的 PR 已在主线上合并。同时,一个针对 CUDA 的优化 PR 也已合并,因此 +15-40% tg,+8% pp。https://github.com/PrismML-Eng/Bonsai-demo - 演示分支 https://github.com/PrismML-Eng/llama.cpp - 定制分支 BitCPM-CANN https://huggingface.co/collections/openbmb/bitcpm-cann Tencent - Hy-MT1.5 - 混合元翻译模型 1.5 版 https://huggingface.co/collections/tencent/hy-mt15 Maple-Preview DeepGrove/maple-preview - 20B-A1B - 在 Mac Mini M4 上 200+ t/s,在 iPhone 上 120+ t/s。llama.cpp PR #27000 - CPU 后端 https://github.com/deepgrove-ai/llama.cpp - 定制 llama.cpp 分支 https://github.com/deepgrove-ai/mlx-lm-deepgrove - 定制 MLX 分支 Mach-1-Additive-35B Mach-1-Additive-35B - A3B - 在消费级笔记本上最高达 120 t/s。Mach-1-Additive-35B-Multimodal https://github.com/SyzygyResearch/llama.cpp-mach1 - 定制 llama.cpp 分支 根据他们最近的推文:目前正在基于 Laguna-S-2.1 和 Qwen3.8-27B 开发新模型。Neutrino-8B https://huggingface.co/FermionResearch/Neutrino-8B https://github.com/fermionresearch/llama.cpp - 定制 llama.cpp 分支 Pestle-27B-Ternary https://huggingface.co/Doses-AI/Pestle-27B-Ternary-GGUF - 医学研究模型 https://github.com/DosesAI/mortar.cpp - 定制推理 - CPU, CUDA, Metal 图像模型: https://huggingface.co/collections/prism-ml/bonsai-image https://huggingface.co/Green-Sky/bonsai-image-ternary-4B-GGUF https://huggingface.co/Green-Sky/bonsai-image-binary-4B-GGUF https://huggingface.co/clark-labs/clark-air-sana-1.6b-1.58bit Abliterated 模型: https://huggingface.co/Hikari07jp/Ternary-Bonsai-27B-Abliterated-LowDeg-GGUF https://huggingface.co/Hikari07jp/Maple-Preview-TQ2-Abliterated https://huggingface.co/dealignai/Bonsai-27b-1bit-CRACK-GGUF 其他杂项: https://huggingface.co/GoAutomateAI/terna-e2b-GGUF https://huggingface.co/Danny-Dasilva/Bonsai-27B-antidoom-1bit-DSpark https://huggingface.co/Danny-Dasilva/Ternary-Bonsai-27B-antidoom-DSpark 一些开放/进行中的 llama.cpp(相关)PR: ggml-cpu : 添加 STQ1_0 三值量化与 ARM NEON vec_dot 内核 - #22836 ggml/cpu: 跳过 TQ1_0 和 TQ2_0 vec_dot 内核中的零缩放块 - #23439 ggml/cpu: 添加 x86 VNNI Q2_0 点积 -- 兼容 VNNI 的 CPU 速度提升 3 倍 - #26348 备注: 未包含旧模型(2026 年之前)。如果我遗漏了任何模型,请告知,我会更新线程。包含了自定义分支以查看其进展。在看到类似类型的模型后,我会更新此线程。免责声明:本线程主要面向 Poor GPU Club。
相似文章
Ternary Bonsai:1.58 比特下的顶级智能
一种使用三值权重(-1、0、1)的高效 AI 模型架构,仅需 1.58 比特/参数即可实现具有竞争力的性能,可部署在极度受限的设备上。
新的BITNET模型!
OpenBMB发布的新BitCPM4-CANN模型(1B、3B、8B),已上架Hugging Face;等待llamacpp支持以进行测试。
Bonsai-27B 和 Ternary-Bonsai-27B 的更新(PR 相关)
更新了 Bonsai-27B 和 Ternary-Bonsai-27B 模型,详细介绍了在 llama.cpp 中 CPU、Metal、CUDA、Vulkan 后端的上游合并状态,并讨论了模型的局限性和路线图。
用纯C语言从零构建了一个BitNet推理引擎——在Xeon上比bitnet.cpp快1.8倍(36 tok/s),零依赖 [招募BitNet和Bonsai CPU测试者]
Project Zero 是一个从零构建的 C99 LLM推理引擎,可在 CPU 上运行 BitNet 与 Qwen Bonsai-27B,拥有零外部依赖,在 Xeon 上相比 bitnet.cpp 实现 1.8 倍加速。该项目诚邀社区为这两种模型提供基准测试结果。
Bonsai 27B(1位LLM):首个能在手机上运行的27B级别模型
PrismML宣布推出Bonsai 27B,这是Qwen3.6 27B的1位与三元量化版本,可在手机和笔记本电脑上运行,保留基线性能的90-95%,占用3.9GB空间,支持自主智能体与多模态的端侧AI。