我对 PrismML 的 1-bit Bonsai-8B 与 IBM 的 Granite 在 CPU 工具调用上进行了基准测试。1-bit 模型胜出,但仅在语法约束解码下。

Reddit r/LocalLLaMA 新闻

摘要

对 PrismML 的 1-bit Bonsai-8B 与 IBM 的 Granite 及其他模型在 CPU 工具调用上的独立基准测试显示,在语法约束解码下,Bonsai-8B 的通过率达到 92%,超越了更大的模型,但在无约束条件下失败。Granite 是原始表现最好的模型,通过率为 72%。

大家都在问 1-bit 模型是否真的可用于智能体,所以我亲自做了测试。我在任何地方都找不到关于 Bonsai-8B 的独立工具调用评估。BFCL 排行榜上没有,BenchLM 上也没有。所以据我所知,这是第一个。设置:30 个确定性工具调用案例(单次、并行、顺序、弃权、格式),温度 0,主线 llama.cpp 在 CPU 上运行。每个模型运行两次:一次原始,一次使用 GBNF 语法将输出约束为有效的工具调用 JSON。结果(PASS 率,原始/带语法): Bonsai-8B Q1_0 (1.16 GB): 0% / 92% Granite-4.1-3B Q4_K_M (2.0 GB): 72% / 88% Qwen2.5-Coder-3B: 0% / 84% Qwen2.5-Coder-7B: 68% / 84% Qwen3-8B: 0% / 84% BitNet-b1.58-2B: 0% / 44% Bonsai 的结果让我惊讶。原始状态下,它对工具调用毫无用处。有效输出为 0%。激活语法后,它在我测试过的所有模型中取得了最佳成绩,而且文件大小只有 3B Q4 模型的一半。在格式、并行、顺序和弃权类别上表现完美。Granite 则相反。原始模型表现最佳,达到 72%。如果你不能或不想运行语法,那就是你的选择。我的结论:'1-bit 模型无法用于智能体' 这个说法需要加个注脚。它们在无约束条件下确实不行。但在前面加上语法后,语义能力显然是存在的,至少在这个小规模基准测试中是这样。在大家过于兴奋之前提醒一下:30 个案例,温度 0,单次运行,我自己的测试工具。这是一个信号,不是排行榜。我很乐意分享案例集,都在仓库里。
查看原文

相似文章

prism-ml/Bonsai-27B-gguf

Hugging Face Models Trending

Prism ML 发布了 Bonsai-27B-gguf,这是一个拥有 270 亿参数的语言模型,采用二进制(1.125 位)权重,实现了约 14 倍的尺寸缩减,同时保留了约 90% 的 FP16 推理性能。它可以在消费级硬件上运行,并具有高吞吐量。

prism-ml/Ternary-Bonsai-27B-mlx-2bit

Hugging Face Models Trending

Prism ML 发布了 Ternary-Bonsai-27B-mlx-2bit,这是一个三元量化的 27B 参数语言模型,在约 7.2 GB 内存下实现了 FP16 性能的约 95%,使笔记本电脑能够进行完整推理。

prism-ml/Bonsai-27B-mlx-1bit

Hugging Face Models Trending

Bonsai-27B 是一个1位二元变换器模型,在手机(iPhone 17 Pro Max)上实现完整的27B级推理,占用约3.9 GB内存,速度约11 tok/s,保留了约90%的FP16智能表现。

PrismML-Eng/Bonsai-demo

GitHub Trending (daily)

PrismML发布了Bonsai 27B,一个支持代理工具调用和长上下文的视觉语言模型,以及1-bit和ternary变体。该演示仓库允许在多种硬件上本地运行这些模型。