标签
一位用户分享了在16GB MacBook Air上本地使用Bonsai 27b的1-bit量化版进行日常聊天、辅导Go语言以及分析个人笔记的积极体验,称赞其智能性和小巧的体积。
一位用户在Terminal-Bench 2.0上测试了27B参数Bonsai模型的量化1-bit和2-bit版本,在8GB显存内获得了结果。
一个经过修改的 Bonsai-27b GGUF 版本已发布在 Hugging Face 上,移除了拒绝回答功能。
PrismML的Bonsai-27B模型在Math 500数据集上取得了99.2%的准确率,超越了DeepSeek-R1和Kimi K2。
更新了 Bonsai-27B 和 Ternary-Bonsai-27B 模型,详细介绍了在 llama.cpp 中 CPU、Metal、CUDA、Vulkan 后端的上游合并状态,并讨论了模型的局限性和路线图。
PrismML 的 Bonsai-27B 模型的技术报告在 Papers with Code 上备受关注,提供了评估和 Hugging Face 模型。
@MaziyarPanahi在Mac Studio上使用llama.cpp本地运行GLM-5.2和Bonsai 27B处理一份三年的病历,发现了一个曾被标记但被忽略的危险药物相互作用。两个模型在Apache-2.0许可下完全在设备上运行,Bonsai在约2秒内回答查询,@PrismML声称一个1-bit构建可以装进iPhone。
用户测试了PrismML的新Bonsai 27B模型在Nvidia DGX Spark上的表现,报告了基准测试速度以及llama.cpp构建的问题,同时PrismML宣布该模型是首款能在手机上运行的27B级模型。
PrismML 的 Bonsai 27B 模型在 Jetson Orin Nano 8GB 上运行,处理速度为 4.31 tokens/s,提示处理速度为 27 t/s,使用 6.2GB 内存和约 25W 功耗。这表明边缘 AI 性能出人意料地可用。
Bonsai 27B 通过 1 位量化实现了 93% 的体积缩减,同时保留了 90% 的智能,借助自定义 WebGPU 内核实现本地浏览器推理。