标签
本文追踪各种低比特AI模型的更新,包括Bonsai、BitCPM等,涵盖性能改进及对llama.cpp等后端的兼容性更新。
Maple-Preview 是一个三值 20B MoE 模型,在 iPhone 上每秒可运行 120 个 token,展现了高效的端侧推理能力。
用户对来自Prisml的ternary Bonsai模型表示失望,质疑其质量尽管有炒作,并怀疑这是否只是典型的模型过度炒作。
Prism-ML 宣布他们的三元 Bonsai 模型现在可以进行微调,提供了示例代码,并建议使用较高的学习率。
Qwen3.6 27B的新三元量化版本,名为Bonsai 27B,可以在12GB GPU上运行,内存需求减少10倍,性能达到原版的95%,使其适用于本地部署。
用户在 RTX 3090 上测试了三元量化版本的 Qwen3.6 27B,使用两个槽位和 100k KV 缓存,占用 21GB 显存,达到了 60 tk/s 的速度,质量良好且工具调用稳定。
Ternary Bonsai 27B,一个大型语言模型,被演示在NVIDIA RTX 5090 GPU上本地运行,内存需求低于6GB,使消费级硬件上实现端到端的智能代理工作流成为可能。
Prism ML 发布了 Ternary-Bonsai-27B-mlx-2bit,这是一个三元量化的 27B 参数语言模型,在约 7.2 GB 内存下实现了 FP16 性能的约 95%,使笔记本电脑能够进行完整推理。
BitCPM 是一个来自 ModelBest、清华大学和 OpenBMB 的新开源模型,它使用三元权重(-1,0,1)在手机上运行全尺寸AI模型。
PrismML发布了Bonsai 27B,一个支持代理工具调用和长上下文的视觉语言模型,以及1-bit和ternary变体。该演示仓库允许在多种硬件上本地运行这些模型。