PrismML-Eng/Bonsai-demo
摘要
PrismML发布了Bonsai 27B,一个支持代理工具调用和长上下文的视觉语言模型,以及1-bit和ternary变体。该演示仓库允许在多种硬件上本地运行这些模型。
查看缓存全文
缓存时间: 2026/07/16 16:22
网站 | GitHub | Discord
HF Collections: Bonsai 27B · Bonsai (1-bit) · Ternary-Bonsai
Whitepapers: Bonsai 27B · 1-bit Bonsai 8B · Ternary-Bonsai 8B
相似文章
prism-ml/Bonsai-27B-gguf
Prism ML 发布了 Bonsai-27B-gguf,这是一个拥有 270 亿参数的语言模型,采用二进制(1.125 位)权重,实现了约 14 倍的尺寸缩减,同时保留了约 90% 的 FP16 推理性能。它可以在消费级硬件上运行,并具有高吞吐量。
prism-ml/Ternary-Bonsai-27B-mlx-2bit
Prism ML 发布了 Ternary-Bonsai-27B-mlx-2bit,这是一个三元量化的 27B 参数语言模型,在约 7.2 GB 内存下实现了 FP16 性能的约 95%,使笔记本电脑能够进行完整推理。
@PrismML: 今天,我们宣布推出 Bonsai 27B:首款能在手机上运行的 27B 参数模型。Bonsai 27B 是全新的多模态旗舰…
PrismML 宣布推出 Bonsai 27B,这是首款能在手机上运行的 270 亿参数模型,提供三进制和 1 位变体(分别为 5.9 GB 和 3.9 GB),能够在本地设备上实现多步推理和智能体工作流,全部以 Apache 2.0 许可证开源。
prism-ml/Bonsai-27B-mlx-1bit
Bonsai-27B 是一个1位二元变换器模型,在手机(iPhone 17 Pro Max)上实现完整的27B级推理,占用约3.9 GB内存,速度约11 tok/s,保留了约90%的FP16智能表现。
Prism-ML Bonsai Qwen 3.6 27B
Prism ML 发布了 Ternary-Bonsai-27B,这是 Qwen3.6-27B 的三元量化版本,在约 7.2 GB 的占用下保留了 FP16 智能的 95%,能够在笔记本电脑和单 GPU 上实现完整的 27B 级推理,在 Apple M5 Pro 上速度可达 26 tok/s。