@HuggingModels: 认识一下 Ternary-Bonsai-2-27B:一个将270亿参数模型压缩到2位三元格式的模型。在llama.cpp上运行,支持CUDA和Metal。
摘要
Ternary-Bonsai-2-27B是一个将270亿参数AI模型压缩到2位三元格式的模型,在llama.cpp上运行,支持CUDA和Metal,有助于实现轻量级的设备端AI部署。
查看缓存全文
缓存时间: 2026/09/19 15:05
认识 Ternary-Bonsai-2-27B:一款通过2比特三进制格式压缩的270亿参数模型。支持CUDA和Metal架构的llama.cpp平台运行。下载量已超40.5万次并持续增长。端侧AI体验迎来更轻量化突破。https://t.co/QGH8QR9nAe
相似文章
Ternary Bonsai:1.58 比特下的顶级智能
一种使用三值权重(-1、0、1)的高效 AI 模型架构,仅需 1.58 比特/参数即可实现具有竞争力的性能,可部署在极度受限的设备上。
prism-ml/Ternary-Bonsai-2-27B-gguf
发布 Ternary-Bonsai-2-27B-gguf,一款 27B 参数的语言模型,采用三元权重实现极端压缩(5.9 GB),同时保留 98.2% 的 FP16 精度性能,并针对笔记本电脑和单 GPU 的高效推理进行优化。
Bonsai 2 27B:在占用空间缩小9倍的条件下实现近无损压缩
介绍Ternary Bonsai 2 27B,这是一个高度压缩的AI模型,在占用空间缩小9倍的同时保留了98.2%的性能,使得推理、编码和多模态处理等任务能够高效地在本地部署。
Ternary Bonsai 2 (27B) 刚刚在 Hugging Face 发布。其大小小于 6GB,甚至可以在浏览器本地通过 WebGPU 运行。
Ternary Bonsai 2 是基于 Qwen3.8-27B 的 27B 参数模型,采用三元权重,将模型大小压缩至 6GB 以下,同时保留 98.2% 的智能,使其能够通过 WebGPU 在浏览器中运行。
Bonsai-27B 和 Ternary-Bonsai-27B 的更新(PR 相关)
更新了 Bonsai-27B 和 Ternary-Bonsai-27B 模型,详细介绍了在 llama.cpp 中 CPU、Metal、CUDA、Vulkan 后端的上游合并状态,并讨论了模型的局限性和路线图。