如何运行 Prism Bonsai 27B
摘要
使用 llama.cpp 运行 Prism Bonsai 27B 的逐步指南,包含 GGUF 量化、编译及服务器设置。
根据他们的 GitHub,所需的文件是 `-Q2_0.gguf` 版本,这需要编译他们版本的 llama.cpp。最简单的下载方式是使用 huggingface-cli(如果已安装):`hf download prism-ml/Ternary-Bonsai-27B-gguf --include "*-Q2_0.gguf*"`。如果没有,直接从 https://huggingface.co/prism-ml/Ternary-Bonsai-27B-gguf/tree/main 下载文件并保存到某处。现在,我们需要编译 llama.cpp:
```
git clone https://github.com/PrismML-Eng/llama.cpp prism-llama.cpp
cd prism-llama.cpp
For Mac:
cmake -B build -DGGML_METAL=ON
cmake --build build --config Release -j$(sysctl -n hw.logicalcpu)
```
我使用的是 `-DGGML_METAL=ON`,因为这是 Mac。如果你使用的是其他平台且需要 CUDA,可以使用类似这样的命令:
```
cmake -B build -DGGML_CUDA=ON
cmake --build build --config Release -j$(nproc)
```
注意 `-j` 的格式差异,它只是指定用于编译的内核数量。现在,你可以通过以下命令运行 llama-server:
```
build/bin/llama-server -hf prism-ml/Ternary-Bonsai-27B-gguf:Ternary-Bonsai-27B-Q2_0 --port 8080 --host 0.0.0.0 --temp 0.7 --top-p 0.95 --top-k 20
```
如果你手动下载了文件,请使用 `-m` 参数传递 GGUF 文件的路径,而不是 `-hf` 开关。根据需要添加任何额外参数。`--temp 0.7 --top-p 0.95 --top-k 20` 是根据他们页面推荐的默认值。最后,你可以在浏览器中访问 `localhost:8080` 来与之交互。注意 `--host 0.0.0.0` 会绑定所有接口,因此它会在内部和外部都监听。如果不需要,可以去掉该开关。
相似文章
@sudoingX:每天都有人问我如何在理论上跑不动的硬件上运行bonsai 27b。所以这里全部内容在此……
一份详细指南,介绍如何在仅有8GB显存的硬件上运行27B Bonsai模型,使用1位量化版本和PrismML分支的llama.cpp,包含精确的服务器命令和配置。
@AgentSparko: 我在DGX Spark上测试了PrismML Bonsai 27B,但我觉得在构建llama.cpp时好像搞错了什么,因为速度…
用户测试了PrismML的新Bonsai 27B模型在Nvidia DGX Spark上的表现,报告了基准测试速度以及llama.cpp构建的问题,同时PrismML宣布该模型是首款能在手机上运行的27B级模型。
prism-ml/Bonsai-27B-gguf
Prism ML 发布了 Bonsai-27B-gguf,这是一个拥有 270 亿参数的语言模型,采用二进制(1.125 位)权重,实现了约 14 倍的尺寸缩减,同时保留了约 90% 的 FP16 推理性能。它可以在消费级硬件上运行,并具有高吞吐量。
@ggerganov:llama-server -hf ggml-org/Qwen3.6-27B-GGUF --spec-default
Georgi Gerganov 分享了一条一行命令,用 llama-server 以默认投机解码设置启动量化版 27B Qwen3.6 模型。
Prism-ML 的 Bonsai-27B 基准测试
Prism-ML 发布了其 Bonsai-27B 模型的基准测试结果。