如何运行 Prism Bonsai 27B

Reddit r/LocalLLaMA 工具

摘要

使用 llama.cpp 运行 Prism Bonsai 27B 的逐步指南,包含 GGUF 量化、编译及服务器设置。

根据他们的 GitHub,所需的文件是 `-Q2_0.gguf` 版本,这需要编译他们版本的 llama.cpp。最简单的下载方式是使用 huggingface-cli(如果已安装):`hf download prism-ml/Ternary-Bonsai-27B-gguf --include "*-Q2_0.gguf*"`。如果没有,直接从 https://huggingface.co/prism-ml/Ternary-Bonsai-27B-gguf/tree/main 下载文件并保存到某处。现在,我们需要编译 llama.cpp: ``` git clone https://github.com/PrismML-Eng/llama.cpp prism-llama.cpp cd prism-llama.cpp For Mac: cmake -B build -DGGML_METAL=ON cmake --build build --config Release -j$(sysctl -n hw.logicalcpu) ``` 我使用的是 `-DGGML_METAL=ON`,因为这是 Mac。如果你使用的是其他平台且需要 CUDA,可以使用类似这样的命令: ``` cmake -B build -DGGML_CUDA=ON cmake --build build --config Release -j$(nproc) ``` 注意 `-j` 的格式差异,它只是指定用于编译的内核数量。现在,你可以通过以下命令运行 llama-server: ``` build/bin/llama-server -hf prism-ml/Ternary-Bonsai-27B-gguf:Ternary-Bonsai-27B-Q2_0 --port 8080 --host 0.0.0.0 --temp 0.7 --top-p 0.95 --top-k 20 ``` 如果你手动下载了文件,请使用 `-m` 参数传递 GGUF 文件的路径,而不是 `-hf` 开关。根据需要添加任何额外参数。`--temp 0.7 --top-p 0.95 --top-k 20` 是根据他们页面推荐的默认值。最后,你可以在浏览器中访问 `localhost:8080` 来与之交互。注意 `--host 0.0.0.0` 会绑定所有接口,因此它会在内部和外部都监听。如果不需要,可以去掉该开关。
查看原文

相似文章

prism-ml/Bonsai-27B-gguf

Hugging Face Models Trending

Prism ML 发布了 Bonsai-27B-gguf,这是一个拥有 270 亿参数的语言模型,采用二进制(1.125 位)权重,实现了约 14 倍的尺寸缩减,同时保留了约 90% 的 FP16 推理性能。它可以在消费级硬件上运行,并具有高吞吐量。