llama.cpp
摘要
本文介绍了 llama.cpp 的官方主页,这是一个开源的本地 LLM 推理引擎,重点介绍了通过 pi-llama 插件与 Pi 编码代理的集成以及广泛的硬件优化。
暂无内容
查看缓存全文
缓存时间: 2026/08/12 08:24
# llama.app - llama.cpp 的官方主页
来源:https://llama.app/
## 搭配本地编码代理使用
运行 `llama serve`,安装 `pi-llama` 插件,然后启动 Pi(https://github.com/earendil-works/pi)。它会自动发现你的本地模型。无需配置,无需 API 密钥。文件保留在你的机器上,请求不会离开你的设备。
```
# 1. 启动模型服务
llama serve
# 2. 安装 pi-llama 插件
pi install git:github.com/huggingface/pi-llama
# 3. 运行 Pi,一切就绪
pi
```
Pi
## 针对任何硬件优化
从你的笔记本电脑到集群,llama.cpp 都能在你拥有的硬件上运行。相同的二进制文件、相同的模型、为每款 GPU 和 CPU 精心调优的内核。
Apple Silicon
M Ultra
RTX 5090
CPU
Jetson
H100
MI300
RTX 4090
A100
M Pro
M Max
DGX Spark
T4
Radeon RX
B200
Intel Arc
RTX 3090
相似文章
llama.cpp 就是 LLM 界的 Linux
文章把 llama.cpp 比作 Linux,认为这款开源库已成为运行大语言模型的基础底座。
pi 0.81.0 增加了对 llama.cpp 的支持
Pi 0.81.0 增加了对 llama.cpp 的支持,从而能够在 Pi 编码代理环境中进行本地 LLM 推理。
ggml-org/llama.cpp
llama.cpp 是一个开源 C/C++ 库,用于在本地硬件上高效运行 LLM 推理,支持多种量化方法和多后端(CPU、GPU 等)。
在树莓派上使用 llama.cpp
关于使用 llama.cpp 在树莓派设备上运行大型语言模型进行本地推理的指南。
llama : 网站 + 统一的 `llama` 二进制文件 · ggml-org/llama.cpp · 讨论 #23875
Llama.cpp 宣布推出新网站和统一的 'llama' 二进制文件,以简化 LLM 推理,同时还包括 Hugging Face 缓存迁移和多模态支持等更新。