Llama.cpp v0.1.0
摘要
Llama.cpp v0.1.0 是用于高效 LLM 和 VLM 推理的 C/C++ 实现,支持广泛的硬件,配置简单且性能卓越。
查看缓存全文
缓存时间: 2026/08/17 18:53
ggml-org/llama.cpp 源码: https://github.com/ggml-org/llama.cpp
llama.cpp
用 C/C++ 实现的 llama LLM 推理库 许可证: MIT (https://opensource.org/licenses/MIT) 发布版本 (https://github.com/ggml-org/llama.cpp/releases) 服务器 (https://github.com/ggml-org/llama.cpp/actions/workflows/server.yml) Docker (https://github.com/ggml-org/llama.cpp/actions/workflows/docker.yml) Winget (https://github.com/ggml-org/llama.cpp/actions/workflows/winget.yml) 项目宣言 (https://github.com/ggml-org/llama.cpp/discussions/205) / ggml (https://github.com/ggml-org/ggml) / 运算说明 (https://github.com/ggml-org/llama.cpp/blob/master/docs/ops.md) / 维护者 PR (https://github.com/ggml-org/llama.cpp/issues?q=is%3Apr%20is%3Aopen%20draft%3AFalse%20(author%3Argerganov%20OR%20author%3AKitaitiMakoto%20OR%20author%3Adanbev%20OR%20author%3Aaldehir%20OR%20author%3Amax-krasnyansky%20OR%20author%3ACISC%20OR%20author%3Aggerganov%20OR%20author%3Aam17an%20OR%20author%3Abartowski1182%20OR%20author%3Ahipudding%20OR%20author%3AServeurpersoCom%20OR%20author%3Apwilkin%20OR%20author%3Areeselevine%20OR%20author%3Angxson%20OR%20author%3Ajeffbolznv%20OR%20author%3A0cc4m%20OR%20author%3Aangt%20OR%20author%3AIMbackK%20OR%20author%3Aarthw%20OR%20author%3AJohannesGaessler%20OR%20author%3AORippler%20OR%20author%3Aruixiang63%20OR%20author%3Axctan%20OR%20author%3Aallozaur%20OR%20author%3Ayomaytk%20OR%20author%3Aaendk%20OR%20author%3Agaugarg-nv%20OR%20author%3Ataronaeo%20OR%20author%3Aforforever73%20OR%20author%3Alhez%20OR%20author%3Anetrunnereve%20OR%20author%3Afairydreaming)%20sort%3Aupdated-desc) / 编译时间 (https://github.com/ggml-org/llama.cpp-dev/blob/master/README-compile-times.md) / lib llama API (https://github.com/ggml-org/llama.cpp/issues/9289) / llama-server REST API (https://github.com/ggml-org/llama.cpp/issues/9291)
快速开始
以下是几种在您的设备上安装 llama.cpp 的方式:
- 访问 https://llama.app 并按照说明操作
- 使用 Docker 运行 — 请参阅我们的 Docker 文档
- 从发布页面下载预编译的二进制文件 (https://github.com/ggml-org/llama.cpp/releases)
- 通过克隆本仓库从源码构建 — 请查阅 我们的构建指南
安装完成后:
# 直接从 Hugging Face 下载并运行模型
llama cli -hf ggml-org/Qwen3.5-0.8B-GGUF
# 启动兼容 OpenAI 的 API 服务器
llama serve -hf ggml-org/Qwen3.5-0.8B-GGUF
使用 llama cli 进行 VLM 会话 使用内置 Web UI 连接 llama serve
项目描述
llama.cpp 的主要目标是以最少的设置,在从本地到云端的广泛硬件上,实现前沿性能的 LLM(和 VLM)推理。
- 纯 C/C++ 实现,无任何外部依赖
- Apple 芯片是一等公民 — 通过 ARM NEON、Accelerate 和 Metal 框架进行优化
- 支持 x86 架构的 AVX、AVX2、AVX512 和 AMX 指令集
- 支持 RISC-V 架构的 RVV、ZVFH、ZFH、ZICBOP 和 ZIHINTPAUSE 指令集
- 支持 1.5 位、2 位、3 位、4 位、5 位、6 位和 8 位整数量化,以实现更快的推理和更低的内存占用
- 用于在 NVIDIA GPU 上运行 LLM 的自定义 CUDA 内核(通过 HIP 支持 AMD GPU,通过 MUSA 支持 Moore Threads GPU)
- 支持 Vulkan 和 SYCL 后端
- 支持 CPU+GPU 混合推理,可部分加速超过总显存容量的大型模型
llama.cpp 项目基于 ggml (https://github.com/ggml-org/ggml) 库构建。
支持的后端
| 后端 | 目标设备 |
|---|---|
| BLAS | 所有 |
| BLIS | 所有 |
| CANN | 华为昇腾 NPU |
| CUDA | Nvidia GPU |
| HIP | AMD GPU |
| Hexagon [进行中] | 高通骁龙 |
| IBM zDNN | IBM Z & LinuxONE |
| MUSA | Moore Threads GPU |
| Metal | Apple Silicon |
| OpenCL | Adreno GPU |
| OpenVINO [进行中] | Intel CPU、GPU 和 NPU |
| RPC (https://github.com/ggml-org/llama.cpp/tree/master/tools/rpc) | 所有 |
| SYCL | Intel GPU |
| VirtGPU | VirtGPU API |
| Vulkan | GPU |
| WebGPU | 所有 |
| ZenDNN | AMD CPU |
文档
工具
开发
- 如何构建
- 在 Docker 上运行
- 在 Android 上构建
- 多 GPU 使用
- 性能问题排查
- GGML 技巧与窍门 (https://github.com/ggml-org/llama.cpp/wiki/GGML-Tips-&-Tricks)
- XCFramework
- 补全功能
- 模型
- 发布流程
参与贡献
- 贡献者可以提交 PR
- 根据贡献情况,协作者将被邀请加入
- 维护者可以将代码推送到
llama.cpp仓库的分支,并将 PR 合并到master分支 - 任何关于管理 issue、PR 和项目的帮助都非常重要!
- 请阅读 CONTRIBUTING.md 了解更多
致谢
- yhirose/cpp-httplib (https://github.com/yhirose/cpp-httplib) - 单文件 HTTP 服务器,被
llama-server使用 - MIT 许可证 - stb-image (https://github.com/nothings/stb) - 单文件图像格式解码器,被多模态子系统使用 - 公共领域
- nlohmann/json (https://github.com/nlohmann/json) - 单文件 JSON 库,被各种工具/示例使用 - MIT 许可证
- miniaudio.h (https://github.com/mackron/miniaudio) - 单文件音频格式解码器,被多模态子系统使用 - 公共领域
- subprocess.h (https://github.com/sheredom/subprocess.h) - 用于 C 和 C++ 的单文件进程启动方案 - 公共领域
相似文章
ggml-org/llama.cpp
llama.cpp 是一个开源 C/C++ 库,用于在本地硬件上高效运行 LLM 推理,支持多种量化方法和多后端(CPU、GPU 等)。
llama.cpp
本文介绍了 llama.cpp 的官方主页,这是一个开源的本地 LLM 推理引擎,重点介绍了通过 pi-llama 插件与 Pi 编码代理的集成以及广泛的硬件优化。
vllm-project/vllm v0.21.0rc1
vLLM v0.21.0rc1 是高性能大语言模型推理和服务库的预发布更新,主要功能包括针对吞吐量、量化以及硬件支持的优化。
vllm-project/vllm v0.19.1
vLLM v0.19.1 发布 - 一个快速易用的开源 LLM 推理和服务库,拥有业界领先的吞吐量,支持 200+ 个模型架构以及包括 NVIDIA/AMD GPU 和 CPU 在内的多样化硬件。
vllm-project/vllm v0.20.1
vLLM v0.20.1 是一个小版本更新,针对这款流行的开源大语言模型推理和服务库,继续保持其高吞吐量和高效内存管理的核心优势。