模型:由 aetherbird 添加对 Ling 3.0 VL 的支持 · 拉取请求 #29151 · ggml-org/llama.cpp
摘要
这是一个拉取请求,旨在为 llama.cpp 添加对 Ling 3.0 VL 模型的支持,以增强其处理视觉语言模型的能力。
查看缓存全文
缓存时间: 2026/09/24 11:08
ggml-org/llama.cpp
来源: https://github.com/ggml-org/llama.cpp
llama.cpp
在 C/C++ 中实现 llama LLM 推理
许可证: MIT (https://opensource.org/licenses/MIT)
发布版本 | 每夜构建 | 服务器版 | Docker | Winget | ggml | 运算库 | 维护者 PR | 开发统计 | lib llama API | llama-server REST API
快速入门
以下是将 llama.cpp 安装到您机器上的几种选项:
- 访问 https://llama.app 并按照说明操作
- 使用 Docker 运行 – 请参阅我们的 Docker 文档
- 从发布页面下载预构建二进制文件 (https://github.com/ggml-org/llama.cpp/releases)
- 克隆此仓库并从源码构建 – 请查看我们的构建指南
安装完成后:
# 直接从 Hugging Face 下载并运行模型
llama cli -hf ggml-org/Qwen3.5-0.8B-GGUF
# 启动与 OpenAI 兼容的 API 服务器
llama serve -hf ggml-org/Qwen3.5-0.8B-GGUF
使用 llama cli 进行视觉语言模型会话
针对 llama serve 的内置 Web 界面
描述
llama.cpp 的主要目标是在广泛类型的硬件(本地和云端)上,以最少的配置和最先进的性能实现 LLM(以及 VLM)推理。
- 纯 C/C++ 实现,无任何依赖
- Apple 芯片是一等公民 – 通过 ARM NEON、Accelerate 和 Metal 框架优化
- 支持 x86 架构的 AVX、AVX2、AVX512 和 AMX
- 支持 RISC-V 架构的 RVV、ZVFH、ZFH、ZICBOP 和 ZIHINTPAUSE
- 支持 1.5 位、2 位、3 位、4 位、5 位、6 位和 8 位整数量化,以实现更快的推理和减少内存使用
- 用于在 NVIDIA GPU 上运行 LLM 的自定义 CUDA 内核(通过 HIP 支持 AMD GPU,通过 MUSA 支持 Moore Threads GPU)
- 支持 Vulkan 和 SYCL 后端
- CPU+GPU 混合推理,可部分加速超过显存总容量的模型
llama.cpp 项目构建于 ggml (https://github.com/ggml-org/ggml) 库之上。
支持的后端
| 后端 | 目标设备 |
|---|---|
| BLAS | 所有 |
| BLIS | 所有 |
| CANN | Ascend NPU |
| CUDA | Nvidia GPU |
| HIP | AMD GPU |
| Hexagon | Snapdragon |
| IBM zDNN | IBM Z & LinuxONE |
| MUSA | Moore Threads GPU |
| Metal | Apple Silicon |
| OpenCL | Adreno GPU |
| OpenVINO [进行中] | Intel CPU、GPU 和 NPU |
| RPC | 所有 |
| SYCL | Intel GPU |
| VirtGPU | VirtGPU APIR |
| Vulkan | GPU |
| WebGPU | 所有 |
| ZenDNN | AMD CPU |
文档
工具
开发
- 如何构建
- 在 Docker 上运行
- 在 Android 上构建
- 多 GPU 使用
- 性能故障排除
- GGML 提示与技巧 (https://github.com/ggml-org/llama.cpp/wiki/GGML-Tips-&-Tricks)
- XCFramework
- 补全
- 模型
- 发布流程
贡献
- 贡献者可以提交 PR
- 将根据贡献情况邀请协作者
- 维护者可以将代码推送到
llama.cpp仓库的分支,并将 PR 合并到master分支 - 任何帮助管理问题、PR 和项目的工作都非常感谢!
- 请阅读 CONTRIBUTING.md 了解更多信息
致谢
- yhirose/cpp-httplib (https://github.com/yhirose/cpp-httplib) – 单文件头 HTTP 服务器,被
llama-server使用 – MIT 许可证 - nothings/stb (https://github.com/nothings/stb) – 单文件头图像格式解码器,被多模态子系统使用 – 公共领域
- nlohmann/json (https://github.com/nlohmann/json) – 单文件头 JSON 库,被各种工具/示例使用 – MIT 许可证
- mackron/miniaudio (https://github.com/mackron/miniaudio) – 单文件头音频格式解码器,被多模态子系统使用 – 公共领域
- sheredom/subprocess.h (https://github.com/sheredom/subprocess.h) – 面向 C 和 C++ 的单文件头进程启动解决方案 – 公共领域
相似文章
Ling 3.0 支持已合并至 llama.cpp
新的 Ling 3.0 推理模型的支持已集成到 llama.cpp 中,使得通过这个开发工具可以访问它们。
模型:Granite4 Vision,作者 gabe-l-hart · 拉取请求 #23545 · ggml-org/llama.cpp
此拉取请求为 llama.cpp(一个开源 LLM 推理引擎)增加了对 Granite4 Vision 模型的支持。
特性:AesSedai 为 llama.cpp 添加 Mimo v2.5 模型支持 · 拉取请求 #22493 · ggml-org/llama.cpp
一个拉取请求已合并到 llama.cpp 中,用于添加对 Mimo v2.5 模型的支持,增强了该框架对此特定 AI 架构的兼容性。
模型:由 Little0o0 添加 Tencent Hy 4 (hy_v4) 预览架构支持 · 拉取请求 #28127 · ggml-org/llama.cpp
一个 GitHub 拉取请求为 llama.cpp C/C++ 推理库添加了 Tencent Hy 4 (hy_v4) 预览架构支持,使此新模型能够进行本地推理。
模型:添加 NVIDIA Nemotron-3-Puzzle-75B-A9B(NemotronHPuzzle)支持,由 YanissAmz 提交 · Pull Request #25444 · ggml-org/llama.cpp
一个拉取请求为 llama.cpp 推理工具添加了对 NVIDIA Nemotron-3-Puzzle-75B-A9B 模型的支持。