llama.cpp

Hacker News Top 工具

摘要

本文介绍了 llama.cpp 的官方主页,这是一个开源的本地 LLM 推理引擎,重点介绍了通过 pi-llama 插件与 Pi 编码代理的集成以及广泛的硬件优化。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/08/12 08:24

# llama.app - llama.cpp 的官方主页 来源:https://llama.app/ ## 搭配本地编码代理使用 运行 `llama serve`,安装 `pi-llama` 插件,然后启动 Pi(https://github.com/earendil-works/pi)。它会自动发现你的本地模型。无需配置,无需 API 密钥。文件保留在你的机器上,请求不会离开你的设备。 ``` # 1. 启动模型服务 llama serve # 2. 安装 pi-llama 插件 pi install git:github.com/huggingface/pi-llama # 3. 运行 Pi,一切就绪 pi ``` Pi ## 针对任何硬件优化 从你的笔记本电脑到集群,llama.cpp 都能在你拥有的硬件上运行。相同的二进制文件、相同的模型、为每款 GPU 和 CPU 精心调优的内核。 Apple Silicon M Ultra RTX 5090 CPU Jetson H100 MI300 RTX 4090 A100 M Pro M Max DGX Spark T4 Radeon RX B200 Intel Arc RTX 3090

相似文章

ggml-org/llama.cpp

GitHub Trending (daily)

llama.cpp 是一个开源 C/C++ 库,用于在本地硬件上高效运行 LLM 推理,支持多种量化方法和多后端(CPU、GPU 等)。