@mitsuhiko: 如果没有 128GB 内存的 Mac,我还有一个 pi-llamacpp 扩展,仅配置了 4 个版本的 Qwen 3.6。https://...

X AI KOLs Timeline 工具

摘要

mitsuhiko 发布了一个 pi-llamacpp 扩展,用于自动化设置和管理基于 llama.cpp 的本地 LLM 推理,特别支持 Qwen 3.6 模型的多种量化版本。

如果没有 128GB 内存的 Mac,我还有一个 pi-llamacpp 扩展,仅配置了 4 个版本的 Qwen 3.6。https://github.com/mitsuhiko/pi-llamacpp… — 编译并运行 llama.cpp,下载模型并正确设置。
查看原文
查看缓存全文

缓存时间: 2026/05/10 08:25

如果你没有配备 128GB 内存的 Mac,我还有一个 pi-llamacpp 扩展,它专门配置了 Qwen 3.6 的 4 个版本。https://github.com/mitsuhiko/pi-llamacpp… —— 它会编译并运行 llama.cpp,下载模型并进行正确设置。


mitsuhiko/pi-llamacpp

来源:https://github.com/mitsuhiko/pi-llamacpp

pi-llamacpp

Pi 提供商扩展,用于运行 Pi 自托管的本地 llama.cpp (https://github.com/ggml-org/llama.cpp) 推理。

该扩展在 llamacpp 提供商下注册 Qwen3.6 GGUF 模型, 下载/构建匹配的 llama.cpp 运行时,并在首次使用时下载所选的 GGUF 模型,启动 llama-server,并在 Pi 关闭时自动停止它。

模型

目前注册的模型:

  • llamacpp/qwen-3.6-dense-2bit (27B 密集模型)
  • llamacpp/qwen-3.6-dense-4bit (27B 密集模型)
  • llamacpp/qwen-3.6-dense-8bit (27B 密集模型)
  • llamacpp/qwen-3.6-moe-2bit (35B-A3B MoE)
  • llamacpp/qwen-3.6-moe-4bit (35B-A3B MoE)
  • llamacpp/qwen-3.6-moe-8bit (35B-A3B MoE)

模型名称描述了其架构:

  • dense 是 Qwen3.6 27B 密集模型。所有参数都参与每个 token 的计算,这使得计算和内存使用更加直接和可预测。
  • moe 是 Qwen3.6 35B-A3B 混合专家(Mixture-of-Experts)模型。它共有约 35B 参数,但每个 token 仅通过一小部分活跃专家子集(约 3B 活跃参数)进行路由。MoE 可以在相似的活跃计算量下提供更大的总容量,但完整的专家权重仍然需要存储和加载。

moe (35B-A3B) 模型下载自 havenoammo/Qwen3.6-35B-A3B-MTP-GGUF (https://huggingface.co/havenoammo/Qwen3.6-35B-A3B-MTP-GGUF), 而 dense (27B) 模型下载自 froggeric/Qwen3.6-27B-MTP-GGUF (https://huggingface.co/froggeric/Qwen3.6-27B-MTP-GGUF)。 这些文件需要 llama.cpp 的 MTP/NextN 支持,因此默认运行时路径构建的是 llama.cpp 拉取请求 #22673 (https://github.com/ggml-org/llama.cpp/pull/22673) 的固定快照,而不是使用标准二进制发布版。

安装

sh pi install https://github.com/mitsuhiko/pi-llamacpp

对于从此代码库进行的本地开发:

sh ./install-pi-extension-local.sh

然后重启 Pi 或运行 /reload

运行时布局

运行时状态保存在 ~/.pi/llamacpp 下:

  • source/:在本地构建的固定 llama.cpp 源代码快照(默认:支持 MTP/NextN 的 PR #22673 (https://github.com/ggml-org/llama.cpp/pull/22673) 快照)
  • runtime/:当 LLAMACPP_RUNTIME_KIND=release 时解压的 llama.cpp 发布存档
  • downloads/:发布存档和可恢复的 .part 文件
  • models/havenoammo/Qwen3.6-35B-A3B-MTP-GGUF/:缓存的 moe (35B-A3B) GGUF 模型文件
  • models/froggeric/Qwen3.6-27B-MTP-GGUF/:缓存的 dense (27B) GGUF 模型文件
  • clients/:活跃的 Pi 进程租约
  • server.json:托管的 llama-server 状态
  • log:下载/解压/服务器/看门狗日志

托管服务器默认绑定到随机的 localhost 端口,并在 server.json 中记录活动的端点。只有在你明确想要固定端口时,才设置 LLAMACPP_PORT

调试

在 Pi 内部使用 /llamacpp 显示实时 llama.cpp 日志,使用 /llamacpp status 查看路径/状态,使用 /llamacpp stop 在没有任何其他活跃租约时停止托管服务器。

相似文章