@mitsuhiko: 如果没有 128GB 内存的 Mac,我还有一个 pi-llamacpp 扩展,仅配置了 4 个版本的 Qwen 3.6。https://...
摘要
mitsuhiko 发布了一个 pi-llamacpp 扩展,用于自动化设置和管理基于 llama.cpp 的本地 LLM 推理,特别支持 Qwen 3.6 模型的多种量化版本。
查看缓存全文
缓存时间: 2026/05/10 08:25
如果你没有配备 128GB 内存的 Mac,我还有一个 pi-llamacpp 扩展,它专门配置了 Qwen 3.6 的 4 个版本。https://github.com/mitsuhiko/pi-llamacpp… —— 它会编译并运行 llama.cpp,下载模型并进行正确设置。
mitsuhiko/pi-llamacpp
来源:https://github.com/mitsuhiko/pi-llamacpp
pi-llamacpp
Pi 提供商扩展,用于运行 Pi 自托管的本地 llama.cpp (https://github.com/ggml-org/llama.cpp) 推理。
该扩展在 llamacpp 提供商下注册 Qwen3.6 GGUF 模型,
下载/构建匹配的 llama.cpp 运行时,并在首次使用时下载所选的 GGUF 模型,启动 llama-server,并在 Pi 关闭时自动停止它。
模型
目前注册的模型:
llamacpp/qwen-3.6-dense-2bit(27B 密集模型)llamacpp/qwen-3.6-dense-4bit(27B 密集模型)llamacpp/qwen-3.6-dense-8bit(27B 密集模型)llamacpp/qwen-3.6-moe-2bit(35B-A3B MoE)llamacpp/qwen-3.6-moe-4bit(35B-A3B MoE)llamacpp/qwen-3.6-moe-8bit(35B-A3B MoE)
模型名称描述了其架构:
dense是 Qwen3.6 27B 密集模型。所有参数都参与每个 token 的计算,这使得计算和内存使用更加直接和可预测。moe是 Qwen3.6 35B-A3B 混合专家(Mixture-of-Experts)模型。它共有约 35B 参数,但每个 token 仅通过一小部分活跃专家子集(约 3B 活跃参数)进行路由。MoE 可以在相似的活跃计算量下提供更大的总容量,但完整的专家权重仍然需要存储和加载。
moe (35B-A3B) 模型下载自
havenoammo/Qwen3.6-35B-A3B-MTP-GGUF (https://huggingface.co/havenoammo/Qwen3.6-35B-A3B-MTP-GGUF),
而 dense (27B) 模型下载自
froggeric/Qwen3.6-27B-MTP-GGUF (https://huggingface.co/froggeric/Qwen3.6-27B-MTP-GGUF)。
这些文件需要 llama.cpp 的 MTP/NextN 支持,因此默认运行时路径构建的是 llama.cpp 拉取请求 #22673 (https://github.com/ggml-org/llama.cpp/pull/22673) 的固定快照,而不是使用标准二进制发布版。
安装
sh pi install https://github.com/mitsuhiko/pi-llamacpp
对于从此代码库进行的本地开发:
sh ./install-pi-extension-local.sh
然后重启 Pi 或运行 /reload。
运行时布局
运行时状态保存在 ~/.pi/llamacpp 下:
source/:在本地构建的固定 llama.cpp 源代码快照(默认:支持 MTP/NextN 的 PR #22673 (https://github.com/ggml-org/llama.cpp/pull/22673) 快照)runtime/:当LLAMACPP_RUNTIME_KIND=release时解压的 llama.cpp 发布存档downloads/:发布存档和可恢复的.part文件models/havenoammo/Qwen3.6-35B-A3B-MTP-GGUF/:缓存的moe(35B-A3B) GGUF 模型文件models/froggeric/Qwen3.6-27B-MTP-GGUF/:缓存的dense(27B) GGUF 模型文件clients/:活跃的 Pi 进程租约server.json:托管的llama-server状态log:下载/解压/服务器/看门狗日志
托管服务器默认绑定到随机的 localhost 端口,并在 server.json 中记录活动的端点。只有在你明确想要固定端口时,才设置 LLAMACPP_PORT。
调试
在 Pi 内部使用 /llamacpp 显示实时 llama.cpp 日志,使用 /llamacpp status 查看路径/状态,使用 /llamacpp stop 在没有任何其他活跃租约时停止托管服务器。
相似文章
本地运行 Qwen3.6-35B-A3B 作为编码 Agent:我的完整部署与可用配置
一份详尽指南,教你如何在 Apple Silicon 上通过 llama.cpp 本地运行 350 亿参数 Qwen3.6 模型,并驱动 pi 编码 Agent,附带优化后的启动参数与采样配置。
@pcuenq: 我的数据点:使用 Pi + llama.cpp + Qwen-3.6-35B-A3B 并行处理两个项目(我更喜欢 MoE 模型)。这项工作……
有用户报告称,在较旧的 M1 Max 机器上使用 Pi 和 llama.cpp 配合 Qwen-3.6-35B-A3B 模型成功运行并行项目,证明了其实际可用性。
@_lewtun: 你现在可以在笔记本上免费全天候运行 AI 研究员了!使用 llama.cpp 和 4-bi…
本文重点介绍了如何在本地笔记本上使用 llama.cpp 和 Unsloth 4-bit 量化免费运行 Qwen3-35B-A3B。
在Mac Studio 96GB上运行Qwen3.5-122B:修复了3个使长上下文推理变得可用的bug
修复了qMLX分支中运行Qwen3.5-122B的三个bug,将长上下文推理的预填充时间从几分钟降低到亚秒级;开源了该分支和基准测试脚本。
@songjunkr:分享我的个人本地LLM配置:设备:MacStudio M2 Ultra 64GB,加载模型:SuperQwen3.6 35b mlx 4bit…
一位用户展示了在MacStudio M2 Ultra 64GB上运行的个人本地LLM栈,组合了SuperQwen3.6-35b-mlx-4bit、Ernie Image Turbo及多款辅助模型,用于编程与聊天。