我们在家也有子代理
摘要
一位开发者分享了一个针对 pi coding agent 的子代理仓库的分支,该仓库可在单个本地 LLM 插槽和有限显存下运行,使用 llama.cpp 服务器和量化模型。该帖子还讨论了使用带有 MTP 的 Apex Qwen 变体时的性能。
在工作中,我可以无限制地使用 gpt 5.4 和 sonnet,所以我非常习惯生成子代理,让它们在仓库中自由发挥并拆分任务。在家时,我的显存有限,喜欢在本地运行模型自娱自乐。几乎每一个子代理扩展/实现都没有考虑到仅拥有 10GB 显存和单个 KV 缓存槽(且已量化)所带来的限制。我本身就是开发者,所以我利用 qwen3.6-35b-a3b 合作标记了一个基于现有子代理仓库的、部分通过 vibe-coded 方式构建的 pi coding agent 分支。
这仅适用于以下情况:
* 使用 pi coding agent 作为你的工具框架
* 只能通过 llama.cpp 服务器同时运行一个 LLM 且仅有一个槽位
* 希望使用子代理,而无需在子代理完成后完全重新处理提示词
仓库在[此处](https://github.com/BenjaminBilbro/pi-subagent),随意使用或分支,我无所谓。我也很好奇其他人是如何在纯本地且显存受限的环境中处理子代理的。
我还计划添加让子代理在没有历史上下文的情况下生成的能力,并通过 `--slot-save-path` 和 `slots` 端点来管理主上下文的保存和存储。但生成的 `.bin` 文件相当庞大,哈哈。
最后一点,我非常喜欢主 llama.cpp 分支中的 MTP,并从 [Apex Qwen 变体](https://huggingface.co/mudler/Qwen3.6-35B-A3B-APEX-MTP-GGUF) 获得了相当可靠的性能。能够在 q_8 kv 下运行 175-200k 的上下文。根据草案命中率,可获得 200-300 pp 和 25-40 tps。
相似文章
帮助优化 llama.cpp + Qwen 27B 在 RTX PRO 6000 Blackwell 上用于编码代理的配置
用户详细介绍了他们在 RTX PRO 6000 Blackwell 上使用 llama.cpp 运行 Qwen 27B 进行本地编码代理的设置,与 Claude 模型进行了性能对比,并请求帮助解决频繁崩溃和响应格式错误的问题。
@dangerm00se: 我让 fable 做的主要事情是路由跨越本地 API 和 cerebras 的 moa 和 rlm 实验。让你的 agent 去…
作者分享了 Hermes Mixture-of-Agents 实验中的发现,包括投票器升级、GPU 拓扑和缓存经济学,表明本地前缀缓存可以使长代理会话几乎免费,并且两个独立的 GPU 实例优于单个分区实例。
一个使用前沿模型进行规划但在本地运行大部分token的代理(为我的双RTX 3090机器构建)
作者构建了一个个人AI代理,它使用前沿模型(Codex)进行高层次规划,同时在双RTX 3090系统上本地运行大部分token处理,支持长时间任务并具备确定性验证。该代理支持三个可互换的层级:规划器、本地和高级,并以开源仓库形式提供。
@TheAhmadOsman:你可以在家运行本地模型,并使用任何代理框架,如 Codex 或 Claude Code
Ahmad 构建了一个简单的工具,使 Claude Code 能与任何本地 LLM 配合使用,演示时使用了 vLLM 在 4 块 RTX 3090 上服务 GLM-4.5 Air。
使用本地编码代理
Sebastian Raschka 撰写的教程,讲解如何使用开源工具和开源权重的大语言模型搭建完全本地的编码代理,涵盖动机、搭建过程以及相较于专有服务的优势。