我们在家也有子代理

Reddit r/LocalLLaMA 工具

摘要

一位开发者分享了一个针对 pi coding agent 的子代理仓库的分支,该仓库可在单个本地 LLM 插槽和有限显存下运行,使用 llama.cpp 服务器和量化模型。该帖子还讨论了使用带有 MTP 的 Apex Qwen 变体时的性能。

在工作中,我可以无限制地使用 gpt 5.4 和 sonnet,所以我非常习惯生成子代理,让它们在仓库中自由发挥并拆分任务。在家时,我的显存有限,喜欢在本地运行模型自娱自乐。几乎每一个子代理扩展/实现都没有考虑到仅拥有 10GB 显存和单个 KV 缓存槽(且已量化)所带来的限制。我本身就是开发者,所以我利用 qwen3.6-35b-a3b 合作标记了一个基于现有子代理仓库的、部分通过 vibe-coded 方式构建的 pi coding agent 分支。 这仅适用于以下情况: * 使用 pi coding agent 作为你的工具框架 * 只能通过 llama.cpp 服务器同时运行一个 LLM 且仅有一个槽位 * 希望使用子代理,而无需在子代理完成后完全重新处理提示词 仓库在[此处](https://github.com/BenjaminBilbro/pi-subagent),随意使用或分支,我无所谓。我也很好奇其他人是如何在纯本地且显存受限的环境中处理子代理的。 我还计划添加让子代理在没有历史上下文的情况下生成的能力,并通过 `--slot-save-path` 和 `slots` 端点来管理主上下文的保存和存储。但生成的 `.bin` 文件相当庞大,哈哈。 最后一点,我非常喜欢主 llama.cpp 分支中的 MTP,并从 [Apex Qwen 变体](https://huggingface.co/mudler/Qwen3.6-35B-A3B-APEX-MTP-GGUF) 获得了相当可靠的性能。能够在 q_8 kv 下运行 175-200k 的上下文。根据草案命中率,可获得 200-300 pp 和 25-40 tps。
查看原文

相似文章

使用本地编码代理

Hacker News Top

Sebastian Raschka 撰写的教程,讲解如何使用开源工具和开源权重的大语言模型搭建完全本地的编码代理,涵盖动机、搭建过程以及相较于专有服务的优势。