Llama-CPP 并行代理 --> 解码时很好,但一个代理的 prefill 会让所有其他代理陷入停顿

Reddit r/LocalLLaMA 工具

摘要

一位用户报告称,在 Llama-CPP 中使用并行子代理时,解码性能很好,但单个代理的 prefill(例如处理网络搜索)会使所有其他代理停滞不前,并请求调优建议。

使用 3-5 个代理进行测试。解码性能非常出色,但如果其中一个代理执行网络搜索并需要处理几千个 token,所有其他代理都会陷入停顿:我尝试调优了一下,但没有成功。我的示例命令(此服务器仅用于子代理):./llama-server \ --model /models/Gemma4-26B/gemma-4-26B-A4B-it-UD-Q5_K_M.gguf \ --model-draft /models/Gemma4-26B/mtp-gemma-4-26B-A4B-it-Q8_0.gguf \ --device Vulkan0 \ --device-draft Vulkan0 \ --split-mode none \ --main-gpu 0 \ --gpu-layers all \ --spec-type draft-mtp \ --spec-draft-n-max 3 \ --ctx-size 240000 \ --parallel 3 \ --batch-size 2048 \ --ubatch-size 512 \ --flash-attn on \ --kv-unified \ --cache-reuse 256 \ --host 0.0.0.0 \ --port 8081 我对并行代理还不太熟悉。对我应该做出哪些改变,你有什么想法或建议吗?
查看原文

相似文章

我们在家也有子代理

Reddit r/LocalLLaMA

一位开发者分享了一个针对 pi coding agent 的子代理仓库的分支,该仓库可在单个本地 LLM 插槽和有限显存下运行,使用 llama.cpp 服务器和量化模型。该帖子还讨论了使用带有 MTP 的 Apex Qwen 变体时的性能。