我测量了上次本地代理帖子中本子版块用户提出的三项主张。你们中有一位的预测超越了我自己的假设。学习一切而非知晓一切的规则
摘要
用户测试了使用Qwen 27B模型扩展本地AI代理,发现由于内存带宽限制,添加更多代理仅能将吞吐量提高到一定程度,且长提示从并行中获益更多。
过去几天,我虔诚地(本应是在度假)在这里发帖讨论本地代理,特别是Qwen 3.8 27B 4 bit模型。评论比我的帖子更犀利,所以我没有独自写后续。这里的三位用户给了我主张,我将每个都变成了我开发设备MacBook Pro M3 Max 128 GB统一内存和40核GPU上的实验。同时启动,所以我无法秘密设置队列顺序。结果如下:第二个代理帮助一点,第四个则没有。聚合吞吐量从1个代理的16.6 tokens/sec提高到2个代理的20.8 tokens/sec,然后基本持平并在4个和8个代理时下降。同时,每个代理的解码速率从17.4降到12.8到6.8到3.9,而首token时间从0.46秒上升到32秒。总量接近固定,所以每个添加的代理只是让大家的份额更薄。你们中的一位预测了确切的形状。预测是1到2个代理时接近1.5倍,而不是2倍,因为解码受内存带宽限制。我测量到解码密集型为1.57倍,预填充密集型为1.51倍。几乎完全吻合。我自己的假设,即预填充会明显胜出,并没有按预期出现,我在写作中保留了这个失误。更长的提示批处理效果更好。扫描提示长度从约170到约3,100 tokens,1到2个代理的增益单调递增,分别为1.52倍、1.58倍、1.67倍、1.73倍。预填充是计算密集型的,并行化好;解码则不然。所以长上下文工作是第二个代理的最佳情况,短闲聊则是最差情况。一个密集的27B是难题。我在LinkedIn上的科技社区同伴也指出,我的模型每个token重新读取所有权重,所以这是最坏情况。一个MoE模型每个token激活约3B参数,在同一总线上有更多余地。整个运行矩阵都在磁盘上,可重现。我希望这项工作能帮助其他正在考虑或进行此操作并想知道他们结果如何的人。传递下去。
相似文章
我测试了2个本地代理是否并行运行还是轮流使用1个模型。批处理是真实的,但使用QWEN 3.8 27B 4bit在MacBook Pro M3Max 128GB统一内存40核GPU上并非没有代价
作者在MacBook Pro M3Max上使用QWEN 3.8 27B 4bit模型进行了两个本地代理并行运行的实验,发现批处理可以实现并发执行,但会增加延迟,最佳代理数约为4个。
我赋予本地 AI 智能体系统文件访问权限以及一种机械式的“痛苦”指标。模型规模的提升彻底改变了其行为
作者分享了一个名为 hollow-agentOS 的本地多智能体系统,该系统利用“痛苦”指标来自主生成、沙盒测试并热加载工具。将模型扩展至 Qwen 3.6 35B 后,系统稳定性和自我纠错能力显著提升,在代码生成方面实现了极高的成功率。
如果你使用 Open Code 或其他代理程序,但没有并行使用代理,那么你会损失大量的 t/s。基准测试:RTX5090,通过 LM Studio 加载 Qwen3.6 35B,并行任务数设为 8
基准测试表明,在 RTX 5090 上使用 LM Studio 并行运行 4-5 个代理可最大化吞吐量,而更多代理会因显存和计算分割导致收益递减。
@dangerm00se: 我让 fable 做的主要事情是路由跨越本地 API 和 cerebras 的 moa 和 rlm 实验。让你的 agent 去…
作者分享了 Hermes Mixture-of-Agents 实验中的发现,包括投票器升级、GPU 拓扑和缓存经济学,表明本地前缀缓存可以使长代理会话几乎免费,并且两个独立的 GPU 实例优于单个分区实例。
我们不再将每个AI代理请求都发送给Claude Opus 5。结果令我们惊讶。
一个团队在89个Terminal-Bench 2.1任务上,将AI代理工作流的不同阶段路由到不同模型,与将所有请求发送给Claude Opus 5进行了基准测试,并发现了令人惊讶的结果。