我测试了2个本地代理是否并行运行还是轮流使用1个模型。批处理是真实的,但使用QWEN 3.8 27B 4bit在MacBook Pro M3Max 128GB统一内存40核GPU上并非没有代价

Reddit r/AI_Agents 新闻

摘要

作者在MacBook Pro M3Max上使用QWEN 3.8 27B 4bit模型进行了两个本地代理并行运行的实验,发现批处理可以实现并发执行,但会增加延迟,最佳代理数约为4个。

一直很享受这个子版块的对话和参与..所以假期的第三天,我的早晨用来提升技能....昨天基于我第2天的帖子,我确实收到了这个问题,帖子中我运行了QWEN 3.8 27B 4bit的实验。在第1天和第2天之间,我发布了关于在我的设置中添加第二个本地编码代理的内容。有人问了一个我可能一开始就应该问自己的问题:"当两个代理同时在同一台机器上访问同一个本地模型时,它们实际上是并行运行,还是悄悄地轮流?"我留出时间进行实际实验,但也思考了如何进行,特别是如果“我”作为人类是最佳的...工具...来执行它?所以...首先我找到了MLX server源代码,浏览了它,并把它交给了我的代理。然后我们合作了。我的代理编写了一个小负载驱动程序,在完全相同的时刻发出两个请求,因为如果人类依次启动它们,你实际上在设置队列顺序并伪造自己的结果。然后我们一起运行它,让数字说话。我观察到的....批处理是真实的。两个代理真正地同时共享模型,服务器进行连续批处理,最多可达32个宽度。但这并非没有代价。增加代理数量,总吞吐量上升,但每个代理变慢,启动等待时间变长。在我的Mac上,最佳点大约是4个代理。超过这个数量,你只是让所有人都排队等待。固定一个随机种子,你会悄悄地毁掉整个事情,每个请求都序列化。子代理也不是魔法,一个生成4个帮助者的父代理只是另外4个争夺同一个GPU的客户端。整个测试设备都在磁盘上,可重现。乐意在评论中讨论调度器细节或方法论。
查看原文

相似文章

我在 MacBook Air M5 上对 21 款本地大模型进行了代码质量与速度的性能评测

Reddit r/LocalLLaMA

一位开发者在 MacBook Air M5 上使用 HumanEval+ 对 21 款本地大模型进行了基准测试,发现 Qwen 3.6 35B-A3B (MoE) 以 89.6% 的得分和 16.9 tok/s 的速度位居榜首,而 Qwen 2.5 Coder 7B 仅需 4.5 GB 内存即可达到 84.2% 的性能,拥有最佳的内存性价比。值得注意的是,Gemma 4 系列的表现远低于预期(31B 版本仅得 31.1%),这可能是受 Q4_K_M 量化策略的影响。