我测试了2个本地代理是否并行运行还是轮流使用1个模型。批处理是真实的,但使用QWEN 3.8 27B 4bit在MacBook Pro M3Max 128GB统一内存40核GPU上并非没有代价
摘要
作者在MacBook Pro M3Max上使用QWEN 3.8 27B 4bit模型进行了两个本地代理并行运行的实验,发现批处理可以实现并发执行,但会增加延迟,最佳代理数约为4个。
一直很享受这个子版块的对话和参与..所以假期的第三天,我的早晨用来提升技能....昨天基于我第2天的帖子,我确实收到了这个问题,帖子中我运行了QWEN 3.8 27B 4bit的实验。在第1天和第2天之间,我发布了关于在我的设置中添加第二个本地编码代理的内容。有人问了一个我可能一开始就应该问自己的问题:"当两个代理同时在同一台机器上访问同一个本地模型时,它们实际上是并行运行,还是悄悄地轮流?"我留出时间进行实际实验,但也思考了如何进行,特别是如果“我”作为人类是最佳的...工具...来执行它?所以...首先我找到了MLX server源代码,浏览了它,并把它交给了我的代理。然后我们合作了。我的代理编写了一个小负载驱动程序,在完全相同的时刻发出两个请求,因为如果人类依次启动它们,你实际上在设置队列顺序并伪造自己的结果。然后我们一起运行它,让数字说话。我观察到的....批处理是真实的。两个代理真正地同时共享模型,服务器进行连续批处理,最多可达32个宽度。但这并非没有代价。增加代理数量,总吞吐量上升,但每个代理变慢,启动等待时间变长。在我的Mac上,最佳点大约是4个代理。超过这个数量,你只是让所有人都排队等待。固定一个随机种子,你会悄悄地毁掉整个事情,每个请求都序列化。子代理也不是魔法,一个生成4个帮助者的父代理只是另外4个争夺同一个GPU的客户端。整个测试设备都在磁盘上,可重现。乐意在评论中讨论调度器细节或方法论。
相似文章
如果你使用 Open Code 或其他代理程序,但没有并行使用代理,那么你会损失大量的 t/s。基准测试:RTX5090,通过 LM Studio 加载 Qwen3.6 35B,并行任务数设为 8
基准测试表明,在 RTX 5090 上使用 LM Studio 并行运行 4-5 个代理可最大化吞吐量,而更多代理会因显存和计算分割导致收益递减。
我测量了上次本地代理帖子中本子版块用户提出的三项主张。你们中有一位的预测超越了我自己的假设。学习一切而非知晓一切的规则
用户测试了使用Qwen 27B模型扩展本地AI代理,发现由于内存带宽限制,添加更多代理仅能将吞吐量提高到一定程度,且长提示从并行中获益更多。
@iotcoi:在小小的GB10 GPU上跑通Google cookbook,10个agent并发,436 tok/s,每agent 43.6 tok/s,Qwen3.6-35B + Dflash + DDTree,vLLM GB10仅74W
一位开发者在单颗74W GB10 GPU上,用vLLM同时跑起10个35B参数Qwen3.6模型agent,总吞吐436 tok/s,实现高效边缘部署。
我在 MacBook Air M5 上对 21 款本地大模型进行了代码质量与速度的性能评测
一位开发者在 MacBook Air M5 上使用 HumanEval+ 对 21 款本地大模型进行了基准测试,发现 Qwen 3.6 35B-A3B (MoE) 以 89.6% 的得分和 16.9 tok/s 的速度位居榜首,而 Qwen 2.5 Coder 7B 仅需 4.5 GB 内存即可达到 84.2% 的性能,拥有最佳的内存性价比。值得注意的是,Gemma 4 系列的表现远低于预期(31B 版本仅得 31.1%),这可能是受 Q4_K_M 量化策略的影响。
在4GB笔记本GPU(RTX 3050 Ti)上的本地智能体工作空间:tok/s 以及小型模型在调用工具、构建制品和RAG时遇到的困难
作者在4GB RTX 3050 Ti笔记本GPU上对Bike4Mind工作空间内的本地Qwen模型进行了基准测试,发现采用Q4_K_M量化的2B模型是适配VRAM的最佳选择,达到了96 tok/s。较小的模型在工具选择、需要多个模型的制品生成以及导致模型切换开销的RAG嵌入方面存在困难。