@shaneparrish: https://x.com/shaneparrish/status/2075226155548807210
摘要
演示了在MacBook Pro上利用BBQ-FP4量化同时运行两个80B Qwen模型,声称性能无损且速度很快。
查看缓存全文
缓存时间: 2026/07/10 08:09
👀
Rob Imbeault (@RobImbeault): 两台80B Qwen BBQ-FP4模型同时在MacBook Pro上运行,功能无损且速度飞快!
团队正在大显身手!
相似文章
本地运行 Qwen3.8 27B:来自我的 Mac Studio 的实测数据
本文提供了在 Mac Studio 上本地运行 Qwen3.8 27B AI 模型的实际性能基准测试,将其与前代模型进行比较,并讨论了硬件要求和量化效果。
@basecampbernie: https://x.com/basecampbernie/status/2074262192304832535
本文详细介绍了作者在GIGABYTE AI TOP ATOM(DGX Spark)工作站上运行NVFP4量化图像和视频生成模型的设置与基准测试,使用FLUX.2、Qwen-Image和LTX-2.3等模型(含同步音频的视频)取得了令人印象深刻的性能。
Show HN:在 Mac 上仅用 4.3 GB 内存运行 80B Qwen,以及在 iPhone 上运行 35B
演示了在 Mac 上仅用 4.3 GB 内存运行 80B Qwen 模型,以及在 iPhone 上运行 35B 模型,展示了本地 LLM 推理的极致内存优化。
@tom_doerr: 在 16GB 内存 Mac 上运行 35B 模型 https://github.com/walter-grace/mac-code…
该工具支持通过从 SSD 流式加载模型权重,在 16GB Mac 上运行 Qwen3.5-35B 等大型语言模型,经优化配置后最高可达 30 tok/s。
我在 MacBook Air M5 上对 21 款本地大模型进行了代码质量与速度的性能评测
一位开发者在 MacBook Air M5 上使用 HumanEval+ 对 21 款本地大模型进行了基准测试,发现 Qwen 3.6 35B-A3B (MoE) 以 89.6% 的得分和 16.9 tok/s 的速度位居榜首,而 Qwen 2.5 Coder 7B 仅需 4.5 GB 内存即可达到 84.2% 的性能,拥有最佳的内存性价比。值得注意的是,Gemma 4 系列的表现远低于预期(31B 版本仅得 31.1%),这可能是受 Q4_K_M 量化策略的影响。