榨干64GB内存:Qwen3.5 122B A10B(UD-Q2_K_XL,启用MTP)已完全取代我原本的Qwen3 Next 80B(UD-Q4_K_XL)
摘要
一位用户比较了在64GB内存系统上运行量化版Qwen3 Next 80B和Qwen3.5 122B的情况,指出了本地LLM推理中速度、质量和内存使用之间的权衡。
我有64GB常规内存,之前运行的是 Qwen3 Next 80B(UD-Q4_K_XL 量化),性能不错,内部知识也比 Qwen3.5 35B A3B 好很多——而 Qwen3.5 35B A3B 本身就比 Qwen3.6 35B A3B 强。在 DDR4 上,我平均获得 8.5 tok/s 的速度。不过,Qwen3.5 122B A10B 配合 UD-Q2_K_XL 量化,使得同一个 64GB 内存也能容纳一个约 120B 的模型。与普遍看法相反,UD-Q2_K_XL 权重尽管核心是 Q2,但即使启用 MTP 也仍然相当不错。我在内部知识方面得到了质量高得多的回复,尽管生成速度大幅下降至仅约 2.9 tok/s,更具体地说,是在 CPU 上运行时提示处理速度大幅下降(没错,我两个模型都只能在 CPU 上运行)。假如我的笔记本换成 DDR5-5600 内存,生成速度本可以提升到高达 6 tok/s,这已经相当可用了。我觉得等待高质量回复是值得的——这些回复似乎是 Qwen3.5 122B 的常规 MoE 架构(10B 激活参数)强行得出的,而相比之下,基本已经过时的 Qwen3 Next 80B 采用稀疏 MoE 架构,虽然总参数量高达 80B,但激活参数仅约 3.5B,这导致它在解释小众主题时可能会遗漏一些重要事实,甚至完全胡编乱造。不过,这样做也有缺点。提示处理速度的大幅下降使得它几乎无法有意义地集成到需要查阅维基百科档案等信息的智能体工作负载中。如果没有一个约 60B 的模型来覆盖 32-48GB 内存范围,并在 Qwen3.6 35B A3B 的速度和 Qwen3.5 122B A10B 的“不差劲”之间找到平衡点,我认为我们无法在仅约 100GB 的存储空间内拥有一部数字百科全书。我们只能将就使用 Qwen3.5/3.6 35B A3B,前提是内存足够容纳——否则就得用 Gemma 4 26B A4B 或密集模型,尤其是在使用独立 GPU 而非统一内存运行 LLM 时。不过,如果你有像 AMD Strix Halo 迷你 PC 那样拥有 64GB 或 96GB 内存的设备,我想你就不会遇到这些问题了。附:我已经尝试过 Qwen3.5 122B A10B 的 REAP 变体,它们完全不行,不知为何变得更笨了,而且提示处理速度极慢的核心问题仍未解决。
相似文章
在 8GB 显存和 32GB 内存上运行 Qwen3.6 35b a3b,~190k 上下文
作者分享了一种高性能的本地推理配置,使用支持 TurboQuant 的修改版 llama.cpp,在硬件受限(8GB 显存、32GB 内存)的情况下运行 Qwen3.6 35B A3B,实现了 ~37-51 tok/sec 的生成速度,并支持 ~190k 上下文。
Show HN:在 Mac 上仅用 4.3 GB 内存运行 80B Qwen,以及在 iPhone 上运行 35B
演示了在 Mac 上仅用 4.3 GB 内存运行 80B Qwen 模型,以及在 iPhone 上运行 35B 模型,展示了本地 LLM 推理的极致内存优化。
在6GB显存和16GB系统内存上运行Qwen 3.8 flash next的体验
一位用户分享了在配备6GB显存和16GB内存的系统上使用llama.cpp运行Qwen 3.8 flash next模型的体验,通过1位量化实现了6-7个每秒的生成速度,并寻求量化变体的推荐。
在16GB显存+32GB内存下运行Qwen 3.8 - 写给贫民窟GPU玩家的实用/趣味指南
一位Reddit用户分享了如何在拥有16GB显存和32GB内存的系统上,通过激进量化及特定llama.cpp设置成功运行Qwen 3.8 Next MoE模型,实现了在有限硬件上高效运行大模型的效果。
在Zeus(小米12 Pro,12GB RAM)上运行Qwen 3.6 35B MoE(Q4_K_M)
演示在搭载12GB RAM的小米12 Pro上以Q4_K_M量化方式运行Qwen 3.6 35B MoE模型,展示了在移动设备上进行本地AI推理。