我以为在标准智能手机上运行大规模模型已经非常了不起了,但
摘要
bigedgeonmoe开源代码库的创建者使得在移动设备和消费级PC上运行大规模MoE模型(高达120B参数)成为可能,在中端手机上实现了Qwen 35B模型每秒6个token的速度。
大家好,我是 bigedgeonmoe 的创建者,这是一个开源代码库,允许你在移动设备或消费级PC上运行大规模MoE模型(从Qwen 35B到开源的120B模型)。而且速度也相当不错:Qwen 35B(Q4)在一台拥有12GB RAM的中端手机上可以达到每秒6个token。诚然,目前还没有具体的应用场景(至少没有明显的),但我看到其他项目在Mac上做同样的事情(使用高端GPU和RAM)走红了,而我的项目则完全在CPU上处理。此外,它相对于llama.cpp是模块化的,只要llama.cpp支持,任何模型或量化方法都能工作;而且,如果有新模型出现,注册架构只需要一行代码。抱歉发了这么多牢骚,但这确实是我倾注了大量心血的项目。
相似文章
在Zeus(小米12 Pro,12GB RAM)上运行Qwen 3.6 35B MoE(Q4_K_M)
演示在搭载12GB RAM的小米12 Pro上以Q4_K_M量化方式运行Qwen 3.6 35B MoE模型,展示了在移动设备上进行本地AI推理。
在老款GTX 1080(8GB显存,128k上下文)上,约30B的MoE模型达到24+ tok/s的推理速度
一位开发者展示了如何使用llama.cpp,通过MoE卸载和TurboQuant KV缓存量化技术,在老款GTX 1080(8GB显存)上以128k上下文运行Qwen 3.6 35B-A3B和Gemma 4 26B-A4B等MoE模型,达到24+ tok/s的推理速度,并揭示了针对Gemma MTP投机解码的优化技巧。
MobileMoE:扩展端侧混合专家模型
MobileMoE 引入了高效的端侧混合专家语言模型,参数规模低于十亿,在性能和效率上均优于密集基线模型和现有的 MoE 模型。这些模型在开源数据集上训练,并在商用智能手机上展现出显著的加速效果。
在M1 Max上使用Zoo Code运行Qwen 3.6 35b MoE真是太棒了!完全本地化、电池供电的编码利器!
本文讨论了在Apple M1 Max Mac上使用Zoo Code本地运行Qwen 3.6 35b混合专家模型,突出其作为电池供电的编码助手的能力。
2.6B 参数模型支持工具调用和 128K 上下文,现可在手机上以 30 tok/s 运行
Liquid AI 发布了 LFM2.5-2.6B,这是一个 2.69B 参数模型,支持 128K 上下文和工具调用,专为多步骤智能体工作流优化,可在手机上以 30 tok/s 运行,Q4_K_M GGUF 文件约 1.67GB。不过,与更大的模型相比,其在编码和知识密集型任务上仍然较弱。