我以为在标准智能手机上运行大规模模型已经非常了不起了,但
摘要
bigedgeonmoe开源代码库的创建者使得在移动设备和消费级PC上运行大规模MoE模型(高达120B参数)成为可能,在中端手机上实现了Qwen 35B模型每秒6个token的速度。
相似文章
在Zeus(小米12 Pro,12GB RAM)上运行Qwen 3.6 35B MoE(Q4_K_M)
演示在搭载12GB RAM的小米12 Pro上以Q4_K_M量化方式运行Qwen 3.6 35B MoE模型,展示了在移动设备上进行本地AI推理。
@aehyok: 分享一个开源项目 FreeToken 专门让超大 MoE 模型在消费级电脑上运行的本地推理引擎。 Qwen3.6 35B → 8GB RTX 4060 笔记本电脑 @ 39 tok/s DeepSeek-V4-Flash 284B → R…
FreeToken is an open-source local inference engine designed to run large Mixture-of-Experts (MoE) models on consumer-grade computers, offering significantly faster performance than alternatives like Ollama with easy installation and native GUI.
在老款GTX 1080(8GB显存,128k上下文)上,约30B的MoE模型达到24+ tok/s的推理速度
一位开发者展示了如何使用llama.cpp,通过MoE卸载和TurboQuant KV缓存量化技术,在老款GTX 1080(8GB显存)上以128k上下文运行Qwen 3.6 35B-A3B和Gemma 4 26B-A4B等MoE模型,达到24+ tok/s的推理速度,并揭示了针对Gemma MTP投机解码的优化技巧。
Edge0/Edge0-35B-A3B-preview
Edge0-35B-A3B-preview 是一个稀疏的MoE模型,通过流式专家卸载和量化技术,实现移动设备上的高效AI推理,以低于3 GiB的内存达到15 tok/s的性能。
MobileMoE:扩展端侧混合专家模型
MobileMoE 引入了高效的端侧混合专家语言模型,参数规模低于十亿,在性能和效率上均优于密集基线模型和现有的 MoE 模型。这些模型在开源数据集上训练,并在商用智能手机上展现出显著的加速效果。