我以为在标准智能手机上运行大规模模型已经非常了不起了,但

Reddit r/AI_Agents 工具

摘要

bigedgeonmoe开源代码库的创建者使得在移动设备和消费级PC上运行大规模MoE模型(高达120B参数)成为可能,在中端手机上实现了Qwen 35B模型每秒6个token的速度。

大家好,我是 bigedgeonmoe 的创建者,这是一个开源代码库,允许你在移动设备或消费级PC上运行大规模MoE模型(从Qwen 35B到开源的120B模型)。而且速度也相当不错:Qwen 35B(Q4)在一台拥有12GB RAM的中端手机上可以达到每秒6个token。诚然,目前还没有具体的应用场景(至少没有明显的),但我看到其他项目在Mac上做同样的事情(使用高端GPU和RAM)走红了,而我的项目则完全在CPU上处理。此外,它相对于llama.cpp是模块化的,只要llama.cpp支持,任何模型或量化方法都能工作;而且,如果有新模型出现,注册架构只需要一行代码。抱歉发了这么多牢骚,但这确实是我倾注了大量心血的项目。
查看原文

相似文章

MobileMoE:扩展端侧混合专家模型

Hugging Face Daily Papers

MobileMoE 引入了高效的端侧混合专家语言模型,参数规模低于十亿,在性能和效率上均优于密集基线模型和现有的 MoE 模型。这些模型在开源数据集上训练,并在商用智能手机上展现出显著的加速效果。