我在不到20美元的CPU芯片上,以不足512MiB的内存运行了Qwen3.5-0.8B
摘要
作者在10-20美元的Amlogic A113X CPU芯片上,使用自定义C运行时运行了Qwen3.5-0.8B,实现了1.82 tok/s的解码速度和低于490 MiB的峰值RSS,证明了小型LLM推理可以在没有GPU的已部署边缘硬件上运行。
ARC-Easy 上得分 4/5。这是一个包含5个案例的冒烟测试,使用贪婪解码,评分规则在运行前已固定。不是官方基准测试。该芯片是 Amlogic A113X:2017年的四核 Cortex-A53,价格在10-20美元级别,没有 NPU,没有 GPU。它位于一个带有2GB内存的 ThirdReality 智能家居中枢中。我为它编写了一个自定义的 C 运行时。单一的静态二进制文件,没有 Python,没有 llama.cpp。设备端实测:预填充 2.92 tok/s,稳定解码 1.82 tok/s,峰值 RSS 490 MiB(零交换),CPU 约334%(4核)。答错的那道题是“哪种技术是最近开发的?”——模型选了电视,正确答案是蜂窝电话。我认为对于0.8B模型来说,这个结果是可以接受的。为什么这样做:内存很昂贵。如果推理能放进490 MiB内存,它就能在已部署的现场硬件上运行——智能家居中枢、网关,以及没有厂商软件栈支持的1GB板卡。方法是提前为一个固定的CPU目标编译一个固定的模型,而不是一个在加载时接受任意模型的通用运行时。解码吞吐量受内存带宽除以每个token的字节数的限制,而GPU并不在这个等式之中。在实现了4.42倍的内核加速后,这次运行实际上仍然是计算受限的,所以还有提升空间。作为对比,同一模型在 M3 Pro 上使用通用 C 运行时,解码速度为 2.39 tok/s。A113X 与之相差不到25%。我的看法是:很多推理并不需要GPU。也许世界已经变了,而 Nvidia 没有理由指出这一点。包含确切提示词、输出、时序和哈希的完整报告:https://github.com/baryhuang/cpu-llms-in-c/tree/main/models/qwen3.5-0.8b/benchmarks/arc-easy-5 仓库:https://github.com/baryhuang/cpu-llms-in-c/tree/main/models/qwen3.5-0.8b 我正在学习,也在寻找合作者。我会帮你为你的CPU构建一个模型。
相似文章
在 8GB 显存和 32GB 内存上运行 Qwen3.6 35b a3b,~190k 上下文
作者分享了一种高性能的本地推理配置,使用支持 TurboQuant 的修改版 llama.cpp,在硬件受限(8GB 显存、32GB 内存)的情况下运行 Qwen3.6 35B A3B,实现了 ~37-51 tok/sec 的生成速度,并支持 ~190k 上下文。
在搭载RTX 4060(8GB)的笔记本电脑上运行Qwen3.6-35B-A3B——哪些有效、哪些无效以及一个令人意外的推测解码结果
详细记录了在8GB笔记本GPU上运行Qwen3.6-35B-A3B MoE模型的经历,涵盖有效优化(如--no-mmap和VRAM余量)、意料之外的发现(推测解码相比基准测试提升26%的速度)以及Windows和CPU瓶颈的陷阱。
在Zeus(小米12 Pro,12GB RAM)上运行Qwen 3.6 35B MoE(Q4_K_M)
演示在搭载12GB RAM的小米12 Pro上以Q4_K_M量化方式运行Qwen 3.6 35B MoE模型,展示了在移动设备上进行本地AI推理。
@iotcoi:Qwen3.6-27B-FP8 + Dflash + DDTree,256k 上下文,10 个智能体,单颗 49W GB10 上峰值 200 tokens/s,平均解码 136 tokens/s
量化版 27B Qwen3.6 在单颗 49W GB10 GPU 上借助 Dflash+DDTree 优化,256k 上下文、10 智能体并发,峰值达 200 tok/s,平均 136 tok/s。
实验:Qwen3.8-2.4T-A95B 在 RTX 5090 + RTX 5060 Ti 上本地运行,约 0.80 tok/s
一个实验,使用 llama.cpp 在双消费级 GPU(RTX 5090 + 5060 Ti)上本地运行 Qwen3.8-2.4T-A95B MoE 模型,启用 MTP 推测解码后达到约 0.8 tok/s。