我在不到20美元的CPU芯片上,以不足512MiB的内存运行了Qwen3.5-0.8B
摘要
作者在10-20美元的Amlogic A113X CPU芯片上,使用自定义C运行时运行了Qwen3.5-0.8B,实现了1.82 tok/s的解码速度和低于490 MiB的峰值RSS,证明了小型LLM推理可以在没有GPU的已部署边缘硬件上运行。
ARC-Easy 上得分 4/5。这是一个包含5个案例的冒烟测试,使用贪婪解码,评分规则在运行前已固定。不是官方基准测试。该芯片是 Amlogic A113X:2017年的四核 Cortex-A53,价格在10-20美元级别,没有 NPU,没有 GPU。它位于一个带有2GB内存的 ThirdReality 智能家居中枢中。我为它编写了一个自定义的 C 运行时。单一的静态二进制文件,没有 Python,没有 llama.cpp。设备端实测:预填充 2.92 tok/s,稳定解码 1.82 tok/s,峰值 RSS 490 MiB(零交换),CPU 约334%(4核)。答错的那道题是“哪种技术是最近开发的?”——模型选了电视,正确答案是蜂窝电话。我认为对于0.8B模型来说,这个结果是可以接受的。为什么这样做:内存很昂贵。如果推理能放进490 MiB内存,它就能在已部署的现场硬件上运行——智能家居中枢、网关,以及没有厂商软件栈支持的1GB板卡。方法是提前为一个固定的CPU目标编译一个固定的模型,而不是一个在加载时接受任意模型的通用运行时。解码吞吐量受内存带宽除以每个token的字节数的限制,而GPU并不在这个等式之中。在实现了4.42倍的内核加速后,这次运行实际上仍然是计算受限的,所以还有提升空间。作为对比,同一模型在 M3 Pro 上使用通用 C 运行时,解码速度为 2.39 tok/s。A113X 与之相差不到25%。我的看法是:很多推理并不需要GPU。也许世界已经变了,而 Nvidia 没有理由指出这一点。包含确切提示词、输出、时序和哈希的完整报告:https://github.com/baryhuang/cpu-llms-in-c/tree/main/models/qwen3.5-0.8b/benchmarks/arc-easy-5 仓库:https://github.com/baryhuang/cpu-llms-in-c/tree/main/models/qwen3.5-0.8b 我正在学习,也在寻找合作者。我会帮你为你的CPU构建一个模型。
相似文章
在 8GB 显存和 32GB 内存上运行 Qwen3.6 35b a3b,~190k 上下文
作者分享了一种高性能的本地推理配置,使用支持 TurboQuant 的修改版 llama.cpp,在硬件受限(8GB 显存、32GB 内存)的情况下运行 Qwen3.6 35B A3B,实现了 ~37-51 tok/sec 的生成速度,并支持 ~190k 上下文。
现在可以在 AMD NPU 上通过 FastFlowLM 运行 Qwen 3.8 27B(解码速度约 1 tps)
AMD 的 ROCm/FastFlowLM 现已支持在 Ryzen AI XDNA2 NPU 上运行 Qwen 3.8 27B(以及其它 MoE、视觉、音频和嵌入模型),无需 GPU,最高支持 256k 上下文,运行时仅 17 MB 轻量级——不过 27B 模型的解码速度被指出仅为较慢的 1 token/s。
在搭载RTX 4060(8GB)的笔记本电脑上运行Qwen3.6-35B-A3B——哪些有效、哪些无效以及一个令人意外的推测解码结果
详细记录了在8GB笔记本GPU上运行Qwen3.6-35B-A3B MoE模型的经历,涵盖有效优化(如--no-mmap和VRAM余量)、意料之外的发现(推测解码相比基准测试提升26%的速度)以及Windows和CPU瓶颈的陷阱。
@Oluwaphilemon1: 在12GB RTX 5070上运行的Qwen3.8-Flash-Next速度只有15 tok/s,显然这不够好。所以与其买更大的G…
一位用户构建了一个名为Strata的开源推理引擎,用于优化Qwen3.8-Flash-Next在普通硬件上的运行,将速度从最初的15 tok/s提升到了最高65.1 tok/s。
在Zeus(小米12 Pro,12GB RAM)上运行Qwen 3.6 35B MoE(Q4_K_M)
演示在搭载12GB RAM的小米12 Pro上以Q4_K_M量化方式运行Qwen 3.6 35B MoE模型,展示了在移动设备上进行本地AI推理。