我在不到20美元的CPU芯片上,以不足512MiB的内存运行了Qwen3.5-0.8B

Reddit r/LocalLLaMA 工具

摘要

作者在10-20美元的Amlogic A113X CPU芯片上,使用自定义C运行时运行了Qwen3.5-0.8B,实现了1.82 tok/s的解码速度和低于490 MiB的峰值RSS,证明了小型LLM推理可以在没有GPU的已部署边缘硬件上运行。

ARC-Easy 上得分 4/5。这是一个包含5个案例的冒烟测试,使用贪婪解码,评分规则在运行前已固定。不是官方基准测试。该芯片是 Amlogic A113X:2017年的四核 Cortex-A53,价格在10-20美元级别,没有 NPU,没有 GPU。它位于一个带有2GB内存的 ThirdReality 智能家居中枢中。我为它编写了一个自定义的 C 运行时。单一的静态二进制文件,没有 Python,没有 llama.cpp。设备端实测:预填充 2.92 tok/s,稳定解码 1.82 tok/s,峰值 RSS 490 MiB(零交换),CPU 约334%(4核)。答错的那道题是“哪种技术是最近开发的?”——模型选了电视,正确答案是蜂窝电话。我认为对于0.8B模型来说,这个结果是可以接受的。为什么这样做:内存很昂贵。如果推理能放进490 MiB内存,它就能在已部署的现场硬件上运行——智能家居中枢、网关,以及没有厂商软件栈支持的1GB板卡。方法是提前为一个固定的CPU目标编译一个固定的模型,而不是一个在加载时接受任意模型的通用运行时。解码吞吐量受内存带宽除以每个token的字节数的限制,而GPU并不在这个等式之中。在实现了4.42倍的内核加速后,这次运行实际上仍然是计算受限的,所以还有提升空间。作为对比,同一模型在 M3 Pro 上使用通用 C 运行时,解码速度为 2.39 tok/s。A113X 与之相差不到25%。我的看法是:很多推理并不需要GPU。也许世界已经变了,而 Nvidia 没有理由指出这一点。包含确切提示词、输出、时序和哈希的完整报告:https://github.com/baryhuang/cpu-llms-in-c/tree/main/models/qwen3.5-0.8b/benchmarks/arc-easy-5 仓库:https://github.com/baryhuang/cpu-llms-in-c/tree/main/models/qwen3.5-0.8b 我正在学习,也在寻找合作者。我会帮你为你的CPU构建一个模型。
查看原文

相似文章