一个纯C从头编写的、仅支持CPU的Qwen 3精简推理引擎
摘要
一个纯C从头实现的、仅支持CPU的Qwen 3模型最小推理引擎
暂无内容
相似文章
在 8GB 显存和 32GB 内存上运行 Qwen3.6 35b a3b,~190k 上下文
作者分享了一种高性能的本地推理配置,使用支持 TurboQuant 的修改版 llama.cpp,在硬件受限(8GB 显存、32GB 内存)的情况下运行 Qwen3.6 35B A3B,实现了 ~37-51 tok/sec 的生成速度,并支持 ~190k 上下文。
CPU设置的首次尝试 - MS-02 Intel 285hx,尝试Qwen3、Qwen3.6和Gemma4
在基于Intel 285hx处理器(MS-02)的CPU配置上测试AI模型Qwen3、Qwen3.6和Gemma4。
我在不到20美元的CPU芯片上,以不足512MiB的内存运行了Qwen3.5-0.8B
作者在10-20美元的Amlogic A113X CPU芯片上,使用自定义C运行时运行了Qwen3.5-0.8B,实现了1.82 tok/s的解码速度和低于490 MiB的峰值RSS,证明了小型LLM推理可以在没有GPU的已部署边缘硬件上运行。
在Mac Studio 96GB上运行Qwen3.5-122B:修复了3个使长上下文推理变得可用的bug
修复了qMLX分支中运行Qwen3.5-122B的三个bug,将长上下文推理的预填充时间从几分钟降低到亚秒级;开源了该分支和基准测试脚本。
Qwen 3.8 27B 在Cerebras平台上以1500 tokens/s的速度推出
Cerebras宣布在其推理平台上提供Qwen 3.8 27B模型,速度达1500 tokens每秒,并详细介绍了其模型压缩技术,如量化和剪枝。