一个纯C从头编写的、仅支持CPU的Qwen 3精简推理引擎
摘要
一个纯C从头实现的、仅支持CPU的Qwen 3模型最小推理引擎
暂无内容
相似文章
在 8GB 显存和 32GB 内存上运行 Qwen3.6 35b a3b,~190k 上下文
作者分享了一种高性能的本地推理配置,使用支持 TurboQuant 的修改版 llama.cpp,在硬件受限(8GB 显存、32GB 内存)的情况下运行 Qwen3.6 35B A3B,实现了 ~37-51 tok/sec 的生成速度,并支持 ~190k 上下文。
CPU设置的首次尝试 - MS-02 Intel 285hx,尝试Qwen3、Qwen3.6和Gemma4
在基于Intel 285hx处理器(MS-02)的CPU配置上测试AI模型Qwen3、Qwen3.6和Gemma4。
在Mac Studio 96GB上运行Qwen3.5-122B:修复了3个使长上下文推理变得可用的bug
修复了qMLX分支中运行Qwen3.5-122B的三个bug,将长上下文推理的预填充时间从几分钟降低到亚秒级;开源了该分支和基准测试脚本。
用纯C语言从零构建了一个BitNet推理引擎——在Xeon上比bitnet.cpp快1.8倍(36 tok/s),零依赖 [招募BitNet和Bonsai CPU测试者]
Project Zero 是一个从零构建的 C99 LLM推理引擎,可在 CPU 上运行 BitNet 与 Qwen Bonsai-27B,拥有零外部依赖,在 Xeon 上相比 bitnet.cpp 实现 1.8 倍加速。该项目诚邀社区为这两种模型提供基准测试结果。
Qwen 3.6 27B:本地开发的理想之选
Qwen 3.6 27B 被赞誉为强大的本地 AI 模型,在通用智能方面超越预期,适用于代码生成等实际任务,并能通过 llama.cpp 轻松运行。