@linexjlin: K2.6 花了 12 个小时, 在 Mac 上用 zig 语言 从 0 写了一个 LLM 推理引擎并,并将 qwen 3.5 0.8B 推理速度由 15 tok/s 优化到了 193.1 tok/s
摘要
Developer built a Zig-based LLM inference engine from scratch on Mac in 12h, boosting Qwen 3.5 0.8B speed from 15 to 193 tok/s.
查看缓存全文
缓存时间: 2026/04/21 10:00
K2.6 花了 12 个小时, 在 Mac 上用 zig 语言 从 0 写了一个 LLM 推理引擎并,并将 qwen 3.5 0.8B 推理速度由 15 tok/s 优化到了 193.1 tok/s
相似文章
@sanbuphy: K2.6 成功在 Mac 本地下载并部署了 Qwen3.5-0.8B 模型,通过使用小众 Zig 语言实现并优化模型推理,证明了新模型的泛化能力。经过 4,000 多次工具调用,超过 12 小时的不间断运行,K2.6 模型共迭代了 14 …
K2.6在Mac本地成功部署Qwen3.5-0.8B模型,使用Zig语言实现推理优化,经过14轮迭代将吞吐量从约15 tokens/s提升至约193 tokens/s,比LM Studio快20%。
@nicekate8888: 最近二十天我都在折腾一件事——怎么让 Qwen3.6-27B 在我的 Mac 上跑得又快又好。 一开始我用 Unsloth Q5,18 tok/s,风扇呼啦呼啦响。 后来换成 MLX 6bit + DFlash,提到 22 tok/s,还…
用户分享在Mac上通过不同量化方法(Unsloth Q5、MLX 6bit + DFlash、MTPLX 4bit)优化Qwen3.6-27B推理速度的经验,最终达到43 tok/s。
@unwind_ai_:中国 Kimi K2.6 居然自主在 Mac 上用 Zig 写了个本地推理运行时,比 LM Studio 快 20%
Kimi K2.6 自主迭代 14 轮、调用工具 4,000+ 次,在 Mac 上用 Zig 写出本地推理运行时,性能比 LM Studio 高 20%,全程无人干预,已开源。
@Xudong07452910: Hacker News 上有一篇评论区火了的文章:Qwen 3.6 27B 是本地开发的理想选择。 核心发现是:密集参数模型、原生支持 256k 上下文,在 MacBook Max M5 上跑 Q8_0 量化版能达到 30 tokens/…
Qwen 3.6 27B is a dense 27B model that achieves impressive performance on local hardware with 256k context, running at 30 tokens/s on MacBook Max M5 and 50 tokens/s on RTX 5090, and is considered by some as the first local model with true general intelligence.
@jun_song: MLX 的新引擎正处于开发的最后阶段。刚刚在一台 MacBook(116GB)上运行 GLM-5.2,达到 41.8…
Jun Song 宣布 MLX 新引擎进入最终开发阶段,在 MacBook 上以 256k 上下文窗口达到 41.8 tok/s,仅有约 4% 质量损失,代表着显著的性能提升。