@UnTalNixon_exe: 忘掉GPU和百万美元集群吧。他们刚刚让全球最大的开源模型(Kimi K3 – 2.78万亿参数)……

X AI KOLs Timeline 工具

摘要

一个名为 kimi-k3-in-c 的新工具,在单个 CPU 上以低至 8.24 GB 的内存运行 2.78T 参数的 Kimi K3 开源模型,从磁盘流式加载专家,并以每 token 10-32 秒的确定性输出运行。

忘掉GPU和百万美元集群吧。 他们刚刚让全球最大的开源模型(Kimi K3 – 2.78万亿参数)在单个 CPU 上仅用 8.24 GB 内存运行。 它叫 kimi-k3-in-c。 → 完整引擎:176 KB 纯 C99 → 零框架、零 BLAS、零 CUDA、零 GPU → 1.56 TB 检查点保存在磁盘上 → 896 个专家中每个 token 仅激活 16 个 → 其余按需流式加载 → 内存是一个旋钮:8 GB、32 GB、128 GB 或 224 GB → 输出逐位相同 在 8 GB 下大约需要 32 秒/token。内存更大时降到约 10 秒/token。 对于聊天来说它不算快……但它能跑。而且以确定性和可验证的方式运行。 这是我们最接近在笔记本电脑上拥有 AI 超级计算机的一次。 仓库 有人已经跑过它了吗?你用了哪个预设?
查看原文
查看缓存全文

缓存时间: 2026/08/05 18:27

忘掉 GPU 和百万美元的集群吧。

他们刚刚让全球最大的开源模型(Kimi K3 – 2.78 万亿参数)在单颗 CPU 上运行,仅需 8.24 GB 内存。

它叫做 kimi-k3-in-c。

→ 完整引擎:176 KB 纯 C99

→ 零框架、零 BLAS、零 CUDA、零 GPU

→ 1.56 TB 的检查点存于磁盘

→ 每个 token 只激活 896 个专家中的 16 个

→ 其余专家按需流式加载

→ 内存是一个旋钮:8 GB、32 GB、128 GB 或 224 GB

→ 输出逐位相同

在 8 GB 下大约 32 秒/token。内存更大时降到约 10 秒/token。

它对于聊天来说并不快……但它能跑。而且是确定性的、经过验证的。

这是我们在笔记本电脑上拥有 AI 超级计算机方面最接近的一次。

仓库

有人跑过吗?你用的是什么预设?

相似文章

使用29 GB内存以0.50 tok/s运行Kimi K3

Hacker News Top

WASTE是一个新的开源C语言推理引擎,它从磁盘流式加载专家权重,在仅29 GB内存的消费级笔记本电脑上运行拥有2.78万亿参数的Kimi K3模型,实现了0.49–0.54 tokens/s的速度。