@UnTalNixon_exe: 忘掉GPU和百万美元集群吧。他们刚刚让全球最大的开源模型(Kimi K3 – 2.78万亿参数)……
摘要
一个名为 kimi-k3-in-c 的新工具,在单个 CPU 上以低至 8.24 GB 的内存运行 2.78T 参数的 Kimi K3 开源模型,从磁盘流式加载专家,并以每 token 10-32 秒的确定性输出运行。
查看缓存全文
缓存时间: 2026/08/05 18:27
忘掉 GPU 和百万美元的集群吧。
他们刚刚让全球最大的开源模型(Kimi K3 – 2.78 万亿参数)在单颗 CPU 上运行,仅需 8.24 GB 内存。
它叫做 kimi-k3-in-c。
→ 完整引擎:176 KB 纯 C99
→ 零框架、零 BLAS、零 CUDA、零 GPU
→ 1.56 TB 的检查点存于磁盘
→ 每个 token 只激活 896 个专家中的 16 个
→ 其余专家按需流式加载
→ 内存是一个旋钮:8 GB、32 GB、128 GB 或 224 GB
→ 输出逐位相同
在 8 GB 下大约 32 秒/token。内存更大时降到约 10 秒/token。
它对于聊天来说并不快……但它能跑。而且是确定性的、经过验证的。
这是我们在笔记本电脑上拥有 AI 超级计算机方面最接近的一次。
仓库
有人跑过吗?你用的是什么预设?
相似文章
使用29 GB内存以0.50 tok/s运行Kimi K3
WASTE是一个新的开源C语言推理引擎,它从磁盘流式加载专家权重,在仅29 GB内存的消费级笔记本电脑上运行拥有2.78万亿参数的Kimi K3模型,实现了0.49–0.54 tokens/s的速度。
@Saboo_Shubham_:有人刚刚在单个CPU和8.24 GB内存环境下运行了拥有2.78万亿参数的Kimi k3模型。100%开源。
据报道,有人仅用8.24 GB内存就在单个CPU上运行了拥有2.78万亿参数的开源Kimi k3模型,展现了极高的效率。
Kimi K3 完整模型在 16x GB10 集群上运行,速度超过 20 tps
Kimi K3 完整模型在 16x GB10 集群上运行,平均每秒处理 20+ 个 token,并计划发布 vllm 镜像和说明。
在 C 语言中、于 CPU 上运行 Kimi K3(c99 和 cpu)
一个项目声称可以通过从 NVMe SSD 流式加载专家权重并使用 MXFP4 压缩,在仅有 8GB 内存的 CPU 上运行拥有 2.78T 参数的 MoE 模型 Kimi K3,以速度换取内存效率。
用户成功通过25GbE以太网在80块RTX 5090上运行Kimi K3。
用户使用仅GDDR7和以太网(无HBM)在80块RTX 5090 GPU上运行Kimi K3,这是一个2.8T参数的开放权重MoE模型,实现了单流20 tok/s,这是首个在消费级硬件上运行的前沿模型。