用户成功通过25GbE以太网在80块RTX 5090上运行Kimi K3。
摘要
用户使用仅GDDR7和以太网(无HBM)在80块RTX 5090 GPU上运行Kimi K3,这是一个2.8T参数的开放权重MoE模型,实现了单流20 tok/s,这是首个在消费级硬件上运行的前沿模型。
查看缓存全文
缓存时间: 2026/07/28 06:35
我们获得了完整的 Kimi K3,参数规模 2.8T,运行在 80 张 RTX 5090 上。
单流 20 tok/s,首发即用,未经调优。上周我们在同样的集群上将 GLM-5.2 从 30 tok/s 提升到了 110 tok/s。这个数字还会继续攀升。
开源权重领域的首次:前沿智能完全无需 HBM(AI 中最稀缺的硅片)即可服务。仅使用 GDDR7 游戏显卡、普通以太网和官方 MXFP4 权重,无需任何重量化操作。
地球上最强大的开源模型,运行在最通用的 GPU 上。任何实验室、初创公司或大学都能拥有它、探测它、微调它、让智能体运行其上。
@Kimi_Moonshot
Kimi.ai (@Kimi_Moonshot): 发布 Kimi K3 的模型权重和技术报告。
Kimi K3 是我们最强大的模型:一个 2.8T 的 MoE 模型,具有原生的视觉理解能力和 1M token 的上下文窗口。
全新模型架构:每单位计算量的智能提升 2.5 倍,而不仅仅是增加参数。
除此之外
相似文章
在 C 语言中、于 CPU 上运行 Kimi K3(c99 和 cpu)
一个项目声称可以通过从 NVMe SSD 流式加载专家权重并使用 MXFP4 压缩,在仅有 8GB 内存的 CPU 上运行拥有 2.78T 参数的 MoE 模型 Kimi K3,以速度换取内存效率。
Kimi K3 完整模型在 16x GB10 集群上运行,速度超过 20 tps
Kimi K3 完整模型在 16x GB10 集群上运行,平均每秒处理 20+ 个 token,并计划发布 vllm 镜像和说明。
Kimi K3(2.8T)在MacBook Pro上以1 token/s运行,从四个固态硬盘流式传输
Deltafin是一款开源工具,使得能够在像MacBook Pro这样的消费级硬件上运行完整的Kimi K3 2.8T参数模型,通过从固态硬盘流式传输数据,实现约每秒1个token的性能。
@UnTalNixon_exe: 忘掉GPU和百万美元集群吧。他们刚刚让全球最大的开源模型(Kimi K3 – 2.78万亿参数)……
一个名为 kimi-k3-in-c 的新工具,在单个 CPU 上以低至 8.24 GB 的内存运行 2.78T 参数的 Kimi K3 开源模型,从磁盘流式加载专家,并以每 token 10-32 秒的确定性输出运行。
Kimi K3 在家用实验室的首批结果 ~ 4t/s
用户分享了在家用实验室运行 Kimi K3 的首批结果,配置为 768GB DDR5 和 2x5090,使用 llama.cpp 分支和 Q2_K 量化,报告预填充速度为 50-70 tps,解码 tps 随时间增长。