用户成功通过25GbE以太网在80块RTX 5090上运行Kimi K3。
摘要
用户使用仅GDDR7和以太网(无HBM)在80块RTX 5090 GPU上运行Kimi K3,这是一个2.8T参数的开放权重MoE模型,实现了单流20 tok/s,这是首个在消费级硬件上运行的前沿模型。
查看缓存全文
缓存时间: 2026/07/28 06:35
我们获得了完整的 Kimi K3,参数规模 2.8T,运行在 80 张 RTX 5090 上。
单流 20 tok/s,首发即用,未经调优。上周我们在同样的集群上将 GLM-5.2 从 30 tok/s 提升到了 110 tok/s。这个数字还会继续攀升。
开源权重领域的首次:前沿智能完全无需 HBM(AI 中最稀缺的硅片)即可服务。仅使用 GDDR7 游戏显卡、普通以太网和官方 MXFP4 权重,无需任何重量化操作。
地球上最强大的开源模型,运行在最通用的 GPU 上。任何实验室、初创公司或大学都能拥有它、探测它、微调它、让智能体运行其上。
@Kimi_Moonshot
Kimi.ai (@Kimi_Moonshot): 发布 Kimi K3 的模型权重和技术报告。
Kimi K3 是我们最强大的模型:一个 2.8T 的 MoE 模型,具有原生的视觉理解能力和 1M token 的上下文窗口。
全新模型架构:每单位计算量的智能提升 2.5 倍,而不仅仅是增加参数。
除此之外
相似文章
Kimi K3 就像展窗里的 F1 赛车。
Moonshot 发布了 Kimi K3,这是一个极其庞大的 AI 模型,即便在配备多块 RTX 6000 Blackwell GPU 的本地工作站上也无法原生运行,促使作者尝试通过破解或蒸馏的方式让它跑起来。
@TheAhmadOsman:今晚RTX 3090用户将能运行Kimi_K3_3T_Q_0.001_K GGUF
Kimi K3模型的量化GGUF版本现已可用,针对RTX 3090 GPU运行进行了优化。
@QuixiAI:@Kimi_Moonshot K2.6 在我的 mi300x 上跑出了 56 tps(单请求),接下来做吞吐测试
Kimi K2.6 在单张 MI300X GPU 上达到 56 token/s,用户计划进一步测试整体吞吐。
MoE的VRAM磁盘缓存使单块DGX Spark上的Kimi 2.7达到340 pp/s和9.6 tg/s
一种详细策略,通过将VRAM用作磁盘缓存,结合统一内存和llama.cpp设置,在单块DGX Spark上为Kimi K2.7实现了340 pp/s和9.6 tg/s。
Kimi K3 架构概述与笔记
Sebastian Raschka提供了开放权重的Kimi K3模型架构概述,重点介绍了其从480亿到2.8万亿参数的扩展、新的LatentMoE和注意力残差组件、移除RoPE改用NoPE,以及原生多模态支持。该模型强调推理效率,并达到前沿性能水平。