用户成功通过25GbE以太网在80块RTX 5090上运行Kimi K3。

Reddit r/LocalLLaMA 新闻

摘要

用户使用仅GDDR7和以太网(无HBM)在80块RTX 5090 GPU上运行Kimi K3,这是一个2.8T参数的开放权重MoE模型,实现了单流20 tok/s,这是首个在消费级硬件上运行的前沿模型。

我们已成功将完整的Kimi K3(2.8T参数)运行在80块RTX 5090上。 单流20 tok/s,首日运行,未经调优。上周我们使用同一集群将GLM-5.2从30 tok/s提升至110 tok/s。这个数字还会继续攀升。 开放权重的首次:基于零HBM(AI中最稀缺的硅片)提供前沿智能。仅需GDDR7游戏显卡、普通以太网和官方MXFP4权重,无需任何重新量化。 地球上最强大的开放模型,运行在地球上最普及的GPU上。任何实验室、初创公司或大学现在都可以拥有它、探测它、微调它、在上面运行智能体。 @Kimi_Moonshot
查看原文
查看缓存全文

缓存时间: 2026/07/28 06:35

我们获得了完整的 Kimi K3,参数规模 2.8T,运行在 80 张 RTX 5090 上。

单流 20 tok/s,首发即用,未经调优。上周我们在同样的集群上将 GLM-5.2 从 30 tok/s 提升到了 110 tok/s。这个数字还会继续攀升。

开源权重领域的首次:前沿智能完全无需 HBM(AI 中最稀缺的硅片)即可服务。仅使用 GDDR7 游戏显卡、普通以太网和官方 MXFP4 权重,无需任何重量化操作。

地球上最强大的开源模型,运行在最通用的 GPU 上。任何实验室、初创公司或大学都能拥有它、探测它、微调它、让智能体运行其上。

@Kimi_Moonshot

Kimi.ai (@Kimi_Moonshot): 发布 Kimi K3 的模型权重和技术报告。

Kimi K3 是我们最强大的模型:一个 2.8T 的 MoE 模型,具有原生的视觉理解能力和 1M token 的上下文窗口。

全新模型架构:每单位计算量的智能提升 2.5 倍,而不仅仅是增加参数。

除此之外

相似文章

Kimi K3 就像展窗里的 F1 赛车。

Reddit r/LocalLLaMA

Moonshot 发布了 Kimi K3,这是一个极其庞大的 AI 模型,即便在配备多块 RTX 6000 Blackwell GPU 的本地工作站上也无法原生运行,促使作者尝试通过破解或蒸馏的方式让它跑起来。

Kimi K3 架构概述与笔记

Hacker News Top

Sebastian Raschka提供了开放权重的Kimi K3模型架构概述,重点介绍了其从480亿到2.8万亿参数的扩展、新的LatentMoE和注意力残差组件、移除RoPE改用NoPE,以及原生多模态支持。该模型强调推理效率,并达到前沿性能水平。