Kimi K3 权重今天发布。我们本周将在A100、H200和B300上部署,而A100的内存需求已经显得很紧张了
摘要
Kimi K3 权重今日发布。该模型拥有2.8万亿参数、MoE架构(896个专家)、100万上下文、视觉能力以及MXFP4量化。在A100和H200上部署需要多节点,但单个B300节点即可容纳。预计本周末将公布各GPU配置下的tok/s、ttft及每百万token成本等基准数据。
简而言之;我们将在A100(没错,我们会尝试看看能否撑住)、H200和B300上托管K3。本周内会给出A100和H200的结果,同时本周末搭建B300集群,结果可能下周出来。权重预计今天上传到Hugging Face(Moonshot承诺7月27日)。从他们的平台文档已知信息:总参数2.8万亿,MoE架构有896个专家,每个token激活16个专家,100万上下文,支持视觉。由于他们使用MXFP4进行了量化感知训练,下载量应在1.4TB左右。
我们坐下来仔细计算了内存需求,既然大家可能都准备拉取权重,这里就分享一下。我们拥有A100 80GB、H200和B300的容量,原本计划在这三者上都跑起来。但当我们实际计算内存时:8块A100共640GB,而权重约1.4TB,这意味着在分配KV缓存之前就需要三个节点。更糟糕的是,安培架构没有FP4甚至FP8张量核心,所以要么反量化,要么运行INT4内核——而这并非此次发布的目标。我们仍然会进行基准测试,因为总该有人拿出真实数据,但我们预计结果会很惨淡!
8块H200大约1.13TB,仍然无法放入一个节点,最少需要两节点配置,每个token都要承担互联成本。8块B300大约2.3TB,这是唯一能将整个模型放入单节点并留有长上下文KV缓存空间的配置。而且Blackwell具有原生FP4支持,这显然就是Moonshot量化所针对的架构。这些B300本周末将上线,我们会在本周末搭建集群——目前所有提前预订硬件的人都是在不了解条款的情况下进行的。Moonshot自己的模型卡也异常诚实地指出了弱点:如果智能体框架截断其思考历史,质量会下降;在模棱两可的情况下,模型倾向于直接行动而不是询问;并且他们承认即使基准测试接近,聊天体验仍然落后于Fable 5和Sol。本周末前我们将提供所有三种GPU配置下的tok/s、ttft和每百万token成本数据。如果您在测试矩阵中希望包含特定的批次大小、上下文长度或并行设置,请评论,我们会添加。
相似文章
@levie: k3 模型权重已到达
Kimi.ai 发布了 Kimi K3 的模型权重和技术报告,这是一个 2.8T 参数的 MoE 模型,具有原生视觉理解和 1M token 上下文窗口,声称每单位计算智能提升 2.5 倍。
Kimi K3 今日开放权重——真的有人在用中国AI模型取代Claude或Codex吗?
月之暗面(Moonshot AI)开放了Kimi K3的模型权重,这是一个3T参数的前沿模型,专注于长周期编程、仓库级上下文和工具使用,支持自托管和微调。
Kimi K3 权重将于27日发布。
Kimi K3 模型权重将于27日发布。
Kimi K3 架构概述与笔记
Sebastian Raschka提供了开放权重的Kimi K3模型架构概述,重点介绍了其从480亿到2.8万亿参数的扩展、新的LatentMoE和注意力残差组件、移除RoPE改用NoPE,以及原生多模态支持。该模型强调推理效率,并达到前沿性能水平。
Kimi K3 明天开放权重!
Kimi K3 将于明天发布开放权重,这是开源的一大胜利,预计将催生新的推理提供商。