稀疏设计(5分钟阅读)

TLDR AI 模型

摘要

Moonshot的Kimi K3是一个2.8万亿参数的开源权重模型,拥有896个专家(每个token激活16个),体现了在保持活跃计算不变的情况下扩大总参数的趋势,并使用注意力压缩来减少KV缓存大小,使得前沿推理更容易实现,但存储成本较高。

Kimi K3每个token激活896个专家中的16个。虽然总参数增加了,但在过去三个版本中,活跃参数几乎没有增长。策略似乎是在保持每个token的计算量大致不变的同时,不断膨胀总容量。在固定的训练计算预算下,更多的专家意味着更低的损失,并且模型从相同的FLOPs中学到更多。开源实验室发现,购买智能最便宜的方式是花费容量。
查看原文
查看缓存全文

缓存时间: 2026/07/21 21:28

# 稀疏设计 来源:https://www.akashbajwa.co/p/sparse-by-design 7月27日,月之暗面发布Kimi K3检查点时,这将是史上最大的开源权重模型:2.8万亿参数、100万token上下文窗口、原生多模态,其基准测试成绩超越Opus 4.8,大约落后Fable 5和GPT-5.6一个代际。 舆论焦点都集中在2.8万亿上。 更重要的数字是16。 K3每个token激活896个专家中的16个——每次前向传播中,其专家权重的激活比例不到2%。这并非实现细节,而是开源模型中最一贯的架构趋势(迄今为止)的终结点。 [图片链接](https://substackcdn.com/image/fetch/$s_!Mugo!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F746df00d-2c0c-431b-976d-f1c74e770a1c_2436x1832.png) 自Mixtral以来,总参数增长了约20倍,仅在过去十二个月内就增长了约3倍。 活跃参数几乎没怎么增长:27个月内一直维持在17-49B的区间内。月之暗面在九个月内发布了K2、K2.5和K2.6,骨架完全相同——1T总参数、32B活跃参数——三个版本,**活跃参数零增长。** 存在一些离散点(GLM-5.2的稀疏度比V4-Pro*低*),所以这是一种有方差的趋势,而非定律。但方向是明确的:保持每个token的计算量大致持平,无情地膨胀总容量。 为什么?因为在固定训练计算预算下,专家越多,损失越低。模型从相同的FLOPs中学到更多。而代价由一种资源支付——存储,它有廉价层级;而非另外两种稀缺且受限的资源:计算和内存带宽。 开源实验室发现,购买智能最便宜的方式是投入容量。 稀疏性在某种程度上是一种适应:当FLOPs受限时,你会扩展出口管制之外的维度。 尽管专家权重变得越来越稀疏,但更长的上下文窗口会增长KV缓存,而缓存每个token都要从内存中加载,就像权重一样。 这就是伴随趋势堵上漏洞的地方。注意力压缩(DeepSeek的CSA/HCA混合架构、多头潜在注意力、K3的新注意力架构)正在压缩缓存。V4-Pro在100万上下文下的KV缓存是其前代产品的**10%**。 越稀疏的专家,每个token移动的权重字节越少。压缩注意力,每个token移动的缓存字节越少。模型路线图上没有任何东西能减少*存储*的字节数。那个数字只会上升。 每一种架构趋势都指向远离峰值带宽瓶颈,而向容量作为约束条件。 稀疏性是使2.8T模型能够被服务的根本原因。正如Altimeter的Jamin Ball在[文章](https://cloudedjudgement.substack.com/p/clouded-judgement-71026-own-your)中关于服务前沿开源模型真实成本的分析: > *历史上影响开源模型定价(任何人都能服务它)的一股力量,当“任何人”意味着“任何拥有超级节点且为全新注意力架构调优过服务栈的人”时,已经大大减弱。* > *一个2.8T模型的服务成本底线可能比1T模型结构性更高,无论谁来服务。K2时代的10倍折扣(部分)存在,是因为那些模型既更小,又按薄利服务。K3只给了你后者。两年来,“开源”和“廉价”被混用,但它们从来不是一回事。* 得益于稀疏性,每个token的推理运行成本应该相当于一个中等规模稠密模型的成本。 从这个意义上说,稀疏性已经民主化了前沿推理的*计算*。 但它对容量毫无帮助。在MXFP4精度下,仅K3的权重就约1.4TB。需要十多个H200才能加载它们,还不算100万窗口上的KV缓存——这就是为什么月之暗面推荐“64个或更多加速器”的超级节点配置。 不断增加的稀疏性将成本从计算转移到存储。 在低批量环境下(例如希望自托管的企业),一个合理的情景是采用分层内存(或内存层次结构),最常用的专家存储在HBM中,而不常用的专家存储在廉价DRAM中。对MoE模型来说,这类似于一种幂律分布。 这种成本/效率优势在超大规模环境中会消失。生产服务器会批量处理数百个并发请求,每个token选择自己的16个专家。总体上,一个完整的批次在每次前向传播中会点亮896个专家中的大多数。没有真正冷却的专家。因此,前沿服务将*所有*专家都放在跨64+个加速器的机架级HBM中,并将token路由到存储其专家的芯片上。在这种模式下,稀疏性根本不会减少购买的HBM,而是将带宽需求转化为HBM*容量*需求。更多堆叠,更少流式。 在低利用率下,单一重度用户(即只有少量并发会话的企业)中,专家确实是冷却的,将模型分层存储在系统DRAM中,同时热加载专家是可行的。这恰恰是开源权重最重要的模式,因为下载检查点的全部意义就是在超大规模云之外运行它。稀疏性是万亿级模型自托管路径存在的唯一原因。 **路由至关重要。** 当今的路由器大致均匀地将token分布在专家之间,这就是热/冷分层层在规模上失效的原因。如果实验室训练具有刻意局部性的路由器(即流行专家、可预测路径),则即使在批量大的情况下,真正的分层也变得可行,廉价容量的DRAM阵营将获得更大优势。

相似文章

Kimi K3,以及我们还能从pelican基准测试中学到什么

Simon Willison's Blog

中国AI实验室Moonshot AI发布了Kimi K3,一个2.8万亿参数的开源权重模型,声称这是首个开源的3T级模型,并在多个基准测试中击败了多个领先模型。文章还讨论了该模型的定价以及一个有趣的pelican SVG基准测试。