@SemiAnalysis_: 与对DeepSeek R1的恐慌类似,一些不明真相的人认为Kimi K3使用线性注意力(KDA)对……不利
摘要
SemiAnalysis认为,与无知的恐慌相反,Kimi K3的线性注意力(KDA)对NVIDIA、HBM、DRAM和网络并非不利,并解释了为什么降低KV-cache需求实际上是有益的。
查看缓存全文
缓存时间: 2026/07/20 11:30
类似于对DeepSeek R1的恐慌,有些缺乏专业知识的人认为Kimi K3使用线性注意力(KDA)对NVIDIA、HBM、DRAM和网络不利,因为它对KV缓存的需求相对较低。事实恰恰相反,原因如下。 1/8
Kimi K3实际上对NVIDIA非常有利,因为大模型推理正是NVL72的强项。由于K3拥有超过2.8万亿参数,需要大规模扩展域来存储其权重。 2/8
其次,尽管Kimi Delta Attention对KV缓存传输的网络需求降低了多达10倍,但其庞大的权重需要更多网络带宽来实现一项名为WideEP的优化——该优化将权重分布到不同GPU上。 3/8
WideEP将896个专家分布到多个GPU上,使得每个GPU的HBM仅包含少量专家,从而优化每令牌的内存使用和计算利用率。 4/8
然而,WideEP优化的一个不幸缺陷是消耗大量网络带宽。该优化高度适配GB200/GB300 NVL72这类机架级系统,其铜背板提供的带宽比同级别DGX B200系统高出18倍。 5/8
此外,由于权重占用超过1.5 TB的HBM容量,即使是在相对较低的用户并发下,K3的KDA和Gated MLA的KV缓存也需要卸载到CPU DDR5和NVMe上,因为HBM中剩余的空间极少。 6/8
Kimi团队自身也指出,实现K3的最佳推理需要一个至少包含64个芯片的大型扩展域机架。 7/8
最后,杰文斯悖论意味着:使注意力机制更高效将推动AI更广泛的应用,最终反而需要更多GPU、HBM、DRAM和网络——而非更少。 8/8
相似文章
@elliotarledge:对于那些好奇我为什么使用 Kimi Linear 巨型内核而不是 Qwen 3.6 的人,首先看看参数数量。一个是……
Elliot Arledge 解释了他为什么更喜欢使用 Kimi Linear 巨型内核而不是 Qwen 3.6 来提升内核性能,比较了参数数量、层同步、隐藏维度和架构特定的优化。讨论强调 Kimi Linear 架构更适合巨型内核实现,特别是在 RTX PRO 6000 Blackwell 上进行 batch-1 解码时。
@thealexker: Kimi-K3 发布中未被充分重视的亮点:> 早期 K3 编写了后期开发阶段的大部分内核 > 它…
Kimi.ai 发布了 Kimi K3,一个拥有 2.8 万亿参数的多模态模型,支持 100 万上下文,采用了新颖的 Delta Attention 和 Attention Residuals,以及包含 MiniTriton 编译器的自优化堆栈。该模型实现了最高 6.3 倍的解码速度提升和约 25% 的训练效率提升。
@noisyb0y1: 有人逆向工程了Kimi K2.6,这彻底终结了“更大模型=更优AI”的说法。1万亿参数…
对Kimi K2.6的逆向工程分析显示,其架构优先考虑编排和技能注入,而非原始参数数量,通过多智能体协作无需再训练即可获得高SWE-Bench分数。
关于Kimi K3:其能力与相关不满(70分钟阅读)
Kimi K3是Moonshot AI推出的2.8T参数开放模型,基准测试表现强劲,但可能过度优化,且落后顶级闭源模型数月。它从Claude蒸馏而来,其发布可能先于IPO。
@nrehiew_: > LatentMoE > 896个专家中激活16个 > Kimi Delta Attention 和 AttnRes > 2.5倍更高效的扩展 这是……
讨论具有极端稀疏性(16/896专家)的LatentMoE架构以及Kimi Delta Attention,声称有2.5倍更高效的扩展,并猜测Kimi K3模型的能力。