@elliotarledge:对于那些好奇我为什么使用 Kimi Linear 巨型内核而不是 Qwen 3.6 的人,首先看看参数数量。一个是……
摘要
Elliot Arledge 解释了他为什么更喜欢使用 Kimi Linear 巨型内核而不是 Qwen 3.6 来提升内核性能,比较了参数数量、层同步、隐藏维度和架构特定的优化。讨论强调 Kimi Linear 架构更适合巨型内核实现,特别是在 RTX PRO 6000 Blackwell 上进行 batch-1 解码时。
查看缓存全文
缓存时间: 2026/07/03 04:30
对于好奇我为什么使用 Kimi Linear megakernel 而非 Qwen 3.6 的人,首先看参数数量。一个是350亿参数,一个是480亿参数,而两者都只有30亿活跃专家(active experts)。所以它们在预测单个 token 时,使用的总权重大致相同,区别在于总参数量。
现在注意一下,其中一个模型有27层,另一个有40层。当层数增加时,通常意味着总体同步操作更多。同步包括归一化(normalization)、softmax,或者需要遍历整个序列获取全局行号后再应用回该行,甚至可能需要多次执行这些操作。
这些问题会显著成为单 token 预测速度的瓶颈,因为线程必须等待其他线程在屏障处对齐,才能继续进入下一层。因此,如果减少层数,核函数(kernel)的优化精力就能更多地集中在如何从单层中榨取更高性能,同时减少需要执行的同步总次数——因为总层数变少了。
如果隐藏维度(hidden dimension)更高,意味着有更多计算量。专家模块本身不变。如果 MoE 中间层长度(从 up projection 起)翻倍,那么需要投入的计算量也更大。如果专注于多头潜在注意力(multi-head latent attention),则需要在注意力层内更加巧妙,因为这是在压缩模型的内存;相比之下,分组查询注意力(group query detention)非常静态且已被充分研究。
因此,能否将一种有趣的注意力类型与大内核(megakernel)融合,是我做出的一个品味判断。对于线性类型而言,这点影响不大;但我发现,对于像 Kimi Delta Attention(KDA)这样的中国实验室架构来说,如果 Kimi 实验室在该架构上让模型达到饱和,那么当 Kimi 架构专用核函数表现良好而其他大内核不行时,我们就知道为什么它在某些基准测试中性能出色了。
这为我们提供了一些情报:实验室是否专注于中国发明的架构。至于词表大小(vocab size),我们可以减少对总核函数数量的担忧——如果我有两个不同的核函数,一个针对25万的大词表,另一个只用一个核函数并将词表大小缩减50%,从而使词表在大内核启动中更易处理,那么从大内核角度看,这要可行得多。
因此,几乎在每一个维度上,Kimi Linear 架构都比广为人知的 Qwen 3.6 架构更适合作为大内核——而后者人们通常会在 RTX 3090 上运行以用于本地智能体工作流。
33%不是50%,我搞错了
这就是我制作它的原因
相似文章
@thealexker: Kimi-K3 发布中未被充分重视的亮点:> 早期 K3 编写了后期开发阶段的大部分内核 > 它…
Kimi.ai 发布了 Kimi K3,一个拥有 2.8 万亿参数的多模态模型,支持 100 万上下文,采用了新颖的 Delta Attention 和 Attention Residuals,以及包含 MiniTriton 编译器的自优化堆栈。该模型实现了最高 6.3 倍的解码速度提升和约 25% 的训练效率提升。
@SemiAnalysis_: 与对DeepSeek R1的恐慌类似,一些不明真相的人认为Kimi K3使用线性注意力(KDA)对……不利
SemiAnalysis认为,与无知的恐慌相反,Kimi K3的线性注意力(KDA)对NVIDIA、HBM、DRAM和网络并非不利,并解释了为什么降低KV-cache需求实际上是有益的。
@noisyb0y1: 有人逆向工程了Kimi K2.6,这彻底终结了“更大模型=更优AI”的说法。1万亿参数…
对Kimi K2.6的逆向工程分析显示,其架构优先考虑编排和技能注入,而非原始参数数量,通过多智能体协作无需再训练即可获得高SWE-Bench分数。
@HotAisle:Kimi K2.6 + DFlash:8×MI300X 上 508 tok/s,自回归基线 90 tok/s 提升至 5.6 倍
Kimi K2.6 搭配 DFlash 推理系统在 8×AMD MI300X 上实现 508 tokens/s,相比 90 tokens/s 基线零质量损失地提升 5.6 倍吞吐。
Kimi K3 编程基准测试
Kimi K3 编程基准测试文章,讨论 Kimi K3 模型在编程任务上的表现。