@elliotarledge:对于那些好奇我为什么使用 Kimi Linear 巨型内核而不是 Qwen 3.6 的人,首先看看参数数量。一个是……

X AI KOLs Timeline 模型

摘要

Elliot Arledge 解释了他为什么更喜欢使用 Kimi Linear 巨型内核而不是 Qwen 3.6 来提升内核性能,比较了参数数量、层同步、隐藏维度和架构特定的优化。讨论强调 Kimi Linear 架构更适合巨型内核实现,特别是在 RTX PRO 6000 Blackwell 上进行 batch-1 解码时。

对于那些好奇我为什么使用 Kimi Linear 巨型内核而不是 Qwen 3.6 的人,首先看看参数数量。一个是 350 亿,一个是 480 亿,而且它们都有 30 亿活跃专家。所以它们总共使用的权重数量大致相同,或者说预测单个 token 时使用的权重数量大致相同,但区别在于总参数数量。 现在注意其中一个有 27 层,另一个有 40 层。当我们有一层时,通常意味着我们会有更多的同步操作。同步操作包括归一化、softmax,或者需要遍历整个序列以获取全局行号,然后再次应用于该行,或者可能执行多个此类操作。 这些问题会严重瓶颈单个 token 预测的速度,因为需要等待线程在屏障处对齐后才能继续下一层。因此,如果限制了层数,那么对内核的投入就会更多地集中在如何从单层中获得更多性能,同时总同步次数更少,因为总层数更少。 如果隐藏维度更高,意味着有更多的计算量。专家数量不变。如果上投影的 MoE 中间长度增加一倍,那么就有更多的计算量需要投入。如果专注于多头潜在注意力,则需要在注意力层内部更加巧妙,因为你在压缩模型的内存;而分组查询注意力则已经非常静态且广为人知。 因此,能够将一种有趣的注意力类型与巨型内核融合是我做出的一种品味决定。对于线性类型,这里其实影响不大,但我发现,具体针对像 Kimi Delta Attention 或 KDA 这样的中国实验室,如果 Kimi 实验室在该架构上饱和其模型,那么我们就知道为什么它在特定基准测试下表现良好——如果 Kimi 架构特定的内核表现良好,而其他巨型内核则不然。 因此,这让我们了解到实验室是否专注于中国发明的架构。然后,词汇表大小意味着我们可以减少对内核总数的担忧,因为如果我有两个不同的内核,一个专注于庞大的 25 万词汇表大小,而只有一个内核,并且我们将词汇表大小减少 50%,使其更容易在同一个内核启动中处理,那么从巨型内核的角度来看,这要可行得多。 所以,几乎在每个方面,Kimi Linear 架构作为巨型内核比人们通常在其 RTX 3090 上用于本地代理工作流的常见 Qwen 3.6 架构更有意义。
查看原文
查看缓存全文

缓存时间: 2026/07/03 04:30

对于好奇我为什么使用 Kimi Linear megakernel 而非 Qwen 3.6 的人,首先看参数数量。一个是350亿参数,一个是480亿参数,而两者都只有30亿活跃专家(active experts)。所以它们在预测单个 token 时,使用的总权重大致相同,区别在于总参数量。

现在注意一下,其中一个模型有27层,另一个有40层。当层数增加时,通常意味着总体同步操作更多。同步包括归一化(normalization)、softmax,或者需要遍历整个序列获取全局行号后再应用回该行,甚至可能需要多次执行这些操作。

这些问题会显著成为单 token 预测速度的瓶颈,因为线程必须等待其他线程在屏障处对齐,才能继续进入下一层。因此,如果减少层数,核函数(kernel)的优化精力就能更多地集中在如何从单层中榨取更高性能,同时减少需要执行的同步总次数——因为总层数变少了。

如果隐藏维度(hidden dimension)更高,意味着有更多计算量。专家模块本身不变。如果 MoE 中间层长度(从 up projection 起)翻倍,那么需要投入的计算量也更大。如果专注于多头潜在注意力(multi-head latent attention),则需要在注意力层内更加巧妙,因为这是在压缩模型的内存;相比之下,分组查询注意力(group query detention)非常静态且已被充分研究。

因此,能否将一种有趣的注意力类型与大内核(megakernel)融合,是我做出的一个品味判断。对于线性类型而言,这点影响不大;但我发现,对于像 Kimi Delta Attention(KDA)这样的中国实验室架构来说,如果 Kimi 实验室在该架构上让模型达到饱和,那么当 Kimi 架构专用核函数表现良好而其他大内核不行时,我们就知道为什么它在某些基准测试中性能出色了。

这为我们提供了一些情报:实验室是否专注于中国发明的架构。至于词表大小(vocab size),我们可以减少对总核函数数量的担忧——如果我有两个不同的核函数,一个针对25万的大词表,另一个只用一个核函数并将词表大小缩减50%,从而使词表在大内核启动中更易处理,那么从大内核角度看,这要可行得多。

因此,几乎在每一个维度上,Kimi Linear 架构都比广为人知的 Qwen 3.6 架构更适合作为大内核——而后者人们通常会在 RTX 3090 上运行以用于本地智能体工作流。

33%不是50%,我搞错了

这就是我制作它的原因

相似文章

Kimi K3 编程基准测试

Reddit r/singularity

Kimi K3 编程基准测试文章,讨论 Kimi K3 模型在编程任务上的表现。