标签
Elliot Arledge 解释了他为什么更喜欢使用 Kimi Linear 巨型内核而不是 Qwen 3.6 来提升内核性能,比较了参数数量、层同步、隐藏维度和架构特定的优化。讨论强调 Kimi Linear 架构更适合巨型内核实现,特别是在 RTX PRO 6000 Blackwell 上进行 batch-1 解码时。
MusaCoder 训练了一个 27B 模型,在 KernelBench 上达到了 93.2 Pass@8,优于 Claude Opus(87.2),并提供了其数据管道、验证器和 RL 稳定器的 5 页技术摘要。