@cursor_ai:我们正在开源 Mixture-of-Kittens (MoK),这是我们为 NVL72 打造的 MoE 训练巨型内核。它融合了所有 Mixture-of-Experts 的…
摘要
Cursor 正在开源 Mixture-of-Kittens (MoK),这是一个针对 NVIDIA NVL72 的融合式 MoE 训练巨型内核,其运行速度比最强的公开基线快达 2.37 倍。
查看缓存全文
缓存时间: 2026/08/04 18:13
我们正在开源 Mixture-of-Kittens(MoK),这是我们为 NVL72s 打造的 MoE 训练巨型内核。
它将所有 Mixture-of-Experts 的通信和计算融合到一个完全确定性的内核中,运行速度比最强的公开基线快达 2.37 倍。https://t.co/yHu5E6RXp9
相似文章
Mixture-of-Kittens:我们为NVL72s提供的开源MoE巨型内核(25分钟阅读)
Cursor正在开源Mixture-of-Kittens(MoK),这是一个用于NVL72s的生产级MoE训练巨型内核,它融合了通信与计算,为其Composer模型带来了1.41倍的端到端训练吞吐量提升。
MoE训练提速40%:更快的megakernel,居然来自Cursor(针对B200)
Cursor开源了Mixture-of-Kittens (MoK),这是一个面向NVIDIA Blackwell GPU的确定性MoE训练megakernel,它融合了计算与通信,相比基线实现最高可提供2.37倍加速。
@omarsar0: NVIDIA 的压缩论文,相当惊艳。(记得收藏)更大的 MoE 模型在质量上持续胜出,但以交互延迟提供服务仍然困难…
NVIDIA 的论文介绍了 Puzzle-75B-A9B,这是一种压缩的混合 MoE 模型,能够在保持质量的同时将服务器吞吐量提高一倍,从而实现大型语言模型的成本高效部署。
Mixture-of-Translators: 跨异构大语言模型的KV缓存翻译
本文介绍了Mixture-of-Translators(MoT),一个跨异构大语言模型翻译KV缓存的框架,使得不同架构之间能够复用缓存。实验表明,在Qwen2.5、GPT-2和OPT模型上,问答性能和长上下文质量得以保持。
@_avichawla: https://x.com/_avichawla/status/2100876555409039605
这篇文章解释了Mixture-of-Experts (MoE) 推理的工程方面,详细介绍了令牌路由、专家批处理、GPU分配和性能权衡,以实现高效的服务。