标签
NVIDIA 的 Vera Rubin NVL72 系统在 MLPerf Inference v6.1 中首次亮相,展现出领先性能。在 DeepSeek-R1 和 Qwen3-VL 等基准测试中,其吞吐量比 GB300 NVL72 最高提升达 3.7 倍。该系统强调系统性能、扩展效率以及软件优化。
Cursor正在开源Mixture-of-Kittens(MoK),这是一个用于NVL72s的生产级MoE训练巨型内核,它融合了通信与计算,为其Composer模型带来了1.41倍的端到端训练吞吐量提升。
Cursor 正在开源 Mixture-of-Kittens (MoK),这是一个针对 NVIDIA NVL72 的融合式 MoE 训练巨型内核,其运行速度比最强的公开基线快达 2.37 倍。
SpaceX将其AI Sat V1的峰值功率规格提升至约250千瓦(电池辅助),平均功率约160千瓦,使其能够支持一个NVL72 Ruben机架。
FastAFD 是一个开源的 serving 系统,用于在 Blackwell NVL72 上对 MoE 模型进行 Attention-FFN 解聚,相较于共置的 MoE 服务,其每 GPU 解码吞吐量提升了 1.35-1.45 倍。