Qwen3-8B 2.4T 在 Nvidia GB300 NVL72 上达到 288k tokens/s

Reddit r/LocalLLaMA 新闻

摘要

NVIDIA 展示了在 GB300 NVL72 硬件上运行 Qwen3-8B 2.4T 参数模型的高吞吐量性能,实现每 GPU 超过 4k tokens/s。

https://developer.nvidia.com/blog/serve-qwen3-8-2-4t-a95b-a-2-4t-parameter-model-with-configurable-reasoning-on-nvidia-gb300-nvl72/ 每 GPU 4k tokens/s,共有 72 个 GPU。每用户 350 tokens/s “无需额外模型调整,该模型在 NVIDIA GB300 NVL72 上使用 FP8 精度在发布时即实现每 GPU 超过 4K tokens/s 和每用户超过 350 tokens/s 的吞吐量。进一步优化,包括 NVFP4 精度,预计将随时间带来性能提升。”
查看原文

相似文章