为AMD MI300X构建LLM推理的单内核 - 每个请求最高3300输出tokens/秒 [P]

Reddit r/MachineLearning 论文

摘要

一种针对AMD MI300X GPU上LLM解码的单内核方法,每个请求可达3300输出tokens/秒,无需推测解码或量化,利用映射到芯片拓扑结构的内存访问模式。

我们构建了一个单内核,将完整的解码序列作为单个驻留在GPU上的程序在AMD MI300X上运行,并采用了一些精巧的优化。芯片拓扑结构是结果的核心,我们将内存访问模式映射到物理布局,计算单元按关联的IOD分组,硬件以其全设计性能运行。每个请求最高3300输出tokens/秒,批量大小为1,无推测解码,无量化,使用8x MI300X。此预览运行一个小型2B编码模型,我们计划在未来支持大型前沿MoE模型。深度技术分析:https://blog.kog.ai/building-a-single-kernel-latency-optimized-llm-inference-engine-on-amd-mi300x-gpus 尝试体验:https://playground.kog.ai
查看原文

相似文章

两个约300B MoE模型,各自装进一台128 GB mini PC(AMD Strix Halo):GLM-5.3-Flash 预填充约580 tok/s,MiMo-V2.6-Flash 解码最高44 tok/s。EXL3 权重 + 开源 ROCm 引擎

Reddit r/LocalLLaMA

Yamz Labs 发布了 Kyojin,一个基于 ExLlamaV3 构建的 AMD Strix Halo 推理引擎,使两个约300B级别的 MoE 模型(GLM-5.3-Flash 和 MiMo-V2.6-Flash)各自能装入并运行在一台128 GB mini PC 上,EXL3 量化权重预填充速度最高可达580 tok/s,投机解码可达44 tok/s。