为AMD MI300X构建LLM推理的单内核 - 每个请求最高3300输出tokens/秒 [P]
摘要
一种针对AMD MI300X GPU上LLM解码的单内核方法,每个请求可达3300输出tokens/秒,无需推测解码或量化,利用映射到芯片拓扑结构的内存访问模式。
我们构建了一个单内核,将完整的解码序列作为单个驻留在GPU上的程序在AMD MI300X上运行,并采用了一些精巧的优化。芯片拓扑结构是结果的核心,我们将内存访问模式映射到物理布局,计算单元按关联的IOD分组,硬件以其全设计性能运行。每个请求最高3300输出tokens/秒,批量大小为1,无推测解码,无量化,使用8x MI300X。此预览运行一个小型2B编码模型,我们计划在未来支持大型前沿MoE模型。深度技术分析:https://blog.kog.ai/building-a-single-kernel-latency-optimized-llm-inference-engine-on-amd-mi300x-gpus 尝试体验:https://playground.kog.ai
相似文章
16块AMD MI50 32GB:GLM-5.2 Q4 在 llama.cpp RPC 上以 12.2 tok/s 运行
描述了在由16块AMD MI50 GPU组成的集群上,使用llama.cpp的RPC以4位量化运行GLM-5.2模型,达到12.2令牌每秒的速度,并在10.7k上下文中实现了连贯的长文本生成。
@HotAisle: 太棒了。我想知道他们用的是谁的 MI300x... ;-)
Kog 宣布在标准数据中心 GPU 上实现每请求每秒 3000+ 输出令牌的实时大语言模型推理,将此前仅限于定制芯片的高速推理引入生产硬件。
用于AMD MI350X的Qwen3.6-35B-A3B开源内核:在8块GPU上实现78,498输出tok/s
本文介绍了为在AMD MI350X GPU上运行Qwen3.6-35B-A3B大语言模型所做的优化,实现了高输出令牌吞吐量,并开源了内核以提升性能。
2倍 tok/s(在1块MI50上从19.4 tok/s提升到38.1 tok/s)尝试类似推测解码的假设……但不是用额外的侧模型,而是利用我可以同时运行多个计算,就好像内存里加载了两份Qwen3.6-27B一样——小量化不占用所有可用算力。
打包双推理(PTI)是一种通过单批解码中运行多个token序列来实现约2倍LLM吞吐量的技术,它利用了llama.cpp中的权重共享,无需草稿模型或额外VRAM。
两个约300B MoE模型,各自装进一台128 GB mini PC(AMD Strix Halo):GLM-5.3-Flash 预填充约580 tok/s,MiMo-V2.6-Flash 解码最高44 tok/s。EXL3 权重 + 开源 ROCm 引擎
Yamz Labs 发布了 Kyojin,一个基于 ExLlamaV3 构建的 AMD Strix Halo 推理引擎,使两个约300B级别的 MoE 模型(GLM-5.3-Flash 和 MiMo-V2.6-Flash)各自能装入并运行在一台128 GB mini PC 上,EXL3 量化权重预填充速度最高可达580 tok/s,投机解码可达44 tok/s。