batch-1

标签

Cards List
#batch-1

为AMD MI300X构建LLM推理的单内核 - 每个请求最高3300输出tokens/秒 [P]

Reddit r/MachineLearning ↗ · 2026-05-29

一种针对AMD MI300X GPU上LLM解码的单内核方法,每个请求可达3300输出tokens/秒,无需推测解码或量化,利用映射到芯片拓扑结构的内存访问模式。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈