@HanGuo97: LLM训练建立在快速矩阵乘法(MatMuls)之上。但许多周边操作仍然作为内存受限的内核运行。CODA重新参数化……

X AI KOLs Following 论文

摘要

CODA将LLM训练中的内存受限操作重新参数化,将其融合到矩阵乘法的epilogue中,从而利用LLM生成的内核实现了接近最先进的性能。

LLM训练建立在快速矩阵乘法(MatMuls)之上。但许多周边操作仍然作为内存受限的内核运行。 CODA将它们重新参数化,隐藏在矩阵乘法的阴影中,在结果离开芯片前融合到其epilogue中。 额外好处:LLM也可以编写快速的CODA内核(接近SoLs)。https://t.co/cOTeMUr4py
查看原文
查看缓存全文

缓存时间: 2026/05/22 05:49

LLM训练建立在快速的MatMuls之上。但许多周围的操作仍然以内存受限的内核运行。

CODA将它们重新参数化,隐藏在矩阵乘法的阴影中,在结果离开芯片之前融合到其尾声。

附加说明:LLM也能编写快速的CODA内核(接近SoLs)。https://t.co/cOTeMUr4py

相似文章

面向格式感知的融合:加速 FP4 预训练

arXiv cs.LG

提出 format-aware fusion 方法,将 FP4 量化中的 scale 计算、操作数打包以及反向状态保存与 GEMM 融合。在 Llama-3 8B 预训练中,最高可达 37.9K tokens/s/GPU;MXFP4 路线在训练损失终点略高于 bfloat16 的情况下,实现 37.2K tokens/s/GPU(86.3% MFU),显著超过 Transformer Engine 的 27.6K。

@shao__meng: CMU 秋季最新课程 11-768: AI Agents 第 12 讲讲义公开:Reinforcement Learning Systems 主讲:@gneubig 课程:https://cmu-agents.com 讲义:https:/…

X AI KOLs Timeline

CMU 课程 11-768 AI Agents 第 12 讲讲义公开,主题为强化学习系统,讲解如何在多 GPU 集群上训练 LLM Agent 的 RL:训练与推理引擎的协同、KV/Prefix Caching、Weight Sync、Agentic RL 常见陷阱(序列扩展、chat template、TITO、sync vs async)及从单程序到云原生微服务的系统设计选型。