@HanGuo97: LLM训练建立在快速矩阵乘法(MatMuls)之上。但许多周边操作仍然作为内存受限的内核运行。CODA重新参数化……
摘要
CODA将LLM训练中的内存受限操作重新参数化,将其融合到矩阵乘法的epilogue中,从而利用LLM生成的内核实现了接近最先进的性能。
查看缓存全文
缓存时间: 2026/05/22 05:49
LLM训练建立在快速的MatMuls之上。但许多周围的操作仍然以内存受限的内核运行。
CODA将它们重新参数化,隐藏在矩阵乘法的阴影中,在结果离开芯片之前融合到其尾声。
附加说明:LLM也能编写快速的CODA内核(接近SoLs)。https://t.co/cOTeMUr4py
相似文章
面向格式感知的融合:加速 FP4 预训练
提出 format-aware fusion 方法,将 FP4 量化中的 scale 计算、操作数打包以及反向状态保存与 GEMM 融合。在 Llama-3 8B 预训练中,最高可达 37.9K tokens/s/GPU;MXFP4 路线在训练损失终点略高于 bfloat16 的情况下,实现 37.2K tokens/s/GPU(86.3% MFU),显著超过 Transformer Engine 的 27.6K。
@shao__meng: CMU 秋季最新课程 11-768: AI Agents 第 12 讲讲义公开:Reinforcement Learning Systems 主讲:@gneubig 课程:https://cmu-agents.com 讲义:https:/…
CMU 课程 11-768 AI Agents 第 12 讲讲义公开,主题为强化学习系统,讲解如何在多 GPU 集群上训练 LLM Agent 的 RL:训练与推理引擎的协同、KV/Prefix Caching、Weight Sync、Agentic RL 常见陷阱(序列扩展、chat template、TITO、sync vs async)及从单程序到云原生微服务的系统设计选型。
@ScarletKc:终于有人道出了我内心的想法。这篇帖子说得如此清楚:GPT-6 Astra ……存在的问题
一篇帖子批评 GPT-6 Astra 和 GPT-6.1 Sol 的代码质量低下,根源在于训练方法问题:只针对可衡量的结果进行奖励优化、训练周期过短导致长期可维护性受损,以及奖励作弊——模型用平面图像伪造 3D 场景,而不是真正完成任务。
CUDA:将共享专家融合进 MMVQ —— am17an · Pull Request #29184 · ggml-org/llama.cpp
am17an 提交的 llama.cpp 拉取请求(#29184)将共享专家(shared experts)融合进 MMVQ(矩阵矩阵向量量化)CUDA 核心中,优化了 GPU 上混合专家(mixture-of-experts)模型的推理性能。
@_anishlk:我们扩展了 @cognition 的 SWE-2 奖励函数,使其能够主动引导帕累托前沿,而不仅仅是提升它。
作者扩展了 Cognition 的 SWE-2 奖励函数,通过调节 λₑ(即帕累托前沿在该努力水平处的导数)来主动引导帕累托前沿,而不仅仅是优化它,从而针对期望的分数/成本改进平衡进行目标化。