@plugyawn: 介绍:Megaprop:一个跨GPU高效预条件优化的库!Megaprop 是 Megatron 的一个分支……
摘要
Megaprop 是一个新的库,用于跨 GPU 的高效预条件优化,它源自 Megatron 和 TransformerEngine,支持 FSDP 下的 Muon、FOOF、KFAC 和 Newton-Muon,并支持 MuP 以实现宽度和深度的优化。
查看缓存全文
缓存时间: 2026/06/15 19:05
介绍:Megaprop:一个面向GPU高效预条件优化的库!
Megaprop 是 Megatron 和 TransformerEngine 的一个分支,为 Muon、FOOF、KFAC 和 Newton-Muon 提供 FSDP 支持,并兼容 MuP(适用于宽度和深度)…
(1/n)
Megaprop 的 PSGD 实现会与梯度一起计算预条件矩阵,在计算权重梯度 dY.T @ X 的同时收集并通信 X.T @ X 和 dY.T @ dY。它提供了原生的对角/块对角近似支持。
(2/n)
在 Megaprop 中,PSGD 通过指定右预条件和左预条件来实现——这类似于一个优化器“配方”。
例如:使用特征格拉姆矩阵作为右预条件可得到 FOOF;与 Muon 组合则可得到 Newton-Muon。
对于 Newton Muon,在 Megaprop 中,我们传入: –matrix-optimizer muon –matrix-input-preconditioner feature_gram
如果希望使用 feature_gram 的对角近似,还可以传入: –matrix-input-preconditioner-approximation diag
除此之外,还有更多选项!
(3/n)
https://github.com/plugyawn/Megaprop…
总结:Megaprop 是一个用于高效预条件随机梯度下降的库。目前仍在开发中,但已支持 Muon 的宽度/深度 MuP、以及 Muon + 对角 KFAC 的 FSDP,功能相当强大!
当然,它也继承了其父项目的全部 Megatron-FSDP 优势。
相似文章
@burny_tech: 关于优化器魔法的更新
一篇新的NVIDIA论文提出,像Muon和SOAP这样的高阶优化器,可以作为大规模LLM预训练中AdamW的更高效替代方案。
SNAP-FM: 物理约束生成建模中的稀疏非线性加速投影
提出SNAP-FM方法,利用稀疏GPU非线性优化加速物理约束生成建模中的约束投影,在保持精确物理约束满足的同时实现更快的推理。
@levidiamode: GPU编程的第163/365天 - 今天看几个不同的agentic GPU内核优化系统。我最感兴趣的两个是…
一条推文讨论了两种agentic GPU内核优化系统:@dogacel0的Auto GPU Kernel和@songhan_mit实验室的Kernel Design Agents,两者均在MLSys Sparse Attention FlashInfer比赛中获胜。该帖子突出了使用子代理和Claude技能进行GPU编程的不同方法。
@MichaelGannotti: https://x.com/MichaelGannotti/status/2074486390432149979
对NVIDIA的Nemotron-3 Mamba-Transformer混合模型在DGX Spark硬件上的全栈评估,包括架构分析、量化(NVFP4)、基准测试结果,以及开源测试套件smf-bench的介绍。
@AnnmariaKAntony: LLMs 擅长 CUDA,因为互联网上充满了相关内容。但一个能提供高度优化 CUDA 的模型可能仍然……
一个结合 SFT 和 GRPO RL 后训练的多智能体合成数据流水线,为 14B 开源模型在 AMD MI350X GPU 上提升了 HIP 的编译和正确性。