@plugyawn: 介绍:Megaprop:一个跨GPU高效预条件优化的库!Megaprop 是 Megatron 的一个分支……

X AI KOLs Following 工具

摘要

Megaprop 是一个新的库,用于跨 GPU 的高效预条件优化,它源自 Megatron 和 TransformerEngine,支持 FSDP 下的 Muon、FOOF、KFAC 和 Newton-Muon,并支持 MuP 以实现宽度和深度的优化。

介绍:Megaprop:一个跨GPU高效预条件优化的库! Megaprop 是 Megatron 和 TransformerEngine 的一个分支,支持 FSDP 下的 Muon、FOOF、KFAC 和 Newton-Muon,并支持 MuP,可同时优化宽度和深度…… (1/n) https://t.co/6OUds8kNj8
查看原文
查看缓存全文

缓存时间: 2026/06/15 19:05

介绍:Megaprop:一个面向GPU高效预条件优化的库!

Megaprop 是 Megatron 和 TransformerEngine 的一个分支,为 Muon、FOOF、KFAC 和 Newton-Muon 提供 FSDP 支持,并兼容 MuP(适用于宽度和深度)…

(1/n)

Megaprop 的 PSGD 实现会与梯度一起计算预条件矩阵,在计算权重梯度 dY.T @ X 的同时收集并通信 X.T @ X 和 dY.T @ dY。它提供了原生的对角/块对角近似支持。

(2/n)

在 Megaprop 中,PSGD 通过指定右预条件和左预条件来实现——这类似于一个优化器“配方”。

例如:使用特征格拉姆矩阵作为右预条件可得到 FOOF;与 Muon 组合则可得到 Newton-Muon。

对于 Newton Muon,在 Megaprop 中,我们传入: –matrix-optimizer muon –matrix-input-preconditioner feature_gram

如果希望使用 feature_gram 的对角近似,还可以传入: –matrix-input-preconditioner-approximation diag

除此之外,还有更多选项!

(3/n)

https://github.com/plugyawn/Megaprop…

总结:Megaprop 是一个用于高效预条件随机梯度下降的库。目前仍在开发中,但已支持 Muon 的宽度/深度 MuP、以及 Muon + 对角 KFAC 的 FSDP,功能相当强大!

当然,它也继承了其父项目的全部 Megatron-FSDP 优势。

相似文章