Tauon:一种在 GPT-Mini 上超越 Muon 的新型优化器(更低损失,~8.5% 更快的步长时间)[P]
摘要
Tauon 是一种新型优化器,使用多项式和正交化技术,在小型 GPT-Mini 模型的初始基准测试中超越 Muon 和 AdamW,显示出更低的损失和更快的步长时间。
嘿,r/MachineLearning!我一直在研究一个名为 Tauon 的新优化器(原来已经有一个叫 "teon" 的了,但如果你有更好的想法,我很乐意接受!)总之,优化器的核心思想是关于多项式和正交化,就像 Muon 一样,不同之处在于,我设法降低了总步数(首先通过谱滤波降到 3 步,然后通过系数调度降到 2 步)并减少了矩阵大小(通过 dct-2)。我想分享一些初始的基准测试结果……
基准测试设置:在 TinyShakespeare 上训练了一个 GPT-Mini(d_model=512,6 层),与 Muon 和 AdamW 进行比较。Tauon:学习率 = 0.02,Muon:学习率 = 0.02,AdamW:学习率 = 0.0006
结果:验证损失:Tauon 收敛到更低的最终损失(~1.6),而 Muon(~1.65)和 AdamW(~1.8)更高。稳定性:AdamW 在约 1200 步时开始过拟合/发散,而 Tauon 在 3000 步中保持了稳定的进展。计算成本:在相同硬件上,Tauon 的运行速度为 391.5 毫秒/步,而 Muon 为 427.7 毫秒/步(快约 8.5%),接近 AdamW 的基线 382.9 毫秒/步。
是的,我知道这个基准测试小得可笑,但我只有 2 小时的 Kaggle 免费 T4 时间,所以真的无法做更多 + 希望有人能在更大的设置上测试它!
链接和代码:📂 GitHub: erj2231/ai-projects/tree/main/tauon 📦 PyPI: pip install tauon-optimizer
很想听听你们对这个优化器的看法!如果有任何想法或建议,请告诉我。大家好!
https://preview.redd.it/8pbtu9azgzrh1.png?width=5370&format=png&auto=webp&s=b2c694fd05a27919a41103e7f7d960eef41b2407
相似文章
@burny_tech: 关于优化器魔法的更新
一篇新的NVIDIA论文提出,像Muon和SOAP这样的高阶优化器,可以作为大规模LLM预训练中AdamW的更高效替代方案。
Muon需要多少正交化?
本文研究了Muon优化器需要多少正交化,提出了一种五步三次牛顿-舒尔茨方案,该方案降低了计算成本,同时在GPT-2 Small和混合MoE/Mamba模型上实现了与更昂贵方法相似的训练质量。
Muon 优化器能否微调 Adam 预训练模型?
研究论文探究了在微调预训练模型时用 Muon 优化器替代 Adam 所导致的性能下降,证明像 LoRA 这样的参数高效方法能有效缓解语言和视觉任务中的这种优化器不匹配问题。
重新评估Muon在矩阵分解中的应用
本文评估了Muon优化器在低秩矩阵分解上的表现,发现它并未持续优于AdamW,从而对早期关于其在大型深度学习中的优势说法提出质疑。
Dion3: Full-Stack Orthogonal Updates
Dion3 is a revised Muon optimizer that reduces computational and communication overhead via Gram Newton-Schulz, symmetric GEMM kernels, and megabatching, achieving up to 6x faster optimizer steps while matching or improving loss.