标签
Soufiane Hayou 和 Nikhil Ghosh 将于 2026 年 7 月 31 日在哈佛大学举行的 STAI-X 2026 会议上教授一门关于 Theory of Scaling in Modern Deep Learning 的短期课程。该课程涵盖使用 muP 及其变体进行跨规模的超参数迁移。
本文为混合专家(MoE)架构提出了一套具有理论基础的缩放理论,引入了最大化尺度稳定参数化(MSSP),确保在宽度、深度、专家宽度和专家数量上的稳定训练和超参数迁移,并通过实验验证。