平滑长上下文混合专家训练中的所有内存峰值

Hugging Face Daily Papers 论文

摘要

本文介绍了管理长上下文长度下训练大型混合专家模型内存峰值的技术,包括Pipelined LLEP、Ring-DTP、SCO和OffloadStreamAdamW,这些技术实现了固定的GPU工作集,并将吞吐量提高了多达10.4倍。

在训练长上下文或大批次大小的混合专家(MoE)模型时,只要任何一个组件的峰值分配超过设备内存,训练就会失败,因此目标是同时处理所有峰值,而不仅仅是平均占用空间。在常用的并行计划中,有四个组件未受限制,且各自以不同方式增长:专家分发与路由矩阵相关,词汇投影与令牌数乘以词汇表大小相关,梯度检查点边界与深度乘以序列长度相关,优化器状态与参数数量相关。哪个组件最先耗尽取决于模型、上下文长度和设备数量,因此降低最大的只会暴露下一个。我们通过调度方案限制了所有四个组件,其GPU工作集在启动时固定:PipelinedLLEP扩展了最不忙专家并行性,对每个源贡献到分发块的令牌数设上限;Ring-DTP在词汇投影处循环激活或权重分片,并将每个对数块折叠成在线对数-求和-指数;选择性检查点卸载(SCO)将每个检查点边界的一个长寿命张量保留在CPU内存中;OffloadStreamAdamW将优化器卸载的串行CPU Adam更新转变为桶管道。所有四种方法只改变计算和数据移动的顺序和粒度,因此损失和梯度保持精确。在匹配的组件测试中,它们将MoE分发峰值降低了多达59.3%,且不损失吞吐量;词汇投影峰值降低了86.6%;卸载的优化器步骤快了2.05倍。在参数从1200亿到6670亿的MoE模型上组合使用,它们能在1M上下文长度下训练,范围是调优的FSDP2基线的8-32倍,吞吐量高达其10.4倍。
查看原文
查看缓存全文

缓存时间: 2026/09/17 10:53

论文页面 - 压平长上下文混合专家模型训练中的所有内存峰值

来源:https://huggingface.co/papers/2609.14306

摘要

在长上下文或大批量训练混合专家模型时,只要任意一个组件的峰值分配超过设备内存容量,训练就会失败。因此,目标是同时压平每一个峰值,而非仅降低平均内存占用。常见的并行方案中有四项内存开销未被严格限制,且各自增长方式不同:涉及路由矩阵的专家分发、与词表大小和令牌数相关的词表投影、与深度和序列长度相关的梯度检查点边界,以及与参数量相关的优化器状态。随着模型、上下文长度和设备数量的变化,首先耗尽内存的组件也会不同,仅降低某一峰值只会暴露下一个瓶颈。

我们通过以下调度方案将所有四项内存占用限定在固定值,使 GPU 工作集在启动时即确定:Pipelined LLEP 扩展了最少加载专家并行策略,限制了每个源在分发块中贡献的令牌数;Ring-DTP 让激活值或权重分片在环中流转,处理词表投影并将每个 logits 块折算为在线 log-sum-exp 运算;选择性检查点卸载将每个检查点边界中唯一长期存在的张量保留在 CPU 内存中;OffloadStreamAdamW 则将优化器卸载的串行 CPU Adam 更新转为桶式流水线。这四种方案仅改变计算与数据移动的顺序和粒度,因此损失值与梯度保持精确。在组件对照测试中,它们将 MoE 分发峰值降低最多 59.3% 而不损失吞吐量,将词表投影峰值降低 86.6%,并将卸载的优化器步骤加速达 2.05 倍。组合应用于参数量从 120B 到 667B 的 MoE 模型时,可实现 1M 上下文长度的训练,达到调优后 FSDP2 基线方案 8–32 倍的覆盖范围,吞吐量最高可达其 10.4 倍。

查看 arXiv 页面 (https://arxiv.org/abs/2609.14306)查看 PDF (https://arxiv.org/pdf/2609.14306)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.14306)

通过代理获取此论文:

hf papers read 2609\.14306

尚未安装最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

无模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2609.14306 以从本页链接。

引用此论文的数据集0

无数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2609.14306 以从本页链接。

引用此论文的空间0

无空间链接此论文

在空间 README.md 中引用 arxiv.org/abs/2609.14306 以从本页链接。

包含此论文的合集0

无合集包含此论文

将此论文添加到合集 (https://huggingface.co/new-collection) 以从本页链接。

相似文章

MESH:用于混合专家训练的内存高效Sinkhorn优化

arXiv cs.LG

本文介绍了MESH,一种用于混合专家(MoE)训练的内存高效Sinkhorn优化器,它在不存储完整优化器状态的情况下恢复时间动量,相比AdamW将内存减少62.5%,同时保持有竞争力的评估损失。

MawForge:面向本地混合专家推理的内存受限专家物化

arXiv cs.LG

MawForge 提出了一种内存受限的方法,用于在受限的统一内存机器上服务大型混合专家(MoE)语言模型,通过将完整模型存储在磁盘上,并按需将专家张量物化到有限缓存中。在 MacBook Pro M5 Pro 上的实验表明,能够在 24GB 内存范围内有效服务 34GB 和 25GB 的模型,并分析了缓存大小权衡和推测解码结果。