SLAI T-Rex: 在昇腾SuperPOD上对DeepSeek-V4系列进行全参数后训练

Hugging Face Daily Papers 论文

摘要

本文介绍了SLAI T-Rex,一种面向昇腾NPU SuperPOD上万亿参数MoE模型的全参数后训练优化框架,实现了34.22%的MFU,并在运筹学任务上比GPT-5.4-Mini高出3.98个百分点。

万亿参数规模MoE模型的全参数后训练为大规模分布式训练带来了严峻的系统级挑战,包括严重的内存压力、非重叠通信开销以及低效的内核执行。尽管大多数大规模LLM训练系统基于GPU集群构建,本报告展示了在昇腾NPU SuperPOD上的端到端优化实践。以DeepSeek-V4模型系列为目标负载,我们开发了一个分层优化框架,涵盖模型级并行、计算-通信编排以及底层内核执行。最终系统实现了34.22%的模型FLOPs利用率(MFU),相比开源基线方案提升2.93倍,同时保持了训练稳定性。在此优化基础设施之上,我们进一步为复杂的运筹学(OR)任务建立了CPT和SFT工作流。我们将该集成框架称为SLAI T-Rex。利用DeepSeek-V4-Flash,我们构建了面向OR的CPT和SFT数据流水线,结合收集的领域资源与求解器验证的合成优化文档。生成的数据集包含10K条高质量SFT样本,涵盖四个任务类别和三种问题表示。该专用模型在评估模型中取得了最高的平均零样本Pass@1分数,达到71.81%,分别超过GPT-5.4-Mini和基础DeepSeek-V4-Flash模型3.98和11.27个百分点。总体而言,该工作展示了一条从昇腾基础设施上高效的万亿参数模型后训练到面向求解器驱动的数学建模的领域专用Flash模型的全栈路径,推动了复杂推理的前沿模型系统发展。
查看原文
查看缓存全文

缓存时间: 2026/07/24 05:09

论文页面 - SLAI T-Rex:在昇腾SuperPOD上对DeepSeek-V4系列进行全参数后训练

来源:https://huggingface.co/papers/2607.20145 发布于7月22日

#1 今日论文 (https://huggingface.co/papers/date/2026-07-23) 作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

对万亿参数规模的MoE模型进行全参数后训练,为大规模分布式训练带来了严峻的系统级挑战,包括严重的内存压力、非重叠的通信开销以及低效的内核执行。虽然大多数大规模LLM训练系统都基于GPU集群构建,但本报告展示了在昇腾NPU SuperPOD上的一套端到端优化实践。以DeepSeek-V4模型系列为目标负载,我们开发了一个分层优化框架,涵盖模型级并行、计算-通信编排以及底层内核执行。最终系统实现了34.22%的模型FLOPs利用率(MFU),相比开源基线方案提升了2.93倍,同时保持了训练稳定性。基于这一优化后的基础设施,我们进一步构建了用于复杂运筹优化(OR)任务的CPT和SFT工作流。我们将该集成框架称为SLAI T-Rex。利用DeepSeek-V4-Flash,我们开发了面向OR的CPT和SFT数据流水线,将收集的领域资源与求解器验证的合成优化文档相结合。生成的数据集包含10K个高质量SFT样本,涵盖四个任务类别和三种问题表示形式。经过专门训练的模型在评估模型中取得了最高的平均零样本Pass@1分数,达到71.81%,分别超出GPT-5.4-Mini和基础DeepSeek-V4-Flash模型3.98和11.27个百分点。总体而言,这项工作展示了一条从昇腾基础设施上高效进行万亿参数模型后训练,到面向领域的Flash模型(用于基于求解器的数学建模)的全栈路径,推动了前沿模型系统在复杂推理方面的发展。

查看arXiv页面 (https://arxiv.org/abs/2607.20145)查看PDF (https://arxiv.org/pdf/2607.20145)GitHub19 (https://github.com/SLAI-AITP/SLAI-T-Rex)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.20145)

引用该论文的模型0

没有模型链接此论文

请在模型README.md中引用arxiv.org/abs/2607.20145以从此页面链接。

引用该论文的数据集0

没有数据集链接此论文

请在数据集README.md中引用arxiv.org/abs/2607.20145以从此页面链接。

引用该论文的Spaces0

没有Space链接此论文

请在Space README.md中引用arxiv.org/abs/2607.20145以从此页面链接。

包含该论文的集合1

相似文章

DeepSeek V4 完整论文发布:FP4 QAT 技术细节与训练稳定性技巧 [D]

Reddit r/MachineLearning

DeepSeek 发布了完整的 V4 论文,详细介绍了 FP4 量化感知训练、MoE 训练稳定性技巧(预判路由与 SwiGLU 截断),以及用于 RLHF 的生成式奖励模型,实现了显著的效率提升——V4-Flash 在 100 万上下文长度下仅需 V3.2 的 10% FLOPs 和 7% 的 KV 缓存。