SLAI T-Rex: 在昇腾SuperPOD上对DeepSeek-V4系列进行全参数后训练
摘要
本文介绍了SLAI T-Rex,一种面向昇腾NPU SuperPOD上万亿参数MoE模型的全参数后训练优化框架,实现了34.22%的MFU,并在运筹学任务上比GPT-5.4-Mini高出3.98个百分点。
查看缓存全文
缓存时间: 2026/07/24 05:09
论文页面 - SLAI T-Rex:在昇腾SuperPOD上对DeepSeek-V4系列进行全参数后训练
来源:https://huggingface.co/papers/2607.20145 发布于7月22日
#1 今日论文 (https://huggingface.co/papers/date/2026-07-23) 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
对万亿参数规模的MoE模型进行全参数后训练,为大规模分布式训练带来了严峻的系统级挑战,包括严重的内存压力、非重叠的通信开销以及低效的内核执行。虽然大多数大规模LLM训练系统都基于GPU集群构建,但本报告展示了在昇腾NPU SuperPOD上的一套端到端优化实践。以DeepSeek-V4模型系列为目标负载,我们开发了一个分层优化框架,涵盖模型级并行、计算-通信编排以及底层内核执行。最终系统实现了34.22%的模型FLOPs利用率(MFU),相比开源基线方案提升了2.93倍,同时保持了训练稳定性。基于这一优化后的基础设施,我们进一步构建了用于复杂运筹优化(OR)任务的CPT和SFT工作流。我们将该集成框架称为SLAI T-Rex。利用DeepSeek-V4-Flash,我们开发了面向OR的CPT和SFT数据流水线,将收集的领域资源与求解器验证的合成优化文档相结合。生成的数据集包含10K个高质量SFT样本,涵盖四个任务类别和三种问题表示形式。经过专门训练的模型在评估模型中取得了最高的平均零样本Pass@1分数,达到71.81%,分别超出GPT-5.4-Mini和基础DeepSeek-V4-Flash模型3.98和11.27个百分点。总体而言,这项工作展示了一条从昇腾基础设施上高效进行万亿参数模型后训练,到面向领域的Flash模型(用于基于求解器的数学建模)的全栈路径,推动了前沿模型系统在复杂推理方面的发展。
查看arXiv页面 (https://arxiv.org/abs/2607.20145)查看PDF (https://arxiv.org/pdf/2607.20145)GitHub19 (https://github.com/SLAI-AITP/SLAI-T-Rex)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.20145)
引用该论文的模型0
没有模型链接此论文
请在模型README.md中引用arxiv.org/abs/2607.20145以从此页面链接。
引用该论文的数据集0
没有数据集链接此论文
请在数据集README.md中引用arxiv.org/abs/2607.20145以从此页面链接。
引用该论文的Spaces0
没有Space链接此论文
请在Space README.md中引用arxiv.org/abs/2607.20145以从此页面链接。
包含该论文的集合1
相似文章
DeepSeek V4 完整论文发布:FP4 QAT 技术细节与训练稳定性技巧 [D]
DeepSeek 发布了完整的 V4 论文,详细介绍了 FP4 量化感知训练、MoE 训练稳定性技巧(预判路由与 SwiGLU 截断),以及用于 RLHF 的生成式奖励模型,实现了显著的效率提升——V4-Flash 在 100 万上下文长度下仅需 V3.2 的 10% FLOPs 和 7% 的 KV 缓存。
从零开始开发开源大语言模型:从预训练到RLHF(PPO/GRPO)
一位开发者分享了从零开始训练一个70亿参数开源大语言模型的进展,该模型基于DeepSeek架构并针对低显存进行了优化,目标是推动AI开发的民主化,并最终超越大型专有模型。
DeepSeek 训练 2T 模型并规划 8T 模型
DeepSeek 正在训练一个 2 万亿参数的 AI 模型,并计划最终构建一个 8 万亿参数的模型。
突破 DeepSeek-V4-Pro 服务极限(28分钟阅读时间)
本文介绍了一种优化 DeepSeek-V4-Pro(一个1.6万亿参数的 MoE 模型)在 H20 GPU 上服务的方法,通过场景特定的配置和优化实现了显著的性能提升。
DeepSeek V4.1 Flash 正在令人惊讶地接近 GPT-5.6 Sol 的领域,同时价格低得离谱
DeepSeek 发布了 V4.1 Flash,一个 552B MoE 模型,具有高效的活动参数,性能接近 GPT-5.6 Sol,而成本却低得多。