DeepSeek-V3 技术报告

Papers with Code Trending 论文

摘要

DeepSeek-V3 是一个参数高效的混合专家(MoE)语言模型,总参数为 671B,在训练仅需 2.788M H800 GPU 小时的情况下,实现了与领先闭源模型相当的性能。

我们推出 DeepSeek-V3,这是一个强大的混合专家(MoE)语言模型,总参数为 671B,每个 token 激活 37B 参数。为了实现高效推理和低成本训练,DeepSeek-V3 采用了多头潜在注意力(MLA)和 DeepSeekMoE 架构,这些架构已在 DeepSeek-V2 中得到充分验证。此外,DeepSeek-V3 开创了一种无辅助损失(auxiliary-loss-free)的负载均衡策略,并设定了多 token 预测训练目标,以获得更强的性能。我们在 14.8 万亿个多样且高质量的 token 上对 DeepSeek-V3 进行预训练,随后进行监督微调和强化学习阶段,以充分发挥其能力。综合评估表明,DeepSeek-V3 优于其他开源模型,并达到了与领先闭源模型相当的性能。尽管性能卓越,DeepSeek-V3 的完整训练仅需 2.788M H800 GPU 小时。此外,其训练过程非常稳定。在整个训练过程中,我们没有遇到任何不可恢复的损失尖峰,也没有进行任何回滚。模型检查点可在 https://github.com/deepseek-ai/DeepSeek-V3 获取。
查看原文
查看缓存全文

缓存时间: 2026/08/14 09:31

论文页面 - DeepSeek-V3 技术报告

来源:https://huggingface.co/papers/2412.19437 发布于 2024 年 12 月 27 日

作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

DeepSeek-V3 是一个参数高效的混合专家(Mixture-of-Experts)语言模型,采用 MLA 和 DeepSeekMoE 架构,以高效训练和最小计算成本实现高性能。

我们提出 DeepSeek-V3,一个强大的混合专家(MoE)(https://huggingface.co/papers?q=Mixture-of-Experts%20(MoE)) 语言模型,总参数量为 671B,每个 token 激活 37B 参数。为了实现高效推理和经济的训练,DeepSeek-V3 采用了多头潜在注意力(MLA)和 DeepSeekMoE (https://huggingface.co/papers?q=DeepSeekMoE) 架构,这些架构已在 DeepSeek-V2 中得到充分验证。此外,DeepSeek-V3 开创了无辅助损失的负载均衡策略,并设置了多 token 预测 (https://huggingface.co/papers?q=multi-token%20prediction) 训练目标以获得更强的性能。我们在 14.8 万亿个多样化且高质量 token 上预训练 DeepSeek-V3,随后进行监督微调 (https://huggingface.co/papers?q=Supervised%20Fine-Tuning) 和强化学习 (https://huggingface.co/papers?q=Reinforcement%20Learning) 阶段以充分发挥其能力。综合评估表明,DeepSeek-V3 优于其他开源模型,并达到与领先闭源模型相当的性能。尽管性能优异,DeepSeek-V3 的完整训练仅需 2.788M H800 GPU 小时。此外,其训练过程非常稳定。在整个训练过程中,我们没有遇到任何不可恢复的损失尖峰,也没有执行任何回滚。模型检查点可在 https://github.com/deepseek-ai/DeepSeek-V3 获取。

查看 arXiv 页面 (https://arxiv.org/abs/2412.19437) 查看 PDF (https://arxiv.org/pdf/2412.19437) GitHub104kauto (https://github.com/deepseek-ai/deepseek-v3) 添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2412.19437)

在您的 agent 中获取此论文:

hf papers read 2412\.19437

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型123

deepseek-ai/DeepSeek-V3 文本生成• 685B• 更新于2025年3月27日 • 1.03M • 4.17k (https://huggingface.co/deepseek-ai/DeepSeek-V3)

deepseek-ai/DeepSeek-V3-0324 文本生成• 685B• 更新于2025年3月27日 • 1.2M • 3.16k (https://huggingface.co/deepseek-ai/DeepSeek-V3-0324)

deepseek-ai/DeepSeek-V3-Base 685B• 更新于2025年3月27日 • 31.9k • 1.7k (https://huggingface.co/deepseek-ai/DeepSeek-V3-Base)

deepseek-ai/DeepSeek-V3.1-Base 文本生成• 685B• 更新于2025年8月26日 • 30.6k • 1.01k (https://huggingface.co/deepseek-ai/DeepSeek-V3.1-Base)

浏览引用此论文的 123 个模型 (https://huggingface.co/models?other=arxiv:2412.19437)

引用此论文的数据集5

alpha-one-index/awesome-ai-index (https://huggingface.co/datasets/alpha-one-index/awesome-ai-index)

jeffliulab/visinject (https://huggingface.co/datasets/jeffliulab/visinject)

AcroYAMALEX/acro-yamalex-llmjp-4-math-tir 查看器• 更新于4月6日 • 135k • 53 (https://huggingface.co/datasets/AcroYAMALEX/acro-yamalex-llmjp-4-math-tir)

molmohsen/deepseek-v3-paper 查看器• 更新于4月17日 • 1 • 36 (https://huggingface.co/datasets/molmohsen/deepseek-v3-paper)

浏览引用此论文的 5 个数据集 (https://huggingface.co/datasets?other=arxiv:2412.19437)

引用此论文的 Spaces1,615

浏览引用此论文的 1,615 个 Spaces (https://huggingface.co/spaces?arxivIds=2412.19437)

包含此论文的收藏集43

浏览包含此论文的 43 个收藏集 (https://huggingface.co/collections?paper=2412.19437)

相似文章

deepseek-ai/DeepSeek-V4-Flash-DSpark

Hugging Face Models Trending

DeepSeek 发布 V4 系列混合专家语言模型(Pro 1.6T/49B 激活参数,Flash 284B/13B 激活参数),支持百万 token 上下文,采用混合注意力和推测解码,声称具有最佳开源模型性能。

deepseek-ai/DeepSeek-V4-Pro

Hugging Face Models Trending

DeepSeek 发布了 V4-Pro 和 V4-Flash,这些混合专家模型采用混合注意力机制和 Muon 优化器,支持百万 token 级上下文。

deepseek-ai/DeepSeek-V4-Pro-DSpark

Hugging Face Models Trending

DeepSeek 发布了其 V4 系列的预览版本,包括 DeepSeek-V4-Pro(1.6T 参数,49B 激活)和 DeepSeek-V4-Flash(284B 参数,13B 激活),两者均支持百万 Token 上下文,并采用混合注意力、流形约束超连接和 Muon 优化器。

@nrehiew_: 给视觉学习者

X AI KOLs Timeline

一条推文描述了一个大型混合专家模型,总参数975B(活跃参数41B),在45T词元的多模态数据上训练而成,包含6个路由专家和2个共享专家,并与DeepSeek-V3进行了比较。