DeepSeek的Huawei芯片训练声明终于有了基准测试和质疑者(3分钟阅读)
摘要
一个由华为主导的联合体发布了基准测试,显示在Ascend芯片上对DeepSeek的V4模型进行高效后训练,但专家指出这仅涵盖后训练,并不能证明华为可以替代英伟达进行完整的预训练。
一个由华为主导的联合体发布了一份技术报告,记录了在华为Ascend芯片上对DeepSeek V4系列进行全参数后训练的情况,其运行模型FLOPs利用率为34.22%。
查看缓存全文
缓存时间: 2026/07/24 17:02
# DeepSeek 华为芯片训练声明终获基准测试
来源:https://www.implicator.ai/deepseeks-huawei-chip-training-claim-finally-gets-its-benchmarks-and-its-doubters/
AI新闻 (https://www.implicator.ai/tag/ai-news/)
一份由华为牵头的报告终于为中国的说法提供了效率数据,即其在昇腾芯片上对 DeepSeek 的 V4 系列进行了后训练。但该报告仅涉及后训练,专家表示 Nvidia 可能仍然承担了大部分繁重工作。
作者:Marcus Schuler (https://www.implicator.ai/author/marcus-schuler/)
一个由华为牵头的联盟在 7 月 22 日发布的技术报告中,记录了在华为昇腾芯片上对 DeepSeek V4 系列进行全参数后训练的过程,提供了 6 月份该说法首次出现时缺失的效率数据。该团队自己的测量结果显示,此次运行的模型 FLOPs 利用率 (MFU) 为 34.22%。独立专家表示,Nvidia 硬件可能仍然承担了大部分繁重工作,并将此结果解读为后训练和推理的证据,而非证明华为能够在前沿训练中取代 Nvidia。
**变化之处**
- 华为牵头的联盟于 7 月 22 日向 arXiv 提交的报告,记录了在华为昇腾芯片上对 DeepSeek 的 V4 系列进行全参数后训练的过程,并报告了 34.22% 的模型 FLOPs 利用率,相比开源基线方案实现了 2.93 倍的效率提升。
- 该论文仅涵盖后训练阶段,并未确定最初训练 1.6 万亿参数的 V4-Pro 使用的是哪种硬件;清华大学的刘知远告诉《麻省理工科技评论》,该模型可能仍然主要是在 Nvidia 硬件上训练的。
- 6 月份一篇来源于深圳市政府消息的报道称,该集群至少使用了 1000 颗昇腾 910C 芯片,该芯片在早期的 DeepSeek 测试中,推理性能约为 Nvidia H100 的 60%。
- 该报告发布之际,华盛顿正在调查中国公司的芯片获取渠道,北京也在权衡自身的 AI 模型出口管制,距离习近平计划中的华盛顿之行仅剩数周。
AI 生成摘要,经编辑审核。更多关于我们的 AI 指南:https://www.implicator.ai/about/
## 7 月 22 日的报告
周三的技术论文记录了在华为昇腾 NPU SuperPOD 上,针对 V4 系列(包括 V4-Flash 和 1.6 万亿参数的 V4-Pro)进行全参数后训练的端到端优化过程。
作者自身的测量结果将优化后的昇腾系统与开源基线方案进行了比较,指出效率提升了 2.93 倍。他们还表示训练过程保持稳定。
但该论文仅涵盖后训练,并未确定 V4 最初的预训练使用的是哪种硬件。
## 6 月 6 日声明中的差距
Tom's Hardware 曾撰文指出,最初的声明“没有附带基准测试”,也未提供运行时长、直接的 Nvidia 对比或集群效率的衡量标准。该媒体称这是“一系列可疑声明”的一部分,并指出 DeepSeek 未予置评。周三的论文增加了利用率和基线对比数据,两者均由华为领导的团队测量。
根据 6 月份的报道,该团队使用了至少 1000 颗昇腾 910C 芯片。这一数字来源于《南华早报》援引的深圳市政府消息,而非报告本身。Tom's Hardware 将 910C 描述为一款采用中芯国际第二代 7 纳米工艺和华为达芬奇架构的双芯片加速器。该媒体称,早期 DeepSeek 测试显示其推理性能约为 Nvidia H100 的 60%,该数据仅适用于推理。
## 对 Nvidia 角色的评估
清华大学计算机科学教授刘知远告诉《麻省理工科技评论》,DeepSeek“似乎仅将 V4 的部分训练过程适配到了中国芯片上”,该模型可能仍然主要是在 Nvidia 硬件上训练的。多位匿名消息人士告诉该媒体,中国处理器仍然更适合推理而非训练。
**在您的收件箱中获取 Implicator.ai**
来自旧金山的战略 AI 新闻。不炒作,没有“AI 将改变一切”的前奏。只提供发生了什么、谁赢了、为什么重要。太平洋标准时间每天早上 6 点发送。
邮箱地址:请检查收件箱,点击链接确认。
无垃圾邮件。可随时取消订阅。
在一场关于模型来源的争议中,一位特朗普政府高级官员声称 V4 是在走私的 Blackwell 芯片上训练的;DeepSeek 否认了这一说法,并提及使用了 H800 GPU 和昇腾 910C,而 Nvidia 则称该指控“牵强附会”。
据路透社报道,Omdia 首席分析师苏廉杰在 4 月份表示,DeepSeek 与华为的合作表明,这些模型在华为和 Nvidia 系统上可以实现相似的性能。5 月 24 日的 aiproem 分析指出,V4 最有力的启示在于推理应用,并表示该模型并不能证明华为可以在前沿训练中取代 Nvidia。
据 Thechinaacademy 报道,V4 已在 Nvidia GPU 和华为昇腾处理器上得到验证。该媒体还写道,DeepSeek 拒绝了 Nvidia 和 AMD 早期为 V4 进行优化的请求,然而该模型在发布时却运行在 CUDA 上。Nvidia 当天就展示了 V4-Pro 在 Blackwell 硬件上的运行,每位用户每秒处理超过 150 个 token。
## 习近平访华前的出口管制
路透社 7 月 21 日援引《金融时报》的报道称,中国正在考虑收紧对 AI 模型和芯片的出口管制。7 月 23 日,Semafor 援引 The Information 的报道称,美国正在调查中国 AI 公司获取先进处理器的渠道,并警告可能随后实施制裁或列入黑名单。路透社 7 月中旬的一篇分析文章称,中国商务部已与阿里巴巴、字节跳动和智谱 AI 会面,讨论限制包括未发布系统在内的国内模型向海外开放的事宜。
根据该分析,美国商务部 6 月下令禁止外国公民接触 Anthropic 的 Fable 和 Mythos 模型,这正是北京现在正在考虑针对自身模型采取的措施模板。据 Semafor 报道,这些美国调查发生在习近平计划访问华盛顿的几周前。
## 常见问题解答
**7 月 22 日的报告显示了什么?**
一个华为领导的团队记录了在华为昇腾 NPU SuperPOD 上对 DeepSeek 的 V4 系列进行全参数后训练的过程,报告了 34.22% 的模型 FLOPs 利用率,以及相比开源基线方案 2.93 倍的效率提升。这些数据是该团队自身的测量结果。
**这能证明中国在没有 Nvidia 的情况下训练出了前沿模型吗?**
不能。该论文仅涵盖后训练,并未确定 V4 最初的训练使用哪种硬件。清华大学的刘知远教授告诉《麻省理工科技评论》,该模型可能仍然主要是在 Nvidia 硬件上训练的,匿名消息人士称中国芯片仍然更适合推理而非训练。
**使用了多少颗华为芯片?**
6 月份一篇来源于《南华早报》援引深圳市政府消息的报道称,该团队使用了至少 1000 颗昇腾 910C 芯片。该数字来自地方政府,而非报告本身。
**昇腾 910C 与 Nvidia 相比如何?**
Tom's Hardware 将 910C 描述为一款采用中芯国际第二代 7 纳米工艺的双芯片加速器,并称早期的 DeepSeek 测试显示其推理性能约为 Nvidia H100 的 60%,该数据仅适用于推理。
**这个时间点为什么重要?**
该报告发布之际,美国正在调查中国公司获取先进处理器的渠道,北京也在权衡自身对 AI 模型的管制,这模仿了美国 6 月份禁止外国公民接触 Anthropic 的 Fable 和 Mythos 模型的命令,而这一切都发生在习近平计划访问华盛顿的几周前。
AI 生成摘要,经编辑审核。更多关于我们的 AI 指南:https://www.implicator.ai/about/
**中国考虑将 AI 模型权重和芯片设计加入出口清单** 中国商务部正在与阿里巴巴、字节跳动、智谱等国内 AI 及芯片公司协商可能的管制措施,涉及模型权重、用于训练的关键数据以及芯片设计。来源:The Implicator (https://www.implicator.ai/china-considers-adding-ai-model-weights-and-chip-designs-to-export-list/)
**Nvidia H200 对华交付在特朗普-习近平峰会后仍处于停滞状态** 在特朗普总统与习近平主席为期两天的北京峰会结束后,Nvidia 的 H200 处理器对华交付仍未恢复,峰会未能就半导体出口管制取得突破。来源:The Implicator (https://www.implicator.ai/nvidia-h200-deliveries-to-china-remain-stalled-after-trump-xi-summit/)
**美国商务部起草全球 AI 芯片出口规则,将销售与美国投资挂钩** 据彭博社和一份文件显示,美国商务部已起草法规,要求 Nvidia 和 AMD 几乎所有 AI 加速器芯片的出口都需获得政府批准。来源:The Implicator (https://www.implicator.ai/commerce-department-drafts-global-ai-chip-export-rules-linking-sales-to-us-investment/)
作者:Marcus Schuler (https://www.implicator.ai/author/marcus-schuler/)
旧金山
Implicator.ai 总编辑兼创始人。前 ARD 通讯记者和资深广播记者,拥有 10 年以上科技报道经验。撰写关于政策和市场动态的每日简报。常驻旧金山。邮箱:[email protected]
## 早间简报
### 在您的收件箱中获取早间简报
注册我们的免费每日早间新闻通讯及免费会员文章。仅我们的每周特别专业简报收费 8 美元/月。
相似文章
@bookwormengr: 关于CANN(华为版的CUDA)及DeepSeek V4在华为芯片上推理的精彩报道……“CANN(神经网络计算架构)
华为已开源其CANN软件工具包,以与Nvidia的CUDA竞争,而DeepSeek V4在华为昇腾芯片上显示出显著的推理性能提升。
面对美国出口管制,中国DeepSeek计划自主研发芯片
面对美国出口管制,中国AI初创公司DeepSeek正在自主研发推理芯片,以减少对英伟达和华为的依赖,加入AI公司设计定制芯片的潮流。
又一个‘DeepSeek时刻’?分析师称华为里程碑改变中国芯片竞赛轨迹
华为推出Tau缩放定律,这是一种绕过美国制裁的芯片架构变通方案,旨在到2031年实现相当于1.4纳米工艺的晶体管密度,标志着中国半导体自给自足迈出重要一步,并改变了与华盛顿的技术竞争格局。
@rohanpaul_ai: 路透社:DeepSeek 已将其 V4-Pro 的价格削减永久化,将价格降至原始 API 成本的 25%。Deep…
路透社报道称,DeepSeek 已将其 V4-Pro API 的价格削减永久化,成本降至原价的 25%,这归因于在中国 AI 硬件战略背景下,从英伟达芯片转向华为芯片。
@cyrilXBT:中国刚刚打造了一款AI模型,以极低成本与OpenAI和Anthropic正面竞争。而且有人刚刚发布了一门免费课程……
DeepSeek是一款由中国量化对冲基金开发的AI模型,据报道其训练成本仅为GPT-4的约5%,却能达到相当的性能水平,引发了市场剧烈震荡,导致NVIDIA单日市值蒸发6000亿美元。目前已有人发布了一门时长1小时50分钟的免费课程,教用户如何在本地及通过API使用DeepSeek V4。