@bookwormengr: https://x.com/bookwormengr/status/2057909493250539891
摘要
对DeepSeek长期战略的分析,认为其在MoE、GRPO和KV缓存缩减方面的创新旨在构建一个10万亿美元的中国AI硬件生态系统,而不是销售即时应用,可能实现1万亿美元的估值。
查看缓存全文
缓存时间: 2026/05/23 10:07
DeepSeek 的 10 万亿美元宏伟战略
你有没有想过,DeepSeek 将如何赚钱,而且是赚大钱?
他们没有像 GLM、MoonShot 和 MiniMax 那样推出有竞争力的编程方案。他们没有多模态、音频、视频模型。直到今天,他们都没有一个成熟的工具链(最近才开始招聘构建工具链的人才)?DeepSeek 还长期致力于开源,并且乐于分享他们的独门秘诀。这是疯狂吗?这纯粹是浪费钱吗?那些即将向 DeepSeek 投资 100 亿美元的投资人,是不是在把钱往水里扔?
不——恰恰相反,恕我直言!!!
**在此,我提出一些观察,关于他们至今为止所做的,以及他们似乎正在遵循的一项战略。梁文锋(DeepSeek CEO)的目光似乎放在了更大的目标上,他们可能实现 1 万亿美元的估值,同时帮助创建一个 10 万亿美元的产业!
TechInAsia 关于 DeepSeek 最新融资轮的新闻
TechInAsia 关于 DeepSeek 最新融资轮的新闻
重温 DeepSeek 的英雄之旅
DeepSeek 一直逆风而行,没有去构建渐进式更好的模型并试图销售即时应用(例如编程方案)。我在 2025 年 1 月 27 日发布了一条关于我所看到的 DeepSeek 英雄之旅的爆火推文。这个故事现在变得越来越有趣了。
- 当人们试图构建密集模型时,DeepSeek 却瞄准了难以训练的混合专家模型 (MoE)。
- 他们从“第一性原理”出发,发明了新的算法 GRPO,以取代实施成本更高的主流 PPO 强化学习 (RL) 算法。
- 他们发现从验证奖励进行强化学习 (RLVR) 是提升模型推理能力的关键策略。
- 他们通过“多 Token 预测”提出了一种简单的推测解码策略,同时也使训练信号更加密集。
- 他们完善了“零气泡”流水线,以改善有限 GPU 资源的利用率。
- 他们发布了专家负载均衡器,使每个人都能轻松部署混合专家模型。特别是采用“宽专家并行”策略,可以更经济地服务模型,因为可以拥有大批次。
- 他们发明了 MLA、DSA、CSA、HCA 来减少 KV 缓存需求,并让计算需求在面对不断增长的上下文时几乎保持恒定。
- 他们发明了 Engram 以用内存换取计算。
- 他们发明了 mHC 来实现在模型规模增长时的稳定训练。这样的例子不胜枚举……
在英雄之旅的故事结构(最普适的结构)中,英雄从不决定自己的旅程将会怎样。他一路学习,为自己找到伟大的使命,并克服重重困难完成它。他遇到许多诋毁者,但他无视他们。他遇到许多恶意的参与者。他有巨大的缺陷或短板——但他克服它们,完成使命。他面对似乎不可逾越的挑战,但设法结成联盟并明智地使用宝贵资源。这正是让观众支持英雄的原因。这也是 DeepSeek 赢得粉丝追随、全球尊重以及诋毁者的原因。
正如我将详细展示的那样,DeepSeek 在这段旅程上已经走了足够久,并发现了终极命运:不是销售编程方案,而是赋能一个 10 万亿美元的中国 AI 硬件生态系统,并为自己实现 1 万亿美元的估值。 在这个过程中,他们也将赋能西方硬件生态系统中的许多新进入者。
欢迎评论和批评:@naval @teortaxesTex @jukan05 @bubbleboi @poezhao0605 @hsu_steve @tphuang
先从 KV 缓存计算的趣味练习开始:
阅读这条来自 @SemiAnalysis_ 的及时推文:
DeepSeek 已经比任何人都更好地解决了这个问题!
DeepSeek 已经比任何人都更好地解决了这个问题!
我们先做点有趣的 KV 缓存数学。如果你不喜欢数学,别担心。我们将使用最近发布的 KV 缓存计算器,看看 DeepSeek V4 Pro 实现的 KV 缓存节省,并与最新的 GLM 和 Qwen 模型进行比较。
我按 1M 上下文计算。我假设 8 位 KV 精度和 16 位索引器精度。你可以亲自操作计算器。
https://kvcache.ai/tools/kv-cache-calculator/
亲自操作计算器!
亲自操作计算器!
对于 1M 上下文
- DeepSeek V4 只需要 5.48 GB HBM
- GML5 需要 60 GB HBM
- Qwen3-235B-A22B 需要高达 89B
请注意
- DeepSeek 是 1.6T 参数模型,
- GLM5 大约是 700B 参数,它已经使用了 DeepSeek 的 MLA 和 DSA;尽管不是最新的压缩注意力
- Qwen3-235B-A22B 大约是 235B 参数,使用了 GQA 注意力
DeepSeek 为缓解内存压力做出了基础性贡献。如果这项创新被广泛采用,将使长期代理变得非常经济,并解锁下一组用例。
1M Token 和模型大小的 KV 缓存占用对比
1M Token 和模型大小的 KV 缓存占用对比
疯狂背后的方法:
这种小尺寸的 KV 缓存——在不影响质量的情况下——是他们能够以如此低廉的价格提供长期缓存的原因——比 Sonnet 4.6 的缓存命中价格低不到 3%——并且他们可以将其保持数小时。
对于长时任务,少量缓存使得卸载到 SSD 并重新加载变得非常经济。这降低了对 HBM 的需求,而 HBM 是供应短缺且从中国 AI 硬件产业角度来看最难制造的内存。DeepSeek 还开发了如双路径论文中所述的从 SSD 更快加载 KV 缓存的技术。
他们的新 DeepSeek V4 将 KV 缓存压缩得如此之多,甚至可能不需要这个了。
他们的新 DeepSeek V4 将 KV 缓存压缩得如此之多,甚至可能不需要这个了。
谁是 KV 缓存压缩的直接受益者?:
谁大量供应 SSD?记住YMTC 正在崛起为 3D NAND 巨头。 NAND 使 DeepSeek 能够避免重新计算 KV。反过来,DeepSeek 为 NAND 和 SSD 创造了巨大的市场——不仅仅是 YMTC 的,还有所有其他厂商的。
但这不仅仅是关于 NAND 和 SSD:
LPDDR 内存在作为存放权重并根据需要将权重流入 HBM 的地方具有巨大潜力,从而减轻对 HBM 需求的压力。SGLang 团队发表了一篇关于此的优秀博客。我下面的图表解释了该方案的工作原理。
虽然 DeepSeek 没有为此做任何专门的事情——但他们的 MoE 架构具有大量专家和 4 位权重,使得实现该方案变得容易。
示意图展示内存如何被使用以及权重如何从 LPDDR 流入 HBM。强烈推荐阅读 SGLang 博客。
示意图展示内存如何被使用以及权重如何从 LPDDR 流入 HBM。强烈推荐阅读 SGLang 博客。
这项创新与超紧凑的 KV 缓存(无损)相结合,显著降低了 HBM 需求。
谁在中国制造 LPDDR?CXMT。 他们在速度上仅落后 LPDDR 0.5 代,在密度上落后 1 代**。差距不远!** 此外,加上丰富的 NAND,中国生态系统在不久的将来将拥有丰富的 LPDDR。这能减轻计算压力吗?是的。 继续看……
智能使用内存也减轻了 GPU/ASIC 的压力
很明显,使用 NAND 进行 KV 缓存可以更长时间地保持 KV 缓存,减轻 HBM 的压力,并有助于避免重新计算 KV 缓存,从而减轻 GPU 和 ASIC 的计算压力。LPDDR 能否以类似的方式提供帮助,同时还是可以“即时”流入权重的场所?答案是肯定的。
LPDDR 支持容纳大量的所谓“Engram”。在他们的 Engram 论文中,DeepSeek 表明,虽然 MoE 通过条件计算来扩展容量,但 Transformer 缺乏用于知识查找的本地原语。它们被迫通过计算来低效地模拟检索。他们引入了 Engram,一个将经典的 N-gram 嵌入现代化为 O(1) 哈希查找的模块,创建了一个他们称之为条件记忆的互补稀疏性轴。这节省了计算,但需要内存来存储可能很大的嵌入表。这是一个经典的内存-计算替代,但关键在于“内存”方面每比特检索成本要低得多(一次 LPDDR 查找对比一次完整的 Transformer 层前向传播),使其在规模上成为非常有利的权衡。这就是他们通过交换内存来节省计算的方式!!!
值得做出的权衡: 中国 GPU 和 ASIC 由于无法达到相同的小芯片晶体管密度(没有 EUV),将永远在原始 FLOPs 上落后于西方 GPU。他们在封装方面也相当落后。因此,这种权衡非常值得,特别是如果你能制造丰富的 NAND 和 LPDDR 内存。
重述 DeepSeek 的长期博弈:
从所有这些创新来看,DeepSeek 的博弈似乎不是立即赚取几亿美元的利润(考虑到他们所做的所有选择:还没有多模态、没有语音模型、视频模型——那是什么?)——但他们正在玩一场耐心的 10 万亿美元游戏,以启用替代硬件生态系统。
这不仅是为了让中国的存储厂商成为中国乃至全球 AI 硬件领域的关键参与者,也是为了降低资源需求本身,以便能够经济高效地训练和服务 AI 模型——这将使许多 GPU/ASIC 制造商以及网络芯片制造商成为可行的选择。所有这些创新也将帮助西方开源生态系统以及新的硬件制造商。
所有迹象都在那里。让我们详细重述他们提出的所有创新:
-
混合专家 (MoE) 和 MLA 在 DeepSeek V2 中引入。MoE 使得以少 40% 到 50% 的计算量训练非常智能的模型成为可能。MLA 使得 KV 缓存减少了 90%。这使得将 KV 缓存卸载到 SSD 非常高效。这些想法是在他们 2024 年 5 月的论文 DeepSeek V2 中引入的。后来它解锁了 DeepSeek V3 的训练,当时该模型几乎闭源,仅使用了 2048 个阉割版 H800 GPU。
-
DSA(在 DeepSeek V3.2 Exp 中引入)用于减少长上下文场景的计算量,同时缓解 HBM 带宽压力。它确保计算量不会随着上下文增长而增长。请参见下面的图表——DeepSeek-v3.2 的处理时间随上下文保持平稳。
-
mHC 于 2025 年 12 月在论文《mHC: Manifold-Constrained Hyper-Connections》中引入。mHC 是 DeepSeek 的一项宏架构创新,它重新发明了信息在 Transformer 层之间的流动方式。它不是自 ResNet 以来使用的标准残差连接 (x + F(x)),而是将残差流扩展为多个并行的信息高速公路,并允许它们之间进行学习的混合——但关键是将混合矩阵约束为双随机矩阵(通过 Sinkhorn-Knopp 投影到 Birkhoff 多面体上),这在数学上保证了信号幅度在任意深度上得以保留。
- 这解决了困扰无约束 Hyper-Connections(最初由字节跳动发明)的灾难性不稳定性,在 27B 规模下信号放大爆炸到 3000 倍,导致训练完全崩溃。
- 计算成本极低: mHC 仅增加 6.7% 的挂钟训练开销,因为它不改变注意力或 FFN 层的 FLOPs,只改变它们的输出在层间的路由方式。
- 然而,性能提升是显著的: 在 27B 参数下,mHC 在 BIG-Bench Hard 推理上提升了 +7.2 分,在 DROP 上提升了 +3.2,在 GSM8K 数学上提升了 +2.8,在 MMLU 通用知识上提升了 +1.4,所有指标都在相同的模型规模和几乎相同的计算预算下。
本质上,mHC 通过为网络提供更丰富、更具表现力的拓扑结构来跨层路由信息,同时几乎不增加额外的 FLOPs,从而实现了每个参数更高的智能。
mHC 是一个复杂的架构,但它提供了很好的训练稳定性和更高的每参数智能
mHC 是一个复杂的架构,但它提供了很好的训练稳定性和更高的每参数智能
-
CSA、HSA(于 2026 年 4 月在 DeepSeek V4 中引入)通过压缩 KV 令牌将 KV 需求再减少 90%,并大幅减少所需的 FLOPs,从而缓解 HBM 和 GPU/ASIC 的压力。
-
Engram 于 2026 年第一季度引入,他们用内存(LPDDR 内存)来交换计算(在某种程度上)。如下详细图表所示,在相同总体参数预算下,Engram 带来的性能提升。
-
极度关注计算和通信重叠,以及像双路径这样的创新,可以解释为应对资源约束的工作方式。但 DeepSeek 更进一步,在 ASIC 设计上向硬件供应商提供建议,以确保他们不浪费宝贵的硅资源。 这来自 DeepSeek V4 论文。
这是他们在 DeepSeek V4 论文中分享的建议。可以肯定,他们私下分享的反馈要多得多。
这是他们在 DeepSeek V4 论文中分享的建议。可以肯定,他们私下分享的反馈要多得多。
- 对 TileLang 的投资指向一个一致的方向:他们不仅是在应对自己的计算危机,而且是在使中国硬件生态系统与西方生态系统具有竞争力。通过 Tilelang,可以一次开发内核(计算代码),并在支持 TileLang 后端的多个硬件平台上成功运行。我预计所有其他中国实验室都会加入进来——帮助中国硬件制造商间接应对“CUDA 护城河”。这也解锁了更多像 AMD 这样的西方硬件。 注意:中国的许多 AI 平台要么提供 CUDA 兼容性,要么提供 CUDA 翻译层:摩尔线程、MetaX、壁仞科技、以及天数智芯是通过翻译层与 CUDA 最兼容的中国芯片。他们理论上不需要 TileLang。
大规模 RL 和 RSI:
随着更多计算资源的获取(由于更多潜在的硬件选项)和计算需求的降低,DeepSeek 可以承担更雄心勃勃的训练项目;特别是 RL 后训练。RL 涉及生成大量轨迹——生成数万亿个 Token。这很快就会变得非常昂贵。此外,要训练 1M 上下文模型,你需要生成长度如此之长的轨迹。为如此长的轨迹训练模型可以实现长时任务。
此外,由于选项增加,DeepSeek 可用的硬件更多,这将实现自动化研究 (RSI)。RSI 涉及 AI 本身设计和执行实验。这种方法有大量的试错,并且会很快变得昂贵。然而,RSI 对于探索整个设计空间至关重要。 DeepSeek 需要在达到 AGI 然后 ASI 之前具备 RSI 能力。
DeepSeek 今天做的,就是行业其他公司明天要做的:
DeepSeek 在混合专家、MLA、DSA 方面的创新已经被全球以及中国的其他 AI 实验室所采用。
例如,GLM 系列模型的制造商 ZAI 使用了 MLA 和 DSA。Kimi (Moonshot) 已经采用了 MLA,并且毫不避讳地表示他们的架构基于 DeepSeek 的架构。作为回报,DeepSeek 使用了 Muon 优化器,该优化器最初由 Kimi (Moonshot) 用于大规模训练。
(注意:
- MoE 由 Google 在 2017 年发明,Naom Shazeer 是主要作者。DeepSeek 将其大规模应用并发明了自己的技巧。
- Muon (MomentUm Orthogonalized by Newton-Schulz) 优化器由机器学习研究员 Keller Jordan 于 2024 年末创建。Kimi (Moonshot) 团队是第一个在大规模使用它的。)
关于如何赚钱呢?:
我们研究一下 OpenAI 的有趣案例。OpenAI 根据消费里程碑,获得了以低价购买 AMD 和 Cerebras 股票的认股权证/期权。这对 AMD 和 Cerebras 来说是一笔好交易。OpenAI 对他们做出承诺,这使得他们长期成功成为可能。
摘自 AMD 的公告:“作为协议的一部分,为了进一步对齐 s
相似文章
@mark_k: 关于DeepSeek AI(@deepseek_ai)的一篇引人入胜且非常深刻的分析文章。你绝对猜不到他们的策略是什么……
对DeepSeek AI非常规策略的分析:优先采用激进架构创新(MoE、MLA、engram、mHC),大幅降低计算和内存需求,从而实现长期布局,构建一个10万亿人民币的中国AI硬件生态系统,并追求1万亿美元估值。
DeepSeek推进102.9亿美元融资轮,梁文峰承诺继续开发开源AI模型而非追求短期商业化目标
DeepSeek正在进行102.9亿美元融资,创始人梁文峰重申致力于开源AI开发和长期AGI目标,而非短期商业化。
AI 初创公司 DeepSeek 预计估值将达 740 亿美元(3 分钟阅读)
AI 初创公司 DeepSeek 正寻求融资 74 亿美元,用于研发和计算基础设施建设,目标估值 740 亿美元。
@FinanceYF5: 1/ DeepSeek 在下一盘万亿大棋 它不做编程套餐,不做多模态,还坚持开源——看着像自废武功。 真相是:它要的不是几亿美元生意,而是托起一个 10 万亿美元的中国 AI 硬件生态。
DeepSeek 不做编程套餐、不多模态且坚持开源,看似自废武功,实则旨在推动一个10万亿美元的中国AI硬件生态。
@bookwormengr: https://x.com/bookwormengr/status/2072421710692028900
美团的长颈鹿实验室(LongCat Lab)如何利用华为的910C AI芯片和CloudMatrix超级集群训练出长颈鹿2.0(LongCat 2.0)模型的分析,展现了中国AI生态系统如何克服美国出口管制。文章强调了美团向AI驱动的超级生活应用的战略转型,以及华为在AI工厂基础设施方面的创新。