Can Google’s AI Chip Beat Nvidia?
摘要
一篇深度科技长文,分析 Google 的 TPU 芯片能否挑战 Nvidia 的 GPU 霸主地位,指出胜负关键不仅在硬件本身,更在于 CUDA 软件生态、成本账单以及 Anthropic 等大客户在两种芯片之间分散下注的策略。
暂无内容
查看缓存全文
缓存时间: 2026/10/01 16:39
# Google 的 AI 芯片能击败 Nvidia 吗?
**TL;DR:Google 用十年造出了专供自用、如今开始外售的 TPU,但 Nvidia 的 CUDA 软件生态与"可解决各家问题"的硬件定位,让最大的客户 Anthropic 选择两边下注——决定胜负的不只是芯片本身,还有根系般的软件体系与真实的账单。**
## 从一笔"数百万美元"的算术题说起
十年前,Google 的工程师们提出了一个看似简单的问题:如果每天都有人用神经网络驱动的语音搜索,哪怕每人只用三分钟,会怎样?
答案让他们不安:如果使用普通处理器,Google 需要把数据中心的数量翻一倍。每人三分钟,就得盖两倍的楼。于是 Google 成立了一个团队来打造自己的芯片,任务只有一个——用更少的时间、更少的电,回答这些搜索。
而在那之前,研究者已经发现了一种对 AI 有帮助的芯片,它来自一个完全不同的领域:Nvidia 为电子游戏制造 GPU。
## GPU 为什么适合 AI
在游戏里,画面不断变化,每一帧都意味着海量计算。GPU 能同时完成其中许多计算,就像把一大张算术题分给满屋子的人,每个人同时做一小部分。
而 AI 的大部分运算,恰恰也可以这样拆分。
一个标志性事件:研究者用两块 Nvidia GPU 训练了一个名为 **AlexNet** 的图像识别系统,并以大幅优势赢得了一场重要比赛。Nvidia 还提前埋下了另一样东西——**CUDA**,一套让程序员把 GPU 用于图形之外任务的软件。记住这个名字,它还会反复出现。
## TPU 与 GPU 的根本区别
神经网络内部的大部分工作,归根结底是对大块数字网格做乘法和加法。Google 团队为此专门造了一款芯片:**张量处理单元(TPU)**。
它的设计逻辑与 GPU 截然不同:
- **GPU**:数千个小型、灵活的运算单元同时工作,各自从内存中取数。于是内存会堵塞,运算单元只能干等。
- **TPU**:一排计算器,按照预先定好的流程运行。模型的数字一直停在各自的单元格里,数据只进入一次,然后在单元格之间反复使用。
一个形象的比喻是蚂蚁。GPU 的蚂蚁各自去打水,工蚁很多,却都在池塘边排队——不过每只蚂蚁都能干不同的活,这正是 GPU 的优势。TPU 的蚂蚁则原地不动,把水沿流水线一个个传下去。
团队在 **15 个月**内完成了第一款 TPU 的设计、制造与部署。等到 Google 在 2016 年对外宣布时,它已经运行了一年多,既支撑了 Google 搜索,也在 AlphaGo 对阵围棋冠军李世石的比赛中派上了用场。
## Google 与 Nvidia:两种造芯片的哲学
也是在同一年,Nvidia CEO 黄仁勋亲自把一台 AI 计算机送到了 OpenAI。
这里出现了一个关键差别:
- **Google** 是为了自己早已存在的问题,在自己的楼里造出了芯片;
- **Nvidia** 卖出的,是其他团队可以用来解决各自问题的硬件。
这个差别至关重要。
## 从自用到租用:TPU 走向市场
随后,Google 向那些团队迈出了一步。新一代 TPU 既能训练模型,也能运行模型,其他公司可以通过 Google 的云租用。
多年后,Apple 发布的一份报告提到,其服务器模型是在 **8000 多颗 TPU** 上训练出来的。
所以,Anthropic 的那笔交易,押注的是已经大规模验证过的硬件——**多达 100 万颗芯片,将分批到位,而不是一次性交付**。
## 为什么 Anthropic 仍然离不开 Nvidia:CUDA 这棵"树"
既然 TPU 可行,为什么 Anthropic 依然需要 Nvidia?部分答案在于 CUDA。
可以把 Nvidia 想象成一棵树:
- **地面上看得见的部分**是硬件——GPU 和机柜;
- **地下的根系**,是让这些 GPU 转动起来的软件——CUDA。
Nvidia 在 **2006 年**埋下了这些根系,远早于 AI 浪潮。它们不断蔓延,构建 AI 模型最流行的框架 **PyTorch**,根扎得最深的地方正是 CUDA。数百万开发者、多年积累的代码——迁移到另一款芯片,可能意味着数周的重写与重测。
Google 则培育了自己的根系:**JAX 和 XLA**,Gemini 就是在那里训练的。但大多数外部开发者用的是 PyTorch。
因此,**2026 年 Google 推出了 TorchTPU**,让 PyTorch 程序几乎只需最小改动就能在 TPU 上运行。
结论很直接:芯片很重要,但**根系决定了人们迁徙的难劣程度**。
## 推理阶段的陷阱:Ironwood 应运而生
训练之后,是永不停歇的部分——人们使用模型。每一次回复,都会让芯片重新运转起来。这正是 TPU 诞生的使命。
于是 Google 打造了 **Ironwood**,一款专为回答(inference)而生的后期 TPU。
但回答有一个陷阱。还记得那个池塘吗?一次取水就能喂饱整条流水线,因为同一滴水可以被反复使用。而模型是一小块一小块地写出回复的——每一块内容,芯片都要把模型学到的数字从内存里重新读一遍。
同时为很多人服务时,他们可以共用每一次取水,**但只能共用到一定程度**。于是蚂蚁不停地往池塘跑,流水线只能原地待命。
所以 Ironwood 不仅仅是一台更快的计算器。Google 给了它:
- 多得多的内存;
- 通往内存的更快路径;
- 芯片之间更快的连接。
Nvidia 也没有停下脚步:它的 GPU 现在包含专为这类网格运算设计的模块,并以 **72 颗芯片为一组**、接线后像一台机器那样协同工作的机柜形式售卖。
## 2025 年的市场震动
2025 年 11 月,Google 发布了**仅在 TPU 上训练的 Gemini 3**。
一周后,有报道称 Meta 正在洽谈为自家数据中心购买 TPU。Nvidia 股价下跌。
几乎从不评论竞争对手的 Nvidia 发布了一份声明:
> "我们为 Google 的成功感到高兴。"
接着又说:
> "Nvidia 领先行业一代。"
一个月后,Nvidia 与 **Groq** 签下约 **200 亿美元**的交易——它历史上最大的一笔。Groq 的芯片专为回答阶段而造。而 Groq 创始人 Jonathan Ross,**12 年前曾在 Google 参与启动 TPU**。
## 账单才是真正的考验
这就回到了账单问题。更低的每小时价格看起来稳赚不赔,但**一台更便宜却更慢的机器,等活儿干完时可能反而更贵**。
Google 确实有一项真正的优势:据估算,一颗顶级 Nvidia 芯片的制造成本约 **6400 美元**,售价却在 **3 万到 4 万美元**之间。Google 在自家芯片上不必支付这层溢价。
但——Google 内部省下的钱,未必会自动变成客户账单上的节省。
而且,当 Google 说它的下一代 TPU 每美元性能提升 **80%** 时,它对比的是**自己的上一代 TPU**,而不是 Nvidia。
真正有意义的测试来自客户自己的模型:**同样的质量、同样的速度、更低的账单**。
## Anthropic 的第二笔交易说得通了
在 TPU 宣布之后,Anthropic 承诺向 **Microsoft** 购买 **300 亿美元**的 Azure 计算资源,并与 **Nvidia** 达成合作;**Amazon** 仍然是它主要的云与训练伙伴。
它不是在挑选一款芯片,而是在多条战线上同时布局。
Google 也在做类似的事:在发布下一代 TPU 的那场活动上,Google 还宣布将通过自家云提供 Nvidia 的下一代芯片。无论客户选哪一边,Google 都能赚钱。一家公司内部,未必只能有一个赢家。
## 一些东西已经变了
但这个故事开篇以来,有些东西已经改变。
- Google 的母公司 Alphabet 现在会公布 **TPU 系统的销售收入**,而不只是租用收入。
- 据称,**2026 年 Meta 同意租用 TPU**。
- 与 Google 共同制造芯片的 **Broadcom**,预计每年出货价值数百亿美元的 TPU,而 Anthropic 是它最大的客户。
Jensen Huang 对此有一个回答:
> "如果没有 Anthropic,TPU 的增长还从何而来?"
而 Nvidia 依然庞大:仅一个季度,其数据中心业务就报告了 **890 亿美元**收入。
## 如果 Google 赢了,意味着什么?
它可能意味着某家公司为下一个模型选择了 TPU,或者把部分回答工作迁到 Google,因为数字算下来更划算,同时继续用 Nvidia 完成其他任务。
2013 年,Google 的工程师看着三分钟的语音搜索,决定造一款芯片来改变自己的计算方式。现在,Google 把改变他人计算方式的机会摆在了其他公司面前。
**要产生意义,它不必取代每一颗 Nvidia GPU;它只需给那些公司一个理由,让它们在下一笔订单中选择自己。**
---
Source: [Can Google’s AI Chip Beat Nvidia? — Ill_Vegetable169](https://www.youtube.com/watch?v=yB9SC4HbH5o)
相似文章
谷歌正在使用英伟达的策略来打造有竞争力的AI芯片业务(11分钟阅读)
谷歌正在采用英伟达的策略来打造有竞争力的AI芯片业务,向Anthropic出租TPU计算能力,并提升推理性能以与英伟达的主导地位竞争。
@snowboat84: https://x.com/snowboat84/status/2061962883651731602
本文是AI工程全景系列的上篇,从历史角度梳理了GPU从游戏显卡到AI加速器的演化、CUDA的豪赌、谷歌TPU的独立路径,以及英伟达为何最终胜出,详细剖析了芯片、供应链、网络、电力等AI基础设施的底层逻辑。
AI淘金热进入最危险阶段
谷歌通过向外部客户开放TPU并瞄准推理市场,正激进挑战英伟达在AI芯片领域的霸主地位,或将重塑全球AI经济格局。
据报道,Google 与 AMD 合作设计下一代 TPU —— 混合 AI ASIC 可能集成片上 CPU 核心用于强化学习(3 分钟阅读)
据报道,Google 与 AMD 合作设计下一代 TPU,该 TPU 可能集成片上 CPU 核心以处理强化学习工作负载,有望推动 AI 硬件架构的发展。
Testing AI chips to survive in space
Google's Project Sun catcher is testing AI hardware, including TPU chips, to withstand space conditions like launch vibrations and radiation for future space-based AI data centers.