TPU推理外部化全速推进(35分钟阅读)
摘要
SemiAnalysis报告称,Google的TPUv7 Ironwood芯片在推理任务中,每美元性能比NVIDIA的B200/B300高出50%,标志着TPU外部化在更广泛行业应用中取得重大进展。
Google的TPUv7 Ironwood芯片相比NVIDIA的B200/B300芯片,每美元性能高出50%。Ironwood是Google首次通过可直接购买或通过其云服务租用的芯片,竞争他人推理工作负载的代次。Google拥有数十年的软件工程经验,因此外部TPU软件应能快速成熟。本文探讨了TPU系统,并讨论了使该技术栈广泛可用所需的步骤。
查看缓存全文
缓存时间: 2026/09/08 23:54
# TPU推理外部化全速推进
来源:https://inferencex.semianalysis.com/blog/tpu-inferencex-full-steam
*最初发表于SemiAnalysis通讯(https://newsletter.semianalysis.com/p/tpu-inferencex-full-steam)2026年9月7日\。*
十多年来,业界目睹了Google依靠自研芯片构建起庞大帝国。搜索、广告、YouTube以及每一代Gemini模型都运行在TPU上。几乎没有其他加速器能像TPU这样引发如此多的架构审视,也没有哪个技术领域像TPU这样,围绕其脱离Google后的性能与经济性展开激烈辩论。到2029年,Anthropic已成为TPU最大使用者,其使用量已超过DeepMind的内部用量。
Google Ironwood TPUv7宣传图 来源:Google (https://blog.google/innovation-and-ai/infrastructure-and-cloud/google-cloud/ironwood-google-tpu-things-to-know/)
Google内部的成功从来不是问题。真正的问题在于:业界其他公司能在多大程度上获得这种优势?能否采用开放权重模型,通过熟悉的推理引擎提供服务,并在业务关键的成本效益上超越NVIDIA?
今天,我们在InferenceX (https://inferencex.semianalysis.com/) 官方预览版发布了首款TPUv7 Ironwood的第三方推理测试结果。在与B200/B300的同等条件对比中,Ironwood的每美元性能提升高达50%。其优势覆盖帕累托曲线的大部分区间,我们将从双方角度分析经济性:Google内部的总拥有成本(TCO)与外部客户实际支付的TCO。
Ironwood(TPUv7)是Google首次通过可直接购买或租赁的芯片,为外部客户提供推理服务。2025年11月,我们已指出(https://newsletter.semianalysis.com/p/tpuv7-google-takes-a-swing-at-the)Anthropic青睐TPU,并承诺采购超过100万颗芯片(约40万+直接购买,60万+通过GCP租赁),主要用于训练也兼顾推理。我们的加速器模型提供最新的Anthropic TPU出货量及Google整体TPU季度出货数据,并包含对TPUv8i、v8t及各代v9/v10等产品的预测(https://semianalysis.com/accelerator-hbm-model/)。
我们对新型TorchTPU技术栈(TPU外部专用栈)的发展速度感到振奋。后文将探讨TPU软件外部化所需的工作,包括优化推测解码、分离式预填充、KV缓存卸载、多轮智能体负载等。即便如此,SemiAnalysis**坚信TPU外部化正沿着正确方向全速前进**。此外,与仍在构建测试优先软件文化的AMD不同,Google拥有数十年软件工程经验和成熟的质量驱动文化,因此我们预计外部TPU软件将快速成熟。
本文将涵盖TPU内核与开放权重模型服务栈的所有优化,包括DP注意力优化、MoE路由与内核优化、GDN内核填充减少等。我们还将深入探讨TPU系统,以及卓越的TPU性能工程师为广泛推广该技术栈所追求的后续步骤。
Google用十余年时间证明了TPU的强大能力。现在,我们将衡量业界其他公司能用它实现什么。
感谢Google团队(Chris Chan, Jahangir Hasan, Wangyuan Zhang, Anne Stern, Puneith Kaul, Ruizi Dong, Sangam Jindal, Qi Zhou, Madhan Jaganathan, Gang Ji, Jun Wan, Devanshu Jain, Jiaxin Cao, Srinath Mandalapu, Haowen Ning)和Inferact团队提供的卓越TPU基础架构与性能!同时也感谢正在开发TorchTPU SGLang的RadixArk团队。
## InferenceX官方预览:TPUv7 Ironwood 对比 Blackwell 及 Blackwell Ultra
https://inferencex.semianalysis.com/blog/tpu-inferencex-full-steam#inferencex-official-preview-tpuv7-ironwood-vs-blackwell-and-blackwell-ultra
我们已看到即将推出的原生TorchTPU vLLM技术栈在同等对比中展现出超越NVIDIA GPU的强劲表现。Google使用Qwen3.5 397B FP8模型作为初始部署模型。后续章节将深入探讨为何TorchTPU新方案能显著改进以往用于外部TPU vLLM/SGLang服务的TorchAX路径。
基础稳固后,Google计划扩展支持其他开放权重模型,包括Kimi K3和GLM 5.3。当少数模型获得充分优化后,我们相信在发布当天就能为众多主流开放模型提供优化支持将变得容易得多。目前vLLM和SGLang在发布当天主要支持NVIDIA,对AMD的支持仅达基本可用水平。我们预计TorchTPU将在不久的将来足够稳定,使vLLM和SGLang维护者可能将其加入发布当天的支持列表。该技术栈预计于10月左右结束内测并开源。
在采用FP8和单token预测的聚合服务同等对比中,TPU的每美元性能比运行FP8聚合服务的B200和B300高出50%。使用NVIDIA GPU的FP4模型服务时,其质量相比FP8存在损失。TPUv7不支持原生FP4计算,因此在FP4上NVIDIA GPU仍保持领先。这将随支持原生FP4的TPUv8i发布而改变,我们坚信TPUv8i Boardfly将与Rubin NVL72具备竞争力。
我们认为,一旦Google启用分离式服务和推测解码(双方均启用MTP与分离式服务),TPU的每美元性能优势将得以延续。后文将探讨TorchTPU基础架构就绪后Google计划添加的优化。为控制初始部署范围,Google最初聚焦于8k1k基准测试。但我们相信TorchTPU技术栈在智能体负载方面也将表现出色,相关结果将于年内稍后发布。后文将讨论TPU外部推理的后续步骤与路线图。
### TPU凭借每美元性能制霸
https://inferencex.semianalysis.com/blog/tpu-inferencex-full-steam#tpu-is-king-on-performance-per-dollar
在100 tokens/s/user交互性下,Ironwood每百万总token成本约0.181美元,对比B200的0.222美元和B300的0.276美元。这意味着在相同用户生成速度下,其成本比B200低约19%,比B300低34%。
本次对比采用外部TPU TCO与超大规模实验室采购TPU的B200/B300 TCO进行比较。去年SemiAnalysis加速器模型首次披露Google不仅通过GCP出租TPU,同时也在销售TPU(https://semianalysis.com/accelerator-hbm-model/)。在大部分交互性范围内,TPU较低的时薪成本抵消了其较低的吞吐量。SemiAnalysis TCO模型提供完整的TPU物料清单估算与TCO分析(https://semianalysis.com/ai-cloud-tco-model/)。
TPUv7 Ironwood、B200和B300在8k1k负载下采用外部TCO的每百万总token成本与交互性关系图 来源:SemiAnalysis InferenceX预览
TPUv7 Ironwood、B200和B300在8k1k负载下每芯片总token吞吐量与交互性关系图 来源:InferenceX预览
在大部分原始性能曲线上,TPU并未超越NVIDIA GPU。但此对比未考虑TPU更低的TCO。**TPU采购方主要关注其创收能力,即每美元性能与每瓦性能。**
不过,在20 tok/s/user交互性下,Ironwood也实现了原始吞吐量领先,达到9,364总tokens/s/chip,对比B200的8,903和B300的8,925。此场景下其吞吐量比任一GPU高出约5%。结合建模更低的小时成本,Ironwood每美元生成token数比B200高50.4%,比B300高96.0%。
TPUv7 Ironwood、B200和B300在Qwen3.5 397B FP8模型下20 tok/s/user交互性的每美元token数对比 来源:SemiAnalysis InferenceX预览
若采用Google内部TCO(每芯片小时1.03美元)计算TPU TCO,在并发256时其每美元性能优势扩大至超越B200 76.7%和B300 130.2%。但高并发结果存在延迟权衡。例如在并发256时,TPU平均首token延迟为5.41秒,而B200为3.75秒,B300为2.40秒。前述50%至96%的优势特指该数据点,而非所有延迟目标场景。
TPUv7 Ironwood采用Google内部TCO(每芯片小时1.03美元)对比B200和B300的每百万总token成本与交互性关系图 来源:SemiAnalysis InferenceX预览
观察端到端延迟,Ironwood在最高吞吐量点之后仍保持竞争力。在20秒中位数响应时间下,帕累托曲线显示TPU每百万总token成本约0.098美元,对比B200的0.106美元和B300的0.132美元。因此TPU成本比B200低约8%,比B300低25%。
TPUv7 Ironwood、B200和B300在Qwen3.5 397B FP8模型下每百万总token成本与中位数端到端延迟关系图 来源:SemiAnalysis InferenceX预览
TPUv7 Ironwood、B200和B300在Qwen3.5 397B FP8模型下每芯片总token吞吐量与中位数端到端延迟关系图 来源:SemiAnalysis InferenceX预览
尽管如此,B200在同等对比曲线的局部区域(如30秒中位数响应时间附近)仍可能占优。但当响应时间延长时,TPU重获每百万token成本优势,同时在所示重叠范围内相对B300保持成本领先。
### 非同等对比:GB300 NVL72分离式服务 对比 TPUv7聚合服务
https://inferencex.semianalysis.com/blog/tpu-inferencex-full-steam#apples-to-bananas-gb300-nvl72-disagg-versus-tpuv7-agg
Google已在生产环境内部运行多年高度优化的分离式服务,但外部TPU服务栈尚未完成完全优化的分离式路径。因此在目前分离式服务对比中,GB200/300 NVL72的每美元性能更具竞争力。但我们预计随着Google、Inferact、RadixArk和SemiAnalysis陆续完成优化,此差距将在数月内缩小,TPUv7将与GB200/300 NVL72具备竞争力,我们将在后续文章中发布TPUv7分离式服务对比GB200/300 NVL72分离式服务的结果。TPUv7集群可通过低延迟ICI互联扩展至1000+芯片,因此能实现NVIDIA NVL72无法支持的大模型分离式服务与超宽专家并行优化。
即便在TPUv7聚合服务与GB300 NVL72分离式服务的非同等对比中(采用内部TCO),TPUv7在高延迟及低至中左延迟区间仍具较强竞争力。但在中右端到端延迟对比中,GB300 NVL72分离式服务对TPUv7聚合服务具有优势。
采用内部TCO的TPUv7聚合服务与GB300 NVL72分离式服务每百万token成本与端到端延迟关系图 来源:SemiAnalysis
当对比GB300 NVL72分离式服务与TPUv7聚合服务时,其在低延迟和高延迟端到端区间表现接近,但在中间区域,GB300对TPUv7聚合服务存在约30%的每美元性能优势。我们坚信一旦TPUv7完成分离式服务优化,将在完整帕累托曲线上与GB300 NVL72展开竞争。
GB300 NVL72分离式服务与TPUv7聚合服务的每美元性能比(基于端到端延迟) 来源:SemiAnalysis
## 全新原生一级TorchTPU后端 对比 以往TorchAX技术栈的推理服务
https://inferencex.semianalysis.com/blog/tpu-inferencex-full-steam#inference-serving-with-the-new-native-first-class-torchtpu-backend-vs-the-previous-torchax-stack
### 以往TorchAX vLLM后端
https://inferencex.semianalysis.com/blog/tpu-inferencex-full-steam#previous-torchax-vllm-backend
Google此前使用TorchAX后端将基于PyTorch的vLLM和SGLang实现转换为JAX。TorchAX旨在让开发者通过JAX运行PyTorch模型定义。然而此方案的问题促使Google与PyTorch、vLLM和SGLang社区合作开发名为TorchTPU的新方案。它允许开发者将TPU作为原生PyTorch设备使用,而底层由StableHLO、XLA和TPU优化的Pallas内核处理执行。后文将展示此TorchTPU后端对比NVIDIA Blackwell及Blackwell Ultra GPU的性能。
vLLM TPU支持历经三个阶段演进:
- 首个TPU原型采用PyTorch/XLA(https://docs.pytorch.org/xla/master/learn/xla-overview.html)。其惰性执行模型将操作收集为计算图供XLA编译,而非立即执行每个PyTorch操作。
- 当前后端tpu-inference(https://vllm.ai/blog/2025-10-16-vllm-tpu)在可用时使用TPU优化的JAX实现,否则通过TorchAX将原始PyTorch模型转换为JAX可执行操作。目标是复用成熟的TPU原语与并行支持,无需重写每个PyTorch模型。
- 即将推出的第三阶段TorchTPU将让vLLM将TPU视为原生PyTorch设备,它将成为SGLang和vLLM在TPU上的首选后端。
下图展示第二阶段细节,说明vLLM的tpu-inference后端如何结合直接JAX模型与通过TorchAX运行的PyTorch模型。
vLLM tpu-inference后端结合直接JAX模型与经TorchAX转换的PyTorch模型示意图 来源:SemiAnalysis/vLLM
最初选择JAX是务实之举。在上次公告(https://vllm.ai/blog/2025-10-16-vllm-tpu)中,Google描述了底层优化、分页注意力及vLLM工作模型适配TPU执行的困难。他们认为JAX能提供更成熟的TPU原语与并行支持。TorchAX使团队无需重写每个PyTorch模型即可利用这些能力,同时面向TPU的JAX实现可共享相同的内核与编译器工作。
通过TorchAX,开发者仍用PyTorch编写模型,但由JAX在TPU上执行。TorchAX充当两者间的转换层。如TorchAX文档(https://google.github.io/torchax/user_guide/how-it-works/)所述,torchax.tensor.Tensor行为类似普通PyTorch张量,但由jax.Array支持。当模型调用PyTorch中的ATen操作(即张量操作)时,TorchAX通过__torch_dispatch__钩子拦截并将其转换为一个或多个JAX操作。因此即使由JAX执行计算,模型仍可用PyTorch编写。
vLLM还需管理生成过程中变化的状态,尤其是存储早期token注意力信息以供重用的KV缓存。其模型包装器(https://github.com/vllm-project/tpu-inference/blob/a32e183a676cf428cb1cea953f58fdd616accb3e/tpu_inference/models/vllm/vllm_model_wrapper.py#L171-L348)将模型权重和KV缓存作为显式状态呈现给JAX。此过程称为函数化,将本应在Python对象内部发生的变化转换为输入输出。
相似文章
@JeffDean:我的@Google同事@NormJouppi、Sridhar Lakshmanamurthy、Cliff Young和David Patterson最近撰写了一篇论文,该论文…
Google研究人员发表了一篇论文,总结了从TPU v2到Ironwood的TPU超级计算机的演进,详细介绍了架构稳定性、规模、弹性、能效以及八年间3600倍的性能提升。
我们的 TPU 如何驱动日益复杂的 AI 工作负载。
Google 介绍了其定制张量处理单元 (TPU) 如何设计以处理庞大的 AI 工作负载,并强调了最新一代 TPU 具备处理 121 exaflops 计算能力的特点。
第八代TPU:面向智能体时代的双芯片设计
Google发布第八代TPU:TPU 8t用于训练,TPU 8i用于推理,专为大规模、高能效AI智能体工作负载打造,将于今年晚些时候推出。
第八代 TPU 架构深度解析
Google 发布第八代 TPU 8t 与 TPU 8i,专为大规模预训练与推理设计,集成 SparseCore、原生 FP4,并支持 9,600 芯片级超节点,为世界模型与智能体 AI 提供算力。
@vivekgalatage: 了解TPU的系统架构非常有趣。 https://henryhmko.github.io/posts/tpu/tpu.html…
深入探讨谷歌TPU架构,解释脉动阵列、流水线和提前编译的设计理念,这些设计带来了高吞吐量和能效。