标签
据报道,Google 与 AMD 合作设计下一代 TPU,该 TPU 可能集成片上 CPU 核心以处理强化学习工作负载,有望推动 AI 硬件架构的发展。
谷歌积极将TPU产能商业化出售给Anthropic等外部客户,加剧了内部不满情绪,并促使关键AI研究人员离职投奔竞争对手,使人才和竞争紧张局势进一步加剧。
在 Startup School 2026 上,谷歌首席科学家 Jeff Dean 讲述了那个让谷歌搜索索引能装进内存的餐巾纸计算,以及 TPU 的研发过程,探讨了推理硬件专业化的趋势,以及初创公司如何依然有机会竞争。
Google Cloud 和 RadixArk 合作,将开源推理框架 SGLang 引入 Google Cloud TPU,初期通过 SGL-JAX,后续推出 SGL-torchtpu 提供原生 PyTorch 支持,让开发者能够无缝在 GPU 和 TPU 上运行生产工作负载。
JAXBench是一个新的基准测试套件,包含50个JAX工作负载,用于评估在谷歌云TPU上的AI生成内核优化,提供人工调优基线和智能体评估框架。论文发现,基于精选TPU文档进行条件化处理能显著提升正确性和加速比,其中Autocomp波束搜索在人工调优内核上相比XLA实现了高达1.6倍的几何平均加速。
谷歌宣布其训练后优化库 Tunix 迎来重大更新,推出了异步解耦式回滚引擎,用于在 JAX/TPU 上规模化实施基于智能体的强化学习,消除空闲时间,提升吞吐量。
本文提出了一种基于MLIR的大型语言模型编译方法,通过两种自定义方言(TopOp和TpuOp)将模型从框架无关的语义逐层降低为硬件专用指令,并针对自回归推理阶段(预填充、预填充KV和解码)引入三阶段静态编译。
Google Cloud 详细介绍了他们如何在 Ironwood TPU 上使用模块化、模型无关的工程手册优化 Qwen 3.5-397B MoE,实现了 3.1 倍的解码性能和 4.7 倍的预填充性能提升。
谷歌推出了 TPU 开发者中心,这是一个集中式资源,包含在 Google Cloud TPU 上构建、训练和提供 AI 服务的文档和框架指南,支持 JAX、PyTorch 和 vLLM。
Google宣布了为Pixel 10的TPU优化的Gemma 4 E2B,实现了设备端多模态AI能力,如离线聊天、图像识别和音频转录。
对图灵奖得主 David Patterson 的采访,涵盖 RISC 与 CISC 的历史、GPU/TPU 比较、摩尔定律及职业建议。
深入探讨谷歌TPU架构,解释脉动阵列、流水线和提前编译的设计理念,这些设计带来了高吞吐量和能效。
Google的TPU采用源自1978年的脉动阵列架构,以更少的内存移动来加速矩阵乘法。该帖子分享了原始论文和TPU设计的链接,并建议在FPGA上构建一个小型版本。
谷歌正在采用英伟达的策略来打造有竞争力的AI芯片业务,向Anthropic出租TPU计算能力,并提升推理性能以与英伟达的主导地位竞争。
LMSYS Org 的一篇博客文章详细介绍了使用 SGLang-JAX 在 TPU v7x 上优化 Ling-2.6-1T(一个 1 万亿参数的混合 MoE 模型),通过单个 Pallas 内核将 MoE 数据移动隐藏在计算之后,从而实现高效的推理。
谷歌正与三星洽谈,计划使用2纳米技术为其下一代AI芯片(代号Icefish)制造部分组件,而主要部分将由台积电生产。该芯片旨在成为英伟达GPU的替代品,预计最早于2028年进入量产。
一款适用于 Google Colab 的全新 CLI 工具,支持从终端进行 GPU/TPU 配置、远程脚本执行和交互式 REPL 访问,内置 Agent Skills 功能,可自动完成模型微调等任务。
本文是AI工程全景系列的上篇,从历史角度梳理了GPU从游戏显卡到AI加速器的演化、CUDA的豪赌、谷歌TPU的独立路径,以及英伟达为何最终胜出,详细剖析了芯片、供应链、网络、电力等AI基础设施的底层逻辑。
Midjourney表示,使用Google TPU使他们的研究落后了一年,并对没有完全坚持使用Nvidia硬件表示遗憾。
谷歌展示了Gemini Flash模型在TPU 8i上实现每秒600-1400 token的处理速度,与Groq的推理速度相当。