@mweinbach: 谁说TPU不能快!这大致是TPU 8i达到Groq的速度,但搭载Gemini Flash模型,智能程度远胜…
摘要
谷歌展示了Gemini Flash模型在TPU 8i上实现每秒600-1400 token的处理速度,与Groq的推理速度相当。
查看缓存全文
缓存时间: 2026/05/20 16:35
谁说 TPU 不能快!
这大概是 TPU 8i 达到的 Groq 级别速度,但用的是 Gemini Flash 模型,因此智能程度高得多 https://t.co/J39FF2yCm6
Max Weinbach (@mweinbach):
Google 刚展示了一个演示,Gemini Flash 模型在 TPU 8i 上运行速度达到 600–1400 tokens/秒峰值一度达到约 1480 tok/s,平均约 800 tok/s
相似文章
@analogalok: Gemma 4 12B QAT(密集)在8GB显存和120k上下文下实现超过1000 tokens/秒的预填充速度 Gemma 4 12B QAT(密集),TurboQ…
Gemma 4 12B QAT(密集)使用TurboQuant在8GB RTX 4060上实现超过1000 tokens/秒的预填充速度,支持120k上下文,实现完整的GPU层卸载。相比之前的方法,预填充速度提升了42%。
Gemma 4 26B 在单块 RTX 5090 上达到 600 Tok/s
一项基准测试显示,使用 vLLM 搭配 DFlash 投机解码,在单块 RTX 5090 上将 Gemma 4 26B 的推理速度提升至约 578 tokens/s,相比基线实现了 2.56 倍的加速。
在12GB显存上使用Gemma 4 12B QAT MTP实现120 tok/s
Google的Gemma 4 12B QAT模型通过llama.cpp的多令牌预测(MTP)在12GB GPU上达到120 tok/s。本文提供分步指南以及无MTP的基准对比,显示速度提升2倍。
@onusoz: 16路并行 Gemma-4-26B-A4B-NVFP4 运行,每路18输出 token/s,合计300 tok/s 一台配备128GB统一内存的DGX Spark…
@onusoz 展示了在单一 DGX Spark(128GB统一内存)上运行16个并行实例的 NVIDIA 量化版 Gemma-4-26B-A4B-NVFP4 模型,合计达到300 tok/s,展示高并发能力且未使用 flashinfer。
@TeksEdge:我对谷歌 Gemma 4 技术报告最惊讶的是,他们通过大量……进行了极其激进的优化
对谷歌 Gemma 4 技术报告的评论,指出他们通过量化感知训练(QAT)和多令牌预测(MTP)进行了激进的优化,以实现更快的推理。