@mweinbach: 谁说TPU不能快!这大致是TPU 8i达到Groq的速度,但搭载Gemini Flash模型,智能程度远胜…

X AI KOLs Timeline 新闻

摘要

谷歌展示了Gemini Flash模型在TPU 8i上实现每秒600-1400 token的处理速度,与Groq的推理速度相当。

谁说TPU不能快! 这大致是TPU 8i达到Groq的速度,但搭载Gemini Flash模型,智能程度远胜 https://t.co/J39FF2yCm6
查看原文
查看缓存全文

缓存时间: 2026/05/20 16:35

谁说 TPU 不能快!

这大概是 TPU 8i 达到的 Groq 级别速度,但用的是 Gemini Flash 模型,因此智能程度高得多 https://t.co/J39FF2yCm6

Max Weinbach (@mweinbach):
Google 刚展示了一个演示,Gemini Flash 模型在 TPU 8i 上运行速度达到 600–1400 tokens/秒

峰值一度达到约 1480 tok/s,平均约 800 tok/s

相似文章

Gemma 4 26B 在单块 RTX 5090 上达到 600 Tok/s

Reddit r/LocalLLaMA

一项基准测试显示,使用 vLLM 搭配 DFlash 投机解码,在单块 RTX 5090 上将 Gemma 4 26B 的推理速度提升至约 578 tokens/s,相比基线实现了 2.56 倍的加速。