NVIDIA报告称,Vera Rubin的智能体吞吐量每兆瓦最高提升30倍——但每兆瓦的令牌数仍不等同于每兆瓦的完成工作量
摘要
NVIDIA报告称,与GB300相比,Vera Rubin的每兆瓦智能体吞吐量最高提升30倍,但强调生产基准测试应包含超越每瓦令牌数的额外指标。
NVIDIA的新AgentX结果重放了具有长上下文、KV缓存重用、工具缺口和动态并发的生产风格编码智能体会话。其Vera Rubin预览结果声称在匹配的交互性目标下,每兆瓦吞吐量比GB300高30倍;NVIDIA表示该结果正在等待SemiAnalysis审查。这比固定的8K/1K服务更具代表性,但分子仍仅限于令牌数。生产基准测试还应报告:
- 每兆瓦时接受的任务结果
- 完成延迟分布
- 工具和重试放大
- 缓存命中率和内存压力
- 模型和框架等价性
- 人工审查分钟数和回滚率
一个高效的系统同样能高效地生成更多无用的工作。来源:NVIDIA技术博客,2026年8月24日 — https://developer.nvidia.com/blog/nvidia-vera-rubin-and-blackwell-set-a-new-standard-for-agentic-ai-performance-per-watt/
相似文章
每瓦功耗工作量提升高达30倍:NVIDIA Vera Rubin NVL72为AI智能体树立新能效标准
NVIDIA Vera Rubin NVL72系统在智能体AI工作负载中,展现出每兆瓦吞吐量提升高达30倍的性能,为AI基础设施设定了新的效率标准。
NVIDIA Vera Rubin:每瓦性能驱动,为全球合作伙伴提供最低代币成本
NVIDIA宣布Vera Rubin平台,每兆瓦吞吐量比Blackwell提升10倍,并通过跨越七颗芯片和五个机架托盘的极致协同设计,为AI工厂提供最低的代币成本。
NVIDIA Vera Rubin 在训练后工作负载中最大化每美元智能——代理式AI的关键指标
NVIDIA 推出了 Vera Rubin,这是一种新架构,旨在最大化训练后工作负载的每美元智能,通过优化每 Token 成本和支持大规模强化学习,满足代理式AI的持续学习需求。
NVIDIA全面投产Groq 3 LPX AI推理加速芯片,以史上最快的令牌生成速度为Vera Rubin平台注入强大动力(4分钟阅读)
NVIDIA已开始全面生产Groq 3 LPX AI推理加速芯片,该芯片为Vera Rubin平台提供支持,实现了AI模型有史以来最快的令牌生成速度。
NVIDIA下一代Vera Rubin GPU定于2027年中期推出
NVIDIA预计2027财年第三季度Vera Rubin系统的销售额将达到200亿美元,这标志着其历史上最快的产品爬坡速度,首批出货将面向Microsoft等主要超大规模客户。