@PyTorch: 开源放大全栈优势,实现最低令牌成本。PyTorch就是一个典型例子:自推出以来……

X AI KOLs Timeline 新闻

摘要

NVIDIA详细介绍了其与PyTorch等开源生态系统共同开发的全栈推理软件,如何在Blackwell GPU上将令牌成本降低多达5倍,来自Baseten、Cognition、Deep Infra等的实际部署展示了性能提升。

开源放大全栈优势,实现最低令牌成本。PyTorch就是一个典型例子: PyTorch于2016年发布,原生支持CUDA,并与@nvidia的架构共同演进,让开发者通过熟悉的框架直接使用Tensor Cores、Transformer Engine和NVFP4等创新技术。 借助开源飞轮,更多开发者优化CUDA原生推理路径,更多生产部署反哺生态系统,每一次软件改进都能增加令牌输出量,同时随着时间的推移降低每个令牌的成本。 阅读@nvidia的完整文章:
查看原文
查看缓存全文

缓存时间: 2026/07/22 04:21

开源放大全栈优势,实现最低Token成本。PyTorch就是典型范例:

自2016年推出以来,PyTorch自带原生CUDA支持,与@nvidia的架构协同演进,让开发者通过熟悉的框架直接访问Tensor Cores、Transformer Engine和NVFP4等创新技术。

凭借开源飞轮效应,更多开发者优化CUDA原生推理路径,更多生产部署反哺生态系统,每一次软件改进都能在降低单Token成本的同时,持续提升交付的Token输出量。

阅读@nvidia的完整博文:


NVIDIA推理软件栈如何实现最低Token成本

来源:https://blogs.nvidia.com/blog/inference-software-lowest-token-cost/

随着组织从AI试点转向生产级AI工厂,基础设施决策已从峰值芯片规格转向每Token成本:每美元、每瓦特以及在所需延迟目标内能交付多少有用Token。

NVIDIA的全栈推理软件与NVIDIA GPU、CPU、网络和系统协同设计,并由广泛的开源生态系统强化,持续提升硬件性能。在NVIDIA Blackwell平台上,仅在DeepSeek V4模型上,该软件栈已在一个月内将Token成本降低了高达5倍。

软件为何对推理经济学至关重要

传统的Web、搜索和软件即服务工作负载相对可预测:用户可能加载页面、刷新信息流或更新业务记录。这些请求通常遵循相似的软件路径,读取或写入数据库,并通过增加相同服务器来扩展规模。

代理式AI则不同。

代理式AI运行分布式、有状态的工作流,涵盖数据中心内的LLM、工具、内存、安全、网络和加速计算。代理能够推理、规划、调用工具、启动专业子代理,并在多轮工作流中管理海量上下文。它们将单个请求转化为分布式计算问题,可能涉及数百个子代理、数千个任务和多个大语言模型,跨GPU、CPU、DPU和存储系统运行。

软件栈决定了这种复杂性是会转化为资源浪费,还是实现更低的每Token成本。

更低的每Token成本来自于将单个优化转化为系统级性能。NVIDIA的推理软件栈通过连接三个层次来实现这一点:

  • 生产运维: 协调分布式服务、编排、自动缩放和内存管理,使推理能在正确的计算和存储资源上运行。
  • 应用加速: 实现模型高性能运行,同时为开发者留出调优和定制的空间,利用运行时优化(如计算与通信重叠及内核融合)。
  • 基础设施访问: 开放NVIDIA GPU、网络、内存和系统能力,无需开发者直接管理每个设备指令集或数据传输协议。

NVIDIA软件栈涵盖模型服务、运行时调度、内核、通信库和硬件感知优化,随着各层优化的叠加,能够快速实现性能提升并降低服务成本。当这些层次作为一个系统协同工作时,各个优化便会产生叠加效应。

解耦服务、基于NVIDIA NVLink互连技术的大规模专家并行、NVFP4精度以及多Token预测,各自都能带来显著提升。组合起来,吞吐量可提升高达20倍。

开源放大全栈优势

同样的全栈基础也因开源生态系统而得到放大。当今许多使用最广泛的开源AI框架和推理项目都原生构建于NVIDIA CUDA之上,这意味着新的研究和软件优化从第一天起就能在NVIDIA GPU上以领先性能运行。

PyTorch就是一个典型范例。自2016年推出时便原生支持CUDA,PyTorch与NVIDIA的架构协同演进,让开发者通过一个熟悉的框架直接访问Tensor Cores、Transformer Engine和NVFP4等创新技术。

当诸如DFlash推测解码(可在现有硬件上实现高达15倍的吞吐量提升)或FastVideo(能在不到5秒内生成1080p视频)等突破性成果落地PyTorch时,它们可以立即在NVIDIA上运行,帮助AI工厂将研究进展转化为更低的Token成本。

NVIDIA与PyTorch的联合开发有助于将新的AI软件创新带给开发者,随着PyTorch采用率的增长,将CUDA原生的进步转化为生产级性能。同样的开源势头也解释了为何当像DeepSeek V4这样的前沿开源模型发布时,像vLLM和SGLang这样的领先推理框架会立即提供针对NVIDIA Blackwell架构的部署方案——使模型在数百万Blackwell GPU上均可访问。这也是为什么在约一个月内,DeepSeek V4在Blackwell上的性能通过vLLM和SGLang框架提升了高达5倍,将Token成本降至此前水平的约五分之一。

这就是开源飞轮效应:更多开发者优化CUDA原生推理路径,更多生产部署反哺生态系统,每一次软件改进都能在降低单Token成本的同时,持续提升交付的Token输出量。

探索软件如何倍增硬件性能,请收听本期NVIDIA AI播客:Token经济学,并访问推理解决方案页面

相似文章

NVIDIA推理软件栈如何实现最低Token成本

NVIDIA Blog

NVIDIA全栈推理软件与硬件协同设计,仅一个月内就在Blackwell平台上将Token成本降低多达5倍,为AI工厂实现更低的每Token成本。Baseten、Cognition、Deep Infra和Together AI等公司正在使用该软件栈优化推理性能。

开源AI现状(15分钟阅读)

TLDR AI

Mozilla发布的《开源AI现状》报告指出,开源权重模型在许多任务上已与闭源模型达到同等水平,同时推理成本在36个月内下降了50倍。目前,大多数生产环境中的token通过开源模型路由,竞争格局已转移到上层的智能体层。