2026年的推理硬件革命
摘要
这篇文章分析了2026年人工智能焦点从训练转向推理的转变,这一转变由硬件创新以及Nvidia、Amazon和Cerebras等科技巨头之间的战略联盟推动,以满足日益增长的需求。
暂无内容
查看缓存全文
缓存时间: 2026/09/15 17:57
# 2026推理硬件革命内幕
来源:https://spectrum.ieee.org/inference-hardware-revolution
Tensordyne公司的Napier芯片旨在加速AI推理。
**自约2020年以来,**AI主要聚焦于训练更大更优的模型。大型语言模型(LLM)的参数规模从数百万急剧膨胀至数万亿。这被证明行之有效:OpenAI于2020年发布的GPT-3最大版本,在知名的知识与推理基准测试中仅能正确回答(https://arxiv.org/pdf/2009.03300)43.9%的问题。仅仅四年后,GPT-4o在同一考试中达到(https://openai.com/index/gpt-4o-mini-advancing-cost-efficient-intelligence/)88.7%的分数,实际上已与人类专家水平相当。
先进的AI实验室仍在训练越来越大的模型,但这种训练在AI对话中已有些退居次席。2026年,推理——即使用训练好的模型来生成代码、撰写文章或将我们自己变成精灵图像——已跃居前台。
“就好像训练是昨天的新闻,”Moor Insights & Strategy的首席数据中心分析师Matt Kimball(https://moorinsightsstrategy.com/team/matt-kimball/)说道。“任何首席信息官想谈的都是推理。”英伟达CEO黄仁勋在公司GTC 2026大会上宣称,这一变化是“推理的拐点(https://www.youtube.com/watch?v=jw_o0xr8MWU)”。
导致这一转变的部分原因非常简单:LLM正变得实用,因此人们开始使用它们。此外,当今市场上的许多模型是推理模型。为响应用户的查询,它们不仅进行一次推理,而是多次运行推理,通过一个称为**思维链(https://arxiv.org/pdf/2201.11903)**的过程自行重新提示。推理模型会生成更长的输出,而高推理力度的模型产生的文本量可达低力度或无力度模型的20倍(https://www.linkedin.com/posts/artificial-analysis_how-many-tokens-do-reasoning-models-use-vs-activity-7318302119206289408-3mt1/)。进一步加剧全球推理工作负载的是,智能体AI(https://spectrum.ieee.org/ai-agents)的兴起导致推理不仅作为用户查询的实时响应运行,还全天候自主运行,朝着用户定义的目标努力。
安纳普尔纳实验室的金属处理器芯片特写,具有反光黑色表面。亚马逊的Trainium芯片最初是为AI训练设计的。然而,亚马逊网络服务选择将AI推理分为两部分,由Trainium运行计算更复杂的部分,而Cerebras的晶圆级引擎负责内存更密集的部分。亚马逊
由此产生的推理需求爆炸式增长,导致科技巨头之间意想不到的联盟。OpenAI(https://openai.com/index/cerebras-partnership/)和亚马逊(https://www.reuters.com/business/retail-consumer/cerebras-systems-amazon-strike-deal-offer-cerebras-ai-chips-amazons-cloud-2026-03-13/)部署了由Cerebras(https://www.cerebras.ai/)设计、餐盘大小的(https://spectrum.ieee.org/cerebrass-giant-chip-will-smash-deep-learnings-speed-barrier)芯片,尽管亚马逊拥有自己的Trainium(https://aws.amazon.com/ai/machine-learning/trainium/)芯片。英伟达以价值200亿美元的争议性交易,从AI推理初创公司Groq(https://groq.com/)收购(https://www.cnbc.com/2025/12/24/nvidia-buying-ai-chip-startup-groq-for-about-20-billion-biggest-deal.html)了关键人才和知识产权。而Anthropic(https://www.anthropic.com/)则每月向LLM竞争对手SpaceXAI(https://x.ai/)支付(https://x.ai/news/anthropic-compute-partnership)超过十亿美元,租用其闲置算力。
尽管看似相似,AI训练和AI推理在计算上是不同的。科技巨头们的这些重大举措表明,为了支持推理需求,我们将需要与专家们甚至几年前可能预期的非常不同的硬件组合。
## AI推理与AI训练有何不同?
未经训练的LLM就像桌上一堆杂乱的拼字游戏字母块。不过,这些字母块显示的不是单个字母,而是称为标记的单词片段。你需要用来写出几乎任何东西的内容都在其中,但没有任何意义。
训练模型通过大规模进行的猜谜游戏来组织这种混乱。模型被展示隐藏了下一个标记的真实文本,并被要求预测接下来是什么。每次猜测后,会揭示正确的标记,并与预测进行比较,差异用于计算模型的准确性。这个游戏不是在单个句子上进行,而是跨越数十亿个段落进行。
虽然真正的拼字游戏可以在薯片和几杯饮料中进行,但AI训练在计算上是密集的。模型通过反向传播(https://spectrum.ieee.org/what-is-deep-learning/backpropagation)更新其参数,这个过程反复计算模型数十亿或数万亿参数中的每一个应该如何移动,以使下一次预测更好。这就是为什么科技巨头正在建设(https://spectrum.ieee.org/5gw-data-center)比以往更大的数据中心。
最终,模型的创建者决定进一步训练不值得付出成本,猜谜游戏停止。反向传播结束,参数被冻结,LLM成为预训练模型。微调——在较小、更专业的数据上进行的短期训练运行——添加最后的调整,然后模型被部署。
带有彩虹色电路的金色计算机芯片特写。
英伟达的Groq 3语言处理单元通过按需将片上SRAM内存和计算块以它们在片上所需的顺序放置,最大限度地减少数据移动。
英伟达
接下来是推理。这是使用已部署模型的过程,该模型经过训练后,已学会按合理的顺序输出拼字游戏字母块——标记。
你可能会认为AI推理计算要求较低,因为用于更新参数的反向传播计算被消除了。但推理硬件公司d-Matrix(https://www.d-matrix.ai/)的创始人兼首席技术官Sudeep Bhoja(https://www.linkedin.com/in/sudeep-bhoja-070a111/)解释说,推理带来了新的挑战。
模型本质上是“自回归”的。也就是说,下一个输出取决于前一个。“因此,要生成下一个标记,你必须读取所有权重和所有前一个标记的[上下文],”Bhoja解释道。上下文包括你的所有提示、LLM的所有回复以及你上传的所有文件。这是大量的数据和大量的处理。
LLM生成其回复分为两个阶段:预填充和解码。预填充是模型读取提示。它一次性处理每个标记,计算每个标记与其他所有标记的关系。这个操作称为注意力(https://en.wikipedia.org/wiki/Attention_(machine_learning)),它是现代LLM背后的Transformer架构的一个定义性特征。它使它们能够响应句子、段落和更大上下文中的某个词,而不是孤立地考虑。可以将其想象为在将字母块放入游戏中之前排列它们。许多玩家会移动字母块来想象它们如何连接。自注意力扮演着类似的角色,只是不是移动物理字母块,而是每个标记向其他标记发送查询并接收表示该标记相关性的分数。
这些查询产生两种类型的向量:键和值。它们通常存储在一个称为KV缓存的存储中。这并非严格必需,因为模型也可以在每次生成新标记时重新计算这些向量。但几乎所有LLM都使用KV缓存来减少计算量。KV缓存存储在内存中,成为LLM可以返回以理解对话的草稿本,尽管它开始时很小,但可能膨胀到数十GB。
预填充是一个可以轻松划分并行处理的问题。这就是为什么随着LLM的普及,GPU成为了主导的AI加速器。图形光栅化(计算屏幕上每个像素的颜色)也是大规模并行的,因此GPU架构非常契合。
戴手套的双手拿着一个大的金色计算机处理器晶圆。
Cerebras的晶圆级引擎芯片通过将所有内容——内存和计算单元——并排放在餐盘大小的芯片上,最大限度地提高内存带宽。
Cerebras
接下来是解码。在这里,模型一次生成一个标记作为回复。在每个步骤中,它取最新的标记,根据KV缓存中的所有内容对其进行权衡,使用该信息预测下一个标记,并将新标记的键和值添加到缓存中。然后它依次重复,一个标记接一个标记。
这正是模型的自回归特性对推理速度不利的地方。预测每个标记需要从内存中读取整个模型,而该模型由可能数十到数百GB的参数(代表模型在训练中学到的内容的数字)组成。关键的是,这还不包括存储KV缓存所需的内存。
结果,所有这些数据在内存中的移动通常需要的带宽超过了推理硬件可用的带宽。因此,GPU的至少部分计算组件在等待数据时处于空闲状态。研究人员发现(https://arxiv.org/pdf/2503.08311),运行开源LLM的英伟达H100 GPU有50%到80%的时间处于空闲状态。
## 内存在推理中的作用
Meta前硅工程主管、AI初创公司Majestic Labs(https://majestic-labs.ai/)联合创始人Shahriar “Sha” Rabii(https://www.linkedin.com/in/rabii/)表示,处理器空闲是许多试图提高AI推理性能的公司高度关注内存的原因。“采用基于GPU的方法,你最终会过度配置计算资源而在内存上捉襟见肘。这推动了[内存]的大规模扩展,”他说。
Bhoja的d-Matrix和Rabii的Majestic Labs都专注于这一内存瓶颈。然而,他们的公司设想了不同的解决方案。
d-Matrix的第二代AI加速器Raptor(https://www.d-matrix.ai/announcements/d-matrix-and-alchip-announce-collaboration-on-worlds-first-3d-dram-solution-to-supercharge-ai-inference/)旨在通过最小化计算与内存之间的距离来提高推理性能。当前大多数AI推理部署中的GPU通过在GPU周边放置高带宽内存(HBM)来实现这一点。每个HBM是一叠连接在一起的DRAM芯片,并通过超快接口连接到GPU。这对训练很适合,但对于推理,你可以堆叠的内存量和它能提供的带宽还有待改进。
d-Matrix的Raptor通过将AI加速器堆叠在DRAM芯片上来消除这一瓶颈。d-Matrix不是堆叠内存,而是堆叠内存和计算。Bhoja说,这将数据必须传输的距离减少到“微米级而不是毫米级”。就像建造摩天大楼一样,垂直化使得在相同的物理空间内做更多事情成为可能。
Majestic采取了相反的方法。公司不是试图最小化计算与内存之间的数据传输距离,而是专注于改进内存接口,以适应更长的走线同时保持高带宽。更长的导线允许Majestic连接不直接位于GPU旁边的内存堆栈,消除了HBM的空间限制。
“内存接口可以运行的物理距离非常短。就HBM而言,最多2或3毫米。你只能在这个周边‘海岸线’放置HBM,这是唯一的地方,”Rabii说。
Majestic声称(https://www.techradar.com/pro/startup-swaps-costly-ai-gpus-for-arm-cores-and-up-to-128tb-of-cheap-lpddr6-ram-instead-of-expensive-hbm-to-smash-through-the-memory-wall)其内存接口可以将比特传输到大约一米远。这是通过专有的铜链接和协调数据的内存聚合器芯片实现的。“聚合器是高速接口的终点,也是一种扩展到众多商用DRAM芯片的方式,”Rabii说。因此,Majestic可以在单个服务器机架中支持高达128TB的DRAM内存——与英伟达GB300 NVL72机架(https://www.nvidia.com/en-us/data-center/gb300-nvl72/)的约20TB HBM3E(https://resources.nvidia.com/en-us-blackwell-architecture/blackwell-ultra-datasheet?ncid=no-ncid)相比有显著增加。
d-Matrix和Majestic有一个共同点:它们都使用现成的DRAM,而不是HBM。这是世界上最常见的计算机内存类型;它存在于从智能手机到汽车的一切设备中。内存分析师Jim Handy(https://thememoryguy.com/)表示,HBM的成本是DRAM的两到三倍。d-Matrix和Majestic选择DRAM部分是因为这种价格优势。然而,包括三星(https://www.samsung.com/us/)和SK海力士(https://www.skhynix.com/)在内的内存巨头们并未坐视不管。
HBM4是最新版本的HBM内存,现已投入生产,并将用于英伟达的Vera Rubin GPU(https://spectrum.ieee.org/nvidia-rubin-networking),预计将于2026年下半年发货。SK海力士(https://www.skhynix.com/)内存系统研究主管Hoshik Kim(https://www.linkedin.com/in/hoshikk/)表示,HBM4将通过使HBM的最大内存带宽翻倍并增加每堆栈的HBM内存量,“决定性地打破制约当今AI推理的内存瓶颈”。
## 芯片组合以实现更快的推理
大玩家——英伟达和亚马逊——正在采取全芯片上阵的方法。英伟达的GPU和亚马逊的Trainium训练加速器仍然适用于部分推理工作负载:预填充阶段,即计算所有上下文键和值的地方。但为了加速解码(生成新标记的部分),他们正在寻求来自较小玩家的新型、以内存为中心的架构。
在英伟达的案例中,这个较小的玩家是Groq(不要与SpaceXAI训练的LLM系列Grok混淆)。英伟达在2025年底收购了Groq的知识产权并聘请了人才,仅仅三个月后,在英伟达GTC 2026大会上,黄仁勋发布了(https://spectrum.ieee.org/nvidia-groq-3)英伟达Groq 3语言处理单元(LPU(https://www.nvidia.com/en-us/data-center/lpx/))。Groq的架构依赖于内存——在它的案例中是SRAM——直接构建在芯片架构中。
除非你是芯片架构师或硬核PC玩家,(https://www.pcworld.com/article/2634140/why-i-care-about-cpu-cache-as-a-pc-gamer-the-obscure-spec-explained.html)你可能从未考虑过SRAM。SRAM的好处是它与计算芯片的架构紧密集成——它位于与处理器相同的硅片上——缺点是密度低于DRAM且更昂贵。大多数芯片仅包含几十兆字节的SRAM。然而,AI推理引发了人们对SRAM的新兴趣,将其作为将存储在内存中的模型权重带到更靠近计算位置的一种手段。
英伟达(https://blogs.nvidia.com/blog/author/ian-buck/)超大规模和高性能计算副总裁兼总经理Ian Buck(https://www.linkedin.com/in/ian-buck-19201315/)表示,LPU与该公司的GPU有着截然不同的优先级。LPU的原始计算能力远低于标准GPU,但它获得了500MB的片上SRAM,直接连接到其浮点数学单元。“好处在于内存带宽。LPU的内存带宽是GPU的七倍,
相似文章
推理的变革(阅读时长约 8 分钟)
本文分析了 Cerebras 即将进行的 IPO,将其视为 AI 硬件领域“推理变革”的信号。文章指出,尽管 Nvidia 在基于 GPU 的训练领域占据主导地位,但为了支持推理工作负载,AI 算力的未来正变得越来越异构。
硬件革命:为什么AI硬件永远改变了(3分钟阅读)
近期AI硬件的进展,包括OpenAI、Etched、亚马逊和SambaNova的定制芯片,标志着向针对AI工作负载的专用ASIC的重大转变,有望带来重大效率提升,并挑战英伟达的主导地位。
@TheAhmadOsman: 推理的未来并不一定在任何当前的硬件提供商那里,顺便说一句,无意冒犯现有厂商,…
推文暗示,未来的AI推理硬件可能不会来自NVIDIA等现有提供商,强调了收购Groq等初创公司,因为GPU并非针对推理进行优化。
停止购买新硬件的理由(或者,为什么推理成本越来越低)
该文认为,AI模型效率提升如此之快,以至于维持固定智能水平所需的硬件成本大约每3个月减半,这使得租赁前沿智能或拥有落后硬件比购买新硬件更经济。
@CNET:NVIDIA GTC 主题演讲中,CEO 黄仁勋谈到我们正面临的推理拐点
NVIDIA CEO 黄仁勋在 GTC 主题演讲中指出 AI 推理正处于拐点;Supermicro 正与 NVIDIA 合作,基于 Blackwell 平台交付一站式“AI 工厂”基础设施方案。