GPU管理:闲置的GPU为何成为新的停飞飞机

Hugging Face Blog 新闻

摘要

本文认为,GPU利用率正成为企业AI的关键瓶颈,类似于航空中的飞机利用率,而闲置的GPU代表着浪费的算力,这种算力决定了竞争优势。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/07/30 15:56

GPU管理:为何闲置GPU成为新的停飞飞机

来源:https://huggingface.co/blog/Dharma-AI/gpu-management 返回文章列表 (https://huggingface.co/blog)

- 利用率而非智能,才是AI领域下一个真正的瓶颈 (https://huggingface.co/blog/Dharma-AI/gpu-management#utilization-not-intelligence-is-the-next-real-constraint-in-ai) - 瓶颈已从模型转向算力 (https://huggingface.co/blog/Dharma-AI/gpu-management#the-bottleneck-moved-from-models-to-compute) - 为何忙碌的集群仍然浪费容量 (https://huggingface.co/blog/Dharma-AI/gpu-management#why-busy-clusters-still-waste-capacity) - 智能正在融入基础设施 (https://huggingface.co/blog/Dharma-AI/gpu-management#intelligence-moves-into-the-infrastructure) - 专业化释放容量,编排消耗容量 (https://huggingface.co/blog/Dharma-AI/gpu-management#specialization-frees-capacity-orchestration-spends-it) - 延伸阅读 (https://huggingface.co/blog/Dharma-AI/gpu-management#further-reading) https://huggingface.co/blog/Dharma-AI/gpu-management#utilization-not-intelligence-is-the-next-real-constraint-in-ai利用率而非智能,才是AI领域下一个真正的瓶颈。

航空业曾为此付出惨痛代价。在该行业的大部分历史中,最能预测一家航空公司能否生存的指标,是其每架飞机每天在地面上停留的时间。

原因在于结构性差异。飞机的成本按日历小时计算:融资、折旧、机身保险、定期维护、机组合同。而收入仅按飞行小时计算。每在地面停留一小时,都会缩小这个等式中的产出端,而成本端却一如既往地持续运行。利用率也几乎取决于航空公司所做的一切其他决策。周转纪律、网络设计、维护计划、机组排班和备件可用性,最终都会体现在这一个数字上,因为底层的运营一旦出现问题,无论其他方面多么顺利,飞机都无法升空。

更大的机队当然有帮助。更多飞机意味着更多可用运力,简单明了。但两家在类似航线上运营类似机队的航空公司,其经济表现可能天差地别,而这种差距大部分源于同一个指标,而非机队规模。

企业级AI正面临同样的结构性难题,只是硬件不同。GPU的成本同样按日历小时累积:融资、折旧、电力和冷却,无论它在某一时刻是否在运行有用任务。其产出仅按计算小时累积。更多GPU的帮助大致相当于更大的机队对航空公司的帮助:带来实际运力和真正优势,但同样无法保证最终决定成败的结果。两家GPU预算相当的公司,其差异越来越取决于在任何给定时刻,有多少硬件正在执行有用任务,而非各自拥有多少硬件。这个数字,就像航空公司的利用率一样,几乎决定了公司做出的所有其他基础设施决策。智能将行业带到了这一步。利用率则是下一个真正瓶颈正在形成的地方。

https://huggingface.co/blog/Dharma-AI/gpu-management#the-bottleneck-moved-from-models-to-compute瓶颈已从模型转向算力

随着AI规模化,稀缺性并未消失。它沿着链条向上移动,落到了完全不同的资源上。

企业级AI的第一波浪潮赢在模型质量上。更大的模型,在更多算力上训练,通过更严格的基准评估:参数量和排行榜位置主导了讨论,这场竞赛产生了足以运行真正企业工作负载的模型。然而,这种能力伴随着一个依赖性:生产级AI需要在专用硬件上运行,而如今这些硬件几乎全是GPU。

GPU昂贵、供应受限,且需求远超可用量,即使是在市场最顶端也是如此。2020年,微软为OpenAI建造了一台专用超级计算机:超过10,000块GPU和285,000个CPU核心,当时被报道为全球最大的五个系统之一,用于训练后来的GPT-3。当时,这看起来几乎是难以想象的硬件集中度,这样的数字让算力对于任何能获得它的人来说都像是一个已解决的问题。六年后,这个数字更像是一个起点而非上限。到2026年,即使是资金最充足的实验室也将算力获取视为一个现实的战略约束,而非一个已解决的难题。仅Anthropic一家就在四个不同的硬件平台(亚马逊、谷歌、微软和AMD)上同时运行着多个吉瓦级的承诺,时间跨度仅在数月之间,而Meta也签署了类似规模的吉瓦级协议。同时在四个供应商之间分散承诺,这就是算力稀缺的样子——当买家拥有几乎无限的资本,却仍然无法从任何一个单一来源获得足够算力时。

六年间相隔的两个事件,都标志着实验室为了保持竞争力所需的前沿。期间发生的变化与AI变得更强关系不大,而与能力不再是约束条件息息相关。

同样的模式在实验室下游以不同的形式出现。通过API使用这些模型的企业遇到了定价问题而非硬件问题。成本随token使用量线性增长,这一事实将概念验证的经济性与生产环境的经济性几乎完全区分开来。每月处理几千个请求的PoC看起来负担得起。同样的工作负载在生产规模下,可能会变成一条永远无法抹平的成本线。正在获得关注的替代方案相当直接:企业购买自己的GPU并在本地运行模型,用固定的资本成本取代可变的、线性增长的成本。

figure_1_cost_curve (https://cdn-uploads.huggingface.co/production/uploads/69d815b52c6db28cfdfdd422/xwvV3cygHhYx8KdCJrXaV.png)API成本随使用量上升,而自有基础设施的成本几乎固定。超过盈亏平衡点后,利弊反转。

这种转变将GPU从一项开支项变成了基础设施,需要按增长规模、按需求峰值来配置,因此其规模必然超出任何一周的实际需求。这意味着购买并不能解决这个问题,而是开启了新的问题。集群上线的那天起,问题就不再是“我们能获得加速卡吗“,而是“我们能让他们保持忙碌吗“,而第一个问题还有采购团队负责。签署硬件合同是有截止日期和负责人的部分。让硬件不闲置则是悄无声息地决定这笔交易是否值得的部分。

这些交易描述的是容量承诺,而非效率。这些容量如何使用效率是一个独立的问题,由不同的人负责,衡量得远不那么严格,而且离解决还有相当距离。

https://huggingface.co/blog/Dharma-AI/gpu-management#why-busy-clusters-still-waste-capacity为何忙碌的集群仍然浪费容量

一个满是忙碌GPU的集群仍然可能浪费其大部分潜力,原因几乎总是同一个。GPU持续运行,日夜不停,而施加给它们的需求并非如此。基础设施必须按峰值需求来配置,即训练任务、批处理作业和实时流量同时到达的时刻,这导致在峰值之外,相当一部分容量被配置却未使用。如果每个GPU都能同样好地吸收所有类型的工作,更好的预测本身就能解决这个问题。但很少有GPU能做到这一点,而这正是问题更棘手的一面。

不匹配始于更深一层。

在企业AI的第一代中,GPU的任务基本上是单一的:运行推理。如今,同样的硬件需要支持训练、微调、量化、实时推理、批处理推理、嵌入生成和模型评估,通常服务于同一个组织,有时甚至服务于同一个模型的同一个集群。每种工作负载对硬件的要求都不同,而且差异很大。实时推理几乎将低延迟置于首位,因为响应慢就等于失败。批处理任务关心吞吐量并能容忍延迟,有时长达数小时。训练可以连续占用一个GPU数小时甚至数天。量化需要大量容量,但仅需短暂时间。为其中一种工作负载调优的调度器,几乎默认会错误分配其他三种。这种失败并不总是会出现在利用率仪表盘上。一个集群可能报告高平均占用率,同时有多个排队任务在等待一个GPU形状,而该形状恰好正忙于运行其他完全不同的任务。

具体的工作负载组合因组织而异。但问题的形态不变。这也是航空比喻遇到极限的地方,而这个极限带来的教训不仅仅是限定比较。闲置的飞机通常可以重新部署到机队中的任何航线:停在芝加哥的737可以飞往丹佛而不是达拉斯,代价不大。闲置的GPU只能吸收其内存、延迟和持续时间配置实际能够服务的工作负载。这种差异使得编排比机队调度更困难,也解释了为什么问题不再关注GPU是否被占用,而是变成了:哪个工作负载应该在哪个GPU上运行,在什么时间,以什么优先级。再买一机架GPU会增加容量和成本,但并不能解决不匹配问题,而且这些新容量同样可能在错误的时间以错误的形态闲置,就像已安装的容量一样。

https://huggingface.co/blog/Dharma-AI/gpu-management#intelligence-moves-into-the-infrastructure智能正在融入基础设施

最大化GPU投资回报率需要的不止是一次性的配置决策。它要求对基础设施进行持续、主动的管理,在每时每刻运行,而不仅仅是在采购时。作为回应,一个独立的学科正在兴起:GPU管理,一个位于工作负载、模型和硬件之间的编排层。它的工作是持续决定:哪个工作负载运行,何时运行,如何运行,以及在集群中的哪个特定GPU上运行。这些概念本身并不新奇。它更接近于一个优秀运维团队凭直觉已经在做的事情,只是被形式化并持续运行,而不是依赖有人注意到问题。

gpu_orchestration_layer_diagram_v3 (https://cdn-uploads.huggingface.co/production/uploads/69d815b52c6db28cfdfdd422/T-ECtXhMW5hUo10atw1Fs.png)智能不止停留在模型边界。编排层正在做出模型本身无法感知的实时分配决策。

过去,智能几乎完全存在于模型中:更大、训练更好、能力更强,这几乎是全部。现在,智能也必须融入基础设施,融入那个时刻决定哪个竞争工作负载能获得刚刚释放的GPU、以及相对于队列中等待的其他任务具有什么优先级的层级。让GPU保持忙碌本身不再是目标,因为忙碌很容易通过运行本可以等待的低优先级任务来伪造。最大化每块已安装GPU所产生的回报成为实际目标,而事实证明,这比之前的配置问题要持续得多。

良好的配置并不能让这个问题消失,只是改变了它的形态。配置决策在购买时做出一次。分配决策则不断做出:每次作业完成时、每个新请求到达时、每次客户面向服务与内部训练运行之间的优先级变化时。这种频率解释了为什么决策从由人员逐案处理变成了必须自动运行。没有工程师会在凌晨三点盯着仪表盘决定一个完成的训练运行是否应该将其GPU交给一个排队中的批处理任务,还是为即将到来的客户流量突发保留它。必须有其他东西持续地做出这个决定,并且足够正确,以至于没有人需要检查。

这个学科足够新,其工具和惯例仍在形成中,还没有一个成熟的GPU管理实践的单一剧本出现。但至少有一点已经确定:约束转移到了哪里。

https://huggingface.co/blog/Dharma-AI/gpu-management#specialization-frees-capacity-orchestration-spends-it专业化释放容量,编排消耗容量

专业化和编排解决了同一问题的不同半部分。

专业化的小模型可以以大型通用模型完成相同任务所需资源成本的一小部分来执行特定任务,同时不牺牲任务所需的质量。这对利用率有直接影响。曾经需要单个大模型、在整个任务期间占用集群大部分容量的工作负载,现在可以在更小、更特定于任务的模型上运行,只占用一小部分资源。原本完全被占用的容量突然释放了。

专业化释放的容量因工作负载和模型而异,但释放的容量仍然需要被使用,否则只会闲置。一个小型专业化模型只有在有人主动决定如何处理它释放出的空间时——将其重新分配给另一个工作负载、另一个模型、另一个等待队列——才能转化为GPU ROI。如果不加管理,释放的容量就会变成另一种形式的闲置,而非胜利,其隐蔽程度与明显未使用的GPU不同,但同样没有生产力。

specialization_orchestration_matrix_v4 (https://cdn-uploads.huggingface.co/production/uploads/69d815b52c6db28cfdfdd422/9J-NG_Z3AeUTUkh2jmnpS.png)没有编排的专业化会释放无人回收的容量。没有专业化的编排则几乎没有什么值得回收的容量。单独一个杠杆无法完成全部工作。

没有编排的专业化会释放无人回收的容量。没有专业化的编排则从一开始就没有多少值得回收的容量,因为模型仍然很大,它们留下的足迹很小。单独一个杠杆无法完成全部工作;每个杠杆都提高了另一个杠杆所能达到的上限。如果目标是真正缩小安装容量与有用产出之间的差距,而非仅仅转移浪费所在,那么两者都不可或缺。

这就是为什么模型架构和GPU管理是解决同一问题的两种方式,从两个不同方向入手,最终相互依赖。一个缩小每个工作负载需要的资源。另一个持续决定差额的去向。


更大的机队一直是真正的优势,这里没有异议。在机队规模相当的航空公司中,有时甚至较小的面对较大的竞争对手时,胜利者通常是那个更充分利用现有飞机的公司,它承载着其所有良好运营的重量。企业级AI正从不同方向走向同样的纪律。GPU已安装、已折旧、已承诺。专业化模型和GPU管理是并行解决方案,或双管齐下的策略。专业化缩小每个工作负载的需求。管理最大化基础设施的回报。掌握两者的企业将为未来十年的AI竞争设定节奏。


https://huggingface.co/blog/Dharma-AI/gpu-management#further-reading延伸阅读

  • 更新模型,同样优势

相似文章

谁害怕那个又大又可怕的GPU?

The Verge

本文探讨了驱动AI热潮的GPU在环境和伦理上的代价,从制造过程到数据中心的能源和水消耗,并质疑其收益是否足以抵消影响。

日益增长的算力短缺

Hacker News Top

本文探讨了人工智能领域日益严重的算力短缺问题,强调了GPU、内存、台积电产能及电力基础设施同时出现的瓶颈,并分析了这种短缺如何重塑企业战略和市场领导地位。

无GPU革命:高效AI模型如何让人工智能大众化

Reddit r/AI_Agents

一场静默的革命正在让强大的AI模型无需昂贵GPU即可在消费级硬件上运行,这得益于量化技术和优化实现(如llama.cpp的Gemma4 MTP支持)的突破,为爱好者、小型企业和边缘计算打开了大门。