LinkedIn 未来一年内不会扩建数据中心
摘要
LinkedIn计划通过提高GPU效率,在下一个财年保持其计算和存储规模不变,这与其它大型科技公司积极扩建数据中心的趋势背道而驰。
尽管AI热潮持续,LinkedIn仍在控制计算开支。相反,它要求工程师让每一块GPU都发挥最大效用。
查看缓存全文
缓存时间: 2026/07/30 15:57
# 领英明年不会扩建数据中心
来源:https://www.wired.com/story/how-linkedin-is-keeping-its-compute-capacity-flat/
与许多大型科技平台不同,领英已决定在本财年不会大举投资扩建其人工智能数据中心(https://www.wired.com/story/new-gas-powered-data-centers-could-emit-more-greenhouse-gases-than-entire-nations/)。这家职业社交网络的高管告诉《连线》杂志,该公司计划保持对GPU的投资稳定,其计算和存储规模也将保持不变。
这一支出计划适用于领英上个月开始、明年6月结束的财年。该公司表示,它之所以能够避免在人工智能硬件上大举支出,是因为在过去六个月中,它找到了一些方法,使其现有GPU的使用效率提高了一倍。领英的计划仍有可能因人工智能硬件需求的快速变化而失效,但高管们表示,该公司已经将内存芯片(https://www.wired.com/story/solving-the-pc-memory-crisis/)价格飙升的因素考虑在内。
"我们设定的目标之一是,在将更多消耗计算资源的功能推向生产环境的同时,尽可能保持我们的计算规模不变或接近不变,"领英工程首席技术官Erran Berger说。"在当今世界,这是一个相当大胆的说法。"
Berger和领英基础设施首席技术官Raghu Hiremagalur表示,他们希望在支出上保持谨慎,并且新的限制将激励工程团队在开发领英计划推出的诸多新生成式AI功能时,发挥更多创造性。Berger认为,效率提升可能会随着时间的推移而累积,使领英在最终再次增加预算时,能够从数据中心扩建中获得更多收益。
"我想强调一点,对于像我们这样规模的公司来说,要在整整一年内实现无增量存储和计算,绝非易事,但这背后付出了巨大的努力,"Hiremagalur说。
像OpenAI、Meta和谷歌这样的公司正在竭尽全力筹集资金(https://www.wired.com/story/data-center-ai-boom-us-economy-jobs/),并通过意想不到的合作(https://www.wired.com/story/anthropic-spacex-compute-deal-colossus/)来建造、配备和运营配备最新计算机芯片的大型数据中心。劳动力和零部件短缺阻碍了许多项目,许多企业不得不限制用户使用某些AI工具。但是,关于对AI的无休止投资是否可持续的质疑(https://www.wired.com/story/claude-tokens-compute-cost-code-8x8/)也越来越多。拥有超过13亿用户的领英,或许是迄今为止通过抵制建设热潮来公开回应支出问题的最大的企业。
"这对行业来说令人鼓舞,"Principal Venture Partners管理合伙人、服务器制造商惠普董事会成员Songyee Yoon表示。"这表明AI正开始从实验阶段转向注重生产的纪律阶段。最终胜出的公司将不仅仅是那些在基础设施上投入最多的公司。"
## 自主掌控
微软在2016年收购领英几年后,领英曾试图迁移到母公司的Azure云服务,但将这家庞大的社交网络塞进通用数据中心在经济上并不划算。"当时Microsoft Azure增长迅猛,客户需求高涨,同时领英这边也看到了飞速增长,"Hiremagalur说。
2022年,领英全力投入建设位于俄勒冈州、德克萨斯州和弗吉尼亚州的自有数据中心。这种自建模式让领英对其技术的每个细节都拥有极大的控制权,为迎接新时代的现实做好了充分准备。大约在同一时间,领英开始开发基于AI的助手,帮助用户撰写信息、找工作以及招募候选人。这项努力并不便宜。"随着时间的推移,每次对我们网站的查询成本都在增加,"Hiremagalur说,并补充说领英存储的数据量每年都在翻倍。"这不是一个可持续的状况。"
领英着手优化AI管道的每个阶段的数据中心使用率,从模型训练到根据用户查询提供服务的推理环节。Hiremagalur的团队开发了测量工具,以了解各个团队使用了多少计算和存储资源。然后,他们建立了一个系统,可以更有效地将项目分配至数据中心内的计算机,从而减少闲置时间。"在训练方面,我们的分配效率和GPU利用率是我见过最好的,"Hiremagalur说,他描述的使用率超过了95%。
领英还使用了诸如蒸馏等从大型模型中训练更小型AI模型的技术。在其职位推荐工具中,一个单一模型从两个更大的模型中学习,既能识别相关职位,也能预测哪些用户最有可能点击它们。虽然更小的模型运行成本更低,但Berger表示它并未牺牲质量。"人们正发现和找到他们以前无法成功找到的工作,因为这个模型在理解他们的需求方面做得非常好,"他说。
用于选择在用户信息流中显示哪些帖子的模型,起初运行成本也很高,但领英找到了一种方式使其"以相当经济高效的方式"运行,Berger说。他表示,公司进行了数十项改进,例如简化模型训练、重复利用早期推荐的信息,以及更好地平衡CPU和GPU之间的工作负载。
领英甚至重写了英伟达处理器上的一些基础软件(https://www.linkedin.com/blog/engineering/open-source/liger-kernel-open-source-ecosystem-for-efficient-llm-training),使其能够处理超出设计规格的大型任务。它还调整了其他软件,以便在CPU而非更昂贵、更难采购、耗电量更大的英伟达GPU上运行任务。总体而言,领英估计,其效率提升工作在过去12个月中节省了约2400万美元,相当于约1100个GPU全天候运行一年的成本。
领英的高管们承认,对于一家年销售额达180亿美元的公司来说,这些节省并不多。但Hiremagalur说,"工艺"也很重要,"灵活性"同样重要,这种灵活性是通过释放资源产生的。工程师可以更早地开展下一个项目,并在不增加领英计算规模的情况下集成更多AI能力。
Berger认为,领英能够在控制成本并为微软创造财务回报的同时,提供更好的职位和候选人搜索结果。"如果我们能做到,我们应该能够通过部署更大的模型、进行更深入的推理,并且以更低的成本,来提供更高质量的服务,"他说。
尽管保持支出不变,领英的数据中心并未停滞不前。该公司已承诺购买新服务器,以便在未来几个月内,随着旧机器老化或故障,持续升级设备。但公司通过提前采购锁定了一些成本节约。"所有这些硬件的成本都已经飙升,"Hiremagalur说,他指出过去几个月里,一些服务器的价格上涨了三倍。"这简直疯了。"
领英的效率提升措施是更广泛趋势(https://www.wired.com/story/claude-tokens-compute-cost-code-8x8/)的一部分,该趋势有时被称为"代币经济学"——更深入地分析使用生成式AI工具的成本。"企业正在从'多买'时代向'多做'时代演进,"咨询公司Gartner帮助企业思考AI云策略的Chirag Dekate表示。"直到现在,口号都是多买省更多。但多买只会增加成本。"
Dekate说,他最近看到一些对基础设施控制力不如领英的小型企业,也在寻找自己的降本方法。他们清除了未使用的软件并裁减员工,从所谓的"新型云服务商"(https://www.wired.com/story/coreweave-scrappy-cryptominer-multibillion-dollar-ai/)那里购买可能比传统提供商更实惠的数据中心空间,并为特定项目采用成本最低的AI模型(https://www.wired.com/story/chinas-open-ai-models-are-challenging-silicon-valleys-playbook/)。
他有些担心,如果领英和其他公司施加过多的财务限制,可能会遇到瓶颈,因为对更多计算和存储的需求是不可避免的。"到了某个时候,总得有所取舍,"Dekate说。"要么你不得不妥协你的人工智能雄心,要么你不得不放弃冻结IT支出的规定。"
领英并未放弃未来的数据中心增长。但它正在改变分配基础设施的方式。Hiremagalur说,不再需要对团队预计在下一年使用多少计算资源做出"漫无边际的猜测"。但Berger说,领英选择了"拥抱混乱",在关注长期投资回报的同时,按季度调整策略。也许这波支出持平的态势不会像计划的那样持久。
相似文章
为应对AI电力激增,数据中心迎来重新设计竞赛
AI公司正在重新设计数据中心,以应对激增的能源需求和基础设施压力。
@TheAhmadOsman:感谢GLM 5.2,我确切知道企业正在脱离云,获取算力,并致力于为…
一条推文讨论了GLM 5.2如何揭示企业向本地计算和后训练模型发展的趋势,以及对开源AI未来的不同看法。
中国企业正在放弃英伟达的高端加速器,转向国内AI供应商
中国企业越来越多地将AI加速器预算分配给华为和Hygon等国内供应商,在中美紧张局势下减少对英伟达的依赖。彭博社一项调查显示,未来一年内46%的支出将用于国内产品,高于之前的30%。
微软因GitHub面临AI算力瓶颈,转向AWS
微软正在转向亚马逊云服务(AWS)来处理GitHub的AI算力限制问题,凸显了AI计算资源的巨大需求。
Launch HN: Expanse (YC P26) – 解锁闲置的GPU算力
Expanse 是一家创业公司,通过预测作业资源需求并提供优化建议,提高GPU/HPC集群的利用率,解决常见的过度请求资源导致实际利用率仅为30-40%的问题。