在我们的系统中寻找僵尸:CPU 瓶颈的真实故事
摘要
Pinterest Engineering 分享了一项关于 CPU 瓶颈和网络驱动程序问题的详细调查,这些问题导致基于 Ray 的训练任务在其 Kubernetes 平台上崩溃,并提供了分析性能问题的经验教训。
暂无内容
查看缓存全文
缓存时间: 2026/08/03 16:34
# 在系统中寻找僵尸:一个真实的 CPU 瓶颈故事
来源:https://medium.com/pinterest-engineering/finding-zombies-in-our-systems-a-real-world-story-of-cpu-bottlenecks-ea4722e552eb
Pinterest 工程团队(https://medium.com/@Pinterest_Engineering?source=post_page---byline--ea4722e552eb---------------------------------------)
Vaibhav Shankar;Staff 软件工程师 \| Raymond Lee;Staff 软件工程师 \| Chia-Wei Chen;Staff 软件工程师 \| Shunyao Li;资深软件工程师 \| Yi Li;Staff 软件工程师 \| Ambud Sharma;首席工程师 \| Saurabh Vishwas Joshi;首席工程师 \| Charles-A. Francisco;高级工程师 \| Karthik Anantha Padmanabhan;工程总监 \| David Westbrook;工程部高级经理
2025 年初的一天,Pinterest 的 Kubernetes 平台团队(PinCompute(https://medium.com/pinterest-engineering/pincompute-a-kubernetes-backed-general-purpose-compute-platform-for-pinterest-8ad408df2d6f))收到了我们 ML 平台团队合作伙伴的提醒。他们基于 Ray 的训练任务(https://medium.com/pinterest-engineering/ray-infrastructure-at-pinterest-0248efe4fd52)经常需要在昂贵的 GPU 硬件上进行数小时的计算,而它们正在崩溃。虽然不是每次都会失败,但频率已经高到不容忽视。他们的日志显示,分布式训练任务出现了间歇性的网络连接丢失,并最终导致任务崩溃。他们的诉求很简单:
1. 为什么会发生这种情况?
2. 能不能让它停止?
这件事引发了一场长达三个多月的调查,也让我们深刻体会到了性能瓶颈剖析的重要性。请继续阅读,从我们关于 CPU 瓶颈、AWS 网络驱动,以及我们如何在系统中发现僵尸(Zombies)的有趣故事中学习经验吧!
## 背景:Pinterest 的 Ray
在 Pinterest,Ray 已成为
相似文章
@injaneity: https://x.com/injaneity/status/2075659478096376158
本文解释了批处理和并行操作如何改善AI计算机使用系统中的延迟和效率,重点介绍了pi-computer-use和cua-driver等开源实现,它们在Codex出现类似功能之前就取得了显著的性能提升。
NVIDIA Exemplar Cloud:在AI基础设施上释放全部性能的经验教训(12分钟阅读)
NVIDIA分享了其Exemplar Cloud项目的调试经验,详细说明了SMMU电源管理、NUMA放置、NCCL队列对并发以及硬件缺陷等配置问题如何导致AI集群8-12%的训练吞吐量差距,以及如何诊断和修复这些问题。
为什么现有硬件难以应对 2026 年多智能体工作流(Mac Studio vs. RTX 5090)
本地运行多智能体 AI 工作流的硬件需求对比,重点探讨显存(VRAM)与 KV Cache 的瓶颈限制。
@zostaff: https://x.com/zostaff/status/2065069139341742588
本文介绍了成为GPU/CUDA工程师的最优AI增强路径,重点介绍了薪资范围以及推理优化专家日益增长的需求。文章提供了现实的时间表,并强调了利用AI工具加速学习的重要性。
@MaxForAI: http://Z.ai和清华这篇ZCube,做Infra的家人们值得看下。 很多人聊AI infra,第一反应还是GPU、显存、量化、推理框架。 但到长上下文和Prefill-Decode分离之后,网络已经不再是机房里的「配角」了。 每一…
ZCube是一种新的网络架构,通过打平拓扑并混合单/多轨接入,优化了长上下文和PD分离场景下的KV Cache传输,在GLM-5.1生产集群中实现了交换机/光模块成本降低33%、GPU推理吞吐提升15%、TTFT P99下降40.6%。