在我们的系统中寻找僵尸:CPU 瓶颈的真实故事

Hacker News Top 新闻

摘要

Pinterest Engineering 分享了一项关于 CPU 瓶颈和网络驱动程序问题的详细调查,这些问题导致基于 Ray 的训练任务在其 Kubernetes 平台上崩溃,并提供了分析性能问题的经验教训。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/08/03 16:34

# 在系统中寻找僵尸:一个真实的 CPU 瓶颈故事 来源:https://medium.com/pinterest-engineering/finding-zombies-in-our-systems-a-real-world-story-of-cpu-bottlenecks-ea4722e552eb Pinterest 工程团队(https://medium.com/@Pinterest_Engineering?source=post_page---byline--ea4722e552eb---------------------------------------) Vaibhav Shankar;Staff 软件工程师 \| Raymond Lee;Staff 软件工程师 \| Chia-Wei Chen;Staff 软件工程师 \| Shunyao Li;资深软件工程师 \| Yi Li;Staff 软件工程师 \| Ambud Sharma;首席工程师 \| Saurabh Vishwas Joshi;首席工程师 \| Charles-A. Francisco;高级工程师 \| Karthik Anantha Padmanabhan;工程总监 \| David Westbrook;工程部高级经理 2025 年初的一天,Pinterest 的 Kubernetes 平台团队(PinCompute(https://medium.com/pinterest-engineering/pincompute-a-kubernetes-backed-general-purpose-compute-platform-for-pinterest-8ad408df2d6f))收到了我们 ML 平台团队合作伙伴的提醒。他们基于 Ray 的训练任务(https://medium.com/pinterest-engineering/ray-infrastructure-at-pinterest-0248efe4fd52)经常需要在昂贵的 GPU 硬件上进行数小时的计算,而它们正在崩溃。虽然不是每次都会失败,但频率已经高到不容忽视。他们的日志显示,分布式训练任务出现了间歇性的网络连接丢失,并最终导致任务崩溃。他们的诉求很简单: 1. 为什么会发生这种情况? 2. 能不能让它停止? 这件事引发了一场长达三个多月的调查,也让我们深刻体会到了性能瓶颈剖析的重要性。请继续阅读,从我们关于 CPU 瓶颈、AWS 网络驱动,以及我们如何在系统中发现僵尸(Zombies)的有趣故事中学习经验吧! ## 背景:Pinterest 的 Ray 在 Pinterest,Ray 已成为

相似文章

@injaneity: https://x.com/injaneity/status/2075659478096376158

X AI KOLs Timeline

本文解释了批处理和并行操作如何改善AI计算机使用系统中的延迟和效率,重点介绍了pi-computer-use和cua-driver等开源实现,它们在Codex出现类似功能之前就取得了显著的性能提升。

@zostaff: https://x.com/zostaff/status/2065069139341742588

X AI KOLs Timeline

本文介绍了成为GPU/CUDA工程师的最优AI增强路径,重点介绍了薪资范围以及推理优化专家日益增长的需求。文章提供了现实的时间表,并强调了利用AI工具加速学习的重要性。

@MaxForAI: http://Z.ai和清华这篇ZCube,做Infra的家人们值得看下。 很多人聊AI infra,第一反应还是GPU、显存、量化、推理框架。 但到长上下文和Prefill-Decode分离之后,网络已经不再是机房里的「配角」了。 每一…

X AI KOLs Timeline

ZCube是一种新的网络架构,通过打平拓扑并混合单/多轨接入,优化了长上下文和PD分离场景下的KV Cache传输,在GLM-5.1生产集群中实现了交换机/光模块成本降低33%、GPU推理吞吐提升15%、TTFT P99下降40.6%。