@gpusteve:你正在面试Anthropic的机器学习性能岗位,他们问:“你在8块GPU上运行一个70B参数的Transformer模型…”

X AI KOLs Timeline 新闻

摘要

一条推文解释了一个在Anthropic机器学习性能面试题中的正确答案:在8块GPU上运行70B参数的Transformer模型时,按列分割张量并行线性层与按行分割的延迟权衡,并强调尽管每块GPU的权重相等,但性能并不相似。

你正在面试Anthropic的机器学习性能岗位,他们问: “你在8块GPU上运行一个70B参数的Transformer模型。按列和按行分割张量并行线性层分别有什么延迟权衡?” 你回答:“无论哪种方式,每块GPU都得到1/8的权重,所以性能应该相似。” 这是错误的。 正确答案如下:
查看原文
查看缓存全文

缓存时间: 2026/06/08 05:19

你在面试Anthropic的机器学习性能岗位,他们问:

“你在8块GPU上部署一个70b参数的Transformer模型。将张量并行的线性层按列分割和按行分割,各自有什么样的延迟权衡?”

你说:“无论哪种方式,每块GPU都只得到1/8的权重,所以性能应该差不多。”——错了。

下面才是正确的回答思路:

先搞清楚线性层在做什么。

它把当前的隐藏状态 X 乘上一个权重矩阵 W,得到 Y。

张量并行就是把 W 切分到各个GPU上。关键细节是你沿哪个维度切分,因为这会决定部分输出的形状。

real

相似文章