@gpusteve:你正在面试Anthropic的机器学习性能岗位,他们问:“你在8块GPU上运行一个70B参数的Transformer模型…”
摘要
一条推文解释了一个在Anthropic机器学习性能面试题中的正确答案:在8块GPU上运行70B参数的Transformer模型时,按列分割张量并行线性层与按行分割的延迟权衡,并强调尽管每块GPU的权重相等,但性能并不相似。
查看缓存全文
缓存时间: 2026/06/08 05:19
你在面试Anthropic的机器学习性能岗位,他们问:
“你在8块GPU上部署一个70b参数的Transformer模型。将张量并行的线性层按列分割和按行分割,各自有什么样的延迟权衡?”
你说:“无论哪种方式,每块GPU都只得到1/8的权重,所以性能应该差不多。”——错了。
下面才是正确的回答思路:
先搞清楚线性层在做什么。
它把当前的隐藏状态 X 乘上一个权重矩阵 W,得到 Y。
张量并行就是把 W 切分到各个GPU上。关键细节是你沿哪个维度切分,因为这会决定部分输出的形状。
real
相似文章
@akshay_pachaar: 你在Anthropic参加机器学习工程师面试。面试官问:"我们的模型在42秒内生成100个token。H…
解释了KV缓存如何通过消除注意力键和值的冗余重计算来加速LLM推理,在速度与内存之间进行权衡,并介绍了生产级缓存管理挑战。
@analogalok:别再盲目信任本地 LLM 的默认多 GPU 设置了,你实际上正浪费 25% 的性能……
基准测试结果对比了 llama.cpp 中针对双 GPU 设置的层并行与张量并行:层模式在预填充(RAG 管道)中快 25%,而张量模式在解码(交互式聊天)中快 16%。
@_avichawla: 一个棘手的LLM面试题:你在vLLM上部署推理模型,长序列时GPU内存总是不够用。于是你加入KV缓存压缩,驱逐了90%的缓存token。显存占用依旧,GPU仍然内存不足。为什么?
解释了为什么在vLLM上部署推理模型时,驱逐90%的KV缓存token无法释放GPU内存,原因是分页注意力碎片化。同时介绍了NVIDIA的TriAttention解决方案,可实现2.5倍加速和10.7倍内存缩减。
@TeachTheMachine:衡量Transformer推理性能
一份关于衡量Transformer推理性能的实用教程,涵盖延迟、TTFT、吞吐量、内存使用等指标,以及针对LLM的基准测试技术。
@akshay_pachaar: 如果必须将70B模型适配到单个GPU上,我会学习的LLM量化技术:(收藏此帖) FP16的70B模型……
一条推文介绍了五种关键的LLM量化技术(RTN, GPTQ, AWQ, LLM.int8(), QAT),用于在有限硬件上适配大型模型,并引用了一篇综合性研究论文。