@GitHub_Daily: 准备AI工作面试,想知道Anthropic和OpenAI等大公司到底喜欢问什么——只能逐一翻阅帖子。

X AI KOLs Timeline 新闻

摘要

一个GitHub仓库,汇集了来自35家主要公司的泄露的AI工程面试问题,按公司组织,并附有解决方案的直接链接,涵盖了高频主题和面试流程。

准备AI工作面试,想知道Anthropic和OpenAI等大公司到底喜欢问什么——只能逐一翻阅帖子。 有人整理了来自35家公司的泄露的AI工程面试问题,按公司组织成一个仓库,对于有解决方案的问题,在下方附上了直接链接。 首先,查看跨公司的高频问题:注意力机制、KV缓存、检索增强、Agents、系统设计——这些分为10个类别,每个问题都标记了哪些公司曾问过。 GitHub: http://github.com/pallavi-shekhar/ai-engineering-interview-questions-company-wise… 每家公司还概述了其面试流程。例如Anthropic:30分钟的初步筛选,70到90分钟的编码评估,外加大约五轮面试,总共持续3周到2个月。 我认为最有趣的部分是问题本身,例如“50,000个文档需要运行模型调用,但接口只允许100个并发调用并且仍然报错——你会如何编写代码?” 还有一个问题是,对于像Claude Code这样的编码Agent,模型和外部框架哪个更重要——如今的面试确实感觉非常接近实际工作。 如果你计划申请大模型应用或Agent方向的职位,先浏览那10个类别的高频问题。
查看原文
查看缓存全文

缓存时间: 2026/09/25 06:38

准备应对AI岗位面试,想了解Anthropic和OpenAI等大公司到底爱问什么——可惜只能逐篇翻阅帖子。有人汇集了来自35家企业的AI工程面试真题泄露版,按公司整理成仓库,下方直接附上了有解答的问题链接。首先看看跨公司的高频考题:注意力机制、KV缓存、检索增强、智能体、系统设计——这些被分为10个类别,每道题都标注了哪些公司曾提问。GitHub地址:http://github.com/pallavi-shekhar/ai-engineering-interview-questions-company-wise… 每家公司还附有其面试流程说明。比如Anthropic:30分钟初筛、70到90分钟编程评估,外加约五轮面试,总耗时3周至2个月。我认为最有趣的是题目本身,比如“需要处理5万份文档的模型调用,但接口只允许100个并发调用且仍会报错——你会如何编写代码?“ 还有一道题问,对于Claude Code这类编码智能体,模型和外部框架哪个更重要——如今的面试题确实非常贴近实际工作。如果你计划申请大模型应用或智能体方向的岗位,建议优先研究那10类高频题。


pallavi-shekhar/ai-engineering-interview-questions-company-wise

来源:https://github.com/pallavi-shekhar/ai-engineering-interview-questions-company-wise

按公司分类的AI工程面试题

AI工程面试题按公司分类——顶尖AI公司AI工程面试备考手册

来自35家公司的真实AI工程面试题目,按公司分类整理,所有有解答的问题均附链接。

这些面试题适用于以下职位:

  • AI工程师
  • 生成式AI工程师
  • LLM工程师
  • 智能体AI工程师
  • AI智能体工程师
  • 机器学习工程师
  • 研究工程师
  • 应用科学家
  • 前沿部署工程师
  • AI解决方案架构师
  • AI平台工程师
  • 应用AI工程师
  • LLM推理与性能工程师
  • MLOps工程师
  • LLMOps工程师

目录

由Outcome School(https://outcomeschool.com)整理维护

Outcome School的AI与机器学习课程:AI与机器学习课程(https://outcomeschool.com/program/ai-and-machine-learning)

关注Outcome School

  • YouTube(https://youtube.com/@OutcomeSchool)
  • X/Twitter(https://x.com/outcome_school)
  • LinkedIn(https://www.linkedin.com/company/outcomeschool)
  • GitHub(https://github.com/OutcomeSchool)

注意:我们将持续更新题目与解答。

按主题分类的题目与解答,请参见《AI工程面试题与答案》(https://github.com/amitshekhariitbhu/ai-engineering-interview-questions)


使用指南

  • 题目均汇编自公开的面试经历分享,内容均非机密。面试环节会不断变化,且因团队、职级和地区而异,因此请将每个公司的部分视为该公司关注重点的指南,而非你一定会被问到的脚本。
  • 首先从跨公司常见问题开始,这些问题在许多公司反复出现。每道题仅列出一次,标注提问的公司,因此在公司专属部分不会重复。
  • 然后查阅你目标公司的部分。每家公司部分包含其涵盖的职位、公开报道的面试流程,以及按主题分类的公司专属问题。
  • 凡有解答的问题,链接均紧跟在问题下方。我们将持续添加解答。

跨公司常见问题

这些问题在许多公司的AI工程面试中出现。此处每道题仅列出一次,并标注提问该公司(或其特定版本)的公司。请优先攻克这些题目。

LLM内部原理与架构

  • 解释缩放点积注意力机制,以及为什么1/√(d_k)的缩放因子很重要。
    • 答案:注意力机制中√d_k缩放因子背后的数学(https://outcomeschool.com/blog/scaling-dot-product-attention)和注意力机制背后的数学 - Q、K、V(https://outcomeschool.com/blog/math-behind-attention-qkv)
  • 什么是KV缓存?其大规模使用的内存影响是什么?推导其公式。
  • 什么是多查询注意力(MQA)和分组查询注意力(GQA),它们牺牲了什么?
    • 提问公司:Meta、Mistral AI
    • 答案:分组查询注意力(https://outcomeschool.com/blog/grouped-query-attention)
  • 什么是多头潜在注意力(MLA),为什么DeepSeek引入它?
    • 提问公司:DeepSeek、月之暗面
    • 答案:KV缓存压缩(https://outcomeschool.com/blog/kv-cache-compression)
  • 解释FlashAttention。它并不减少浮点运算次数,那么为什么更快?
    • 提问公司:Together AI
    • 答案:解码LLM中的Flash注意力(https://outcomeschool.com/blog/decoding-flash-attention)
  • 字节对编码(BPE)如何工作?其失败模式是什么(数字、代码、非拉丁文字)?
    • 提问公司:阿里巴巴、Sarvam AI、Hugging Face
    • 答案:字节对编码(https://outcomeschool.com/blog/bpe-in-llms)和大型语言模型(LLM)中的分词(https://www.youtube.com/watch?v=sK2s9I84EVI)
  • 什么是Transformer中的位置编码,它是如何演变的(正弦式 → 学习式 → RoPE → ALiBi)?
    • 答案:LLM中的位置嵌入(https://outcomeschool.substack.com/p/positional-embeddings-in-llms)和RoPE(旋转位置编码)背后的数学(https://outcomeschool.com/blog/math-behind-rope-rotary-position-embedding)
  • 解释RoPE,以及位置插值/YaRN如何将上下文长度扩展到训练长度之外。
    • 提问公司:Meta、月之暗面、阿里巴巴
    • 答案:RoPE(旋转位置编码)背后的数学(https://outcomeschool.com/blog/math-behind-rope-rotary-position-embedding)
  • Chinchilla缩放定律说了什么?它们与早期的缩放直觉有何不同?
  • 什么是混合专家(Mixture-of-Experts)架构?它如何在不增加浮点运算次数的情况下扩展容量?
  • 解释预训练、监督微调和偏好优化的区别。
    • 提问公司:Meta、Scale AI
    • 答案:解码InstructGPT(https://outcomeschool.com/blog/decoding-instructgpt)和基于人类反馈的强化学习(RLHF)(https://outcomeschool.com/blog/reinforcement-learning-from-human-feedback-rlhf)
  • 比较贪心搜索、束搜索、Top-k、Top-p和温度采样。各自在什么情况下会失效?
    • 提问公司:Google DeepMind、Apple、Perplexity
    • 答案:温度如何控制LLM输出?(https://outcomeschool.com/blog/how-does-temperature-control-llm-output)和Top-k与Top-p采样如何工作?(https://outcomeschool.com/blog/how-do-top-k-and-top-p-sampling-work)
  • 长上下文中的“中间丢失“问题是什么?如何解决?
    • 提问公司:月之暗面
    • 答案:LLM中的“中间丢失“问题(https://outcomeschool.com/blog/lost-in-the-middle-problem-in-llms)
  • 为什么现代Transformer中LayerNorm放在块之前?什么是RMSNorm?
    • 答案:RMSNorm(均方根层归一化)(https://outcomeschool.com/blog/rmsnorm-root-mean-square-layer-normalization)
  • 解释SwiGLU,以及为什么门控激活函数在现代LLM MLP模块中取代了ReLU/GELU。
    • 提问公司:Meta
    • 答案:LLM中的前馈网络(https://outcomeschool.com/blog/feed-forward-networks-in-llms)
  • 逐步讲解解码器专用Transformer的一次前向传播中,张量层面发生了什么。
    • 提问公司:Anthropic
    • 答案:解码Transformer架构(https://outcomeschool.com/blog/decoding-transformer-architecture)

推理、服务与GPU性能

  • 解释预填充(prefill)和解码(decode)阶段。为什么预填充是计算密集型,而解码是内存带宽密集型?
    • 提问公司:月之暗面、NVIDIA、Together AI
    • 答案:预填充 vs 解码:LLM推理优化(https://outcomeschool.com/blog/prefill-vs-decode-llm-inference-optimization)
  • 什么是连续(运行中)批处理?为什么它取代了静态批处理?
  • 分页注意力(PagedAttention)如何工作?它解决了KV缓存碎片化的什么问题?
    • 提问公司:NVIDIA、Together AI
    • 答案:LLM中的分页注意力(https://outcomeschool.com/blog/paged-attention-in-llms)和vLLM如何工作?(https://outcomeschool.com/blog/how-does-vllm-work)
  • 什么是投机解码?为什么能保持输出质量?什么时候它不起作用?
    • 提问公司:NVIDIA、Together AI
    • 答案:投机解码(https://outcomeschool.com/blog/speculative-decoding)
  • 解释前缀缓存/提示缓存。何时应使用它?什么会使其缓存的前缀失效?
    • 提问公司:月之暗面、Character.AI
    • 答案:提示缓存如何工作?(https://outcomeschool.com/blog/how-does-prompt-caching-work)
  • 比较用于服务的FP16、BF16、FP8、INT8、INT4和FP4。每一步降级会损坏什么?
  • 比较张量并行、流水线并行、数据并行、序列并行和专家并行。何时需要组合使用它们?
  • 估算服务一个70B模型所需的GPU内存:权重、KV缓存、激活值、碎片。
    • 提问公司:NVIDIA
    • 答案:LLM中的KV缓存是什么?(https://outcomeschool.com/blog/kv-cache-in-llms)和LLM中的分页注意力(https://outcomeschool.com/blog/paged-attention-in-llms)
  • 什么是TTFT、TPOT、ITL和吞吐量?它们之间如何权衡?
    • 提问公司:Microsoft、Apple、Perplexity
    • 答案:预填充 vs 解码:LLM推理优化(https://outcomeschool.com/blog/prefill-vs-decode-llm-inference-optimization)和LLM中的首token延迟问题(https://www.youtube.com/watch?v=XD8DD4cEHu0)
  • 进行屋顶线数学计算:对于批大小为1的70B模型,单个H100每秒能产生多少token?
    • 提问公司:NVIDIA、Together AI
    • 答案:预填充 vs 解码:LLM推理优化(https://outcomeschool.com/blog/prefill-vs-decode-llm-inference-optimization)
  • 何时选择vLLM vs SGLang vs TensorRT-LLM vs 自定义方案?
    • 提问公司:NVIDIA、Together AI
    • 答案:vLLM如何工作?(https://outcomeschool.com/blog/how-does-vllm-work)、SGLang如何工作?(https://outcomeschool.com/blog/how-does-sglang-work)和TensorRT-LLM如何工作?(https://outcomeschool.com/blog/how-does-tensorrt-llm-work)
  • 你如何将LLM服务成本降低10倍?列举所有杠杆并排序。
    • 提问公司:Microsoft、Amazon、NVIDIA、Cursor
    • 答案:在此视频中解释:LLM推理优化(https://www.youtube.com/watch?v=jV2sCj4lHYk)和LLM推理优化(https://outcomeschool.com/blog/llm-inference-optimization)
  • 在未更改模型的情况下部署后,你的p99延迟翻倍了。逐步讲解诊断过程。
  • 什么是分块预填充?为什么它能在混合流量下改善尾延迟?
  • 解释预填充/解码分离服务,以及何时它能收回成本。
    • 提问公司:月之暗面、Groq
    • 答案:LLM推理中的预填充-解码分离(https://outcomeschool.com/blog/prefill-decode-disaggregation)

RAG与检索

  • 对于大型技术文档语料库,你会使用什么分块策略?为什么?
    • 提问公司:Glean
    • 答案:RAG的分块策略(https://outcomeschool.com/blog/chunking-strategies-for-rag)
  • 如何在稀疏检索器(如BM25)和稠密检索器之间做选择?何时两者都需要?

相似文章

AI求职面试催生了一个全新行业

Reddit r/artificial

本文探讨了为AI职位提供的付费辅导和面试准备服务这一日益增长的行业,其背后是OpenAI、Anthropic和Google DeepMind等公司的高需求和激烈竞争。

@GitHub_Daily: GitHub 上一份精心收集的数据工程师面试题库:data-engineering-interview-questions ,收录了超过 2000 道题。 覆盖数据库与数据仓库、大数据处理框架、云平台服务、数据格式、数据可视化等核心方向,…

X AI KOLs Timeline

GitHub 上有一个精心收集的数据工程师面试题库 data-engineering-interview-questions,收录了超过 2000 道题,覆盖数据库、大数据框架、云平台、数据可视化等核心方向。

@GitHub_Daily: 准备运维和 DevOps 面试,网上搜到的大多是那种拼凑的题库,跟真实面试差别挺大。 DevOps-Interview-Guide 收录了 151 份真实面试记录,来自 85 家公司,问的问题都是候选人原样记下来的,没有二手转述。 覆盖 …

X AI KOLs Timeline

推荐一个收录了151份真实DevOps/SRE面试记录的GitHub仓库,涵盖85家公司,问题由候选人原样记录,覆盖Kubernetes、Docker、Terraform、AWS、CI/CD等方向,方便求职者按公司或主题准备面试。