AI工程师Colab笔记本 – 免费、无需框架的RAG/代理/评估
摘要
一套面向AI工程师的免费、无需框架的Colab笔记本,用于学习应用LLM技术栈,包括RAG、代理和评估。
查看缓存全文
缓存时间: 2026/08/28 00:23
calmrocks/ai-engineer-notebooks
来源:https://github.com/calmrocks/ai-engineer-notebooks
AI工程师笔记本
许可证:MIT
在Colab中打开 (https://colab.research.google.com/github/calmrocks/ai-engineer-notebooks/blob/main/00-setup/00-environment.ipynb)
GitHub星标数 (https://github.com/calmrocks/ai-engineer-notebooks/stargazers)
按照面试中实际考核的方式学习应用型LLM技术栈——无框架、使用免费API,从提示工程到服务、微调、再到红队基准测试的全流程。
为**AI工程师/现场部署工程师(FDE)**技能集设计的可运行Colab笔记本:在基础模型之上构建可工作的系统——模型API、RAG、评估、智能体、适配、服务——使用原始API,而非框架。
项目特色
- 刻意无框架设计。 你将首先使用原始API调用编写智能体循环、RAG和评估代码——如此你才能理解LangChain/LlamaIndex实际做了什么,再决定是否使用它们(以及判断何时不应使用)。模式是持久的;包装器会过时。
- 评估是核心。 “先度量再调优”的理念被早早植入,并在每个章节中回归——这个习惯区分了能交付系统的工程师和只会搭建演示的人。
- 端到端免费运行。 所有内容均在免费Groq (https://console.groq.com/) API(无需信用卡)上运行。Groq无法托管的两个主题——LoRA微调(06)和自托管服务(09)——采用概念先行的方式,并附带可选的、有围栏的Colab-GPU附录,已在真实的Colab T4上验证。
- 真实案例研究,而非玩具演示。 三个端到端案例研究展示了在真实约束下综合运用这些技能:一个在生产环境中调试的支持助手、一个管道与智能体的成本对决,以及一个红队鲁棒性基准测试。
- 始终兼容OpenAI标准,因此每个模式都可直接移植到OpenAI,(只需少量修改)也可用于Anthropic——接口可替换,技能则通用。
本项目作为《计划:转型为现场部署工程师/AI工程师》(https://www.calm.rocks/resources/career-development/transition-fde-ai-engineer/)的实践伴侣构建。该计划解释了学什么以及为什么学;这些笔记本是你实践的地方。
适用对象
正转向AI工程师、FDE、应用AI或解决方案工程师(AI)职位的后端或全栈工程师——头衔不同,工作大同小异。你能交付生产代码;你想掌握其上的应用模型层。
学习顺序
自上而下学习。每个笔记本都是独立的(安装自身依赖、从Colab密钥读取API密钥)并以练习结束。
00 — 设置
| 笔记本 | 你将学到什么 |
|---|---|
| 环境与成本管理 | |
| 在Colab中打开 (https://colab.research.google.com/github/calmrocks/ai-engineer-notebooks/blob/main/00-setup/00-environment.ipynb) | 通过Colab密钥管理API密钥、支出保护、模型选择 |
01 — 模型API
| 笔记本 | 你将学到什么 |
|---|---|
| 提示基础 | |
| 在Colab中打开 (https://colab.research.google.com/github/calmrocks/ai-engineer-notebooks/blob/main/01-model-apis/00-prompting-basics.ipynb) | 清晰指令、少样本学习、输出格式规范、逐步推理——最廉价的提升手段,每项都展示其如何提升效果 |
| 结构化输出 | |
| 在Colab中打开 (https://colab.research.google.com/github/calmrocks/ai-engineer-notebooks/blob/main/01-model-apis/01-structured-output.ipynb) | 如何从模型获取可靠的JSON输出,以及其失效场景 |
| 工具调用 | |
| 在Colab中打开 (https://colab.research.google.com/github/calmrocks/ai-engineer-notebooks/blob/main/01-model-apis/02-tool-calling.ipynb) | 函数/工具调用的端到端流程,包括错误路径 |
| 流式传输 | |
| 在Colab中打开 (https://colab.research.google.com/github/calmrocks/ai-engineer-notebooks/blob/main/01-model-apis/03-streaming.ipynb) | 流式响应及其UI需求 |
| 上下文与缓存 | |
| 在Colab中打开 (https://colab.research.google.com/github/calmrocks/ai-engineer-notebooks/blob/main/01-model-apis/04-context-and-caching.ipynb) | 上下文窗口预算、提示缓存、批处理与实时定价 |
02 — 评估 I:度量输出
| 笔记本 | 你将学到什么 |
|---|---|
| 度量输出 | |
| 在Colab中打开 (https://colab.research.google.com/github/calmrocks/ai-engineer-notebooks/blob/main/02-evals-basics/01-measuring-outputs.ipynb) | 在第01章任务上构建黄金数据集与指标——在构建任何需要调优的东西之前,培养“先度量再调优”的习惯。评估是核心;此后它将在每个章节中回归 |
03 — RAG
| 笔记本 | 你将学到什么 |
|---|---|
| 什么是RAG? | |
| 在Colab中打开 (https://colab.research.google.com/github/calmrocks/ai-engineer-notebooks/blob/main/03-rag/00-what-is-rag.ipynb) | 检索→增强→生成循环,为何RAG优于纯LLM,以及RAG为何不同于嵌入——附带15行代码的可运行演示 |
| 嵌入与检索 | |
| 在Colab中打开 (https://colab.research.google.com/github/calmrocks/ai-engineer-notebooks/blob/main/03-rag/01-embeddings-retrieval.ipynb) | 嵌入模型选择、向量搜索、相似度陷阱——首先让检索工作起来 |
| 混合与重排序 | |
| 在Colab中打开 (https://colab.research.google.com/github/calmrocks/ai-engineer-notebooks/blob/main/03-rag/02-hybrid-and-reranking.ipynb) | 关键词+向量混合检索、重排序器、各自何时值得其成本 |
| 分块 | |
| 在Colab中打开 (https://colab.research.google.com/github/calmrocks/ai-engineer-notebooks/blob/main/03-rag/03-chunking.ipynb) | 在真实杂乱语料库上的分块策略——最后才回顾,待你能根据检索效果评判它们时 |
| RAG为何失败 | |
| 在Colab中打开 (https://colab.research.google.com/github/calmrocks/ai-engineer-notebooks/blob/main/03-rag/04-why-rag-fails.ipynb) | 诊断不良答案:检索质量,而非生成,通常是瓶颈 |
04 — 评估 II:差异化技能
| 笔记本 | 你将学到什么 |
|---|---|
| 黄金数据集 | |
| 在Colab中打开 (https://colab.research.google.com/github/calmrocks/ai-engineer-notebooks/blob/main/04-evals/01-golden-sets.ipynb) | 为第03章的RAG系统构建黄金数据集 |
| LLM作为裁判 | |
| 在Colab中打开 (https://colab.research.google.com/github/calmrocks/ai-engineer-notebooks/blob/main/04-evals/02-llm-as-judge.ipynb) | 裁判提示、与人类的一致性以及裁判自身的失败模式 |
| 回归评估 | |
| 在Colab中打开 (https://colab.research.google.com/github/calmrocks/ai-engineer-notebooks/blob/main/04-evals/03-regression-evals.ipynb) | 评估作为CI:在更改提示或模型时捕获质量回归 |
05 — 智能体
| 笔记本 | 你将学到什么 |
|---|---|
| 从零构建智能体循环 | |
| 在Colab中打开 (https://colab.research.google.com/github/calmrocks/ai-engineer-notebooks/blob/main/05-agents/01-agent-loop-from-scratch.ipynb) | 使用原始API调用的可工作智能体循环——无框架 |
| 工具设计 | |
| 在Colab中打开 (https://colab.research.google.com/github/calmrocks/ai-engineer-notebooks/blob/main/05-agents/02-tool-design.ipynb) | 设计模型能有效使用的工具 |
| 护栏与预算 | |
| 在Colab中打开 (https://colab.research.google.com/github/calmrocks/ai-engineer-notebooks/blob/main/05-agents/03-guardrails-and-budgets.ipynb) | 终止条件、成本/延迟预算、管道何时优于智能体 |
| MCP与工具生态 | |
| 在Colab中打开 (https://colab.research.google.com/github/calmrocks/ai-engineer-notebooks/blob/main/05-agents/04-mcp-and-the-tool-ecosystem.ipynb) | 概念:模型上下文协议标准化了什么,它如何映射到原始工具循环,以及何时采用它 |
| 技能与渐进式揭示 | |
| 在Colab中打开 (https://colab.research.google.com/github/calmrocks/ai-engineer-notebooks/blob/main/05-agents/05-skills-and-progressive-disclosure.ipynb) | 概念:打包可复用知识供智能体按需加载——SKILL.md模式、上下文预算收益,以及工具/MCP/技能如何融为一体 |
| 运行框架工程 | |
| 在Colab中打开 (https://colab.research.google.com/github/calmrocks/ai-engineer-notebooks/blob/main/05-agents/06-harness-engineering.ipynb) | 综合:调用外围的脚手架——上下文组装与压缩、工具结果塑形,以及验证循环。本章逐片教授的学科在此命名 |
06 — 模型适配
| 笔记本 | 你将学到什么 |
|---|---|
| 微调 vs RAG vs 提示 | |
| 在Colab中打开 (https://colab.research.google.com/github/calmrocks/ai-engineer-notebooks/blob/main/06-adaptation/01-fine-tune-vs-rag-vs-prompt.ipynb) | 何时更改模型权重而非输入;LoRA/QLoRA是什么及其成本;你将在讨论中遇到的论点——附带可选的真实LoRA微调(使用免费GPU) |
07 — 安全
| 笔记本 | 你将学到什么 |
|---|---|
| 提示注入与信任边界 | |
| 在Colab中打开 (https://colab.research.google.com/github/calmrocks/ai-engineer-notebooks/blob/main/07-security/01-prompt-injection-and-trust.ipynb) | 直接与间接提示注入、输出处理、PII、过度代理——OWASP LLM Top 10风险,先现场演示失败再展示防御 |
08 — 运维
| 笔记本 | 你将学到什么 |
|---|---|
| 可观测性与LLMOps | |
| 在Colab中打开 (https://colab.research.google.com/github/calmrocks/ai-engineer-notebooks/blob/main/08-operations/01-observability-and-llmops.ipynb) | 追踪每次调用、安全记录提示、成本/延迟/错误指标、漂移检测,以及观测→评估反馈循环 |
| 可靠性与回退 | |
| 在Colab中打开 (https://colab.research.google.com/github/calmrocks/ai-engineer-notebooks/blob/main/08-operations/02-reliability-and-fallbacks.ipynb) | 带退避的重试、超时、回退模型、输出验证、熔断器、优雅降级 |
| 实验跟踪与注册表 | |
| 在Colab中打开 (https://colab.research.google.com/github/calmrocks/ai-engineer-notebooks/blob/main/08-operations/03-experiment-tracking-and-registry.ipynb) | MLflow端到端:从第04章评估框架记录运行/参数/指标,注册模型并版本化,并按阶段推广——将“我运行了一次评估”转变为可跟踪、可复现工作流的工具 |
09 — 服务与推理性能
当免费Groq API无法运行该主题(这些框架需要GPU)时,笔记本采用概念先行的方式,并围起可选的Colab-GPU附录——与第06章LoRA附录采用相同模式。
| 笔记本 | 你将学到什么 |
|---|---|
| 服务框架 | |
| 在Colab中打开 (https://colab.research.google.com/github/calmrocks/ai-engineer-notebooks/blob/main/09-serving-inference/01-serving-frameworks.ipynb) | AI工程师实际在其中选择的服务栈——vLLM、TGI、Triton、TensorRT-LLM——各自优化什么,如何映射到你一直在调用的原始API,以及何时选择哪个 |
| 推理性能 | |
| 在Colab中打开 (https://colab.research.google.com/github/calmrocks/ai-engineer-notebooks/blob/main/09-serving-inference/02-inference-performance.ipynb) | 吞吐量与延迟背后的杠杆:连续批处理、KV缓存、量化,以及吞吐量与延迟的权衡——附带估算部署规模的简便计算 |
10 — ML系统设计与性能
| 笔记本 | 你将学到什么 |
|---|---|
| 设计推理服务 | |
| 在Colab中打开 (https://colab.research.google.com/github/calmrocks/ai-engineer-notebooks/blob/main/10-ml-system-design/01-designing-an-inference-service.ipynb) | 概念:ML系统设计面试题的端到端求解——QPS/显存/延迟/成本估算、副本扩展、排队、缓存以及SLA权衡,基于一个真实的LLM服务提示 |
11 — 客户技艺(FDE的差异化技能)
| 笔记本 | 你将学到什么 |
|---|---|
| 范围界定与发现 | |
| 在Colab中打开 (https://colab.research.google.com/github/calmrocks/ai-engineer-notebooks/blob/main/11-customer-craft/01-scoping-and-discovery.ipynb) | 将模糊的客户需求转化为可界定、可评估的系统:发现性问题、一页范围文档、演示纪律——大多数工程师无法证明的客户场景面试环节 |
12 — 案例研究与毕业设计
技能在此汇聚成项目。首先是一个案例研究——一个可运行的、端到端处理的真实场景——然后是毕业设计,你自己构建的已部署代码库。(章节概述。)
| 笔记本 | 你将学到什么 |
|---|---|
| 案例A — 客户支持助手 | |
| 在Colab中打开 (https://colab.research.google.com/github/calmrocks/ai-engineer-notebooks/blob/main/12-case-studies-and-capstone/01-customer-support-assistant.ipynb) | 从范围界定→构建→服务→在生产环境中调试一个场景:将模糊需求变为一个已部署、已评估的RAG+智能体助手,然后是一次真实质量回归(语料库迁移后的陈旧索引),你对其进行诊断和修复。一条贯穿第02–11章的构建至调试弧线 |
| 案例B — 合同提取:管道 vs 智能体 | |
| 在Colab中打开 (https://colab.research.google.com/github/calmrocks/ai-engineer-notebooks/blob/main/12-case-studies-and-capstone/02-contract-extraction-pipeline-vs-agent.ipynb) | 面试官喜欢的判断题:将同一个提取任务同时构建为智能体和管道,然后用准确率+令牌成本证明当步骤已知时管道获胜 |
| 案例C — 红队鲁棒性基准测试 | |
| 在Colab中打开 (https://colab.research.google.com/github/calmrocks/ai-engineer-notebooks/blob/main/12-case-studies-and-capstone/03-red-team-robustness-benchmark.ipynb) | 一种不同类型的系统——一个评估模型而非服务模型的框架:一个攻击者→目标→裁判(PAIR)循环,测量攻击成功率,综合了智能体循环、LLM裁判、安全和评估 |
毕业设计:项目简述是将出现在你简历上的已部署项目——一个包含服务组件和评估报告的真实代码库。案例研究用于学习;毕业设计用于求职。
约定
- 原始模型API,无框架。 模式是持久的;包装器会过时。
- 单一共享语料库 (
data/) 跨RAG和评估章节使用,因此评估衡量的是你实际构建的检索。 - 独立笔记本。 第一个单元格安装依赖,第二个单元格调用
from aien import setup; client, MODEL = setup()以从Colab密钥(或本地环境变量)加载你的密钥。笔记本间无隐藏状态。aien是本仓库中的小型共享设置包——更改的唯一位置
相似文章
@mdancho84: 面向AI工程师的93个项目。MCP、Agents和RAG(免费):
由Matt Dancho分享的涵盖MCP、Agents和RAG的93个免费AI工程师项目精选列表。
从零开始学习AI工程
一个免费的开源课程,从基本原理教授AI工程,在使用框架之前从原始数学构建算法。课程包含20个阶段的435节课,支持Python、TypeScript、Rust和Julia。
@DanKornas: 别再从随机的教程标签中学习应用AI了。AI Engineering Academy是一个开源学习平台,面向应用…
AI Engineering Academy是一个开源学习平台,为提示工程、RAG、LLM微调、部署和智能体等应用AI主题提供结构化的学习路径。
owainlewis/awesome-artificial-intelligence
一份精心整理的、用于构建和交付AI系统的必用且积极维护的资源合集,涵盖AI工程主题,如RAG、智能体、评估、护栏和部署,以及推荐的书籍、课程和里程碑式论文。
@tom_doerr: 构建RAG系统的分步指南笔记本 https://github.com/langchain-ai/rag-from-scratch…
一个从头构建RAG系统的分步笔记本系列,涵盖索引、检索和生成,并附有视频播放列表。