AI工程师Colab笔记本 – 免费、无需框架的RAG/代理/评估

Hacker News Top 工具

摘要

一套面向AI工程师的免费、无需框架的Colab笔记本,用于学习应用LLM技术栈,包括RAG、代理和评估。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/08/28 00:23

calmrocks/ai-engineer-notebooks

来源:https://github.com/calmrocks/ai-engineer-notebooks

AI工程师笔记本

许可证:MIT
在Colab中打开 (https://colab.research.google.com/github/calmrocks/ai-engineer-notebooks/blob/main/00-setup/00-environment.ipynb)
GitHub星标数 (https://github.com/calmrocks/ai-engineer-notebooks/stargazers)

按照面试中实际考核的方式学习应用型LLM技术栈——无框架、使用免费API,从提示工程到服务、微调、再到红队基准测试的全流程。

为**AI工程师/现场部署工程师(FDE)**技能集设计的可运行Colab笔记本:在基础模型之上构建可工作的系统——模型API、RAG、评估、智能体、适配、服务——使用原始API,而非框架。

项目特色

  • 刻意无框架设计。 你将首先使用原始API调用编写智能体循环、RAG和评估代码——如此你才能理解LangChain/LlamaIndex实际做了什么,再决定是否使用它们(以及判断何时不应使用)。模式是持久的;包装器会过时。
  • 评估是核心。 “先度量再调优”的理念被早早植入,并在每个章节中回归——这个习惯区分了能交付系统的工程师和只会搭建演示的人。
  • 端到端免费运行。 所有内容均在免费Groq (https://console.groq.com/) API(无需信用卡)上运行。Groq无法托管的两个主题——LoRA微调(06)和自托管服务(09)——采用概念先行的方式,并附带可选的、有围栏的Colab-GPU附录,已在真实的Colab T4上验证
  • 真实案例研究,而非玩具演示。 三个端到端案例研究展示了在真实约束下综合运用这些技能:一个在生产环境中调试的支持助手、一个管道与智能体的成本对决,以及一个红队鲁棒性基准测试。
  • 始终兼容OpenAI标准,因此每个模式都可直接移植到OpenAI,(只需少量修改)也可用于Anthropic——接口可替换,技能则通用。

本项目作为《计划:转型为现场部署工程师/AI工程师》(https://www.calm.rocks/resources/career-development/transition-fde-ai-engineer/)的实践伴侣构建。该计划解释了学什么以及为什么学;这些笔记本是你实践的地方。

适用对象

正转向AI工程师、FDE、应用AI或解决方案工程师(AI)职位的后端或全栈工程师——头衔不同,工作大同小异。你能交付生产代码;你想掌握其上的应用模型层。

学习顺序

自上而下学习。每个笔记本都是独立的(安装自身依赖、从Colab密钥读取API密钥)并以练习结束。

00 — 设置

笔记本你将学到什么
环境与成本管理
在Colab中打开 (https://colab.research.google.com/github/calmrocks/ai-engineer-notebooks/blob/main/00-setup/00-environment.ipynb)通过Colab密钥管理API密钥、支出保护、模型选择

01 — 模型API

笔记本你将学到什么
提示基础
在Colab中打开 (https://colab.research.google.com/github/calmrocks/ai-engineer-notebooks/blob/main/01-model-apis/00-prompting-basics.ipynb)清晰指令、少样本学习、输出格式规范、逐步推理——最廉价的提升手段,每项都展示其如何提升效果
结构化输出
在Colab中打开 (https://colab.research.google.com/github/calmrocks/ai-engineer-notebooks/blob/main/01-model-apis/01-structured-output.ipynb)如何从模型获取可靠的JSON输出,以及其失效场景
工具调用
在Colab中打开 (https://colab.research.google.com/github/calmrocks/ai-engineer-notebooks/blob/main/01-model-apis/02-tool-calling.ipynb)函数/工具调用的端到端流程,包括错误路径
流式传输
在Colab中打开 (https://colab.research.google.com/github/calmrocks/ai-engineer-notebooks/blob/main/01-model-apis/03-streaming.ipynb)流式响应及其UI需求
上下文与缓存
在Colab中打开 (https://colab.research.google.com/github/calmrocks/ai-engineer-notebooks/blob/main/01-model-apis/04-context-and-caching.ipynb)上下文窗口预算、提示缓存、批处理与实时定价

02 — 评估 I:度量输出

笔记本你将学到什么
度量输出
在Colab中打开 (https://colab.research.google.com/github/calmrocks/ai-engineer-notebooks/blob/main/02-evals-basics/01-measuring-outputs.ipynb)在第01章任务上构建黄金数据集与指标——在构建任何需要调优的东西之前,培养“先度量再调优”的习惯。评估是核心;此后它将在每个章节中回归

03 — RAG

笔记本你将学到什么
什么是RAG?
在Colab中打开 (https://colab.research.google.com/github/calmrocks/ai-engineer-notebooks/blob/main/03-rag/00-what-is-rag.ipynb)检索→增强→生成循环,为何RAG优于纯LLM,以及RAG为何不同于嵌入——附带15行代码的可运行演示
嵌入与检索
在Colab中打开 (https://colab.research.google.com/github/calmrocks/ai-engineer-notebooks/blob/main/03-rag/01-embeddings-retrieval.ipynb)嵌入模型选择、向量搜索、相似度陷阱——首先让检索工作起来
混合与重排序
在Colab中打开 (https://colab.research.google.com/github/calmrocks/ai-engineer-notebooks/blob/main/03-rag/02-hybrid-and-reranking.ipynb)关键词+向量混合检索、重排序器、各自何时值得其成本
分块
在Colab中打开 (https://colab.research.google.com/github/calmrocks/ai-engineer-notebooks/blob/main/03-rag/03-chunking.ipynb)在真实杂乱语料库上的分块策略——最后才回顾,待你能根据检索效果评判它们时
RAG为何失败
在Colab中打开 (https://colab.research.google.com/github/calmrocks/ai-engineer-notebooks/blob/main/03-rag/04-why-rag-fails.ipynb)诊断不良答案:检索质量,而非生成,通常是瓶颈

04 — 评估 II:差异化技能

笔记本你将学到什么
黄金数据集
在Colab中打开 (https://colab.research.google.com/github/calmrocks/ai-engineer-notebooks/blob/main/04-evals/01-golden-sets.ipynb)为第03章的RAG系统构建黄金数据集
LLM作为裁判
在Colab中打开 (https://colab.research.google.com/github/calmrocks/ai-engineer-notebooks/blob/main/04-evals/02-llm-as-judge.ipynb)裁判提示、与人类的一致性以及裁判自身的失败模式
回归评估
在Colab中打开 (https://colab.research.google.com/github/calmrocks/ai-engineer-notebooks/blob/main/04-evals/03-regression-evals.ipynb)评估作为CI:在更改提示或模型时捕获质量回归

05 — 智能体

笔记本你将学到什么
从零构建智能体循环
在Colab中打开 (https://colab.research.google.com/github/calmrocks/ai-engineer-notebooks/blob/main/05-agents/01-agent-loop-from-scratch.ipynb)使用原始API调用的可工作智能体循环——无框架
工具设计
在Colab中打开 (https://colab.research.google.com/github/calmrocks/ai-engineer-notebooks/blob/main/05-agents/02-tool-design.ipynb)设计模型能有效使用的工具
护栏与预算
在Colab中打开 (https://colab.research.google.com/github/calmrocks/ai-engineer-notebooks/blob/main/05-agents/03-guardrails-and-budgets.ipynb)终止条件、成本/延迟预算、管道何时优于智能体
MCP与工具生态
在Colab中打开 (https://colab.research.google.com/github/calmrocks/ai-engineer-notebooks/blob/main/05-agents/04-mcp-and-the-tool-ecosystem.ipynb)概念:模型上下文协议标准化了什么,它如何映射到原始工具循环,以及何时采用它
技能与渐进式揭示
在Colab中打开 (https://colab.research.google.com/github/calmrocks/ai-engineer-notebooks/blob/main/05-agents/05-skills-and-progressive-disclosure.ipynb)概念:打包可复用知识供智能体按需加载——SKILL.md模式、上下文预算收益,以及工具/MCP/技能如何融为一体
运行框架工程
在Colab中打开 (https://colab.research.google.com/github/calmrocks/ai-engineer-notebooks/blob/main/05-agents/06-harness-engineering.ipynb)综合:调用外围的脚手架——上下文组装与压缩、工具结果塑形,以及验证循环。本章逐片教授的学科在此命名

06 — 模型适配

笔记本你将学到什么
微调 vs RAG vs 提示
在Colab中打开 (https://colab.research.google.com/github/calmrocks/ai-engineer-notebooks/blob/main/06-adaptation/01-fine-tune-vs-rag-vs-prompt.ipynb)何时更改模型权重而非输入;LoRA/QLoRA是什么及其成本;你将在讨论中遇到的论点——附带可选的真实LoRA微调(使用免费GPU)

07 — 安全

笔记本你将学到什么
提示注入与信任边界
在Colab中打开 (https://colab.research.google.com/github/calmrocks/ai-engineer-notebooks/blob/main/07-security/01-prompt-injection-and-trust.ipynb)直接与间接提示注入、输出处理、PII、过度代理——OWASP LLM Top 10风险,先现场演示失败再展示防御

08 — 运维

笔记本你将学到什么
可观测性与LLMOps
在Colab中打开 (https://colab.research.google.com/github/calmrocks/ai-engineer-notebooks/blob/main/08-operations/01-observability-and-llmops.ipynb)追踪每次调用、安全记录提示、成本/延迟/错误指标、漂移检测,以及观测→评估反馈循环
可靠性与回退
在Colab中打开 (https://colab.research.google.com/github/calmrocks/ai-engineer-notebooks/blob/main/08-operations/02-reliability-and-fallbacks.ipynb)带退避的重试、超时、回退模型、输出验证、熔断器、优雅降级
实验跟踪与注册表
在Colab中打开 (https://colab.research.google.com/github/calmrocks/ai-engineer-notebooks/blob/main/08-operations/03-experiment-tracking-and-registry.ipynb)MLflow端到端:从第04章评估框架记录运行/参数/指标,注册模型并版本化,并按阶段推广——将“我运行了一次评估”转变为可跟踪、可复现工作流的工具

09 — 服务与推理性能

当免费Groq API无法运行该主题(这些框架需要GPU)时,笔记本采用概念先行的方式,并围起可选的Colab-GPU附录——与第06章LoRA附录采用相同模式。

笔记本你将学到什么
服务框架
在Colab中打开 (https://colab.research.google.com/github/calmrocks/ai-engineer-notebooks/blob/main/09-serving-inference/01-serving-frameworks.ipynb)AI工程师实际在其中选择的服务栈——vLLM、TGI、Triton、TensorRT-LLM——各自优化什么,如何映射到你一直在调用的原始API,以及何时选择哪个
推理性能
在Colab中打开 (https://colab.research.google.com/github/calmrocks/ai-engineer-notebooks/blob/main/09-serving-inference/02-inference-performance.ipynb)吞吐量与延迟背后的杠杆:连续批处理、KV缓存、量化,以及吞吐量与延迟的权衡——附带估算部署规模的简便计算

10 — ML系统设计与性能

笔记本你将学到什么
设计推理服务
在Colab中打开 (https://colab.research.google.com/github/calmrocks/ai-engineer-notebooks/blob/main/10-ml-system-design/01-designing-an-inference-service.ipynb)概念:ML系统设计面试题的端到端求解——QPS/显存/延迟/成本估算、副本扩展、排队、缓存以及SLA权衡,基于一个真实的LLM服务提示

11 — 客户技艺(FDE的差异化技能)

笔记本你将学到什么
范围界定与发现
在Colab中打开 (https://colab.research.google.com/github/calmrocks/ai-engineer-notebooks/blob/main/11-customer-craft/01-scoping-and-discovery.ipynb)将模糊的客户需求转化为可界定、可评估的系统:发现性问题、一页范围文档、演示纪律——大多数工程师无法证明的客户场景面试环节

12 — 案例研究与毕业设计

技能在此汇聚成项目。首先是一个案例研究——一个可运行的、端到端处理的真实场景——然后是毕业设计,你自己构建的已部署代码库。(章节概述。)

笔记本你将学到什么
案例A — 客户支持助手
在Colab中打开 (https://colab.research.google.com/github/calmrocks/ai-engineer-notebooks/blob/main/12-case-studies-and-capstone/01-customer-support-assistant.ipynb)从范围界定→构建→服务→在生产环境中调试一个场景:将模糊需求变为一个已部署、已评估的RAG+智能体助手,然后是一次真实质量回归(语料库迁移后的陈旧索引),你对其进行诊断和修复。一条贯穿第02–11章的构建至调试弧线
案例B — 合同提取:管道 vs 智能体
在Colab中打开 (https://colab.research.google.com/github/calmrocks/ai-engineer-notebooks/blob/main/12-case-studies-and-capstone/02-contract-extraction-pipeline-vs-agent.ipynb)面试官喜欢的判断题:将同一个提取任务同时构建为智能体和管道,然后用准确率+令牌成本证明当步骤已知时管道获胜
案例C — 红队鲁棒性基准测试
在Colab中打开 (https://colab.research.google.com/github/calmrocks/ai-engineer-notebooks/blob/main/12-case-studies-and-capstone/03-red-team-robustness-benchmark.ipynb)一种不同类型的系统——一个评估模型而非服务模型的框架:一个攻击者→目标→裁判(PAIR)循环,测量攻击成功率,综合了智能体循环、LLM裁判、安全和评估

毕业设计:项目简述是将出现在你简历上的已部署项目——一个包含服务组件和评估报告的真实代码库。案例研究用于学习;毕业设计用于求职。

约定

  • 原始模型API,无框架。 模式是持久的;包装器会过时。
  • 单一共享语料库 (data/) 跨RAG和评估章节使用,因此评估衡量的是你实际构建的检索。
  • 独立笔记本。 第一个单元格安装依赖,第二个单元格调用 from aien import setup; client, MODEL = setup() 以从Colab密钥(或本地环境变量)加载你的密钥。笔记本间无隐藏状态。aien 是本仓库中的小型共享设置包——更改的唯一位置

相似文章

从零开始学习AI工程

Hacker News Top

一个免费的开源课程,从基本原理教授AI工程,在使用框架之前从原始数学构建算法。课程包含20个阶段的435节课,支持Python、TypeScript、Rust和Julia。

owainlewis/awesome-artificial-intelligence

GitHub Trending (daily)

一份精心整理的、用于构建和交付AI系统的必用且积极维护的资源合集,涵盖AI工程主题,如RAG、智能体、评估、护栏和部署,以及推荐的书籍、课程和里程碑式论文。