@sairahul1: https://x.com/sairahul1/status/2058464422306443766
摘要
一份关于AI智能体的全面指南,涵盖基础知识、ReAct循环、任务分解、上下文工程以及自主性光谱,面向初学者和构建生产系统的人员。
查看缓存全文
缓存时间: 2026/05/24 12:29
AI 智能体:完整课程
2026 年每个人都在谈论 AI 智能体。
但大多数人并不知道它们实际是如何运作的。
今天,这一切将改变。
我花了数周时间提炼所有内容:课程、书籍、实际构建、生产中的失败案例。
以下是你需要真正了解的内容。
无论你是自动化自己的工作流程,还是为公司构建生产级 AI 系统——这都是你的路线图。
收藏本文。它很长。但值得一读。
第一部分:初学者 AI 智能体究竟是什么
1. 什么是 AI 智能体?
常规的 LLM 只做一件事:
你提问。它回答。结束。
一次性。线性。没有迭代。
AI 智能体的工作方式不同。
它就像你在处理困难任务时的实际方式:
→ 先计划 → 研究 → 草稿 → 自我审查 → 修改 → 重复
这被称为 ReAct 循环:
推理 → 行动 → 观察 → 重复
模型推理下一步该做什么。采取行动(通常通过调用工具)。观察结果。然后要么给你答案,要么循环回去。
为什么这很重要?
每一次循环都会增加深度。更强的推理能力。更少的幻觉。更好的组织。
所有你在一次性的尝试中失去的东西——智能体都能找回来。
2. 智能体真正擅长什么?
并非每个任务都需要智能体。
正确的思维模型:一个 2×2 矩阵。
坐标轴:复杂性与所需精度。
→ 低复杂性 + 高精度 = 直接使用代码 → 低复杂性 + 低精度 = 直接使用单个 LLM 提示 → 高复杂性 + 高精度 = 带严格护栏的智能体(税务表格、法律文档) → 高复杂性 + 低精度 = 最佳切入点
最后一个象限是你最快获得早期成功的领域。
完美的智能体任务示例:
→ 研究并撰写报告
→ 回复客户邮件(查找订单 → 起草回复)
→ 处理发票
→ 保存到数据库
→ 通过实际检查库存来回答“你们有 80 美元以下的蓝色牛仔裤吗?”
当任务需要以下条件时,智能体大放异彩:
→ 多个步骤
→ 外部信息
→ 迭代和自我修正
如果你能用一条提示解决它——那就不要构建智能体。
3. 自主性光谱
构建智能体时第一个重要的决策:
你给它多少控制权?
想象一个光谱。
脚本化(左端)
你对每一步进行硬编码。
→ 生成搜索词
→ 调用网络搜索
→ 抓取页面
→ 撰写文章。
模型只做文本生成。你决定其他一切。可预测。易于调试。但有限制。
**半自主(中间)**智能体从你定义的工具中选择。在你设定的护栏内做出决策。这是大多数实际生产系统所处的位置。
**完全自主(右端)**LLM 决定一切。搜索什么。抓取多少页面。是否进行反思。是否编写新代码并运行它。更强大。但也更难控制。
你应该从哪里开始?
光谱的中间。给它工具。设置护栏。只有在你有信心时才增加自主性。
4. 上下文工程
这才是真正让智能体变得“智能”的关键。
不仅仅是模型本身。
而是你围绕它构建的上下文。
上下文工程 = 决定智能体在每一刻拥有哪些信息。
这包括:
→ 背景 — 任务是什么,用户是谁
→ 角色 — “你是一个专注于市场分析的研究智能体”
→ 记忆 — 之前步骤中发生了什么
→ 可用工具 — 它可以调用哪些函数
→ 知识 — 它可以引用的文档、数据库、PDF
把上下文设计好 → 模型行为一致。
设计得差 → 不可预测的垃圾输出。
模型本身是一样的。
上下文是区分优秀智能体与糟糕智能体的关键。
5. 任务分解
构建智能体时最重要的技能。
从这一点开始:人类会如何完成这个任务?
然后对每个步骤问:LLM 能做到吗?一段代码能做到吗?一个 API 调用能做到吗?
如果答案是否定的 → 继续拆分成更小的部分,直到可以。
示例——文章撰写智能体:
-
大纲 → LLM 生成结构
-
搜索词 → LLM 生成,然后调用搜索 API
-
抓取页面 → 工具调用
-
撰写草稿 → LLM 使用抓取到的来源
-
自我批评 → LLM 列出差距和弱点
-
修改 → LLM 根据批评重写
每个步骤都是:→ 小 → 可检查 → 有清晰的输入和输出
当最终输出不好时,你能准确知道是哪个步骤需要修复。
这就是分解的超能力。
第二部分:中级 构建实际有效的多智能体系统
6. 评估(将专业人士与爱好者区分开来的无聊之事)
没人愿意谈论评估。
但每个交付实际系统的人都会做。
如何衡量你的智能体是否有效?
简单任务 → 统计正确答案数量。客服机器人是否正确回答了库存问题?是/否。
复杂任务 → 使用 LLM 作为评判者。用第二个模型根据固定的评分标准对输出进行 1-5 分评分。文章是否有强有力的论点?合适的引用?正确的语气?
你需要两个层次的评估:
→ 组件级别 — 每个单独步骤是否有效?(搜索查询是否足够具体?批评是否传递了真实的反馈?)
→ 端到端 — 最终输出是否良好?(文章是否真的不错?)
如果端到端失败但组件评估通过 → 交接问题。如果某个特定组件失败 → 那个智能体需要改进。
从第一天开始就进行评估。不要等待一个“完美”的评估系统。快速交付并迭代。
7. 记忆与知识
两个截然不同的东西,人们常常混淆。
记忆 = 动态的。每次运行都会更新。
→ 短期记忆:智能体在工作时写笔记。其他智能体可以读取这些笔记。 → 长期记忆:任务完成后,智能体进行反思。哪些做得好?哪些不好?存储经验教训。
下一次运行 → 加载这些教训 → 应用它们。
这就是无需微调就能“训练”智能体的方式。给予反馈 → 智能体每次运行都会改进。
知识 = 静态的。启动时加载。
→ PDF、CSV、内部文档、数据库访问 → 智能体的参考库 → 一次性提供。每当需要准确答案时,它就会从中提取。
可以这样理解:
记忆 = 从经验中学到的东西。知识 = 你可以参考的教科书。
两者都很重要。一个不能替代另一个。
8. 护栏
一个正常工作的智能体并不等于一个安全的智能体。
LLM 是非确定性的。
它们可能格式错误、陈述错误事实、偏离任务。
护栏是“智能体说它完成了”与“任务真正确定下来”之间的质量关卡。
三种类型:
**类型 1 — 代码检查(快速 + 廉价)**用于确定性的事情。 → 输出格式是否正确?长度是否合适?必填字段是否存在?编写一个简单的验证函数。立即运行它。尽可能优先使用。
类型 2 — LLM 评判者用于细微的质量检查。 → “这个回答是否与源文档事实一致?” → “语气是否专业且积极?”如果评判者说否 → 解释原因 → 智能体修改 → 重试。
类型 3 — 人机协同用于高风险决策。智能体在最终确定前停止。将输出发送给人审查。人批准、拒绝或要求修改。
大多数生产系统至少使用这三种中的两种。
9. 提升每个智能体的 4 种设计模式
这四种模式可靠地使智能体变得更好。
模式 1:反思
不要停留在初稿。
模型产生输出 → 批判它 → 根据批判重写。
邮件 v1:“嘿,我们下个月见。谢谢。”批判:日期模糊,没有签名,语气太随意。邮件 v2:“Hi Alex,我们在 1 月 5-7 日见面。告诉我什么时间合适。祝好,Sai。”
对于代码效果更佳——编写、运行、捕获错误、反馈、模型修复。
用于:结构化输出、长文本写作、代码、程序步骤。
模式 2:工具使用
给 LLM 一个它可以调用的函数菜单。
模型决定何时以及使用哪个工具。
网络搜索。数据库查询。代码执行。日历。邮件。API 调用。
LLM 无法单独完成这些操作。工具是智能体与世界互动的方式。
模式 3:规划
不是固定的流水线,而是让智能体决定步骤。
给它一个工具包。提示它制定一个计划。逐步执行。
零售示例:“任何 100 美元以下的圆框太阳镜?”智能体计划:搜索描述 → 检查库存 → 按价格过滤 → 回答。
你没有编写这些确切的步骤。是智能体选择的。
模式 4:多智能体协作
将复杂工作分配给专门化的智能体。
研究员 → 设计师 → 写作者。
每个智能体在自己的特定工作上都很出色。输出更好,因为没有单个智能体试图做所有事情。
10. 多智能体系统设计
实际如何构建一个多智能体系统?
四种协调模式,从最简单到最复杂。
模式 1:顺序每个智能体完成 → 将输出传递给下一个智能体。像流水线一样。研究员 → 设计师 → 写作者 → 完成。易于调试。可预测。从这里开始。
模式 2:并行同时运行独立的智能体。研究员 + 设计师同时工作。写作者合并他们的输出。更快。但协调更复杂。
模式 3:管理者层级一个管理者智能体协调专家。管理者计划、委派、审查。专家向管理者报告,而不是彼此之间。当今实际生产系统中最常见的模式。
模式 4:全连通任何智能体都可以给任何其他智能体发消息。混乱。难以预测。仅用于创意/低风险工作,允许变化。不要在生产中使用。
经验法则:从顺序开始。只有在需要时才增加复杂度。
第三部分:生产 真正让你从原型到上线的关键
11. 高级任务分解
在复杂的多智能体系统中,你如何分解至关重要。
4 种模式:
功能性 — 按技术领域划分。前端智能体。后端智能体。数据库智能体。工程团队的经典模式。
空间性 — 按文件或目录结构划分。智能体 1 处理 /services/users/。智能体 2 处理 /services/orders/。适合大型代码库。最小化冲突。
时间性 — 按顺序阶段划分。阶段 1:研究。阶段 2:计划。阶段 3:构建。阶段 4:发布。每个阶段完成后才开始下一个。
数据驱动 — 按数据分区划分。智能体 1 处理第 1 周日志。智能体 2 处理第 2 周。等等。适合大型数据集。并行分析。
你可以混合使用。
主结构使用功能性分解 + 每个智能体内部使用时间性分解。
使用任何匹配你任务自然边界的模式。
12. 在生产中提高质量
系统在工作但不够好。
两种类型的组件。两种不同的修复策略。
非 LLM 组件(网络搜索、RAG、OCR、代码执行):
→ 调整参数:搜索日期范围、top-k 结果、块大小、相似度阈值 → 更换提供商:尝试不同的搜索 API、视觉模型、解析器
LLM 组件(生成、推理、提取):
→ 改进提示:添加约束、示例、输出模式 → 尝试不同的模型:有些模型擅长代码,另一些擅长遵循指令 → 将更困难的任务分解成更小的部分 → 微调(最后手段——昂贵,留到最后几个百分点)
顺序很重要。
先改进提示。尝试不同的模型。进一步分解。最后微调。
大多数团队在第二步就达到了足够好的质量。
13. 延迟与成本
先关注质量。再考虑速度和成本。
降低延迟:
-
测量每一步。找到真正的瓶颈。
-
并行化任何不依赖于其他步骤的步骤。
-
调整模型大小——简单步骤使用快速廉价的 LLM,推理使用大模型。
-
尝试更快的提供商——令牌流速度差异很大。
-
裁剪上下文——更短的提示解码更快。
降低成本:
典型研究智能体运行的实际成本分解:
→ LLM 生成调用:约 $0.04 → 网络搜索 API 调用:约 $0.02 → 嵌入调用:约 $0.005 → 基础设施:约 $0.015 → 每次运行总计:约 $0.08
每天 1,000 次运行 = $80/天 = $2,400/月。
如何削减:
→ 首先攻击最大的开销 → 按层级使用模型——简单任务用便宜的,困难任务用昂贵的 → 积极缓存结果(搜索结果、嵌入、摘要) → 约束输出(“返回 JSON。最多 5 个字段。”) → 尽可能批量操作
14. 可观测性:大规模监控你的智能体
传统软件:追踪执行路径。A 调用 B。B 调用数据库。返回结果。
AI 智能体的工作方式不同。
它们是非确定性的。相同输入 → 不同输出。分布式执行。可能失败的外部依赖。
你需要两种可见性:
放大指标(单次运行调试)→ 完整跟踪:每个提示、每个工具调用、每个使用的令牌 → 为什么智能体选择了这个工具? → 每个步骤返回了什么? → 确切在哪里失败了?
记录不仅发生了什么,还要记录为什么:“智能体选择网络搜索而不是 RAG,因为查询包含‘最近’”“反思识别出 3 个问题:缺少引用、日期模糊、语气错误”
缩小指标(多次运行的系统健康度)→ 随时间变化的质量评分 → 幻觉率 → 成功率 → 变更是在帮助还是损害?
你无法手动检查大规模运行的每个跟踪。
使用质量采样——评估一定比例的所有运行。构建趋势线。
这样你就能在用户之前发现回归问题。
15. 安全:没人谈论(但应该)的部分
AI 智能体的安全与传统应用安全不同。
你不仅要防范外部攻击者。
还要防范你自己的系统做出危险决策。
威胁包括:
→ 提示注入 — 用户输入中的恶意内容劫持智能体指令 → 不安全的代码生成 — 智能体编写访问敏感数据或执行有害操作的代码 → 数据泄露 — 通过输出或工具调用暴露 PII 或专有信息 → 资源耗尽 — 智能体陷入无限循环或消耗昂贵的 API 调用
代码执行是风险最高的功能。
如果启用,以下是安全实施方法:
→ 在 Docker 中沙箱化。每次运行后容器被销毁。 → 设置严格的资源限制:超时、内存上限、CPU 限制 → 仅白名单特定的安全库 → 在到达智能体之前验证所有输入 → 扫描所有输出中的敏感数据(API 密钥、PII) → 使用确定性 I/O——代码返回结构化的 JSON,而不是向用户返回自由格式文本
大多数团队通过惨痛教训学到这些。
在发布之前请阅读本文。
以上就是完整课程。
总结
初学者:→ 智能体迭代工作——计划、行动、观察、重复 → 最适合能接受约 90% 准确率的复杂多步骤任务 → 从半自主开始,不要完全自主 → 上下文工程是真正的智能 → 任务分解是最重要的技能
中级:→ 从第一天就开始评估——复杂任务用 LLM 作为评判者 → 记忆(动态)≠ 知识(静态) → 三种护栏类型:代码 → LLM 评判者 → 人工 → 四种总是有用的模式:反思、工具使用、规划、多智能体 → 从顺序开始。只有在需要时才增加协调复杂度。
生产:→ 4 种分解模式:功能性、空间性、时间性、数据驱动 → 先改进提示,再考虑微调 → 测量每步的延迟和成本,然后攻击最大的开销 → 两种可观测性模式:放大的跟踪 + 缩小的健康指标 → 安全 = 防范自己的系统,而不仅仅是攻击者
大多数人开始构建智能体。
但很少有人能交付在大规模下可靠工作的智能体。
差距就在于本文中的所有内容。
如果本文对你有用:
→ 转发分享 → 关注 @sairahul1 获取更多此类分析 → 收藏本文——你在构建时会用到它
我撰写关于 AI 系统、产品构建以及在你睡觉时自动工作的内容。
相似文章
@sairahul1: https://x.com/sairahul1/status/2068986018943156440
一份关于生产系统中15种AI智能体设计模式的全面指南,阐述了每种模式的使用时机和常见陷阱。
AI Agent 入门
关于构建可靠AI Agent的全面指南,解释感知、决策逻辑和行动接口的核心组件,并包含前Meta工程师的见解。
@Suryanshti777: https://x.com/Suryanshti777/status/2057423582276522469
一份全面的指南,解释了AI操作系统作为智能编排层的概念,该层协调工作流、记忆、工具和代理。它分解了架构以及公司如何构建自主系统。
@chamath: https://x.com/chamath/status/2054646394867364143
关于AI代理兴起的详细入门,包括统计数据、故障模式以及五层框架,重点介绍了从聊天机器人到自主任务导向型AI的转变。
@sairahul1: https://x.com/sairahul1/status/2067171101978071501
本帖子全面介绍了AI代理的上下文工程技术,阐述了上下文管理对代理性能的关键作用,以及如何优化Token使用以避免性能退化。