@sairahul1: https://x.com/sairahul1/status/2058464422306443766

X AI KOLs Timeline 新闻

摘要

一份关于AI智能体的全面指南,涵盖基础知识、ReAct循环、任务分解、上下文工程以及自主性光谱,面向初学者和构建生产系统的人员。

https://t.co/OKiwVkzIir
查看原文
查看缓存全文

缓存时间: 2026/05/24 12:29

AI 智能体:完整课程

2026 年每个人都在谈论 AI 智能体。

但大多数人并不知道它们实际是如何运作的。

今天,这一切将改变。

我花了数周时间提炼所有内容:课程、书籍、实际构建、生产中的失败案例。

以下是你需要真正了解的内容。

无论你是自动化自己的工作流程,还是为公司构建生产级 AI 系统——这都是你的路线图。

收藏本文。它很长。但值得一读。

第一部分:初学者 AI 智能体究竟是什么

1. 什么是 AI 智能体?

常规的 LLM 只做一件事:

你提问。它回答。结束。

一次性。线性。没有迭代。

AI 智能体的工作方式不同。

它就像你在处理困难任务时的实际方式:

→ 先计划 → 研究 → 草稿 → 自我审查 → 修改 → 重复

这被称为 ReAct 循环:

推理 → 行动 → 观察 → 重复

模型推理下一步该做什么。采取行动(通常通过调用工具)。观察结果。然后要么给你答案,要么循环回去。

为什么这很重要?

每一次循环都会增加深度。更强的推理能力。更少的幻觉。更好的组织。

所有你在一次性的尝试中失去的东西——智能体都能找回来。

2. 智能体真正擅长什么?

并非每个任务都需要智能体。

正确的思维模型:一个 2×2 矩阵。

坐标轴:复杂性与所需精度。

→ 低复杂性 + 高精度 = 直接使用代码 → 低复杂性 + 低精度 = 直接使用单个 LLM 提示 → 高复杂性 + 高精度 = 带严格护栏的智能体(税务表格、法律文档) → 高复杂性 + 低精度 = 最佳切入点

最后一个象限是你最快获得早期成功的领域。

完美的智能体任务示例:

→ 研究并撰写报告

→ 回复客户邮件(查找订单 → 起草回复)

→ 处理发票

→ 保存到数据库

→ 通过实际检查库存来回答“你们有 80 美元以下的蓝色牛仔裤吗?”

当任务需要以下条件时,智能体大放异彩:

→ 多个步骤

→ 外部信息

→ 迭代和自我修正

如果你能用一条提示解决它——那就不要构建智能体。

3. 自主性光谱

构建智能体时第一个重要的决策:

你给它多少控制权?

想象一个光谱。

脚本化(左端)

你对每一步进行硬编码。

→ 生成搜索词

→ 调用网络搜索

→ 抓取页面

→ 撰写文章。

模型只做文本生成。你决定其他一切。可预测。易于调试。但有限制。

**半自主(中间)**智能体从你定义的工具中选择。在你设定的护栏内做出决策。这是大多数实际生产系统所处的位置。

**完全自主(右端)**LLM 决定一切。搜索什么。抓取多少页面。是否进行反思。是否编写新代码并运行它。更强大。但也更难控制。

你应该从哪里开始?

光谱的中间。给它工具。设置护栏。只有在你有信心时才增加自主性。

4. 上下文工程

这才是真正让智能体变得“智能”的关键。

不仅仅是模型本身。

而是你围绕它构建的上下文。

上下文工程 = 决定智能体在每一刻拥有哪些信息。

这包括:

背景 — 任务是什么,用户是谁

角色 — “你是一个专注于市场分析的研究智能体”

记忆 — 之前步骤中发生了什么

可用工具 — 它可以调用哪些函数

知识 — 它可以引用的文档、数据库、PDF

把上下文设计好 → 模型行为一致。

设计得差 → 不可预测的垃圾输出。

模型本身是一样的。

上下文是区分优秀智能体与糟糕智能体的关键。

5. 任务分解

构建智能体时最重要的技能。

从这一点开始:人类会如何完成这个任务?

然后对每个步骤问:LLM 能做到吗?一段代码能做到吗?一个 API 调用能做到吗?

如果答案是否定的 → 继续拆分成更小的部分,直到可以。

示例——文章撰写智能体:

  • 大纲 → LLM 生成结构

  • 搜索词 → LLM 生成,然后调用搜索 API

  • 抓取页面 → 工具调用

  • 撰写草稿 → LLM 使用抓取到的来源

  • 自我批评 → LLM 列出差距和弱点

  • 修改 → LLM 根据批评重写

每个步骤都是:→ 小 → 可检查 → 有清晰的输入和输出

当最终输出不好时,你能准确知道是哪个步骤需要修复。

这就是分解的超能力。

第二部分:中级 构建实际有效的多智能体系统

6. 评估(将专业人士与爱好者区分开来的无聊之事)

没人愿意谈论评估。

但每个交付实际系统的人都会做。

如何衡量你的智能体是否有效?

简单任务 → 统计正确答案数量。客服机器人是否正确回答了库存问题?是/否。

复杂任务 → 使用 LLM 作为评判者。用第二个模型根据固定的评分标准对输出进行 1-5 分评分。文章是否有强有力的论点?合适的引用?正确的语气?

你需要两个层次的评估:

组件级别 — 每个单独步骤是否有效?(搜索查询是否足够具体?批评是否传递了真实的反馈?)

端到端 — 最终输出是否良好?(文章是否真的不错?)

如果端到端失败但组件评估通过 → 交接问题。如果某个特定组件失败 → 那个智能体需要改进。

从第一天开始就进行评估。不要等待一个“完美”的评估系统。快速交付并迭代。

7. 记忆与知识

两个截然不同的东西,人们常常混淆。

记忆 = 动态的。每次运行都会更新。

→ 短期记忆:智能体在工作时写笔记。其他智能体可以读取这些笔记。 → 长期记忆:任务完成后,智能体进行反思。哪些做得好?哪些不好?存储经验教训。

下一次运行 → 加载这些教训 → 应用它们。

这就是无需微调就能“训练”智能体的方式。给予反馈 → 智能体每次运行都会改进。

知识 = 静态的。启动时加载。

→ PDF、CSV、内部文档、数据库访问 → 智能体的参考库 → 一次性提供。每当需要准确答案时,它就会从中提取。

可以这样理解:

记忆 = 从经验中学到的东西。知识 = 你可以参考的教科书。

两者都很重要。一个不能替代另一个。

8. 护栏

一个正常工作的智能体并不等于一个安全的智能体。

LLM 是非确定性的。

它们可能格式错误、陈述错误事实、偏离任务。

护栏是“智能体说它完成了”与“任务真正确定下来”之间的质量关卡。

三种类型:

**类型 1 — 代码检查(快速 + 廉价)**用于确定性的事情。 → 输出格式是否正确?长度是否合适?必填字段是否存在?编写一个简单的验证函数。立即运行它。尽可能优先使用。

类型 2 — LLM 评判者用于细微的质量检查。 → “这个回答是否与源文档事实一致?” → “语气是否专业且积极?”如果评判者说否 → 解释原因 → 智能体修改 → 重试。

类型 3 — 人机协同用于高风险决策。智能体在最终确定前停止。将输出发送给人审查。人批准、拒绝或要求修改。

大多数生产系统至少使用这三种中的两种。

9. 提升每个智能体的 4 种设计模式

这四种模式可靠地使智能体变得更好。

模式 1:反思

不要停留在初稿。

模型产生输出 → 批判它 → 根据批判重写。

邮件 v1:“嘿,我们下个月见。谢谢。”批判:日期模糊,没有签名,语气太随意。邮件 v2:“Hi Alex,我们在 1 月 5-7 日见面。告诉我什么时间合适。祝好,Sai。”

对于代码效果更佳——编写、运行、捕获错误、反馈、模型修复。

用于:结构化输出、长文本写作、代码、程序步骤。

模式 2:工具使用

给 LLM 一个它可以调用的函数菜单。

模型决定何时以及使用哪个工具。

网络搜索。数据库查询。代码执行。日历。邮件。API 调用。

LLM 无法单独完成这些操作。工具是智能体与世界互动的方式。

模式 3:规划

不是固定的流水线,而是让智能体决定步骤。

给它一个工具包。提示它制定一个计划。逐步执行。

零售示例:“任何 100 美元以下的圆框太阳镜?”智能体计划:搜索描述 → 检查库存 → 按价格过滤 → 回答。

你没有编写这些确切的步骤。是智能体选择的。

模式 4:多智能体协作

将复杂工作分配给专门化的智能体。

研究员 → 设计师 → 写作者。

每个智能体在自己的特定工作上都很出色。输出更好,因为没有单个智能体试图做所有事情。

10. 多智能体系统设计

实际如何构建一个多智能体系统?

四种协调模式,从最简单到最复杂。

模式 1:顺序每个智能体完成 → 将输出传递给下一个智能体。像流水线一样。研究员 → 设计师 → 写作者 → 完成。易于调试。可预测。从这里开始。

模式 2:并行同时运行独立的智能体。研究员 + 设计师同时工作。写作者合并他们的输出。更快。但协调更复杂。

模式 3:管理者层级一个管理者智能体协调专家。管理者计划、委派、审查。专家向管理者报告,而不是彼此之间。当今实际生产系统中最常见的模式。

模式 4:全连通任何智能体都可以给任何其他智能体发消息。混乱。难以预测。仅用于创意/低风险工作,允许变化。不要在生产中使用。

经验法则:从顺序开始。只有在需要时才增加复杂度。

第三部分:生产 真正让你从原型到上线的关键

11. 高级任务分解

在复杂的多智能体系统中,你如何分解至关重要。

4 种模式:

功能性 — 按技术领域划分。前端智能体。后端智能体。数据库智能体。工程团队的经典模式。

空间性 — 按文件或目录结构划分。智能体 1 处理 /services/users/。智能体 2 处理 /services/orders/。适合大型代码库。最小化冲突。

时间性 — 按顺序阶段划分。阶段 1:研究。阶段 2:计划。阶段 3:构建。阶段 4:发布。每个阶段完成后才开始下一个。

数据驱动 — 按数据分区划分。智能体 1 处理第 1 周日志。智能体 2 处理第 2 周。等等。适合大型数据集。并行分析。

你可以混合使用。

主结构使用功能性分解 + 每个智能体内部使用时间性分解。

使用任何匹配你任务自然边界的模式。

12. 在生产中提高质量

系统在工作但不够好。

两种类型的组件。两种不同的修复策略。

非 LLM 组件(网络搜索、RAG、OCR、代码执行):

→ 调整参数:搜索日期范围、top-k 结果、块大小、相似度阈值 → 更换提供商:尝试不同的搜索 API、视觉模型、解析器

LLM 组件(生成、推理、提取):

→ 改进提示:添加约束、示例、输出模式 → 尝试不同的模型:有些模型擅长代码,另一些擅长遵循指令 → 将更困难的任务分解成更小的部分 → 微调(最后手段——昂贵,留到最后几个百分点)

顺序很重要。

先改进提示。尝试不同的模型。进一步分解。最后微调。

大多数团队在第二步就达到了足够好的质量。

13. 延迟与成本

先关注质量。再考虑速度和成本。

降低延迟:

  • 测量每一步。找到真正的瓶颈。

  • 并行化任何不依赖于其他步骤的步骤。

  • 调整模型大小——简单步骤使用快速廉价的 LLM,推理使用大模型。

  • 尝试更快的提供商——令牌流速度差异很大。

  • 裁剪上下文——更短的提示解码更快。

降低成本:

典型研究智能体运行的实际成本分解:

→ LLM 生成调用:约 $0.04 → 网络搜索 API 调用:约 $0.02 → 嵌入调用:约 $0.005 → 基础设施:约 $0.015 → 每次运行总计:约 $0.08

每天 1,000 次运行 = $80/天 = $2,400/月。

如何削减:

→ 首先攻击最大的开销 → 按层级使用模型——简单任务用便宜的,困难任务用昂贵的 → 积极缓存结果(搜索结果、嵌入、摘要) → 约束输出(“返回 JSON。最多 5 个字段。”) → 尽可能批量操作

14. 可观测性:大规模监控你的智能体

传统软件:追踪执行路径。A 调用 B。B 调用数据库。返回结果。

AI 智能体的工作方式不同。

它们是非确定性的。相同输入 → 不同输出。分布式执行。可能失败的外部依赖。

你需要两种可见性:

放大指标(单次运行调试)→ 完整跟踪:每个提示、每个工具调用、每个使用的令牌 → 为什么智能体选择了这个工具? → 每个步骤返回了什么? → 确切在哪里失败了?

记录不仅发生了什么,还要记录为什么:“智能体选择网络搜索而不是 RAG,因为查询包含‘最近’”“反思识别出 3 个问题:缺少引用、日期模糊、语气错误”

缩小指标(多次运行的系统健康度)→ 随时间变化的质量评分 → 幻觉率 → 成功率 → 变更是在帮助还是损害?

你无法手动检查大规模运行的每个跟踪。

使用质量采样——评估一定比例的所有运行。构建趋势线。

这样你就能在用户之前发现回归问题。

15. 安全:没人谈论(但应该)的部分

AI 智能体的安全与传统应用安全不同。

你不仅要防范外部攻击者。

还要防范你自己的系统做出危险决策。

威胁包括:

提示注入 — 用户输入中的恶意内容劫持智能体指令 → 不安全的代码生成 — 智能体编写访问敏感数据或执行有害操作的代码 → 数据泄露 — 通过输出或工具调用暴露 PII 或专有信息 → 资源耗尽 — 智能体陷入无限循环或消耗昂贵的 API 调用

代码执行是风险最高的功能。

如果启用,以下是安全实施方法:

→ 在 Docker 中沙箱化。每次运行后容器被销毁。 → 设置严格的资源限制:超时、内存上限、CPU 限制 → 仅白名单特定的安全库 → 在到达智能体之前验证所有输入 → 扫描所有输出中的敏感数据(API 密钥、PII) → 使用确定性 I/O——代码返回结构化的 JSON,而不是向用户返回自由格式文本

大多数团队通过惨痛教训学到这些。

在发布之前请阅读本文。

以上就是完整课程。

总结

初学者:→ 智能体迭代工作——计划、行动、观察、重复 → 最适合能接受约 90% 准确率的复杂多步骤任务 → 从半自主开始,不要完全自主 → 上下文工程是真正的智能 → 任务分解是最重要的技能

中级:→ 从第一天就开始评估——复杂任务用 LLM 作为评判者 → 记忆(动态)≠ 知识(静态) → 三种护栏类型:代码 → LLM 评判者 → 人工 → 四种总是有用的模式:反思、工具使用、规划、多智能体 → 从顺序开始。只有在需要时才增加协调复杂度。

生产:→ 4 种分解模式:功能性、空间性、时间性、数据驱动 → 先改进提示,再考虑微调 → 测量每步的延迟和成本,然后攻击最大的开销 → 两种可观测性模式:放大的跟踪 + 缩小的健康指标 → 安全 = 防范自己的系统,而不仅仅是攻击者

大多数人开始构建智能体。

但很少有人能交付在大规模下可靠工作的智能体。

差距就在于本文中的所有内容。

如果本文对你有用:

→ 转发分享 → 关注 @sairahul1 获取更多此类分析 → 收藏本文——你在构建时会用到它

我撰写关于 AI 系统、产品构建以及在你睡觉时自动工作的内容。

相似文章

AI Agent 入门

X AI KOLs

关于构建可靠AI Agent的全面指南,解释感知、决策逻辑和行动接口的核心组件,并包含前Meta工程师的见解。