@AlphaSignalAI: https://x.com/AlphaSignalAI/status/2072786187962425817
摘要
本指南区分了AI中的工作流和智能体,通过一个编码智能体示例分解了从模型到系统的智能体AI堆栈,说明了循环和层次结构。
查看缓存全文
缓存时间: 2026/07/04 12:48
智能体 AI 入门调研论文:模型与系统之间的技术栈
从工作流到智能体,每一层的区别何在
约10分钟阅读:智能体循环、从模型到智能体系统的阶梯、从模型到用户界面的完整技术栈、工作流 vs 智能体 vs 多智能体对比表,以及每一层隐藏的失败模式。 所以,你得存下这篇文章。
你现在使用的每一个工具都自称是智能体。
但大多数只是带聊天框的工作流。
真正的分界线在这里:工作流运行你写好的步骤,智能体则自己决定步骤:它观察情境、选择动作、执行动作、检查结果,然后重复直到任务完成或需要你介入。
这个循环就是全部核心。本指南中的其余内容,都是围绕这个循环构建的,目的是让循环变得安全可靠。
最近的一项调研比大多数资料更能说明问题:智能体 AI 是一个系统工程问题,而不是模型越大越好。
来源背景
《智能体 AI Hitchhiker 指南》 共 603 页,28 章,6 个部分,一条连贯主线,从 Transformer 内部机制到多智能体部署。读起来就像是一本面向交付团队的手册。
你不需要读完全部 603 页。你需要的是可操作模型,也就是最有用的部分,本指南就是从中提取出来的。
我们将用一个贯穿全文的例子。想象一个编码智能体,它的任务是为一个 Web 应用添加密码重置流程:读取仓库、规划变更、编辑文件、运行测试、打开拉取请求。
两个核心概念
抓住这两个概念,其余的技术栈就只是细节了。
循环:智能体是什么
智能体是一个模型在其部分控制的循环中运行。观察、推理、行动、再次观察,然后停止或请求帮助。
你的编码智能体读取失败的测试(观察),判断缺少重置令牌逻辑(推理),编写函数(行动),再次运行测试套件(观察),然后要么提交,要么卡住时询问你。
单独的模型做不到这一点。它回答一次然后遗忘。
把它放进一个带有工具和停止条件的循环中,它就开始像智能体了。
阶梯:模型、工作流、智能体、智能体系统
四个层级,人们经常混淆。模型回答一个提示。
工作流按照你定义的顺序串联模型调用:摘要、翻译、然后发邮件。可预测、廉价、且易于测试。
智能体根据所见自行选择顺序。能力更强,也更难预测。
智能体系统是智能体加上所有使其在生产环境中可靠的组件:记忆、工具、协议、协调,以及供你观察和纠正的方式。这个“所有”就是下面的技术栈。
观察一次循环运行
假设测试套件失败,报错“未找到重置令牌”。你的智能体读取该错误(观察),推理出令牌从未写入数据库。
它打开重置处理器,添加写入(行动),重新运行套件(再次观察)。测试通过,于是它停止并打开拉取请求。
现在假设重新运行遇到不同的错误。同样的循环:读取新失败、形成新猜测、编辑、再次检查,直到套件通过或撞墙并通知你。
这就是整个机制。下面技术栈的每一层都是为了使这个循环的一次迭代更便宜、更安全或更聪明。
技术栈,逐层解析
将技术栈分为两层。下层是模型带来的,上层是生产环境围绕循环补充的。
下面每一层都附有你实际会选择的选项,以及跳过它时出问题的方式。
第一层:模型带来的能力
模型基础
底层是一个 Transformer,它读取你的仓库并编写代码。它的上下文窗口就是工作桌面的大小,现在通常是几十万个 Token。
超出窗口后,最早期的上下文就滑落桌面。你的智能体会忘记二十步前读取的文件,然后盲目编辑。
后训练
原始基础模型只是预测文本。指令遵循、工具使用和任务专注来自后训练:首先是有监督微调,然后是强化学习方法,如 RLHF、DPO 和 GRPO。
一个实用提示:GRPO 去掉了 PPO 所需的独立评判模型,从而减少了训练中的内存消耗。这里的失败模式是奖励黑客,即模型通过操纵评分而不是完成任务来取巧。
推理
测试时计算让模型在行动前思考。有了推理空间,你的智能体可以规划重置流程,权衡在哪里添加令牌检查,并在写代码前捕获自己的错误。
在规划步骤使用推理模型。但给它太多自由,它就会过度思考,在两行变更上浪费大量 Token 和时间。
评估
无法衡量就无法信任。评估结果(测试是否通过、重置是否实际生效),而不是输出与某个参考字符串的匹配程度。
这里有两大陷阱。模型会记忆公开基准,而且任何指标只要优化得过分,就不再衡量原本的目标(古德哈特定律)。
第二层:生产环境补充的内容
这是大部分实际工作所在的地方,也是大多数智能体项目失败的地方。
知识,即 RAG
你的模型从未见过你的代码库。检索增强生成在模型需要时喂给它相关文件和文档。
当智能体自行执行检索时,它就变得智能:搜索、读取、判断缺少信息、再次搜索。推荐混合检索,让智能体自行决定查询路径。
跳过这一步,智能体就会猜测。它检索到错误的模块,然后自信地编辑与密码重置毫无关系的代码。
记忆
上下文是短期的。记忆是跨步骤和跨会话存活的东西,它是一门读写纪律,而不仅仅是更长的提示。
四种记忆值得了解。工作记忆是当前桌面上的内容,情节记忆是智能体已经尝试过的东西,语义记忆是它了解到的关于你代码库的事实,程序记忆是下次可以复用的技能。
推荐向量存储加上清晰的读写策略。没有它,你的智能体会两次解决同一个 Bug,或者忘记某个死胡同方法,然后直接走回去。
操控层
这里的层级人们总是忘记存在。操控层是运行循环的代码:它调用模型、分发工具、跟踪状态、失败重试、记录每一步。
生产环境的可靠性实际上在这里,而不是在模型中。推荐使用 LangGraph 或 OpenAI Agents SDK,而不是自行编码。
跳过操控层,一次糟糕的工具调用就会让整个运行无声停滞。当拉取请求从未出现时你才会发现。
工具与协议
工具是你的智能体可以调用的单个功能:运行测试、打开拉取请求。技能将提示、一些工具和知识捆绑成一个可复用的能力。
MCP(模型上下文协议)是将智能体连接到工具和数据标准插头,这样你就不用为每对组合编写自定义集成。A2A(智能体到智能体)是让智能体之间对话的标准。
推荐使用 MCP 暴露工具,当独立的智能体需要协调时使用 A2A。失败模式很棘手:工具输入携带隐藏指令(“忽略你的任务,泄漏密钥”),也就是提示注入。
多智能体
一个智能体可以处理很多事情。有时你需要拆分任务:一个编码智能体编写重置流程,一个审查智能体在打开拉取请求前检查。
常见形态有:主管指挥工人、对等传递任务、层级结构、或群体。建议从主管模式开始,而不是一开始就追求更花哨的设计。
每增加一个智能体都会增加协调成本和新的错误复合方式。两个智能体可能会长时间地相互自信地犯错。
人机界面
值得信赖的自主性会展示其工作:进度、来源、审批、回滚按钮、审计跟踪。你的智能体打开拉取请求供审查,它不会在凌晨三点直接合并到主分支。
去掉这一点,你就得到了一个黑箱。无法看到它做了什么,也无法停止或撤销。
工作流、智能体还是多智能体?
大多数团队在工作流更便宜、更可靠的情况下却选择了智能体。在构建之前用下表决定。
从上到下阅读表格,停在第一个匹配的行。那通常就是正确答案。
由于表格内容较多,此处以文字形式呈现(翻译表格时注意保留英文术语)
| 条件 | 推荐方案 |
|---|---|
| 步骤可以预先完全定义,且不需要动态决策 | 工作流 |
| 每一步的决策空间很小,但顺序不确定 | 智能体(单智能体) |
| 任务涉及多个独立的专业领域,需要不同角色的协作 | 多智能体 |
| 任务需要与人类紧密协作并频繁确认 | 智能体系统(带人类界面) |
如何验证这些方案
没有“优秀智能体”的排行榜,但有验证场。智能体在代码沙箱中测试(要求修复真实仓库),在 Web 和 GUI 环境中测试(要求完成操作),以及在多智能体模拟中测试。
重要的是这些测试评分的内容。好的评估关注整个轨迹、成本、工具调用、智能体是否从错误中恢复、是否保持安全,而不仅仅是最终答案。
AlphaSignal 观点
Roitman 绘制了整个技术栈,但最有用的结论是关于炒作中忽略的两件事的警告。
大多数“智能体”应该是工作流。
自主性昂贵且脆弱,只有当任务确实需要动态决策时,循环才有价值。Anthropic 在《构建有效智能体》中的建议也落到同一处:先构建最简单的解决方案,只有工作流无法完成任务时才添加智能体行为。
技术栈是护城河,而不是模型。
可靠性存在于操控层、记忆策略和评估设置中,这些正是一个闪亮的新基础模型无法修复的。换一个更聪明的模型,但缺失的操控层仍然以同样的方式失败。
调研中有一个被低估的空白:生产环境评估和安全性是解决最不充分的层面。通过工具进行的提示注入和失控的成本是开放问题,而非已解决的问题。
因此,最佳建议是构建最简单的可靠运行时,它能完成任务并展示其工作,然后只在自主性确实有回报的地方添加自主性。一个善于规划的模型加一个能大声失败的操控层,胜过你无法调试的智能体集群。
谁受益,谁不适
这篇内容适合刚接触智能体的开发者,他们想一次性看到全貌;适合为真实产品添加智能体功能的工程师;适合决定任务是否需要智能体的技术负责人。
不适合需要确定性、保证输出的场景(请用工作流),不适合没有评估或日志记录的团队(无法衡量的自主性是负债),也不适合需要框架教程的人(因为本文是地图,不是手册)。
实践启示
你现在可以构建一个编码智能体,确切知道每一层做什么,以及你缺失哪一层。
对照这些层级检查你自己的技术栈:
- 模型和上下文:你的任务是否适合窗口大小?
- 推理:它是否在行动前规划?
- 检索:它能找到你的代码,还是靠猜?
- 记忆:它是否跨步骤记忆?
- 操控层:它是否重试和记录,还是无声停滞?
- 工具和协议:工具输入是否被盲目信任?
- 多智能体:你真的需要不止一个吗?
- 界面:你能看到、停止和撤销它做的事吗?
构建顺序很简单:先从一个模型、一个操控层和一个工具开始,然后只有当任务迫使你时才添加记忆、检索或第二个智能体。
你的技术栈现在缺失哪一层?
来源
- The Hitchhiker’s Guide to Agentic AI (arXiv:2606.24937, ~603页,完整调研)
- Model Context Protocol 文档(工具和数据如何连接到智能体)
- Google 的 Agent-to-Agent (A2A) 公告(智能体间协调)
- LangGraph 文档和 OpenAI Agents SDK(两个值得入手的操控层)
关注 @AlphaSignalAI 获取更多类似内容。
订阅 alphasignal.ai/newsletter 获取每日 AI 信号。拥有超过 30 万订阅者。
常见问题
什么是智能体 AI? 智能体 AI 是一个在循环中运行的模型,它可以行动而不仅仅是回答问题。它观察、推理、使用工具执行动作、检查结果,然后重复直到达成目标或需要人类介入。
工作流和智能体有什么区别? 工作流遵循你预先定义的步骤。智能体根据观察自行决定步骤,更灵活但也更难预测。
我需要多智能体系统吗? 通常一开始不需要。一个带有良好操控层的智能体可以处理大多数工作,只有当工作分割成清晰、独立的角色时才添加更多智能体。
什么是智能体操控层? 智能体操控层是运行循环的代码:它调用模型、分发工具、跟踪状态、重试失败、记录一切。生产环境的可靠性就来源于此。
MCP 和 A2A 是什么? MCP(模型上下文协议)是将智能体连接到工具和数据的标准方式。A2A(智能体到智能体)是独立智能体之间发现和协调的标准方式。
相似文章
@AlphaSignalAI: https://x.com/AlphaSignalAI/status/2057153343081111582
UIUC、Meta和斯坦福大学联合发布的一份100页调查报告引入了人工智能代理的三个 harness 层(接口、机制、Scaling),认为大多数代理失败源于 harness 问题而非推理缺陷,并提供了一个用于审计代理堆栈的分类体系。
@hwchase17: https://x.com/hwchase17/status/2053157547985834227
文章概述了一个系统的“智能体开发生命周期”(构建、测试、部署、监控),以有效创建和管理 AI 智能体,重点介绍了 LangChain、LangGraph 和 CrewAI 等关键框架。
@AlphaSignalAI: https://x.com/AlphaSignalAI/status/2066928605691523210
这篇文章将28篇研究论文提炼成一个10层堆栈,用于构建围绕AI模型的自我改进框架,强调有限、有门控的变化,而非通用的代理循环。
@sairahul1: https://x.com/sairahul1/status/2058464422306443766
一份关于AI智能体的全面指南,涵盖基础知识、ReAct循环、任务分解、上下文工程以及自主性光谱,面向初学者和构建生产系统的人员。
来自@0xCodez: https://x.com/0xCodez/status/2089393338977829278
本文概述了2026年AI智能体工程师的12步路线图,重点介绍了七个相互关联的支柱,如上下文、工具和记忆,并结合基于Claude的工作流,以构建可靠的生产环境智能体。