Swati Gupta (@hrswatigupta) 在 X 上

X AI KOLs 新闻

摘要

文章认为,AI工程正在从一次性提示演变为构建循环,使模型能够检索上下文、推理、采取行动、评估并随时间不断改进,强调可靠的AI系统需要围绕模型设计循环,而不仅仅是优化提示。

https://t.co/Y5Msnp3IQ8
查看原文
查看缓存全文

缓存时间: 2026/06/27 13:21

从提示词到循环:AI 工程的下一轮演进

过去两年,大多数团队将 AI 工程视为一个提示词问题。

如何写出正确的指令?

哪个系统提示效果最好?

应该包含多少上下文?

要不要加示例?

这些问题确实重要。

它们教会了团队模型的行为方式、漂移规律,以及单次输出有多脆弱。

但这也形成了一种狭隘的心智模型。

这让许多团队认为 AI 工程主要就是让模型在一次交互中给出好的回答。

这已经不够了。

AI 工程的下一轮飞跃,绝不仅仅是更好的提示词。

而是构建 循环。

这意味着系统能够:

  • 检索上下文

  • 推理任务

  • 执行操作

  • 评估结果

  • 必要时重试

  • 信心不足时升级处理

  • 持续改进

这正是这个领域正在前进的方向。

而且,它的重要性远超大多数团队的认知。

看看领先的平台团队如何描述这种转变,模式是一致的。Anthropic 明确将现代智能体描述为在循环中使用工具的系统,并在其关于构建有效 AI 智能体和有效上下文工程的工程文章中,将上下文工程描述为提示词工程的自然进阶。

想要更多这样实用的 AI 解读吗? 我经常撰写关于 AI 工具、提示词、自动化、工作流和构建级实现的简短实用笔记。在此加入 ByteBuilders: https://bytebuilders.beehiiv.com/subscribe

越早理解这一点的团队,将能构建出更好的产品。

他们会交付更可靠的 AI 系统。

并且会减少在那些无法解决结构问题的提示词调整上浪费的时间。

因为一旦你超越了演示阶段,AI 工程就不再是关于单个输出。

它变成了关于 系统随时间的表现行为。

简单来说:

  • 提示词有助于得到一个答案

  • 循环有助于管理整个任务

  • 强大的 AI 产品两者都需要

提示词时代是必要的,但它从来不是终点

提示词之所以重要,是因为它是人类与强大模型之间的第一个接口层。

它给了我们早期的原语:

  • 指令

  • 示例

  • 角色设定

  • 结构约束

  • 上下文注入

  • 输出格式化

这足以开启一波产品浪潮。

聊天界面。写作助手。支持回复草稿。摘要工具。内部副驾驶。检索系统。分类流程。内容生成。编程助手。

在一段时间内,许多这些产品之所以看起来有差异,仅仅是因为它们比隔壁团队有更好的提示词。

但提示词工程有一个天花板。

一旦你的系统需要:

  • 处理模糊性

  • 收集更多上下文

  • 调用工具

  • 检查自己是否正确

  • 从失败中恢复

  • 适应新信息

  • 在信心不足时停止

  • 从重复错误中学习

一次性提示就不再是主要手段了。

此时,真正的问题不再是“我该如何措辞这个提示词?”

而是:

我该如何围绕模型设计循环?

这才是更深层的工程问题。

AI 工程中循环的实际含义

这个词用得很随意,所以有必要精确一下。

循环是一个重复的决策周期。

模型不只回答一次。

它在这样一个系统内工作,该系统能够:

  • 检查进度

  • 收集更多上下文

  • 使用工具

  • 评估结果

  • 决定下一步做什么

在实际层面,许多有用的 AI 循环看起来像这样:

  • 接收任务

  • 解读目标

  • 检查当前上下文

  • 检索缺失的信息

  • 产生行动或答案

  • 评估结果是否足够好

  • 重试、修正、升级或最终确定

这与以下模式截然不同:

  • 用户提问

  • 模型回答

  • 完成

这种转变听起来可能很微妙。

但事实并非如此。

它改变了:

  • 架构

  • 可靠性模型

  • 可观测性需求

  • 团队所需的技能

为什么提示词在真实系统中会失效

理解循环最简单的方法,是理解提示词在哪些地方会失效。

提示词可以提高质量。

但它本身无法解决以下问题:

  1. 信息缺失

如果模型没有足够的上下文,一个写得漂亮的提示词也会产生薄弱的结果。

而循环可以在回答之前检索更多信息。

  1. 多步骤工作流

如果任务需要规划、工具使用、验证和执行,一个提示词通常很快就会变得脆弱。

而循环可以将问题分解为多个阶段。

  1. 错误恢复

提示词无法从失败的 API 调用、格式错误的工具响应或意外的用户输入状态中恢复。

而循环可以检测失败、重试或回退。

  1. 质量控制

提示词可以要求模型“准确”,但无法保证结果准确。

而循环可以运行检查、比较输出、评分置信度,或者在输出答案前要求提供证据。

  1. 随时间适应

提示词是静态的。

而循环可以从反馈、追踪记录、失败和变化的业务逻辑中学习。

这就是为什么成熟的 AI 系统越来越不像聊天会话,而更像受控的运行周期。

从输出到行为的转变

这是最重要的概念转变。

在提示词时代,团队优化的是 输出。

他们问:

  • 答案看起来好吗?

  • 草稿听起来对吗?

  • 提示词产生正确的格式了吗?

在循环时代,团队优化的是 行为。

他们问:

  • 系统何时决定检索更多上下文?

  • 它如何知道自己不确定?

  • 工具调用失败时会发生什么?

  • 何时应该停止并询问人类?

  • 如何防止重复失败模式?

  • 哪些重试提高了质量,哪些仅仅增加了成本?

  • 哪些信号告诉我们系统正在随时间退化?

这是一种更严肃的工程学科。

而且它更接近于健壮软件系统一直以来的构建方式。

最有价值的 AI 系统越来越由循环驱动

如果你观察 AI 在哪里变得具有操作实用性,最强的例子很少仅仅是提示词的包装器。

它们是结合了模型和重复控制流的系统。

循环驱动型 AI 系统的例子

支持副驾驶

一个有用的支持系统不仅仅是生成回复。

它通常需要:

  • 识别意图

  • 检索账户或产品上下文

  • 搜索文档

  • 起草答案

  • 检查答案是否有根据

  • 决定是否需要升级

  • 记录交互以供未来改进

这就是一个循环。

编码智能体

一个严肃的编码智能体不仅仅写一次代码。

它通常:

  • 读取代码库

  • 提出计划

  • 编辑文件

  • 运行测试

  • 检查失败

  • 修正代码

  • 重新运行检查

  • 总结变更内容

这就是一个循环。

研究助手

一个有用的研究系统不会在第一次搜索后就停止。

它可能:

  • 查询一个来源

  • 判断证据是否充分

  • 再次搜索

  • 比较来源

  • 总结发现

  • 标记差距或矛盾

这就是一个循环。

文档处理流水线

一个生产级别的提取工作流可能:

  • 解析文件

  • 提取字段

  • 验证模式

  • 重新阅读模糊部分

  • 对低置信度字段请求二次处理

  • 将边缘情况发送给人审

同样,这是一个循环。

区别并非表面上的。

循环才是健壮性的来源。

工程栈正在随着这种转变而改变

当 AI 系统主要受提示词驱动时,工程栈看起来相对简单。

你需要:

  • 模型 API

  • 提示词模板

  • 可能一个 UI

  • 可能还需要检索

一旦循环成为核心,工程栈就扩展了。

现在你需要考虑:

  • 编排

  • 工具调用

  • 状态管理

  • 重试

  • 记忆边界

  • 评估逻辑

  • 人工升级

  • 追踪和可观测性

  • 成本监控

  • 循环终止条件

  • 回归测试

这就是为什么 AI 工程正变得越来越不像提示词写作,而更像系统设计。

这也是为什么工作流运行时和编排框架现在比一年前重要得多。LangGraph 官方文档关于工作流和智能体的部分,以及更广泛的 LangChain 概述,很好地解释了这种转变:持久化执行、人机协同支持、持久性和追踪,正成为标准工程讨论的一部分。

模型仍然重要。

但周围的控制系统变得越来越具有决定性。

思考循环的最佳方式:观察、决策、行动、评估

如果你使用一个基本的心智模型,很多复杂性都会变得简单。

大多数好的循环包含四个核心阶段:

  1. 观察

系统当前知道什么?

输入可能包括:

  • 用户请求

  • 当前对话状态

  • 检索到的文档

  • 数据库值

  • 工具输出

  • 先前的失败

  • 策略约束

  1. 决策

下一步应该做什么?

例子:

  • 直接回答

  • 检索更多上下文

  • 问一个澄清性问题

  • 调用工具

  • 以更窄的范围重试

  • 升级给人类

  1. 行动

执行选择的步骤。

这可能包括:

  • 生成文本

  • 触发工作流

  • 发送 API 请求

  • 更新记录

  • 调用代码执行

  1. 评估

行动成功了吗?

评估可以是:

  • 基于规则

  • 基于模型

  • 基于指标

  • 人工审查

  • 混合方式

如果答案是否定的,系统就循环。

这是当代大量 AI 可靠性背后的运作逻辑。

为什么循环比更智能的提示词更重要

一个更强的提示词可以改进一个弱系统。

而一个循环可以拯救一个不完美的模型。

这是一个重要的区别。

在实际部署中,可靠性往往不是来自找到神奇的措辞,而是来自用结构包围模型。

例如:

  • 检索可以补偿有限的记忆

  • 验证可以捕获格式错误的输出

  • 重试可以从临时故障中恢复

  • 置信度检查可以减少幻觉般的确定性

  • 人工审查关卡可以控制风险

  • 回归测试可以防止悄无声息的质量下降

这就是为什么那些痴迷于提示词却忽视循环的团队,往往很早就进入了平台期。

他们不断调整句子,而系统设计仍然脆弱。

循环是产品质量变得有防御性的地方

这种转变还有一个战略原因。

提示词很容易被复制。

而循环很难被完美复制。

任何人都能在公开后重新创建一个不错的提示词模式。

但能重现以下内容的团队要少得多:

  • 你的路由逻辑

  • 你的重试逻辑

  • 你的评估流水线

  • 你的检索策略

  • 你的人工升级设计

  • 你的记忆边界

  • 你的可观测性层

  • 你的边缘情况和失败数据集

这就是 AI 产品开始变得更有防御性的地方。

不是因为它们隐藏了提示词。

而是因为它们设计了一个在真实条件下表现良好的循环。

AI 工程师需要改变什么

这种转变也改变了优秀 AI 工程师需要擅长的领域。

在以提示词为中心的阶段,大部分注意力集中在:

  • 提示词技巧

  • 提示词模板

  • 系统指令风格

  • 模型选择

这些技能仍然重要。

但以循环为中心的 AI 工程将更多权重放在一套不同的优势上。

系统思维

你能设计重复的决策流程,而不是一次性输出吗?

工具编排

系统能安全地使用 API、数据库、搜索、代码执行和内部工具吗?

状态设计

系统应该记住什么?

记多久?

以什么格式?

评估

你怎么知道循环是在改进而不是在漂移?

失败处理

当系统错误、不确定或不完整时会发生什么?

产品判断

循环应该何时继续?

何时应该由人类介入?

这是一个更成熟的工程画像。

它更接近于产品工程、工作流设计和可靠性工程,这比许多人最初预期的 AI 工作形态要复杂得多。

团队在处理循环时最大的错误

他们混淆了循环与自主性。

这是许多本可避免的混乱的根源。

一个循环并 不 自动意味着智能体可以肆意运行。

事实上,最好的循环通常是受限的。

它们明确规定了:

  • 系统被允许做什么

  • 它可以访问哪些工具

  • 它有多少次重试机会

  • 它何时必须停止

  • 它何时必须请求帮助

  • 什么算是成功

  • 什么算是失败

好的循环设计不是“让模型继续运行下去”。

而是“设计一个受约束的周期,在提高输出质量的同时不失去控制。”

这是一种完全不同的思维方式。

循环成熟度的实际层次

不是每个团队都需要在第一天就拥有复杂的智能体架构。

在实践中,循环成熟度通常是分阶段发展的。

第一阶段:纯提示词系统

模型接收输入并返回输出。

适用于:

  • 简单生成

  • 低风险格式化

  • 粗略构思

第二阶段:提示词加检索

系统在回答前检索上下文。

适用于:

  • 知识助手

  • 有根据的总结

  • 文档问答

第三阶段:提示词加工具使用

模型可以执行操作或获取外部数据。

适用于:

  • 操作助手

  • 工作流自动化

  • 内部副驾驶

第四阶段:工具使用加评估循环

系统检查结果、重试或升级。

适用于:

  • 支持工作流

  • 研究系统

  • 提取流水线

  • 编码助手

第五阶段:自适应循环系统

系统利用反馈、追踪记录和性能信号随时间改进。

适用于:

  • 高容量生产系统

  • 关键任务内部操作

  • 产品化的 AI 工作流

这个递进很重要,因为许多团队试图从第一阶段跳到第五阶段,而没有学习中间的学科。

这通常结局很糟。

循环在产品设计中的样子

工程上的转变也带来了产品设计上的转变。

一个由循环驱动的产品,其行为与由提示词驱动的产品不同。

以提示词优先的用户体验通常看起来像:

  • 一个输入框

  • 一个回复

  • 可能一个重试按钮

以循环优先的用户体验通常看起来像:

  • 澄清任务

  • 收集额外信息

  • 显示进度或任务步骤

  • 解释系统为什么正在检查某些东西

  • 在对敏感操作前请求批准

  • 显示不确定性或置信度

  • 在最终执行前提供可审查的输出

这就是为什么智能体产品设计与聊天机器人设计感觉不同的原因之一。

界面必须反映出工作是跨周期发生的,而不仅仅是在单个答案中。

为什么评估在循环时代变得核心

你构建的循环越多,就越不能依赖直觉。

你需要证据。

提示词系统通常通过非正式方式测试。

一些示例输入。一些输出。也许还有一些用户反馈。

一旦循环在做出重复决策,这就远远不够了。

你需要知道:

  • 循环何时正确终止

  • 它何时重试过多次

  • 检索何时有帮助,何时会造成混淆

  • 工具选择何时是错的

  • 系统何时升级过晚

  • 成本何时增长快于质量

这就是为什么评估正成为现代 AI 工程的定义性学科之一。

OpenAI 关于评估最佳实践、评估和智能体工作流评估的官方指导都指向同一个方向:一旦系统涉及工具调用、路由和多步骤行为,你需要工作流级别的衡量,而不仅仅是提示词级别的直觉。

没有评估,循环就成了昂贵的猜测。

有了评估,它们就成了可改进的系统。

未来属于设计反馈系统的团队,而不仅仅是设计提示词

这是战略上的核心要点。

下一代强大的 AI 产品,将不由谁写出了最漂亮的提示词来定义。

而将由谁设计了最好的反馈系统来定义。

这意味着:

  • 哪些信号被记录下来

  • 哪些失败被分类

  • 哪些重试是

相似文章

@mvanhorn: https://x.com/mvanhorn/status/2063865685558903149

X AI KOLs Following

本文解释了AI编程中'循环'的概念,即开发者编写程序来提示编码代理,而不是手动提示,这一概念由Peter Steinberger和Boris Cherny推广开来,并讨论了这种转变如何代表了AI辅助开发中的新抽象层。

AI正在吞噬AI工程循环(5分钟阅读)

TLDR AI

文章讨论了AI工程循环如何能够完全自动化,但认为将整个循环交给AI会产生'agent slop'(智能体垃圾),因为评估不完善。它建议自动执行某些步骤,同时保留人类判断以处理细微差别。