@aparnadhinak: https://x.com/aparnadhinak/status/2073492320159510869

X AI KOLs Timeline 新闻

摘要

对AI工程中涌现出的“循环”(loop)多重含义进行深度分析,追踪从2024年6月到AI工程师世界博览会的炒作周期,并映射出四种不同的架构(执行循环、任务循环、产品循环和人机交互循环)。

https://t.co/31rd1aRZNM
查看原文
查看缓存全文

缓存时间: 2026/07/05 00:54

循环到底是什么?

这个月,AI 工程界突然爱上了一个新词,而且它至少代表四种不同的含义:循环。

我们目前正处于炒作周期的顶峰。6 月 7 日,Peter Steinberger 发文称,你不应该再给编码智能体写提示了,而应该设计循环来驱动你的智能体。同一周,Anthropic 的 Boris Cherny 在台上表示,他也不再给 Claude 写提示了:“我写循环,循环替我干活。”Addy Osmani 在 6 月 7 日发表了一篇题为《Loop Engineering》的文章,6 月 12 日 swyx 发表了《Loopcraft: The Art of Stacking Loops》,6 月 16 日 LangChain 发表了《The Art of Loop Engineering》。随后是 AI Engineer World’s Fair,这个词主宰了主舞台。Swyx 的主题演讲是关于 Loopcraft 的,整条议题路线都专注于软件工厂,一个接一个的演讲者都提到了同一个词,会议在 7 月 2 日以一场长达一小时的辩论结束,讨论循环背后的炒作是否已经超出了实际可行的范围。

问题在于,谈论循环的人说的并不是同一件事。我数了一下,至少有两种截然不同的架构隐藏在这个词背后。所以这篇文章试图厘清每个人到底在说什么。

1. 执行循环:智能体自身的行动-观察周期

这是大多数人想到“智能体”时想到的循环:调用工具、读取结果、决定下一步动作、重复直到没有更多工具调用需要执行。这就是 Addy 所说的内部执行循环,智能体现在很大程度上可以自主运行的部分,也是你可以设计的最内层循环(swyx 的堆栈中有一个 token 循环,但没有人设计 token 循环,它只是模型的一部分)。

Swyx 的 Loopcraft 图示

Swyx 的 Loopcraft 图示

执行循环在一个任务内的步骤上迭代。它因环境反馈而结束:测试输出、API 响应、文件内容。人类通常不在循环中间,而是在边界出现,批准计划或审查结果。它也会在智能体认为自己完成时结束,无论它是否真的完成了。该领域找到的第一个修复方案是将这个循环再包裹进另一个循环,不再相信智能体自己说了算。

2. 任务循环:重新启动智能体,直到满足规格

这是第一个拥有名称的循环,即 Geoffrey Huntley 的 Ralph Loop,它在 AI Engineer World’s Fair 主舞台上被点名,当时 Keycard 的 Allie Howe 在介绍软件工厂路线时引用了他的文章《everything is a ralph loop》。Ralph 循环会反复重新启动一个编码智能体,针对相同的规格,每次迭代都分配一个全新的上下文窗口,每个循环只执行一个任务。这种表面上的浪费正是关键:每次重新喂入完整规格可以防止长时间运行会话中悄悄发生的上下文退化和压缩事件。

这个循环迭代的是单个工件。结束循环的条件是符合规格并通过测试。人类编写规格并判断是否完成,而且在 Geoffrey 的描述中,人类还有一个任务,我稍后会提到:观察循环,发现失败模式,并修复它们使之不再发生。在会议最后一天的闭幕辩论中,他将这个角色比作火车司机,其全部工作就是让火车保持在轨道上。然而,如果从单个规格中拉远视角,一个更大的循环就会显现出来:那就是运行整个代码库的循环。

3. 产品循环:软件工厂

这是在 AI Engineer World’s Fair 中最响亮的版本。Factory 的 Tereza Tížková 将软件工厂定义为“整个循环,即自主开发软件的整个生命周期”,而 Warp 的 Zach Lloyd 在接受 Latent Space 采访时具体说明了这个生命周期是什么:分类、规格说明、实现、审查、验证、发布和监控。Zach 声称软件工程变成了工厂工程,你将构建那个构建产品的东西。Warp 正在内部使用这一理念:该公司将其开源的代码库置于其工厂平台 Oz 的控制之下,Zach 描述了采用路径:从低风险的代码库开始,将自动 PR 合并率从 20% 逐步提高到 60%。Anthropic 似乎也在内部进行同样的实验:该公司表示,其产品团队 65% 的代码现在由其内部版本的 Claude Tag 生成,Mike Krieger 在 World’s Fair 将其团队的使用方式描述为委托式和主动式:不是“修复这个 bug”,而是“对这个代码库部分负责,监控这个反馈渠道,并自己拾取任务”。

任务循环和执行循环都有明确的退出条件;产品循环则持续迭代一个代码库及其待办事项清单,其结束信号完全来自代码库外部:新问题、生产日志、用户反馈、审查结果。人类的角色变得可配置。在 Zach 的框架中,你选择生命周期中要自动化的部分以及让人类参与的点,不同组织在高风险变更中是否保留人工代码审查等问题上有所不同。工厂改善产品。下一个循环改善工厂本身。

4. 系统循环:自动研究

Introspection 的 Roland Gavrilescu 称之为自动研究,他在 Latent Space 采访中的框架最为清晰:内层循环是你的主要系统,面向用户工作;外层循环则研究并维护主要系统。它迭代提示、工具、模型选择以及评估本身。他的一句话是:循环就是产品。

这种模式现在在规模的两端都有真实的验证案例。最小案例是 Andrej Karpathy 在 2026 年 3 月的自动研究,大约 630 行 Python 代码,在一张 GPU 上一夜之间运行了 50 个假设-编辑-评估实验。已发布案例是 Meta 在 6 月底宣布的 Brain2Qwerty v2,研究人员报告说,智能体迭代修改代码库以发明更好的解码架构,显著降低了词错误率。Meta 的告诫具有启发性:最终的训练配置仍然需要手动选择。即使是旗舰系统循环,在最后一个检查点也保留着人类。

结束这个循环的信号是四种循环中最苛刻的:评估、裁判、过滤后的产品反馈,以及(在 Roland 的设计中)一个明确的 ask-a-human 工具,通过它智能体像新员工一样积累隐性知识。这就是堆栈的顶端。将四种循环放在一起,整个系统的形状就清晰可见了。

四种循环并列

那 Agentic MapReduce 呢?

同一周的一个著名模式有意地从这张图中省略了。Cognition 的 Devin Security Swarm 将并行的有边界智能体分散到一个仓库中,并聚合它们的发现,这种形式他们称之为 Agentic MapReduce,并且也被称为循环。我不认为它是循环。分发、收集、验证是一个管道:没有任何东西反馈到下一个周期,而没有反馈的循环只是 for 语句。扇出是一种拓扑结构,你可以把它部署在任何一种循环内部,而不是一个独立的循环。

顶部的未命名循环是监督循环

在 swyx 的循环图中,最外层的环,即制造循环的循环之上的那个,被明确标记为“???? 循环”。它的动词是设定目标、分配、剔除。它的退出条件被列为“无”。

我认为那个循环有一个名字。我称它为监督循环:在这里设定目标、分配预算、剔除工作,这是一个人类应该身处其中的环。Addy 在 AIEWF 舞台上说过:“内层循环是能力。外层循环是自主性。”自主性正是监督循环所持有的。

循环堆栈,退出条件已命名。每个环中的箭头表示它结束的地方。

循环堆栈,退出条件已命名。每个环中的箭头表示它结束的地方。

AIEWF 上最尖锐的分歧,一旦翻译过来,都是关于谁来运行那个顶层循环的争论。Zach 和 Roland 主张向上转动刻度盘:有意识地选择你的检查点,随着信任的积累逐步提高自主性,并且用 Roland 令人难忘的区分来说,先建立管弦乐队再建立工厂——管弦乐队是一个保持人类指挥的系统。另一个阵营则认为刻度盘有一个止点。Notion 的 Geoffrey Litt 在 X 上称工厂是一种令人沮丧的愿景,并在一次演讲(后来发表为一篇文章)中辩称,那些授权给智能体去理解的人最终会被智能体取代。Paul Bakaus 直截了当地说:“没有自动,也不会有自动。”他的论点不仅仅是关于质量,更是关于所有权。人们需要目标,并且希望在他们创造的东西中发挥作用。

闭幕辩论(Latent Space 的会议报道中有详细记录)将两种立场都搬上了舞台。HumanLayer 的 Dex Horthy 谨慎地表示自己并不反循环,指出 Kubernetes 建立在控制循环之上,但那是确定性的循环,他担心的是热情已经领先于工程实践。他的建议是向下降低抽象层级,而不是向上升。Geoffrey 持相反观点,称循环是不可避免的。Mike 则提供了所有数据点中最诚实的一个:即使在 Anthropic 内部,运行 Tag 的团队也报告说瓶颈在于审查以及人类对其系统行为进行概念化的能力。人类为自己保留的检查点现在成了约束条件。

自主性是一个刻度盘,在四个循环中的每一个上独立存在。你可以在一个高度监督的产品循环内部运行一个完全自主的执行循环。你可以将系统循环交给智能体,同时将目标设定完全保留给人类。有趣的工程问题不是哪个阵营获胜,而是你需要什么信息来正确设置每个刻度盘。

上表是我试图填补那些空白。每个循环,包括顶部的循环,都有一个可命名的退出条件,而顶部的退出条件就是你自己。但命名信号并不等同于连接信号。没有信号的循环不会收敛,它只会一直运行直到外部力量阻止它。要知道你的循环在生产规模下是否真正闭合,就需要扫描轨迹并持续聚类失败,而不是抽查记录——这正是 Arize AX 设计用来做的事情。

你在构建哪个循环?

现在循环有了名字,这就是要问的问题。“循环”这个词这个月承载了很多含义,因为这个领域最喜欢追逐下一个热门事物。但真正的实践支撑着所有四种循环,而且在每一种循环中,实践都是相同的:人们正在提升他们的抽象层级,并将人类判断推送到堆栈的更上层。这就是循环的真正教训。通过攀爬堆栈,我们完成得更多,现在你有了地图,你知道应该爬到哪里。

由 @seldo 合著

相似文章