@ericzakariasson: https://x.com/ericzakariasson/status/2070493377267646797
摘要
一份实用指南,介绍如何为AI编码代理设置迭代循环,包括定义的停止条件、云端执行和通知渠道,以便卸载工作而无需持续监控。
查看缓存全文
缓存时间: 2026/06/26 14:12
人类参与循环
我现在最喜欢用AI代理编码的地方是,我可以同时挂起几个运行任务,继续做其他工作。当任务完成或需要我介入时,我再出现。这篇文章简短解释一下我使用的设置、代理可以自行评分的完成定义、一个持续运行直到应该停止的循环,以及让我知道何时需要介入的提醒。
找到代理可以验证的事情
在启动一个较长时间的任务之前,我先锁定一个完成的定义。以下是我实际使用的示例:
- 模型或评估工作。 目标是某个分数。改变方法,运行评估,只有当数字朝着正确方向变化时才保留更改。这最接近 Karpathy 的自动研究(ML 训练循环)。
- Web 应用或 UI。 目标是 QA 通过。加载页面或运行 Playwright,截屏,确保它仍然能完成该功能。
- 后端或重构。 目标是测试套件。先有失败的测试,然后全部变绿,并且必须保持绿色。
- 性能或稳定性。 目标是具体数字(p95、基准测试)。通过修改和测量,直到低于你设定的阈值。
- 数据或内容清理。 目标是计数。循环直到零行验证失败,或每个项目都通过检查。
编写循环主要是编写你自己检查工作的方式。有些任务需要每一步都在页面上可见。另一些任务我给出一个目标和大致方向,让模型自行填充中间步骤。我会从比我预想更明确的指导开始,然后当我看到它能推断出什么时再放宽限制。
将其封装在循环中
完成定义确定后,我告诉代理围绕它进行循环。修改某样东西,测量,保留或回退,然后继续。不必每次都只做一个小编辑。每一步只需要能够针对目标进行测量。我最关心的是停止条件,可能是:
- 指标达到目标
- 尝试几次后没有改进
- 没有思路了
- 被阻塞或不确定(停止并询问)
接收通知而不是全程监控
因此,代理获得一个通知路径(MCP 加上 /notify),并通过它联系我。通常是 Slack,因为其他所有事情都在那里。同样的设置也可以是 iMessage 或其他。我把它当作一个通用的通知渠道,而不是让代理完全访问 Slack。状态更新和“我需要做出决定”会像普通消息一样显示。当我回复时,那条回复就是循环下一步要处理的内容。
在云端运行
大部分内容都不在我的笔记本电脑上运行。它在云端运行,这样循环可以持续运行数小时,而无需我的机器一直开着。我使用自己的客户端作为编排器,并从这里将工作分发给云端代理。
然后启动下一个
当一个循环正在运行时,我就启动另一个。通常是三个左右,有时五个。而且这仅仅是长时间循环。我通常还会同时运行其他代理处理较短的工作:一个 PR、一次一次性调查、或者不是需要数小时爬坡的任务。如果事情安静下来,我就再启动一个。如果有三个任务正在等我,我就停止启动新任务,转而进行审查。
提示模板
我提示的大致模板如下。/loop 驱动迭代,/notify 让我随时了解情况:
任务:使用 /loop 直到达到 <目标>。将其视为事实来源,在运行期间不要更改它。如果在多次尝试后停滞不前或没有思路了,请提前停止。如果被阻塞或不确定,停止并询问。在开始时、遇到任何意外时以及完成或卡住时使用 /notify。需要决策时提醒我。
如果你也在运行循环,我很想知道我们如何能让你更容易!
相似文章
@s4yonnara: https://x.com/s4yonnara/status/2070797048471756948
一份关于为AI编码智能体构建自主循环的指南,解释了如何设计系统,使智能体能够无需人工干预地重复运行任务,并阐述了何时值得使用循环以及如何安全构建它们。
@shmidtqq: https://x.com/shmidtqq/status/2068704187492221405
一份关于AI编程代理循环工程的深入指南,解释了如何构建自动循环来重复提示代理、验证结果并避免失控成本,并通过一位工程师一个月内提交259个拉取请求的案例研究加以说明。
@jasonzhou1993: https://x.com/jasonzhou1993/status/2075179471951614381
作者分享了运行AI代理循环一个月后的实际经验,强调了循环契约、状态和日志的重要性,以使代理实现自主和可靠。
@0xCodez: https://x.com/0xCodez/status/2064374643729773029
一个包含14个步骤的循环工程路线图,指导开发者从手动提示AI编码代理到设计自动化系统,由系统自行处理提示、验证和迭代。
@mikenevermiss: https://x.com/mikenevermiss/status/2066401066518802637
Boris Cherny 等人描述了从提示 AI 代理转向设计持续运行的自主循环,利用内存文件和评估器模式来保证代码质量。