@charliejhills: Anthropic刚刚定义了什么是代理循环。共有4种,每种都更多地交接工作:循环是代理重…

X AI KOLs Timeline 新闻

摘要

Anthropic定义了四种代理循环类型——基于回合、基于目标、基于时间和主动型——每种都允许在AI任务中不同级别的自动化,并提供实施的实用技巧。

Anthropic刚刚定义了什么是代理循环。 共有4种,每种都更多地交接工作: 循环是代理重复工作周期,直到满足停止条件(他们的原话,不是我的)。 区分这四种的唯一因素是你自己停止做多少事情。 1. 基于回合 你交接检查。 - 由你发送的提示触发。 - 当Claude认为完成时停止。 - 适用于短任务,在流程之外。 - 通过技能(而不是更多回合)保持低成本。 这里没有命令。你只写一次检查,作为一个技能。 将其保存为名为SKILL .md的文件,Claude之后就会在每个任务上运行它。 用普通英语请求它: "创建一个技能来检查我的工作:打开页面,截图前后,检查控制台,修复失败项并重新运行。" 这就是基于回合。你仍然说开始。 2. 基于目标 你交接停止条件。 - 由提示实时触发。 - 在目标处或回合上限处停止。 - 适用于有明确终点的工作。 - 通过设置上限保持低成本,大声说出来。 输入/goal,然后同时设置门槛和限制。 "/goal 将主页Lighthouse分数提高到90以上,尝试5次后停止" 上限是Claude知道何时停止的方式。 3. 基于时间 你交接触发器。 - 由你设置的间隔触发。 - 当你取消或工作完成时停止。 适用于重复性任务和外部系统。 - 通过增加运行间隔保持低成本。 输入/loop,然后是间隔,然后是任务。 "/loop 5分钟检查我的PR,处理评论,修复失败的CI" /loop在你的机器上运行。如果你关闭盖子,它会停止。 4. 主动型 你交接提示。 - 由事件或计划触发。 - 在每个任务的目标处停止,然后继续。 适用于分类、错误报告、升级。 - 通过使用更小、更快的模型保持低成本。 /schedule将同一循环移至Anthropic的云,作为例程运行。 输入/schedule,然后是时间和内容: "/schedule 每小时:检查反馈频道的错误报告" 那个会无需你参与而持续运行。 每一个仍然需要一个停止条件。 这是人们跳过的部分,也是让我整夜燃烧令牌的原因。我让Claude在一个可能整夜运行的循环中批评自己的工作。 修复是一个上限,比如"尝试5次后停止"。 掌握循环所需的一切: 我如何运行循环: https://charliehills.substack.com/p/how-to-actually-use-fable-5… 他们的指南:https://claude.com/blog/getting-started-with-loops… /goal: https://code.claude.com/docs/en/goal 例程:https://code.claude.com/docs/en/routines… 技能:https://code.claude.com/docs/en/skills 我今年构建的所有提示、技能和指南都在这里免费提供。查看它 https://charliehills.substack.com/p/resource 如果这节省了你的阅读时间,请转发。 附:你之前构建过循环吗?
查看原文
查看缓存全文

缓存时间: 2026/08/27 11:37

Anthropic 刚刚定义了智能体循环的四种模式

共有四种类型,每种模式都逐步移交更多控制权:

智能体循环指的是智能体重复执行工作周期,直到满足停止条件(这是他们的原话,并非我的说法)。

四种模式的区别仅在于你自己需要承担多少工作。

1. 回合制

你移交检查权。

  • 由你发送的提示词触发。
  • 当 Claude 认为任务完成时停止。
  • 适用于短时任务,独立于其他流程。
  • 通过技能(而非更多回合)控制成本。

此模式无须指令。你只需编写一次技能即可。

将其保存为名为 SKILL.md 的文件,之后 Claude 将在每个任务中自动执行。

用自然语言描述即可:

“创建一个技能来检查我的工作:打开页面、截取修改前后截图、检查控制台、修复失败项并重新运行。”

这就是回合制。你仍然需要发出开始指令。

2. 目标制

你移交停止条件。

  • 由提示词实时触发。
  • 达成目标或达到回合上限时停止。
  • 适用于有明确终点的任务。
  • 通过明确说出的上限控制成本。

输入 /goal,然后同时设定目标和限制:

“/goal 将主页 Lighthouse 评分提升至 90 分以上,尝试 5 次后停止”

上限就是 Claude 判断何时停止的依据。

3. 时间制

你移交触发机制。

  • 由你设定的时间间隔触发。
  • 你取消或任务完成时停止。
  • 适用于周期性任务和外部系统。
  • 通过延长运行间隔控制成本。

输入 /loop,然后设定间隔和任务:

“/loop 5分钟 检查我的代码评审、处理评论、修复失败的 CI”

/loop 在本地运行。关闭窗口即停止。

4. 主动式

你移交提示词。

  • 由事件或时间表触发。
  • 每个任务达到目标后继续下一个。
  • 适用于分类、缺陷报告、升级等场景。
  • 通过使用更小更快的模型控制成本。

/schedule 将同样的循环移至 Anthropic 云端,作为常规任务运行。

输入 /schedule,然后设定时间和任务:

“/schedule 每小时:检查反馈频道中的缺陷报告”

这种模式无需人工干预即可持续运行。

所有循环都必须设置停止条件。

这是最容易被忽略的环节,也是让我通宵浪费 Token 的原因。我曾让 Claude 在可能持续整夜的循环中自我评估。

解决方案就是设置一个上限,比如“尝试 5 次后停止“。

掌握循环的必备知识:

我的运行方式:
https://charliehills.substack.com/p/how-to-actually-use-fable-5…

官方指南:
https://claude.com/blog/getting-started-with-loops…

/goal 文档:
https://code.claude.com/docs/en/goal

常规任务文档:
https://code.claude.com/docs/en/routines…

技能文档:
https://code.claude.com/docs/en/skills

我今年制作的所有提示词、技能和指南都在这里免费获取:
https://charliehills.substack.com/p/resource

如果本文对你有帮助,请转发分享。

附言:你构建过循环吗?


(真正)如何使用 Fable 5

来源:https://charliehills.substack.com/p/how-to-actually-use-fable-5
Claude Fable 5 回归了,目前是你能使用的最强大的模型。


但你使用它的时间有限。在 7 月 7 日之前,它包含在你的 Claude 计划中,之后将转为按用量计费。

在使用期间,不要将其当作拥有更大上下文窗口的旧版 Claude 来运行。它更强大,但这不是重点。重点在于循环。

其中一种循环就应用在本期内容中。

它根据我过往的 110 期内容构建了评分标准,将本稿评为 51/100,并不断重写直至通过。你看到的就是通过后的版本。

本期内容:

  • 今天就运行你的第一个循环的精确方法
  • 我用于让 Claude 自我检查的评估循环
  • 为本期评分的标准——基于我自己的数据构建

如果你是新读者,欢迎;如果老读者,感谢你的支持。正是你的订阅让这类内容成为可能。

所有循环都遵循相同的四个节拍:

  1. 目标 在任务开始前书面定义“完成“的标准。
  2. 行动 模型向目标迈出一步。
  3. 检查 某物将结果与目标进行对比。
  4. 重复 若检查未通过则重新开始;若通过则停止。

一次提示词就是一个回合。循环会持续运行直至检查通过。检查是大家都跳过的环节,我会反复强调这一点。


Fable 5 不是更快的模型,而是不同的模型,需要不同的提示词技巧。

Anthropic 发布了完整指南(https://platform.claude.com/docs/en/build-with-claude/prompt-engineering/prompting-claude-fable-5)。其中最有用的部分可直接复制使用。以下是我实际使用的技巧:

说明原因,而非仅给出任务。
Fable 在理解目的后表现更好。多写十个字,产出质量显著提升。

我正在为[目标用户]处理[更大任务]。他们需要[输出成果的价值]。基于此:[你的请求]。

明确何时行动。
它可以思考数分钟(这对难题很有用),但在简单任务中要告诉它何时停止规划。

当信息足够时立即行动。如果需要权衡选择,请给出建议而非罗列所有选项。

让它自我检查进度。
长时间运行时曾出现虚报进度的情况,因此要让它核对每项声明与实际结果。

报告进度前,请根据实际结果核对每项声明。仅报告有证据支持的工作。若未经验证,请说明。

设定边界。
Fable 有时会擅自采取未要求的行动。

当我自言自语而非要求修改时,请评估后停止。在未请求前不要进行修改。

保持长时间任务运行。
在长时间会话中它可能提前终止,或担心上下文用尽。

你在自主运行且上下文充足。对于可逆步骤,请直接执行无需询问。不要停止或建议开启新会话。

赋予记忆功能。
最佳实践是将经验教训写入文件再读取。Markdown 文件即可。

维护一个笔记文件。每条记录一个经验教训,用一行摘要说明有效与无效之处。更新现有笔记而非重复创建。

其余是设置项而非提示词。关键是“努力度“设置。它取代了模型切换——无需为简单任务更换更小模型,只需调低设置值。


这是 Anthropic 官方基准测试。中等努力度的 Fable 5 在所有设置下(包括最大努力度)都超越了 Opus 4.8,且成本更低。

高努力度是默认值和最佳平衡点。

切换到极高努力度可在最难问题上多得五分。最大努力度仅提升约两分却增加一半成本。建议保持高努力度,仅在真正困难时使用极高努力度。

最大努力度适用于宁愿多付成本也不愿重做的任务。

不要从循环开始,而应从评估开始——为任务编写测试,让循环能自行评分而非依赖你。

为本期内容,我构建了一个评估体系。

我在 Claude Code 中撰写通讯,每份草稿都由 QA 智能体先行审核。

首先需要数据。

我让 Agent Browser(https://agent-browser.dev/,Vercel 为 AI 智能体开发的自动化浏览器)登录 Substack,导出我全部 110 期内容及其打开率与互动数据。


随后 Claude 对比成功案例与失败案例,将差异转化为评分标准。


现在,全新智能体依据该标准对每份草稿进行冷评分。Fable 负责规划,Sonnet 负责执行,评审独立进行以确保无人为自己的作业评分。

低于 95 分的稿件需根据笔记重写。本期内容在初稿阶段就从 51 分提升至 95 分,而我尚未阅读内容。


且效果会持续积累。 我每次手动发现的问题都会添加到评分标准中,循环将永不再犯相同错误。

构建你自己的循环,复制以下提示词:

以下是我的三篇最佳[文章/邮件/设计]:[粘贴内容]

1. 研究它们并基于[钩子、结构、风格、清晰度]等优秀要素,制定百分制评分标准
2. 关于[主题]起草新内容
3. 以严格评审者身份根据标准为草稿评分
4. 低于 95 分:重写并重新评分,直至通过
5. 仅展示最终版本及其评分

这就是一个完整的聊天循环。建立你的评分标准,就能实现相同效果。

所有 AI 都读过相同的互联网内容,因此产出风格相似。但它没读过你的互动数据、最佳作品和失败案例。

你独有的数据才是护城河。 将其输入循环,成果便独属于你,而非千篇一律。

本周就从小循环开始。Claude Code 提供两个命令:

  1. /goal 用一句可测试的语句设定终点线
  2. /loop 让 Claude 持续工作直至目标达成

首次循环会比亲自动手更费力。第十次时,你早已忘记任务本身的存在。

编写循环很简单,编写检查机制才是关键。

提示词失败时你能当场修复,而循环在你睡觉时失败,会交出 50 份存在细微错误的工作成果。

你编写的检查机制是防止此情况的唯一屏障。因此人类不能离开房间——人类需要转变为:

  • 在任务开始前定义“完成“标准
  • 审阅检查机制而非草稿
  • 保持对发布按钮的控制权

内容质量低劣是判断力失败,而非工具问题。循环将放大这一事实:它们会产出你设定的任何“合格“标准之物。

我刚刚开放了本期内容中这个系统的内测资格。

包括循环构建、评分标准、QA 智能体,可研究、撰写和设计你的内容(含信息图和动画 GIF)。

仅开放 20 个名额。 结账时使用代码 ALPHA 享受五折优惠。先到先得,且将是历史最低价。

立即报名(https://second-brain-factory.com/p/charlie-hills-content-os)。

保持好奇,保持人性,编写循环,而非提示词。

—— Charlie

成为付费订阅者(https://charliehills.substack.com/subscribe?plan=paid):完整访问往期所有 MarTech AI 内容,支持未来创作。

Claude 内容引擎(https://growth.charliehills.io/are-you-a-fit):驱动 35 万+社交媒体粉丝和 1 亿年曝光量的 Claude 引擎。

本文讨论

准备好了解更多了吗?

相似文章