@mattshumer_: 还在运行!我应该让它再运行一天吗?Gauntlet Looping 指南:https://somethingbig.ai/gauntlet-loop
摘要
本文介绍了使用 AI 智能体生成高质量输出的 Gauntlet Looping 技术,演示如何仅用一个提示与 Claude Opus 5 构建一款 Call of Duty 风格的游戏,并提供了实施步骤指南。
查看缓存全文
缓存时间: 2026/08/17 08:20
还在运行中!要不要再让它跑一天?
Gauntlet Loop 指南:https://t.co/S5MHKsNzzn https://t.co/GkoFo4DHvQ
如何运行 Gauntlet Loop
来源:https://somethingbig.ai/gauntlet-loop 几天前,我发布了一个由 Claude Opus 5 从单个提示词构建的《使命召唤》风格游戏。
准确地说,我给了 Claude Code 一个提示词(https://x.com/mattshumer_/status/2081100592689324502),然后就没管它。它工作了许多小时,生成了大量子代理,编写了大约 55,000 行代码,并从零开始用代码生成了所有的纹理、模型、动画和声音。我完全没有坐在那里进行任何引导。
一个提示词。数小时。大约 55,000 行代码,所有纹理、模型、动画和声音都从零生成。在 X 上查看运行过程 → (https://twitter.com/mattshumer_/status/2081054356405731740)
引发这一切的帖子。这个帖子迅速获得了数百万次浏览。(https://x.com/mattshumer_/status/2081054356405731740?s=20) 由于其质量远超其他 Opus 5 的演示,难怪很多人说它是假的。因此,我发布了提示词并将所有代码开源(https://github.com/mshumer/Claude-of-Duty)。
然后发生了一件挺有趣的事:原本持怀疑态度的人开始自己运行提示词的版本,以为能证明它行不通。结果,它成功了,这些人最终得到了完全可运行的游戏!(https://x.com/0xRishi/status/2081230708593590378?s=20) 另一些人则将同样的想法应用到了完全不同类型的工作中。
我理解大家为什么怀疑……我展示的质量水平比其他人得到的高得多。那么,为什么我能做到?区别在哪里?
区别在于我引导代理的方式。我没有让它产出一个还不错的结果就停止,而是让它不断将自己的工作成果与更高的标准进行比较。
我开始将这种方法称为 Gauntlet Loop(挑战循环)。
它适用于远不止游戏的领域。你可以将其用于代码、网站、产品设计、营销活动、写作、研究,或者任何其他输出可以被检查和改进的场景。
本文内容
- 整体理念 (https://somethingbig.ai/gauntlet-loop#the-whole-idea)
- 首先,使用真正的代理 (https://somethingbig.ai/gauntlet-loop#use-an-agent)
- 给它目标,而不是你的实现方式 (https://somethingbig.ai/gauntlet-loop#the-goal)
- 给它一个真正的标准 (https://somethingbig.ai/gauntlet-loop#the-bar)
- 让代理拆分工作 (https://somethingbig.ai/gauntlet-loop#split-the-work)
- 永远不要让构建者给自己评分 (https://somethingbig.ai/gauntlet-loop#separate-critic)
- 让它持续运行 (https://somethingbig.ai/gauntlet-loop#keep-going)
- 观察它,但不要打断它 (https://somethingbig.ai/gauntlet-loop#watch-it)
- 一个可选的平滑处理步骤 (https://somethingbig.ai/gauntlet-loop#smoothing-pass)
- 构建你自己的 Gauntlet Loop 提示词 (https://somethingbig.ai/gauntlet-loop#build-your-own)
- 人们用它构建了什么 (https://somethingbig.ai/gauntlet-loop#built)
整体理念
Gauntlet Loop 的工作原理如下:
你给一个主代理一个目标和一个展示“优秀”样貌的真实示例。主代理决定如何将目标分解成最小的、可以独立改进的部分。每个部分都有自己的构建者和一个拥有全新上下文的独立评审。
构建者创造一些东西。评审将其与参考示例进行比较。如果参考示例胜出,评审会解释最大的剩余差距,并将工作发回给构建者。构建者进行修复。然后,新一轮开始。
这个过程持续进行,直到结果达到标准(或者更可能的是,你认为它已经准备好了)。
首先,使用真正的代理
不要将 Gauntlet Loop 粘贴到普通的 Claude 聊天中,并期待得到相同的结果。
你需要在一个代理工具(如 Claude Code 或 Codex)内运行它。用大白话说,这意味着模型可以真正地工作:打开文件、运行代码、渲染结果、查看截图、使用工具、修改内容以及生成其他代理。
我目前默认使用 Claude Code 搭配 Opus 5,特别是对于视觉或创意工作。Claude Code 的子代理可以在自己独立的上下文窗口中运行,这正是独立评审所需要的。
Codex 在后端工程和其他不太依赖视觉创作的工作方面非常出色。它在查看视觉结果并提出批评方面也做得很好。但根据我的经验,在从头创建视觉结果方面,它远不如 Opus 5。
对于严肃的 Gauntlet Loop,我还建议开启 ultracode(输入 /effort 并选择 ultracode)。虽然成本高得多,但额外的努力通常能在大型多代理运行中产生更好的结果。
1. 给它目标,而不是你的实现方式
告诉代理你想要什么。不要告诉它具体如何实现。
我最初的游戏提示词没有包含详细的架构说明。它没有列出游戏需要的所有系统,也没有解释渲染器应该如何工作。
它基本上是这样说的:
用 Three.js 构建一个现代、3A 级别的第一人称射击游戏。将工作分配给子代理。让每个重要部分都经过自己的循环,并配有一个独立、严格的视觉评审。将我们的输出与真实的《使命召唤》进行并排比较。如果我们的输了,就继续改进。使用 ultracode。
这几乎就是整个提示词。
最新的模型通常非常擅长决定如何实现一个大目标。当你规定了架构、工作流程和每个步骤时,你实际上是用自己的判断取代了模型的判断。
给出目标。让它选择路线。
2. 给它一个真正的标准
标准是最重要的部分。
“做得令人惊叹”不是一个标准。“做到可投入生产”或“持续改进”也不是。
代理需要一些具体的东西,以便它能够检查和对比自己的工作。
对于游戏,我使用了真实的《使命召唤》截图。评审应该并排查看两者,决定哪个更好,并在我们的游戏输了时继续改进。
对于一个网站,标准可能是该类别中一些最好的真实网站。
对于写作,你可以提供一些段落作为参考,这些段落达到了你想要的清晰度和信息压缩水平。例如,如果你欣赏 Paul Graham 的清晰风格,你可以使用他的一些段落作为参考……不是为了模仿他的声音,而是为了让评审判断你文章中的每个段落是否至少和他的一样清晰。
对于后端工程,标准可能是一个测试套件、延迟目标、故障恢复测试、安全审查或参考实现。
一个严格的标准不一定需要是现实可达的。我的游戏并没有变得比《使命召唤》更好。当它还在改进时我就停止了运行。《使命召唤》为代理提供了一个方向,并防止它在游戏仅仅看起来“对 AI 来说还不错”时就停止改进。
当你不知道正确的标准是什么时,将寻找标准作为任务的一部分。不要简单地让代理自己决定什么是“好”。可以这样说:
找到一个具体的比较或度量方式,它对于这个任务的作用,就像真实的《使命召唤》截图在 Matt Shumer 的 Claude of Duty 项目中对游戏的作用一样。解释为什么这是一个有用的标准,然后根据它来评判每一轮结果。
3. 让代理拆分工作
告诉主代理将目标分解成最小的、可以独立改进和评判的部分。
对于一个游戏,枪支、手部、树木、灌木丛、光照、移动、敌人行为、声音和各个效果可能都值得有自己的循环。
对于一篇文章,论证、开头、例子、章节、段落和过渡部分可能被分别评判。
你不应该预先决定所有这些部分。告诉主代理去做这件事。它理解这个作品,并且可以决定哪些部分应该分开,哪些应该保持在一起,哪些可以并行运行。
重要的是,“让游戏变得更好”太大太模糊。“让这棵树与参考图像中的这棵树相比不相上下”给了代理一个它可以反复攻克的问题。
4. 永远不要让构建者给自己评分
构建者和评审应该是不同的代理。
构建者看到了它做出的每一个决定。它记得为什么做出这些决定。这使得它非常擅长解释为什么它的工作是合理的。
你想要的不是合理。你想要的是独立的判断。
生成一个新的评审,给它目标、标准、相关规则和实际的制品。不要给它构建者的历史记录或解释。
评审的行为应该几乎像一个 A/B 测试员。它查看我们的输出和参考示例,而不被告知哪个是哪个。它选择更好的那个。
当我们的版本输了时,它要找出最大的有意义的差距。构建者修复这个差距。然后,作品再次通过挑战。
评审应该检查实际的东西:真实的像素、运行的产品、渲染的页面、测试结果或完成的文稿。它永远不应该给构建者写的总结打分。
5. 让它持续运行
不要告诉它做三轮就停下来。
告诉它持续循环。Claude Code 包含一个用于重复代理工作的 /loop 技能,但更重要的理念是不应该有任意固定的最终轮次。
我发布的那个游戏在停止时仍在改进。只要标准足够高,几乎总是有另一个差距可以缩小。
你可以在喜欢结果时停止,或者在改进变得微不足道时停止,或者在你已花费了愿意投入的计算资源时停止。
观察它,但不要打断它
对于长时间的运行,告诉代理创建一个简单的实时 HTML 页面(https://shumer.dev/how-i-prompt-fable)或 workbench.md(https://workbench.md/)文档,并在工作过程中更新它。
你不需要过度规定其具体细节(是的,这是一个我将不断提及的主题)……只需告诉它使用任何对任务有意义的方式来展示随时间进展的情况:截图、视频、草稿、测试结果、解释或其他媒体。
然后你可以用手机打开这个页面,立即看到工作进展如何。你不需要每二十分钟就打断代理并询问更新。
当你满意时,回到 Claude Code 或 Codex 并停止运行。
一个可选的平滑处理步骤
当多个代理更改一个作品的不同部分时,各个部分可能单独看很好,但彼此之间会略有不一致。
在每个主要波次结束时,你可以生成一个新的代理来检查完整的结果,并在下一波次开始前对其进行平滑处理。
它的工作不是重新设计一切。它应该确保各个部分协同工作,解决冲突,并让结果感觉像是一个整体,而不是一堆独立改进的部分。
这很有用,但它不是 Gauntlet Loop 的核心。核心仍然是:拆分、构建、评审、重复。
构建你自己的 Gauntlet Loop 提示词
将此内容连同你的目标粘贴到一个强大的模型中。让它选择标准并编写最终的提示词。然后在 Claude Code 或 Codex 中运行它生成的提示词。
元提示词
我想为这个目标运行一个 Gauntlet Loop:
[目标]
可能的参考或质量标准:
[可选的参考]
选择一个代理能够真正检查并与自己的工作进行比较的最严格的具体标准。如果我没有提供,请提出一个有用的比较对象或度量方式,它对于这个任务的作用,就像真实的《使命召唤》截图在 Matt Shumer 的 Claude of Duty 游戏(阅读提示词:https://github.com/mshumer/Claude-of-Duty/blob/main/prompt.md)中的作用一样。用一句话解释这个标准。
然后用 Matt 提示词的风格,为 Claude Code 或 Codex 写一个简短的提示词(这里越简洁越好,我们希望代理决定细节!)。
给主代理目标和标准,但让它选择方法。告诉它将目标分解成最小的、可以独立改进和评判的部分。对于每个重要部分,它应该生成一个构建者和一个拥有全新上下文的独立评审。
每个评审必须检查实际输出,直接将其与标准进行比较——尽可能使用盲法 A/B 比较——识别最大的剩余差距,并将其发回进行另一轮。持续循环,直到我们的输出胜出或我停止运行。
让主代理维护一个简单的实时进度页面,展示工作随时间演变的过程。
让它使用子代理和 ultracode。不要规定架构、精确分解或固定轮次。保持最终提示词简短,就像 Matt 的那样。
这真的就是整个方法了。
设定一个雄心勃勃的目标。给代理一个它无法通过说辞绕过的标准。让它决定如何拆分工作。让每个部分都通过一个独立的评审。然后让循环持续运行的时间比几乎所有人都要长。
人们用它构建了什么
这些不是我的项目。人们拿过提示词,指向他们想要做的任何事情,然后让它运行。大多数这些项目现在就可以在你的浏览器中运行——完整的目录中还有更多(https://somethingbig.ai/games)。
如果你用这个提示词构建了东西并属于这里,请提交到游戏目录(https://somethingbig.ai/games#submit)。
Matt Shumer (@mattshumer_): Grok 4.6 不眠不休工作了 48 小时来构建这个射击游戏。
事实证明 Grok 足够强大,可以运行 Gauntlet Loops。
让游戏制作开始吧!
相似文章
@mattshumer_: 这太疯狂了。如果你想学习如何构建这样的游戏,我制作了一份指南:https://somethingbig.ai/gauntlet-loop
Matt Shumer 解释了他的“Gauntlet Loop”提示技术,该技术使 AI 代理能够通过针对高质量参考示例进行迭代,仅凭一条提示就构建出一款可完整游玩的《使命召唤》风格游戏。他还分享了一份开源指南和提示,供其他人复现这一结果。
@shmidtqq: https://x.com/shmidtqq/status/2068704187492221405
一份关于AI编程代理循环工程的深入指南,解释了如何构建自动循环来重复提示代理、验证结果并避免失控成本,并通过一位工程师一个月内提交259个拉取请求的案例研究加以说明。
@mattshumer_: Grok 4.6 连续工作48小时构建了这个射击游戏。结果发现 Grok 功能强大到足以运行 Gauntlet Loops。L…
Grok 4.6 AI模型连续工作48小时构建了一个射击游戏,展示了其在游戏制作中运行 Gauntlet Loops 的能力。
@mvanhorn: https://x.com/mvanhorn/status/2068426104088748331
一篇解释AI编码工具(如Claude Code和Codex)中goal、loop和schedule命令区别的文章,并提供了15个实用的循环示例,用于运行自动化任务。
@s4yonnara: https://x.com/s4yonnara/status/2070797048471756948
一份关于为AI编码智能体构建自主循环的指南,解释了如何设计系统,使智能体能够无需人工干预地重复运行任务,并阐述了何时值得使用循环以及如何安全构建它们。