@ChrisHayduk: https://x.com/ChrisHayduk/status/2053807198870880743
摘要
本文提供了有效使用 OpenAI Codex Goals 功能的建议,强调了制定清晰、可量化的目标以及建立紧密反馈循环的重要性,以防止智能体出现失效模式。
查看缓存全文
缓存时间: 2026/05/12 02:47
高效使用 Codex 目标模式
细心的 Codex 用户可能已经注意到,/goal 命令现在已在 Codex 应用中可用——只需在提示词开头输入 /goal,并指定你希望智能体执行的任务即可。
这将触发 Codex 持续循环执行,直到达成你的目标。但为了让智能体有效工作,我们需要采用与你以往习惯略有不同的提示方式。
在本文中,我将分享一些从在 OpenAI 内部以及我的个人副业项目中试用目标模式中总结出的技巧,帮助你最大化发挥 Codex 的潜力。
设定清晰、可量化的目标
在过去大约 6 个月里,模型性能取得了巨大飞跃,导致我们在日常工作中作为提示词撰写者变得有些“懒惰”。我们往往只是模糊地指示 GPT-5.5 该构建什么,而它通常能很好地理解意图并找到实现路径。
然而,这种提示风格在使用目标模式时是一个主要的失败原因。
目标模式的核心是一个循环:智能体执行某些操作,评估这些操作的结果,检查评分是否满足目标,若未满足则继续循环,若满足则终止。
关键在于第三步——检查评分是否满足目标。如果目标是模糊且定性的(例如“让我的代码变得更好”),那么循环的结束状态就是不明确定义的。智能体如何知道何时达成了目标并结束循环?代码处于什么状态算“更好”,什么时候才算“足够好”而可以停止?
我观察到,面对这些定义不清晰的目标,模型会出现两种截然不同的失败模式。在某些情况下,模型会过早放弃,仅工作几分钟便停止;在另一些情况下,模型会无休止地工作,盲目地做出各种更改,试图满足一个无法达成的目标。
相比“让我的代码变得更好”这样的目标,更好的表述应该是:“在不导致现有单元测试和集成测试回归的前提下,将 specific_file 中代码的运行时间减少 20%。”
此时,智能体拥有了一个清晰且可量化的目标(特定文件代码运行时间减少 20%),以及明确的约束条件(无单元或集成测试回归)。
需要注意的是,如果目标足够清晰且可量化,模型自身有时也能进行评估!例如,我曾设置目标模式将一篇 NeurIPS 论文预印本转换为 ICML 研讨会论文。ICML 拥有一个保存在 LaTeX 文件中的庞大格式约束列表,直接对照评分并不方便。为了解决这个问题,我让 Codex 将这些规则提取到一个 Markdown 文件中,包含一份超过 200 条格式和风格规则的清单。以下是该清单的节选:
(此处原文应有图片,略)
接着,Codex 的目标设定为:“根据提供的 checklist.md 将 NeurIPS 论文转换为 ICML 格式,且不改变论文的任何技术内容。”
通过提供清单,我们将定性目标转化为定量目标。Codex 只需要思考:“当我勾选完全部 200 条规则时,目标即完成。”尽管每条规则本身可能略显模糊,但 Codex 在判断每条规则是否完成方面的推理能力,远强于直接判断模糊整体目标的能力。
我还添加了指示,要求模型在完成各项时勾选清单中的对应项,以便模型将状态持久化到文件系统中(同时也让我能直观地跟踪其进展)。
确保反馈回路紧凑
为了让智能体根据你的目标评估其操作,它需要某种机制来测试所做的更改。
你能多快运行这些测试(以及让模型执行测试有多容易),就决定了模型能多快获得关于其进展的反馈。
例如,如果你设置智能体来改进机器学习算法的架构,让它在一个比完整训练运行更小模型规模和子采样数据集上操作会有帮助。这将使模型能够比使用生产环境训练设置更快地测试各种想法。
尽一切可能加速这个反馈回路,同时不牺牲模型接收到的评分质量。
在我寻找改进蛋白质结构模型架构的案例中,我使用了 NanoFold——一个规模较小但采样良好的数据集来运行实验。这将评分运行时间从完整训练集需要的几天缩短到了仅几分钟。
为智能体提供用于跟踪的 Markdown 文件
使用目标模式时,你可以让 GPT-5.5 连续运行数天。尽管 Codex 内置了强大的上下文压缩能力,但让模型在如此长的时间跨度内保持连贯的思路仍然非常困难。
与其迫使模型在内存中维持所有相关上下文,不如提供 Markdown 文件供其写入,以跟踪其工作内容,这会非常有帮助。
在目标模式中,我通常给智能体提供三个 Markdown 文件的访问权限:
-
PLAN.md — 记录智能体在朝向目标推进过程中打算遵循的高层计划。你可以用你对其应遵循方向的初始想法来填充此文件。
-
EXPERIMENTS.md — 智能体在此跟踪每次实验的详细信息(这特定于机器学习任务,但你可以将此类型文件复用于许多不同任务)。这通常表现为一个整洁、经过整理的实验列表,包含标题、尝试内容的简要描述以及该尝试的结果。
-
EXPERIMENT_NOTES.md — 这是智能体的草稿纸。它是智能体执行不同操作时实时想法的按时间顺序排列的列表。拥有此文件非常有用,以便你可以审计智能体的思维过程,看看是否需要将其引导回另一个方向。
我认为 EXPERIMENTS.md 是这三个文件中最重要的,因为它让你和智能体都能回顾其先前达成目标的尝试,以及这些尝试成功/失败的原因。以下是来自我的智能体 EXPERIMENTS.md 的一个节选,以便了解实际效果:
(此处原文应有图片,略)
就是这样!这就是整个操作指南。
设定清晰、可衡量的目标,保持反馈回路紧凑,并为智能体提供用于思考的 Markdown 文件。只要落实这三点,Codex 将乐意为你的难题连续工作数小时(甚至数天)。
现在,去运行你的循环吧!
相似文章
@dkundel: https://x.com/dkundel/status/2062650378089594955
关于使用Codex的目标模式(/goal)在长时间内完成复杂编码任务的详细指南,包含定义明确标准、提供指导和衡量进度的小贴士。
我基本上再也不自己写 /goal 了。我让 Codex 为自己和它生成的每个代理写一个。像这样…
用户分享了一种技巧,即使用OpenAI的Codex为自己和它生成的代理编写目标,从而减少手动工作。
@akshay_pachaar: 像写验收标准一样写 /goals。/goal 现已无处不在。Claude Code、Codex、Hermes 以及更多智能体正在采用……
这篇文章提供了为 Claude Code、Codex、Hermes 等 AI 编码智能体编写有效 /goal 声明的最佳实践,强调目标应描述评估者能够验证的可观察结束状态。
@gdb: 如何在Codex中使用/goal — 让Codex持续工作直到解决一个持久目标:
Greg Brockman的一条推文突出了一篇关于在Codex中使用Goals让AI持续工作于一个持久目标的文章,涵盖了何时使用、验证标准以及架构设计。
@daniel_mac8: 这太神奇了。照着做。让 Codex 自己编写 /goal 指令。/goal + gpt-5.5 high + fast mode 是目前杠杆效应最高的 AI……
一条社交媒体帖子,介绍了利用 Codex 和 GPT 进行目标导向自动化的高杠杆 AI 代理配置。