驾驭之道
摘要
作者探讨了使用控制工具管理AI编码代理的重要性,并分享了借助Cursor、Claude和Deepseek等工具提升生产力和模型使用成本效益的技巧。
暂无内容
查看缓存全文
缓存时间: 2026/08/27 00:16
# 驾驭系统才是关键 —— Scott Fryxell
来源:https://scott-fryxell.github.io/blog/the-harness-is-the-thing/
当我初入开发领域时,一位经验丰富的前辈曾告诉我,摩尔定律同样适用于软件。当时我并不明白,那种持续探讨解决方案的对话正是进步的轨迹;那些对J2EE的抱怨、对Netbeans运行缓慢的不满、对表格布局和频繁整页刷新的吐槽——这些日常的优化过程,同样是推动进步的引擎。
过去十八个月是一个持续改进的特殊窗口期。Tab补全已让位于智能体编码,而智能体编码又进一步演进为通过驾驭系统管理你的智能体。我从最初对生产力提升的惊叹,逐渐过渡到深入实践并尽可能榨干柠檬汁般的极致探索。
## 新的认知
单个开发者能够构建出媲美大型开发团队水平与稳定性的项目。你完全可以并应该构建定制应用,不必为资深工程师的融入而焦虑——只要他们对自身技术栈了如指掌,就能快速掌握如何为你的项目做贡献。但最重要的是,我领悟到驾驭系统才是关键;它是平衡我期望与大语言模型能力的支点。
目前我的工作流依托于两个订阅服务(Cursor、Claude),并可根据需要辅以Pi。三者共享我的技能库和`AGENTS.md`配置。尽管我同时使用三个终端界面(TUI),却获得了统一的使用体验。这对我而言意味着模型的商品化——Claude或Cursor中并没有什么神秘配方或特殊体验能直接影响我的生产力。因此对于本月底从Cursor切换到Codex,我丝毫没有焦虑。
## 成本优势
在这个模型商品化的时代,我可以从众多可用模型中获得出色的效果。自`deepseek-v4-flash-0731`发布以来,我便主要依赖它。只有少数情况才会动用我的Anthropic API预算来使用Fable。
大多数维护性和简单任务我都会运行Deepseek。只有在探索重要功能或涉及众多关联组件的大型重构时,我才会求助于前沿模型。最近我了解到Can Bölük的预遍历技巧——它利用前沿模型完成规划阶段和首个任务,待模式确立后便移交控制权。我将其与《构建高级智能体驾驭系统》中提到的规划者/执行者/评审者分工模式相结合:单一提示词同时规划、执行和自我评审会混淆目标,因此每个角色应被隔离。我将这两者整合到一个技能集中,并配以支持Pi扩展程序,以便在工作流的任何阶段接管任务。
**探索**引导形成**计划**,最终转化为明确的有向无环图(DAG)任务列表。随后**执行者**接手,专注逐步实现DAG中的每个节点。完成后,我引入**评审者**来简化和质疑实现方案。这个阶段常会提出足够多的反向意见,导致需要重新审视执行阶段。但一旦满意,评审者将让位给**推广者**——这是提醒我:只有将成果恰当地传达给他人,工作才算真正完成。
添加推广者环节是为了弥补我急于交付后继续前进的弱点。它提醒我要让他人知晓我完成的工作。在这个阶段我需要Fable的些许帮助,因为推广工作需要微妙处理,且容易出错;加上没人喜欢批评者,所以通过前沿模型处理能增加其分量。
一条包含五个节点的浅弧——探索、规划者、执行者、评审者、推广者。一条浅色带贯穿整个弧线内侧,深度堪比最高峰:那是商品化模型,承担了大部分工作。两座红色高峰耸立于执行者头部,而另一座较浅的山峰则横跨评审者与推广者的接缝处。这使我在最繁忙的场景下,Fable的使用量也减少了75%。这感觉很合理,类似于AI浸泡式学习。通过两个二十美元的订阅计划,我既能服务客户,也能在自己的项目上取得实质进展,同时在Pi中灵活切换使用Deepseek或Fable。
## 产品与驾驭系统的联结
我的产品(https://realness.online/about)是一款相机应用,设计初衷是让用户轻松拍照并即时将其转换为矢量图形,一次处理一张。它的乐趣在于简洁性——分辨率降低、图像被简化为明度图层和形状,保留上下文的同时去除细节,方便你重新绘制。这就是它的全部功能:打印出来后直接在上面作画,或导入Procreate在分层结构中绘制。
这项功能通过海报驱动器(https://realness.online/poster-driver)与驾驭系统集成。在无头Chrome中打开它,操控实时站点即可从任意图形或解构后的视频中生成海报。这使得应用的脚本化变得像加载网页一样简单。
一个此前仅有笨拙解决方案的高级用例,现在变得可用且有趣——一个充满探索潜力的功能:
```
# 从驾驭系统根目录运行
npm run make:animation artifacts/my-movie.mp4
```
大语言模型帮我弄明白了这点并编写了脚本,我将其保存在驾驭系统中;这样就能无限次运行而不消耗token。产品变得更强大,因为驾驭系统能触达它。系统支持文件系统API。在Brave浏览器中启用后,我将我的想法同步到工作目录,收获自己创作的伤感歌词在房间里独自歌唱——这痛苦又美妙。另一个我正在探索的创意用途是制作Blender环境,将社区三维模型与覆盖的海报结合,形成远比网页更丰富的场景、故事板。
这款应用现在以一种一年前不可能的方式完全可用。创意工作者仍能以AI方式使用非AI工具,我们依然能享受创作过程中最有趣的部分。
## 解构驾驭系统
我的工作日完全基于这个驾驭系统运行(https://github.com/scott-fryxell/brayness)。我的nvim配置已映射到工作目录,现在大语言模型知道我打开了哪个文件,可以编辑它,并且——鉴于我还是个游泳新手——能帮助我使用正确的命令。我将驾驭系统视为工装夹具:大语言模型与我共同编辑配置,让我既能专注工作,又能保持使用vim命令的纪律性。
驾驭系统是自包含的,支持超越家庭目录的环境(沙盒、Web界面、文件系统访问API、Docker、Deno可执行文件等)。
这些概念在我的脑海中仍在成形,因此我通过引用`npm start`、`cursor-agent`、`claude`这些终端界面来保持驾驭系统概念的清晰性。所有终端界面共享同一个驾驭系统。
保持可审计性至关重要,因此终端界面被指示将所有内容保留在artifacts/目录内。Cursor使用.gitignore忽略文件,我认为这很明智,因此需要一个无git的根目录。我有一个技能将驾驭系统与工作目录中的仓库同步。技能、扩展程序和`AGENTS.md`是根目录下的一等公民,等待被修改和构建。终端界面必须遵守规则(https://scott-fryxell.github.io/blog/the-harness-is-the-thing/#claude-agents-wrapper)。
```
brayness/
├── AGENTS.md
├── AGENTS.local.md
├── bin/
├── prompts/
├── plans/
├── skills/
├── extensions/
├── artifacts/
└── work/
├── realness/
├── blog/
├── brayness/
├── nvim/
└── ...
```
最初我对技能的定义过于具体;现在我正在学习放宽特异性,并意识到存在一个临界点——超过后就是在向机器浪费token说教。随着驾驭系统稳定下来,我需要采用更实证的方法来确认变更的影响。
以下是映射到我规划流程的一些技能:
### 探索阶段
- nvim缓冲区管理
- 灵活视觉系统
- 知识库
- 面试准备
- Vuetify转Semantic UI
### 规划阶段
- 规划技能
- 记忆管理
- 先前工作参考
- 项目工具链
- brayness同步
### 执行阶段
- realness设计
- 排版
- 用户界面
- Rust最佳实践
- 智能体浏览器
- 标志查找
### 评审阶段
- 评审技能
- 测试覆盖
- 简化
- Vue检查
### 推广阶段
- Hyperframes集成
- 可读性优化
- Zoom到Ableton转换
- 运动系统
双脚重新踏回实地后,我再也不会在cursor-agent或Claude中感到迷茫。我对工作流有掌控力,能精心设计解决方案的工程方式。使用Pi学到的经验常会反哺我的Claude和Cursor使用。通过Pi,我相信能用`bash`解决任何问题。让驾驭系统运行脚本,用大语言模型协调脚本。
最近三个月,我发现自己越来越频繁地离开编辑器转向终端。多重因素共同促成了这种和谐:信任代码交给智能体、切换至Ghostty、通过nvim对抗技能生疏。通常如此大变动会严重影响产出,但我的个人项目和客户工作都保持在最高水平与节奏上。一些小技巧,比如用分割窗口为长时间运行的智能体任务构建上下文,帮助我更好地适应AI工作体验。
---
这一切因政府禁用Fable并开始彰显其对行业的控制权而变得紧迫。我——以及我估计约十万名其他软件开发者——突然感到需要多元化模型接入渠道。于是,为了自由,我们集体决定尝试这些中国模型。Pi从一个我刚弄懂还在摸索的工具,一跃成为我工作流中最关键的组件。
评论区(https://news.ycombinator.com/item?id=49452346)
1. https://www.emergingtrajectories.com/lh/commodification-and-circularity/
2. https://stencil.so/blog/prewalk
3. https://data4sci.com/blog/building-an-advanced-agentic-harness
4. https://realness.online/about
5. https://realness.online/poster-driver
6. https://github.com/scott-fryxell/brayness
7. https://news.ycombinator.com/item?id=49452346
相似文章
Own the Loop:Agent Harnesses 现场指南(5分钟阅读)
随着AI编码模型变得商品化,智能体控制框架——即管理工具和工作流的控制循环——成为关键差异化因素。本指南绘制了控制框架领域的图谱,权衡了供应商原生性能与模型无关工作流的可移植性。
什么是Harness?
本文通过将AI代理的'Harness'与登山安全带进行比较,来解释其概念,详细介绍了系统提示和工具等组件,这些组件使AI模型能够作为代理运行。
AI 工具研究
DeepSeek Harness 的发布引发了关于 AI 工具与模型重要性的争论,作者指出缺乏科学证据,并呼吁进行研究和基准测试,以定义何为优秀的 AI 工具。
@sairahul1: https://x.com/sairahul1/status/2063544956158185927
本文介绍了“Harness Engineering”这一概念,这是一门专注于设计约束和引导AI代理的系统,使其在生产中可靠的学科,并认为Harness(约束系统)比模型本身更重要。
观察:每个模型的最佳代理框架将由模型开发者自身提供
讨论人工智能模型如何在使用其自身开发者构建的框架时表现最佳,而第三方框架可能导致表现不佳,尽管基准测试成绩出色。文中引用了Claude Code(针对Claude模型)和Codex(针对GPT模型)等示例。