驾驭之道

Hacker News Top 工具

摘要

作者探讨了使用控制工具管理AI编码代理的重要性,并分享了借助Cursor、Claude和Deepseek等工具提升生产力和模型使用成本效益的技巧。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/08/27 00:16

# 驾驭系统才是关键 —— Scott Fryxell 来源:https://scott-fryxell.github.io/blog/the-harness-is-the-thing/ 当我初入开发领域时,一位经验丰富的前辈曾告诉我,摩尔定律同样适用于软件。当时我并不明白,那种持续探讨解决方案的对话正是进步的轨迹;那些对J2EE的抱怨、对Netbeans运行缓慢的不满、对表格布局和频繁整页刷新的吐槽——这些日常的优化过程,同样是推动进步的引擎。 过去十八个月是一个持续改进的特殊窗口期。Tab补全已让位于智能体编码,而智能体编码又进一步演进为通过驾驭系统管理你的智能体。我从最初对生产力提升的惊叹,逐渐过渡到深入实践并尽可能榨干柠檬汁般的极致探索。 ## 新的认知 单个开发者能够构建出媲美大型开发团队水平与稳定性的项目。你完全可以并应该构建定制应用,不必为资深工程师的融入而焦虑——只要他们对自身技术栈了如指掌,就能快速掌握如何为你的项目做贡献。但最重要的是,我领悟到驾驭系统才是关键;它是平衡我期望与大语言模型能力的支点。 目前我的工作流依托于两个订阅服务(Cursor、Claude),并可根据需要辅以Pi。三者共享我的技能库和`AGENTS.md`配置。尽管我同时使用三个终端界面(TUI),却获得了统一的使用体验。这对我而言意味着模型的商品化——Claude或Cursor中并没有什么神秘配方或特殊体验能直接影响我的生产力。因此对于本月底从Cursor切换到Codex,我丝毫没有焦虑。 ## 成本优势 在这个模型商品化的时代,我可以从众多可用模型中获得出色的效果。自`deepseek-v4-flash-0731`发布以来,我便主要依赖它。只有少数情况才会动用我的Anthropic API预算来使用Fable。 大多数维护性和简单任务我都会运行Deepseek。只有在探索重要功能或涉及众多关联组件的大型重构时,我才会求助于前沿模型。最近我了解到Can Bölük的预遍历技巧——它利用前沿模型完成规划阶段和首个任务,待模式确立后便移交控制权。我将其与《构建高级智能体驾驭系统》中提到的规划者/执行者/评审者分工模式相结合:单一提示词同时规划、执行和自我评审会混淆目标,因此每个角色应被隔离。我将这两者整合到一个技能集中,并配以支持Pi扩展程序,以便在工作流的任何阶段接管任务。 **探索**引导形成**计划**,最终转化为明确的有向无环图(DAG)任务列表。随后**执行者**接手,专注逐步实现DAG中的每个节点。完成后,我引入**评审者**来简化和质疑实现方案。这个阶段常会提出足够多的反向意见,导致需要重新审视执行阶段。但一旦满意,评审者将让位给**推广者**——这是提醒我:只有将成果恰当地传达给他人,工作才算真正完成。 添加推广者环节是为了弥补我急于交付后继续前进的弱点。它提醒我要让他人知晓我完成的工作。在这个阶段我需要Fable的些许帮助,因为推广工作需要微妙处理,且容易出错;加上没人喜欢批评者,所以通过前沿模型处理能增加其分量。 一条包含五个节点的浅弧——探索、规划者、执行者、评审者、推广者。一条浅色带贯穿整个弧线内侧,深度堪比最高峰:那是商品化模型,承担了大部分工作。两座红色高峰耸立于执行者头部,而另一座较浅的山峰则横跨评审者与推广者的接缝处。这使我在最繁忙的场景下,Fable的使用量也减少了75%。这感觉很合理,类似于AI浸泡式学习。通过两个二十美元的订阅计划,我既能服务客户,也能在自己的项目上取得实质进展,同时在Pi中灵活切换使用Deepseek或Fable。 ## 产品与驾驭系统的联结 我的产品(https://realness.online/about)是一款相机应用,设计初衷是让用户轻松拍照并即时将其转换为矢量图形,一次处理一张。它的乐趣在于简洁性——分辨率降低、图像被简化为明度图层和形状,保留上下文的同时去除细节,方便你重新绘制。这就是它的全部功能:打印出来后直接在上面作画,或导入Procreate在分层结构中绘制。 这项功能通过海报驱动器(https://realness.online/poster-driver)与驾驭系统集成。在无头Chrome中打开它,操控实时站点即可从任意图形或解构后的视频中生成海报。这使得应用的脚本化变得像加载网页一样简单。 一个此前仅有笨拙解决方案的高级用例,现在变得可用且有趣——一个充满探索潜力的功能: ``` # 从驾驭系统根目录运行 npm run make:animation artifacts/my-movie.mp4 ``` 大语言模型帮我弄明白了这点并编写了脚本,我将其保存在驾驭系统中;这样就能无限次运行而不消耗token。产品变得更强大,因为驾驭系统能触达它。系统支持文件系统API。在Brave浏览器中启用后,我将我的想法同步到工作目录,收获自己创作的伤感歌词在房间里独自歌唱——这痛苦又美妙。另一个我正在探索的创意用途是制作Blender环境,将社区三维模型与覆盖的海报结合,形成远比网页更丰富的场景、故事板。 这款应用现在以一种一年前不可能的方式完全可用。创意工作者仍能以AI方式使用非AI工具,我们依然能享受创作过程中最有趣的部分。 ## 解构驾驭系统 我的工作日完全基于这个驾驭系统运行(https://github.com/scott-fryxell/brayness)。我的nvim配置已映射到工作目录,现在大语言模型知道我打开了哪个文件,可以编辑它,并且——鉴于我还是个游泳新手——能帮助我使用正确的命令。我将驾驭系统视为工装夹具:大语言模型与我共同编辑配置,让我既能专注工作,又能保持使用vim命令的纪律性。 驾驭系统是自包含的,支持超越家庭目录的环境(沙盒、Web界面、文件系统访问API、Docker、Deno可执行文件等)。 这些概念在我的脑海中仍在成形,因此我通过引用`npm start`、`cursor-agent`、`claude`这些终端界面来保持驾驭系统概念的清晰性。所有终端界面共享同一个驾驭系统。 保持可审计性至关重要,因此终端界面被指示将所有内容保留在artifacts/目录内。Cursor使用.gitignore忽略文件,我认为这很明智,因此需要一个无git的根目录。我有一个技能将驾驭系统与工作目录中的仓库同步。技能、扩展程序和`AGENTS.md`是根目录下的一等公民,等待被修改和构建。终端界面必须遵守规则(https://scott-fryxell.github.io/blog/the-harness-is-the-thing/#claude-agents-wrapper)。 ``` brayness/ ├── AGENTS.md ├── AGENTS.local.md ├── bin/ ├── prompts/ ├── plans/ ├── skills/ ├── extensions/ ├── artifacts/ └── work/ ├── realness/ ├── blog/ ├── brayness/ ├── nvim/ └── ... ``` 最初我对技能的定义过于具体;现在我正在学习放宽特异性,并意识到存在一个临界点——超过后就是在向机器浪费token说教。随着驾驭系统稳定下来,我需要采用更实证的方法来确认变更的影响。 以下是映射到我规划流程的一些技能: ### 探索阶段 - nvim缓冲区管理 - 灵活视觉系统 - 知识库 - 面试准备 - Vuetify转Semantic UI ### 规划阶段 - 规划技能 - 记忆管理 - 先前工作参考 - 项目工具链 - brayness同步 ### 执行阶段 - realness设计 - 排版 - 用户界面 - Rust最佳实践 - 智能体浏览器 - 标志查找 ### 评审阶段 - 评审技能 - 测试覆盖 - 简化 - Vue检查 ### 推广阶段 - Hyperframes集成 - 可读性优化 - Zoom到Ableton转换 - 运动系统 双脚重新踏回实地后,我再也不会在cursor-agent或Claude中感到迷茫。我对工作流有掌控力,能精心设计解决方案的工程方式。使用Pi学到的经验常会反哺我的Claude和Cursor使用。通过Pi,我相信能用`bash`解决任何问题。让驾驭系统运行脚本,用大语言模型协调脚本。 最近三个月,我发现自己越来越频繁地离开编辑器转向终端。多重因素共同促成了这种和谐:信任代码交给智能体、切换至Ghostty、通过nvim对抗技能生疏。通常如此大变动会严重影响产出,但我的个人项目和客户工作都保持在最高水平与节奏上。一些小技巧,比如用分割窗口为长时间运行的智能体任务构建上下文,帮助我更好地适应AI工作体验。 --- 这一切因政府禁用Fable并开始彰显其对行业的控制权而变得紧迫。我——以及我估计约十万名其他软件开发者——突然感到需要多元化模型接入渠道。于是,为了自由,我们集体决定尝试这些中国模型。Pi从一个我刚弄懂还在摸索的工具,一跃成为我工作流中最关键的组件。 评论区(https://news.ycombinator.com/item?id=49452346) 1. https://www.emergingtrajectories.com/lh/commodification-and-circularity/ 2. https://stencil.so/blog/prewalk 3. https://data4sci.com/blog/building-an-advanced-agentic-harness 4. https://realness.online/about 5. https://realness.online/poster-driver 6. https://github.com/scott-fryxell/brayness 7. https://news.ycombinator.com/item?id=49452346

相似文章

Own the Loop:Agent Harnesses 现场指南(5分钟阅读)

TLDR AI

随着AI编码模型变得商品化,智能体控制框架——即管理工具和工作流的控制循环——成为关键差异化因素。本指南绘制了控制框架领域的图谱,权衡了供应商原生性能与模型无关工作流的可移植性。

什么是Harness?

Hacker News Top

本文通过将AI代理的'Harness'与登山安全带进行比较,来解释其概念,详细介绍了系统提示和工具等组件,这些组件使AI模型能够作为代理运行。

AI 工具研究

Reddit r/AI_Agents

DeepSeek Harness 的发布引发了关于 AI 工具与模型重要性的争论,作者指出缺乏科学证据,并呼吁进行研究和基准测试,以定义何为优秀的 AI 工具。