@Kangwook_Lee: https://x.com/Kangwook_Lee/status/2052925157606568217
摘要
作者主张,为 AI Agent 设计的人工结构框架应被 AI 自主构建的工程架构所取代。文中引入 Three Regimes Framework,阐述这一转变如何释放中型模型的潜能。结合 Meta Harness 等项目的实践,作者预测 AI 将很快实现对其自身系统架构的自主优化。
查看缓存全文
缓存时间: 2026/05/09 03:42
我们为何应该停止为 AI Agent 设计 Harness
(如果不熟悉“马车类比”,请先阅读我最近的文章)
在本文中,我想说明为什么我们都应该停止手动为 AI Agent 设计 Harness。
TLDR; 适用于 AI Agent 的最佳 Harness 可能不再是由人类为其设计的,而是由 Agent 自身工程化构建的。如果我们继续为 AI Agent 手工设计 Harness,我们自己将成为瓶颈。
让我来解释原因。
Harness 设定了一个阈值
我先提出一种关于 Harness 与模型之间关系的新思考方式。
目前大多数人使用的观点是:“固定模型,改变 Harness。”
我想提出的观点是:“固定 Harness,调整模型能力。”
那么,对于固定任务而言,Harness 会在模型的原始智力上设定一个单一的阈值。
如果模型比该阈值更聪明,它就能借助此 Harness 完成任务;如果低于该阈值,则无法完成。
让我们将这个阈值记为 θ(h),它是相对于 Harness h 定义的。
下图阐释了这一观点。
三阶段框架
当比较两种 Harness 时,这一视角将变得非常有用。
一种是优秀的 Harness(h_good),另一种是糟糕的 Harness(h_bad)。
优秀的 Harness 会让任务变得更简单,因此它会设定一个更低的阈值。
糟糕的 Harness 对同一任务要求更聪明的模型,因此会设定一个更高的阈值。
这自然引申出三种阶段。
第一阶段。 处于该阶段的模型无论使用哪种 Harness 都无法完成任务。
第二阶段。 该阶段的模型具备中等智能水平,它们能完成任务,但必须依赖优秀的 Harness!
第三阶段。 该阶段的模型足够聪明,无论使用何种 Harness 都能完成任务。
需要注意的是,Harness 的质量在中间阶段至关重要,此时模型具备中等智能但还不够顶尖。正是在这个阶段,优秀的 Harness 才能发挥作用。
我们将此称为三阶段框架。
人工 Harness vs AI 生成的 Harness
让我们回到“马车类比”。
马与 AI 之间存在一个关键差异。
马无法为自己制作挽具,而 AI 可以。
现在,考虑这两类 Harness。
h_human:人类制造的 Harness。 h_ai:AI 制造的 Harness。
在过去几年里,情况是这样的。
h_good = h_human h_bad = h_ai
人类制作的 Harness 优于 AI 制作的。
因此,在三阶段框架中,中间阶段意味着:“AI 模型仅能在人工 Harness 下运行。”
Agent 循环、工具调用模式、记忆结构以及规划脚手架等,都是我们精心手工工程化的产物,其表现远超 AI 自驱生成的结果。构建优秀 Agent 的关键在于构建优秀的 Harness。
个人而言,我在这个时代投入了大量时间用于为 AI Agent 设计 Harness。我设计了当时最领先的聊天机器人 Harness [ACL’23]、基于 VLM 的图像聚类 Agent [ICLR’24]、PUBG 游戏伴侣 Agent [blog] Ally,以及面向编程 Agent 的 Terminus-KIRA [blog]。
那段时间确实很有趣。至少有一阵子。
但前提正在发生变化
AI 的代码编写能力日益精进。 调试能力不断提升。 系统迭代速度越来越快。 最终,它将比我们更擅长构建 Harness。
这将彻底扭转局面。
h_good = h_ai h_bad = h_human
这意味着什么?根据三阶段框架,中间阶段将变为:“AI 模型仅能在 AI 自建的 Harness 下运行。”
换句话说,如果我们继续使用“人工 Harness”,将无法挖掘出那些能力处于中间阶段的模型的全部潜力。
事实上,我们最近的论文 Meta Harness(由 @yoonholeee 领导)已经表明,在中型模型上,AI 在 Harness 的迭代工程方面已经超越了人类。
为了看清全貌,让我引入时间轴。
假设 AI 的代码能力随时间单调递增。我们将得到如下二维相图,可以看出我们正处于一次重要相变的临界点。
“黄色阶段”的出现为 @a1zhang 和 @lateinteraction 提出的“未被妥善管理的天才”假说提供了另一种可能的解释。如果我们继续使用手工设计的 Harness,就无法展现底层 AI 模型的全部潜力。
结论
当模型能力极强时,Harness 的质量几乎无关紧要。一个简单的 Agent 循环配合合适的工具就足以应对绝大多数任务。
当模型能力太弱时,Harness 质量也同样无关紧要。没有任何 Harness 能将其拯救。
问题出在中间地带。当模型具备中等智能时,理论上具备能力,但若缺乏合适支持便会失败。正是这个阶段,Harness 的质量起着决定性作用。
而直到最近,这种优秀的 Harness 仍必须由人类提供。
但如今已不必如此。为了充分利用处于中间阶段的模型,我们需要从 Harness 工程中退后一步。
让聪明的马匹自己打造 Harness 吧。
相似文章
@qinzytech: https://x.com/qinzytech/status/2066585405479371092
对构建自我进化AI代理的两种方法的技术分析:基于模型的方法(通过像SSMs或具有快速权重更新的transformer等架构,以及训练方法)和基于工具的方法(通过内存或能够自我重写的元工具)。作者为不同受众提供了实用建议。
@SuJinyan6: https://x.com/SuJinyan6/status/2073955240349770069
这篇由SuJinyan6撰写的博文探讨了AI Agent从简单的LLM加工具使用,向上下文工程和长时间运行框架的演变。文中引用了Anthropic的最新研究,讨论了Agent能力如何成为一种系统级属性,涉及多个组件。
我认为AI代理的讨论即将超越框架层面
作者认为构建AI代理不再是难点;真正的挑战在于部署、测试、版本控制和运维管理,这些在生态系统中仍然支离破碎。
@techwith_ram: https://x.com/techwith_ram/status/2064925285003542820
探讨了AI编程中从人类在环到自主代理循环的转变,其中代理自我提示并迭代,讨论了减少人类控制的前景与隐藏成本。
一位开发者分享关于如何最大化AI代理能力的见解,认为更简单的设置和理解核心原则比复杂的工具和库更有效。
一位开发者分享关于如何最大化AI代理能力的见解,认为更简单的设置和理解核心原则比复杂的工具和库更有效。