AI 工具问题的答案(2分钟阅读)
摘要
文章认为,AI 工具服务于两个不同的目的——提供关于用户想要什么(意图)的上下文和如何实现它的指令(执行)——并且这两者会随着时间推移而价值变化:随着模型改进,执行指令的价值下降,而意图上下文的价值上升。
一个AI工具应该捕捉人类真正想要的,在每个任务中将其传达给模型,除此之外不干预。
查看缓存全文
缓存时间: 2026/07/30 18:26
# 马具问题的答案
来源:https://danielmiessler.com/blog/the-answer-to-the-harness-question
马具用于意图;模型用于执行
2026年7月29日
马具问题的答案(https://danielmiessler.com/images/the-answer-to-the-harness-question.webp)
Martin Casado 发了一条关于 AI 马具的帖子,恰好点出了当下许多聪明人卡住的地方。
> 关于马具,我在三种信念之间摇摆:马具越少越好。模型才是魔法。对模型进行后训练并配上马具,效果会好得多,而模型提供商胜出。马具具有独立于模型的真正价值。我不知道哪种是对的。
> Martin Casado(https://x.com/martin_casado/status/2082527395920347362)
我想我能回答这个问题。
这个问题之所以看似无解,是因为我们把马具当作了一样东西。实际上它是两样。每个马具都承载着某种 WHAT 与 HOW 的混合——关于你想要什么的上下文,以及关于如何实现它的指令。而这两半的时效性正好相反。
HOW 的那一半会腐朽。这就是Sutton的苦涩教训(http://www.incompleteideas.net/IncIdeas/BitterLesson.html)在你的配置文件中上演:模型越聪明,你的分步指令相比之下就显得越蠢。如果你的马具主要是 HOW,那么 Martin 的第一种信念就对了。马具越少越好,因为模型才是魔法。
WHAT 的那一半会增值。你是谁、你在做什么、你想要达成什么、以及对你而言什么是“好”。越聪明的模型越能利用这些上下文,而不是相反。如果你的马具主要是 WHAT,那么他的第三种信念就对了。它确实具有独立价值,而且这个价值会随着每个模型发布而增长。
所以信念一和信念三都是对的。它们只是针对马具的不同部分。
第二种信念——模型提供商把马具后训练进模型并获胜——在执行上是正确的,但在意图上是错误的。实验室绝对可以训练模型成为更好的智能体,它们也会这么做。但它们无法把你的上下文后训练进模型。你要构建什么、为谁构建、带着你的约束和品味。这些都必须从外部捕获并传递过来,每一次都如此。
这就是马具的用途。我一直称此为意图工程(https://danielmiessler.com/blog/intent-engineering),这也是我自己的马具(https://danielmiessler.com/blog/personal-ai-infrastructure)背后的整个设计原则:捕获人类真正想要的,在每个任务中传达给模型,其他方面则保持不干预。
所以,马具是必要的。极为强大。但仅限于你的上下文,同时为模型的执行让路。
#### 附注
大约29.7701年来,我在这里无广告地写作——至今已累计3,075篇论文和教程。如果它对你有用,每月或一次性捐赠能让它继续下去。🫶🏼
### 月捐
### 一次性捐赠
相似文章
@sairahul1: https://x.com/sairahul1/status/2063544956158185927
本文介绍了“Harness Engineering”这一概念,这是一门专注于设计约束和引导AI代理的系统,使其在生产中可靠的学科,并认为Harness(约束系统)比模型本身更重要。
Own the Loop:Agent Harnesses 现场指南(5分钟阅读)
随着AI编码模型变得商品化,智能体控制框架——即管理工具和工作流的控制循环——成为关键差异化因素。本指南绘制了控制框架领域的图谱,权衡了供应商原生性能与模型无关工作流的可移植性。
@akshay_pachaar: 从提示工程到上下文工程再到封装工程。三个术语在AI工程中反复出现,经常被混为一谈……
Akshay Pachaar阐释了三个不同的AI工程概念——提示工程(消息)、上下文工程(记忆)和封装工程(机器)——解释了它们在构建基于LLM的智能体中的角色与相互作用,并附有一篇关于智能体封装工程的深入文章链接。
关于Harness Engineering的许多讨论,它到底意味着什么?
围绕Harness Engineering和AI agent Harness的热议,质疑行业是否正在远离让LLM决定代理响应的做法。
你现在到底在评估什么:提示词、上下文,还是整个框架?
关于AI评估焦点的讨论,质疑从业者是在优化提示词、上下文还是整个框架,并指出正转向整体优化。