@LiuVaayne: 这是 yan5xu(ex ManusAI)写的长文:《从 Prompt 到 Harness:如何理解 LLM Engineering》 核心框架:螺旋上升的工程范式演进 第一圈:Prompt Engineering(2022-2024) …

X AI KOLs Timeline 新闻

摘要

这篇文章由 yan5xu(前 ManusAI)撰写,提出了 LLM 工程范式的螺旋演进模型:从 Prompt Engineering(2022-2024)到 Context Engineering(2025),再到 Harness Engineering(2026-),并讨论了各阶段的瓶颈与驱动因素。

这是 yan5xu(ex ManusAI)写的长文:《从 Prompt 到 Harness:如何理解 LLM Engineering》 核心框架:螺旋上升的工程范式演进 第一圈:Prompt Engineering(2022-2024) • 写好 system prompt,设计 few-shot,调 prompt 结构 • 天花板:模型变强后,精心设计的技巧反而成约束(Khan 的 Prompting Inversion:GPT-4o 上 Sculpting 97%,GPT-5 上降到 94%) 第二圈:Context Engineering(2025) • Karpathy 命名:"the delicate art and science of filling the context window with just the right information for the next step" • 管理动态展开任务中的信息流转:上一步结果怎么流入下一步、环境反馈怎么注入、对话历史怎么压缩 • 典型产品:Cursor(动态检索相关代码)、Lovable/Bolt(LSP 报错、测试失败自动注入下一轮) • 局限:规则是人硬编码的,"context rot"(多轮后性能平均下降 39%) 第三圈:Harness Engineering(2026-) • 两步走: ‣ 放手:给 agent 工具链(lint、测试、搜索),让它自己决定什么时候用什么 ‣ 上保险:框定能力边界(sandbox、CI 轮数限制、文件权限、结构测试) • 定量验证:同一模型同一 prompt,换 harness 配置成功率从 42% → 78% 金句:"Agents aren't hard; the Harness is hard." 关键洞察 • 不是线性替代,是螺旋积层:harness 内部还在跑 context engineering pipeline,pipeline 里还在写精心设计的 prompt • 每一圈演化的驱动力:上一阶段不够用了 → 新实践被逼出来 • 下一圈瓶颈已露头:Eval(怎么定义"好"?LLM-as-judge 有 bias)和 Governance(多 agent 互认证、审计、权限)
查看原文
查看缓存全文

缓存时间: 2026/05/26 19:13

这是 yan5xu(ex ManusAI)写的长文:《从 Prompt 到 Harness:如何理解 LLM Engineering》

核心框架:螺旋上升的工程范式演进

第一圈:Prompt Engineering(2022-2024)

• 写好 system prompt,设计 few-shot,调 prompt 结构 • 天花板:模型变强后,精心设计的技巧反而成约束(Khan 的 Prompting Inversion:GPT-4o 上 Sculpting 97%,GPT-5 上降到 94%)

第二圈:Context Engineering(2025)

• Karpathy 命名:“the delicate art and science of filling the context window with just the right information for the next step” • 管理动态展开任务中的信息流转:上一步结果怎么流入下一步、环境反馈怎么注入、对话历史怎么压缩 • 典型产品:Cursor(动态检索相关代码)、Lovable/Bolt(LSP 报错、测试失败自动注入下一轮) • 局限:规则是人硬编码的,“context rot”(多轮后性能平均下降 39%)

第三圈:Harness Engineering(2026-)

• 两步走: ‣ 放手:给 agent 工具链(lint、测试、搜索),让它自己决定什么时候用什么 ‣ 上保险:框定能力边界(sandbox、CI 轮数限制、文件权限、结构测试) • 定量验证:同一模型同一 prompt,换 harness 配置成功率从 42% → 78%

金句:“Agents aren’t hard; the Harness is hard.”

关键洞察

• 不是线性替代,是螺旋积层:harness 内部还在跑 context engineering pipeline,pipeline 里还在写精心设计的 prompt • 每一圈演化的驱动力:上一阶段不够用了 → 新实践被逼出来 • 下一圈瓶颈已露头:Eval(怎么定义“好“?LLM-as-judge 有 bias)和 Governance(多 agent 互认证、审计、权限)

相似文章

@freeman1266: Harness Engineering 不是玄学,是可工程化的活产物 很多人看了一圈 Harness Engineering 的文章,理念都懂了,但第一步到底该做什么? 六层零件,逐层叠加: • Rule:写死基础规矩,告诉 AI 什么不…

X AI KOLs Timeline

Harness Engineering 不是玄学,而是可工程化的活产物。文章提出六层逐步叠加的工程框架(Rule、Skill、Sub Agent、Workflow、Scripts、dev-map),强调从简单开始、依赖脚本而非提示词,并通过迭代改进。