@mfpiccolo:Kaffu的‘富人的玩具’这句话是我今年读到关于工具框架的最犀利的评论之一。他对症状的判断是对的……
摘要
该推文讨论了AI代理框架中的臃肿问题,赞同Kaffu提出的框架变成‘富人的玩具’的批评,并倡导一种由小型可替换工作者组成的可组合架构,以减少漂移,保持系统廉价且易于调试。
查看缓存全文
缓存时间: 2026/06/02 01:52
Kaffu 提出的“富人的玩具”系列,是我今年读到的关于 harness 最尖锐的观点之一。他对症状的判断是对的。但在诊断的某一部分上,我想提出不同意见。
他所说的“膨胀漂移”——agent 工程悄然变成软件工程——是真实存在的。我接触过的每个 harness 团队,大约在第九个月都会遇到这个问题。你最初采用的框架长出了本不需要的功能,系统提示词不断膨胀,检索层翻倍,每任务成本翻三倍。Codex 和 Claude Code 还在不断变强,你开始怀疑自己到底在构建什么。
我的补充是:这种漂移是结构性的。原因在于,在框架形态的 harness 中,工作单元就是整个框架。要增加一个能力,你就得扩展框架;要改变一个行为,你就得分叉框架。膨胀没有其他地方可去。
当工作单元缩小到单个窄 Worker、单个类型函数、单个任务时,漂移就失去了可依附的表面。一个出错的检索 Worker 会被替换掉,而非扩展。Kaffu 正确推崇的基于数学的重排序器,变成了一个注册 rerank::score 的 Worker;微调后的 RoBERTa 变成了一个注册 embed::generate 的 Worker。它们和 LLM 提供商 Worker 同在一个总线上。系统通过可组合性保持低成本。
简单来说,一切都变成了 Worker。
这本身并不会让 harness 具有经济价值。Kaffu 更深刻的观点依然成立:团队交付的大部分东西,纸面上很漂亮,生产环境里毫无用处。框架时代助长了这一点,因为它售卖的工作单元总是太大。
我不知道稳态下具有经济价值的 harness 长什么样。我觉得它应该很小。小到每个部分都可替换、可调试、可基准测试,并且可通过一个针对 100 行微调替代方案的可观测性 Worker 进行观测。Harness 应该是一个滑块,而非一座纪念碑。
为了热爱。
相似文章
@akshay_pachaar: 现在重要的是框架。模型只是商品。模型本身只返回文本。它产生的任何东西都无法…
本文认为,现在框架(代理框架)比模型本身更关键,并通过Cline的测试展示出推理预算调整带来的性能差异。Cline推出了ClinePass,这是一种订阅服务,可以折扣价在其框架内使用多个开放权重模型。
@mfpiccolo: https://x.com/mfpiccolo/status/2060069083878408689
文章认为,当前像 LangChain 和 CrewAI 这样的智能体编排框架将独立关注点捆绑成一个整体模块,导致缺乏灵活性。文章介绍了 iii 引擎,其中每个职责都是一个独立的、可替换的工作单元,通过共享总线和单一触发原语连接,使开发者能够通过替换工作单元而非分叉框架来组合自己的编排方案。
最好的智能代理工具会这样做……
作者分享了构建高效智能代理工具的见解:最好的工具最大限度地减少对大语言模型(LLM)在琐碎任务上的依赖,将其保留用于复杂推理,从而将真正的代理工具与简单的包装器区分开来。
@omarsar0:强烈推荐。我经常声称构建agent harnesses有巨大的alpha收益。结果发现harnesses是组合…
讨论了agent harnesses作为组合通用器的概念,用于模型中扩展泛化能力,并引用了RLM harness。
@sairahul1: https://x.com/sairahul1/status/2063544956158185927
本文介绍了“Harness Engineering”这一概念,这是一门专注于设计约束和引导AI代理的系统,使其在生产中可靠的学科,并认为Harness(约束系统)比模型本身更重要。