@hooeem: https://x.com/hooeem/status/2062266452921491934
摘要
一份指南,解释如何通过将固定流程编译成更小的微调模型,而不是反复提示前沿模型,从而使代理工作流成本降低高达462倍。
查看缓存全文
缓存时间: 2026/06/03 21:55
如何让智能体工作流便宜100倍(完整指南):
你的智能体工作流正在浪费你的token。它们反复为编排循环浪费你的钱。以下是如何修复并让你的工作流便宜100倍(没错,便宜100倍)。
实际上,在测试中,三个测试领域分别便宜了128倍、296倍和462倍,所以说100倍还算是保守估计了。
这项研究的论文由墨尔本大学的Simon Dennis、Riviaan Patil、Kevin Shabahang和Hao Guo撰写(文末会附上完整论文链接)。
本文将告诉你如何利用他们的研究,让你的智能体工作流便宜100倍,文章内容如下:
-
为什么你的智能体工作流成本如此高昂
-
一个值得记住的观点
-
具体怎么做(理论)
-
效果如何?
-
自己算账(看看花了多少钱)
-
这适合你吗?
-
完整构建指南
本指南可以让你的对话成本降低高达462倍,同时保持前沿模型87-98%的质量,所以让我们开始吧!
1: 为什么你的智能体工作流成本如此高昂
好的,假设你有一个固定的流程——一个智能体工作流。
然后这个智能体工作流所在的位置,以及仅仅这一个选择,就决定了你的智能体工作流的成本。
A: 编排
这是目前最常见的设置,软件位于模型之上,在每一轮对话中注入指令并决定对话的下一步走向。成本?每次对话0.05-0.17美元。
B: 上下文内
这是“直接提示它”的路线,将整个工作流粘贴到模型的系统提示中,然后让它自行运行。这是最昂贵的方法,成本?每次对话0.10-0.33美元。
C: 编译
这是我们将从研究论文中学习的方法——我们一次性教会一个小模型流程,然后自行托管。流程嵌入在模型内部,成本?每次对话0.0003-0.001美元。
2: 一个值得记住的观点
如果你的工作流的形状——它的步骤、分支、顺序——在每次对话之间都不变,那为什么还要每次付费去描述它呢?FFFFFFFF*****CCCCCKKKKK 去他妈的。把不变的形状放入模型本身,提示只留给实际变化的部分。看:
graph TD
A[固定流程形状] --> B[模型内部学习]
A --> C[每次变化的提示]
B --> D[低成本自编排]
C --> D
3: 怎么做?
让我们深入探讨…
步骤1:将工作流绘制为流程图
将你的流程映射为方框和箭头,没错,一个流程图。每个方框是一次对话轮次,每个箭头是可能的下一步。标记开始和对话结束的方式。为什么?这是一种精确的流程记录方式,计算机可以自动遍历。如果你能写下你的智能体工作流,那么你就可以进入步骤2了。
步骤2:从中生成练习对话
前沿模型(如Claude Sonnet)能够遍历你的流程图中的每一条合理路径,并写出每次细节不同的逼真示例对话。这就是你教它的方法,为此你需要让它运行2000-6000次对话
相似文章
[R] 将代理工作流编译到LLM权重中:以两个数量级的成本降低实现接近前沿质量
本文证明,将代理工作流程序编译到小型微调模型的权重中,与上下文基线相比,实现了接近前沿的质量,成本降低128至462倍,解决了质量、成本和灵活性的感知障碍。
@dair_ai: 新论文值得一读。完整的代理工作流可以蒸馏到模型权重中,以约 100 倍更低的推理成本运行…
本文展示了代理工作流可以蒸馏到小型微调模型中,在实现接近前沿质量的同时,与编排方法相比将推理成本降低两个数量级。
结构化工作流与小规模本地模型的力量
作者详细介绍了使用小型本地模型(Qwen3.5 9B)结合结构化工作流和map-reduce模式来管理上下文限制、构建自定义智能体循环的经验,并已用其取代Claude Code处理大部分任务。
@Zephyr_hg: https://x.com/Zephyr_hg/status/2062176187384807488
一篇实用指南认为,掌握子代理需要在周末构建四个特定工作流,涵盖分解、上下文打包、验证和成本控制,而不是花费200小时看教程。
@DeRonin_: https://x.com/DeRonin_/status/2054235707791778034
一份实用指南,介绍了如何通过更智能的 Token 管理(包括多模型路由、提示词缓存和上下文纪律)来降低 80% 的 AI 编码成本,而不是简单地切换到更便宜的模型。