当你的编程代理突然感觉变笨时,检查其两个版本号中哪个发生了变化

Reddit r/AI_Agents 新闻

摘要

文章讨论了AI编程代理性能变化通常源于工具包装器更新而非模型变更,建议开发者跟踪两个版本号并避免跨工具比较。

在反复出现的'模型是否被削弱了'讨论串中发现了一个规律:有一半时间模型本身没有任何变化。是包装它的工具自动更新了,或者用户切换了工具,正在跨包装器进行比较。让我恍然大悟的是:模型从不执行任何操作,它只提出建议。围绕它的程序组装了模型每轮所看到的内容(系统提示、工具定义、你的规则文件、修剪后的历史),执行它提出的建议,决定错误发生时的处理方式,并决定何时停止。一个更新日志中写着'改进了工具描述'的工具更新,已经悄然重写了你的模型每轮阅读的内容。因此,一个代理实际上是一个组合:权重 × 循环。这改变了我的两个习惯:当感觉不对时,我会记录两个版本号。工具更新远比模型频繁,这是常见的嫌疑。并且我停止了跨不同工具比较模型。一个在其他工具中看起来更聪明的模型,可能只是换了个更好的包装器;跨工具比较衡量的是整个组合。还有其他人跟踪包装版本吗?或者我是不是过度关注这一点了?
查看原文

相似文章