当更好的模型/工具出现时,您如何保持AI代理的技术栈更新?

Reddit r/AI_Agents 新闻

摘要

作者讨论了在模型和工具不断演进的情况下保持AI代理技术栈更新的挑战,并寻求生产团队关于基准测试和更新实践的见解。

今年早些时候,我们开始为所有非工程角色(客户服务、营销、销售、运营等)构建代理,其中我们团队将工程师分配到这些团队,并帮助为他们创建定制代理。在构建代理时,我一直在思考一件感觉越来越烦人的问题。你选择一个模型,给代理一套工具/API,调整提示/配置,让一切运行起来……然后生态系统变化如此之快。我们一直在努力弄清楚应该多久进行一次基准测试,以寻找更便宜或更好的模型、工具、API等。如今人们实际上是如何处理这个问题的?例如,如果你的代理使用Tool A进行网络搜索,而出现了3个新的搜索API,你真的会对它们进行基准测试以对比你的工作负载吗?还是你主要坚持使用已经能用的东西,直到有理由改变?对于模型也是同样的问题。你会定期重新评估新模型吗,还是切换主要基于基准测试/声誉/手动测试?我特别好奇的是那些在生产环境中运行代理的团队,而不是原型阶段。你多久重新考虑一次技术栈,以及什么真正促使你做出改变?
查看原文

相似文章

@qinzytech: https://x.com/qinzytech/status/2066585405479371092

X AI KOLs Timeline

对构建自我进化AI代理的两种方法的技术分析:基于模型的方法(通过像SSMs或具有快速权重更新的transformer等架构,以及训练方法)和基于工具的方法(通过内存或能够自我重写的元工具)。作者为不同受众提供了实用建议。