当更好的模型/工具出现时,您如何保持AI代理的技术栈更新?
摘要
作者讨论了在模型和工具不断演进的情况下保持AI代理技术栈更新的挑战,并寻求生产团队关于基准测试和更新实践的见解。
今年早些时候,我们开始为所有非工程角色(客户服务、营销、销售、运营等)构建代理,其中我们团队将工程师分配到这些团队,并帮助为他们创建定制代理。在构建代理时,我一直在思考一件感觉越来越烦人的问题。你选择一个模型,给代理一套工具/API,调整提示/配置,让一切运行起来……然后生态系统变化如此之快。我们一直在努力弄清楚应该多久进行一次基准测试,以寻找更便宜或更好的模型、工具、API等。如今人们实际上是如何处理这个问题的?例如,如果你的代理使用Tool A进行网络搜索,而出现了3个新的搜索API,你真的会对它们进行基准测试以对比你的工作负载吗?还是你主要坚持使用已经能用的东西,直到有理由改变?对于模型也是同样的问题。你会定期重新评估新模型吗,还是切换主要基于基准测试/声誉/手动测试?我特别好奇的是那些在生产环境中运行代理的团队,而不是原型阶段。你多久重新考虑一次技术栈,以及什么真正促使你做出改变?
相似文章
如何处理生产环境中AI代理的工具/模型发生变动?
一个讨论贴,询问开发者如何处理AI代理依赖的工具、API或模型版本在生产环境中发生变化的情况,包括检测、修复和成本。
当模型不断变化时,如何保持本地AI评估的有用性?
讨论在模型频繁更新时保持本地AI评估有用性的策略,重点在于适应性和一致性。
@qinzytech: https://x.com/qinzytech/status/2066585405479371092
对构建自我进化AI代理的两种方法的技术分析:基于模型的方法(通过像SSMs或具有快速权重更新的transformer等架构,以及训练方法)和基于工具的方法(通过内存或能够自我重写的元工具)。作者为不同受众提供了实用建议。
@HuggingPapers: 现代智能体系统中的自我改进——一项涵盖239篇论文的调研,关于AI智能体如何通过更新模型…
一项涵盖239篇论文的调研,分析AI智能体如何通过更新模型本身或框架(提示、记忆、工具)来自我提升。
智能体在增加更多工具后是否变得更难维护?
探讨了随着集成工具数量的增加,维护AI智能体可能面临的挑战,质疑其可扩展性和复杂性。