AI 代理在无人值守运行时,实际基础设施配置如何?
摘要
这是一个关于运行无人值守 AI 代理的基础设施配置的讨论,涵盖了执行环境、工具管理、密钥管理、版本控制、故障处理和调度等方面。
例如:代理在哪里运行?如何处理技能/工具、密钥、版本控制、故障、日志等?使用什么进行调度?最终自己构建了什么?尝试过并放弃的是什么?特别感兴趣的是那些已经运行了一段时间的配置。
相似文章
在AI代理投入生产之前,还缺少哪些基础设施?
关于运行AI代理所需基础设施缺失的讨论,包括监控、权限、恢复和审计追踪,质疑这是否会成为新的基础设施类别。
有人想了解先进公司是如何在实际生产环境中运行AI代理的吗?
作者在一家AI基础设施公司工作,观察到在实际生产环境中运行AI代理更多是关于环境、访问控制、隔离和安全状态管理,而非模型本身,并询问社区是否想要详细的架构模式。
有没有人真正在生产环境中使用AI代理(面对真实用户,不是演示,也不是10个测试用户)?你的技术栈是什么?有没有人在尝试将代理用于生产后又回归传统代码——为什么?
一个讨论贴,询问关于拥有100+用户的真实AI代理部署情况,涉及技术栈和扩展问题,以及回归传统代码的经验。
你们是如何处理AI代理在生产中中途任务失败的?以及这种情况对你们来说有多频繁?
一个讨论提问,询问开发者如何处理AI代理在生产中中途崩溃的情况,探讨重启、持久化状态、使用检查点或手动检查等方法。
Agent工程中的枯燥部分
作者讨论了在生产中构建可靠AI Agent时那些不引人注目但至关重要的方面,包括监控运行中的进程、恢复失败的任务以及提供UI状态,并向社区询问常见的痛点和现成的解决方案。