如何为智能体设计后端架构?

Reddit r/AI_Agents 新闻

摘要

一位开发者寻求关于为AI智能体设计后端架构的建议,涉及多轮ReAct循环的并发问题及SSE流式传输。

以下是我当前的设置:前端负责处理用户会话交互。后端接收请求,调用大语言模型并执行工具调用(涉及多轮循环)。不同的用户会话共享同一个大语言模型客户端,消息历史按用户会话ID(PostgreSQL)持久化存储。后端推送SSE消息,实时通知前端后端活动(推理步骤、工具调用、执行结果等)。仔细思考后,我仍有一个问题:单个用户请求可能使后端运行多个ReAct循环,这相当耗时,并且可能导致Web服务上的并发堆积。人们通常如何处理这个问题?如果我使用异步队列,那么可能无法再使用SSE向前端推送实时更新。业界对此是否有相对标准化的架构方法?
查看原文

相似文章