在生产环境中使用定时任务运行智能体一个月:四个出问题的点,无一归咎于模型

Reddit r/AI_Agents 新闻

摘要

作者分享了在生产环境中使用定时任务运行AI智能体一个月时遇到的四个机械故障,强调所有问题都源于设置问题,而非模型缺陷。

我运行一个小系统,其中智能体按计划针对共享状态发布内容,无需人工审批个人操作。该系统已上线约一个月。每一个花费我大量时间的故障最终都被证明是机械故障,每一个都看起来像是模型工作不力。记录下来是因为一个月前我可能会为这份清单付费。 1. 上下文窗口决定了行为,而我却归咎于模型。智能体被指示回复特定的开场白,而契约规定目标ID必须来自它们提供的动态。命中率保持在33%。原因:回复比开场白更新,动态是固定数量的十二篇最新帖子,因此到了第二阶段,开场白已被挤出窗口。指令指向了窗口中不再存在的内容。一旦在预算外注入开场白,命中率提高到80-100%。这个子版块中有人比我更好的命名了这个修复:一个固定频道与一个时效频道并存。 2. 沉默服从比拒绝更糟糕。在上述情况下没有错误发生。契约要求使用动态中的ID,目标已消失,因此模型选择了另一个有效ID并继续执行。输出格式良好且看似合理。没有异常可捕获,结果中也无任何错误迹象。只有通过比较智能体的行为与你的意图,或者渲染它收到的精确输入,才能发现。 3. 工具描述是每次调用时都被读取的契约。我的一个读取工具声称结果按最早优先返回。API按最新优先返回。所有测试都通过了,因为测试调用端点并检查排序,但没有一个读取描述。没有人看到这个谎言。只有智能体看到了,而智能体不提交错误报告,它们基于此进行构建。 4. 昂贵的故障模式是行为良好的智能体。我为失控循环做好了准备。真正威胁预算的是按计划执行无人需要工作的完全服从的智能体。每次运行上限、一个默认为开启而非关闭的紧急开关,以及按能力类别分隔的每日预算,比任何循环检测都更有效。现在,一轮未找到任何工作要做的运行在结构上结束于零成本,而非因为选择了得好。 一般教训,如果有的话:当智能体行为异常时,在修改提示之前先检查机械部分。我的智能体每次都表现得很顺从。提示没有问题,是管道在欺骗它。 乐意回答有关调度、成本上限或服务器端的任何问题。链接在评论中,根据规则3。
查看原文

相似文章

让我损失最惨重的智能体故障全都声称成功

Reddit r/AI_Agents

作者分析了155个AI智能体任务,发现大多数故障源于基础设施问题,如超时和虚假成功信号,而非模型错误,从而提出了基于效果断言和使用多条验证路径等实践方法。