当所有 span 都显示正常但代理仍然执行错误操作时,你实际上会检查什么?

Reddit r/AI_Agents 新闻

摘要

用户探讨了在生产环境中调试AI代理系统的策略,当所有指标都显示成功但结果不正确时,如何收集证据和进行诊断,并向社区寻求建议。

好奇在生产环境中人们如何处理这个问题。不是那种工具抛出异常或某个节点明显失败的简单情况。我说的是当整个运行看起来都很健康时:LLM调用返回,检索返回文档,工具返回200,状态更新显示成功,验证通过,最终步骤完成,但实际结果仍然错误,哈哈。我听说过很多不同的版本发生这种情况。工具说成功,但响应体悄悄包含错误;正确的字段存在,但有错误的账户或租户ID;检索返回完全有效的文档,但它们是那个请求的错误文档;状态成功写入,但下一步读取了不同的内容;配置的模型说一件事,但回退/提供者实际提供了另一个;某物被验证了,但检查的是错误的东西。这就是我觉得“状态=成功”不再告诉你很多的时候。那么,当一切在技术上都显示正常时,你接下来会寻找什么证据?你是与已知良好的运行进行比较吗?开始向后追踪状态?检查每个下游步骤具体消耗了什么?验证写入后的读取,而不是信任写入响应?查看有效的模型/提供者/缓存信息?或者是否有一些数据你希望每次跟踪都捕获,因为没有它你基本上是在猜测?我特别好奇最后一个问题,当最需要时通常不在跟踪中的东西是什么?任何你构建的东西也欢迎,只需在下面链接,我喜欢看到解决方案,免费请不要只是推广垃圾,谢谢。
查看原文

相似文章

智能体给出的正确答案不代表它做对了事

Reddit r/AI_Agents

本文探讨了仅根据最终答案来评估AI智能体的陷阱,强调了检查中间步骤、工具调用和推理过程以发现看似自信但实际错误的输出的重要性。文章建议使用自动评分和轨迹回放来测量并改进智能体的行为。