评估智能体非常困难

Reddit r/AI_Agents 新闻

摘要

本文讨论了评估基于LLM的智能体执行多步推理的挑战,指出仅对最终输出进行评分是不够的,因为智能体可能走错路径但偶然恢复,并提出了如何在不手动审查的情况下评估轨迹的问题。

我一直在用LLM构建应用,最近把我的一个功能从单次提示/补全设置升级到了一个真正的多步智能体(工具调用、几步推理、决定下一步做什么等)。在演示中效果很好。但在评估方面我现在有点迷茫。对于单次补全,它很简单,发送输入,对输出评分,完成。我有一个不错的小数据集和评分设置,感觉很好。但困扰我的是最终答案看起来完全没问题,所以我旧的“对输出评分”的评估通过了,但当我实际查看中间过程时,却发现一团糟。它调错了工具,偶然恢复了,做了一个恰好这次正确的假设。所以输出是“正确的”,但它到达那里的路径完全错误(或者至少不是预期的路径)。感觉下周同样的查询就会失败,因为那些幸运的步骤之一会转向另一边。所以仅对最终输出评分显然不足以评估智能体。但我不确定如何真正评估轨迹,即整个步骤序列,而不变成大量手动阅读跟踪记录的混乱局面。向在这条路上走得更远的人请教:你们是如何评估轨迹而不仅仅是最终答案的?你们是对单个步骤评分(正确的工具,正确的参数)还是对整个路径评分?如何在每次更改智能体流程时避免成为维护噩梦?感觉现在这应该是一个已解决的问题,但我显然遗漏了什么。
查看原文

相似文章

智能体给出的正确答案不代表它做对了事

Reddit r/AI_Agents

本文探讨了仅根据最终答案来评估AI智能体的陷阱,强调了检查中间步骤、工具调用和推理过程以发现看似自信但实际错误的输出的重要性。文章建议使用自动评分和轨迹回放来测量并改进智能体的行为。

构建AI代理时如何进行评估与可观测性?

Reddit r/AI_Agents

作者探讨了在生产环境中评估和监控AI代理所面临的挑战,包括离线评估与在线评估、LLM作为评判、链路追踪和成本追踪,并提到Langfuse、LangSmith等工具,但更关注底层流程。

你的LLM提示词有200行。你真的知道智能体遵从了多少吗?

Reddit r/AI_Agents

本文讨论了在生产环境中评估和监控基于LLM的智能体所面临的挑战,涵盖离线评估、提示工程陷阱、可观测性工具、审查队列、标注、聚类、主题分类,以及将人工审查、LLM作为评判和小型分类器进行成本分层的方法。