不可能测试自己的智能体。我试过了,失败了。
摘要
一位开发者亲身讲述客观评估自己AI智能体性能的困难,强调了自我测试的陷阱以及意外真实世界基准的价值。
在花费了近一年时间构建个人助理智能体后,我仍然无法确切地告诉你它是否好用。它每天都在为我处理实际工作,如果你问我这东西到底好不好,我只能用模糊的过程描述来回答。让标准的桌面模型通过上传我所有的工作区文件来评价我的智能体,并没有太大帮助。寻找现有的基准测试工具,我一无所获。我的智能体记住了所有成功,悄悄忘记了失败,而我却感到沮丧。更糟的是,即使经过一大堆“改进”,这东西每周似乎都保持不变。模型切换和承诺的落空。内存故障。未经我允许就自行改变的工具。所以,即使上个月它表现良好,对于今天的情况也毫无参考价值。于是我做了显而易见的事情:开始编写自己的测试。而它显然非常擅长通过那些测试!最终真正有帮助的不是证书或最终分数。更像是一个心跳。一些近期的、新鲜的、当前的、智能体意料之外的东西。这是被低估的一点:知道自己正在被测试的智能体可以在窗口期内保持镇定。而不知道的智能体则必须真正优秀。对我来说真正明白的那一天,是我运行了一年的智能体在某个完整类别上被一个仅存在一天的智能体击败。老实说,我一点也不高兴,咒骂了很多。但这正是关键所在(不是咒骂)。改进的方向变得清晰。总之,我很好奇其他人是如何应对的。你如何真正知道你的智能体是好的并且在进步?你是用自己的测试还是别人的测试来重新测试它?或者只是信任它直到出现故障?
相似文章
人人都说要为AI代理编写评估,但实际该测什么?
一份关于为AI代理编写有效评估的实用指南,重点是从观察到的失败入手,并结合确定性检查和LLM裁判。
寻找极端/不可能的任务来对我的智能体进行彻底的压力测试。我再也不能相信自己的判断了
一位开发人员构建了一个完全自主的定制智能体架构,可以在无人干预的情况下运行数周。他正在向社区寻求极端、对抗性的任务来对其进行彻底的压力测试,因为他无法再相信自己的判断。
调试智能体比构建它们更难
作者探讨了调试AI智能体的难点,重点关注可观测性问题,并对当前生产环境中的评估方法提出质疑。
大多数智能体基准测试并未解决我们真正关心的问题
作者认为,当前的人工智能智能体基准测试忽略了诸如错误处理、人工干预和长期可靠性等实际问题,强调了操作因素对现实世界可信度的重要性。
如何破解你的AI代理
一个实用指南,介绍如何通过多轮攻击测试AI代理,以揭示那些在孤立情况下看似无害但在交互中变得关键的漏洞。