不可能测试自己的智能体。我试过了,失败了。

Reddit r/AI_Agents 新闻

摘要

一位开发者亲身讲述客观评估自己AI智能体性能的困难,强调了自我测试的陷阱以及意外真实世界基准的价值。

在花费了近一年时间构建个人助理智能体后,我仍然无法确切地告诉你它是否好用。它每天都在为我处理实际工作,如果你问我这东西到底好不好,我只能用模糊的过程描述来回答。让标准的桌面模型通过上传我所有的工作区文件来评价我的智能体,并没有太大帮助。寻找现有的基准测试工具,我一无所获。我的智能体记住了所有成功,悄悄忘记了失败,而我却感到沮丧。更糟的是,即使经过一大堆“改进”,这东西每周似乎都保持不变。模型切换和承诺的落空。内存故障。未经我允许就自行改变的工具。所以,即使上个月它表现良好,对于今天的情况也毫无参考价值。于是我做了显而易见的事情:开始编写自己的测试。而它显然非常擅长通过那些测试!最终真正有帮助的不是证书或最终分数。更像是一个心跳。一些近期的、新鲜的、当前的、智能体意料之外的东西。这是被低估的一点:知道自己正在被测试的智能体可以在窗口期内保持镇定。而不知道的智能体则必须真正优秀。对我来说真正明白的那一天,是我运行了一年的智能体在某个完整类别上被一个仅存在一天的智能体击败。老实说,我一点也不高兴,咒骂了很多。但这正是关键所在(不是咒骂)。改进的方向变得清晰。总之,我很好奇其他人是如何应对的。你如何真正知道你的智能体是好的并且在进步?你是用自己的测试还是别人的测试来重新测试它?或者只是信任它直到出现故障?
查看原文

相似文章

自动化智能体评估的实证研究

arXiv cs.CL

本文介绍了 EvalAgent,这是一个通过编码领域专业知识来自动化 AI 智能体评估的系统,旨在解决标准编程助手在此任务中的局限性。此外,本文还提出了用于测试评估流程的基准 AgentEvalBench,并展示了在评估可靠性方面的显著提升。