不可能测试自己的智能体。我试过了,失败了。
摘要
一位开发者亲身讲述客观评估自己AI智能体性能的困难,强调了自我测试的陷阱以及意外真实世界基准的价值。
在花费了近一年时间构建个人助理智能体后,我仍然无法确切地告诉你它是否好用。它每天都在为我处理实际工作,如果你问我这东西到底好不好,我只能用模糊的过程描述来回答。让标准的桌面模型通过上传我所有的工作区文件来评价我的智能体,并没有太大帮助。寻找现有的基准测试工具,我一无所获。我的智能体记住了所有成功,悄悄忘记了失败,而我却感到沮丧。更糟的是,即使经过一大堆“改进”,这东西每周似乎都保持不变。模型切换和承诺的落空。内存故障。未经我允许就自行改变的工具。所以,即使上个月它表现良好,对于今天的情况也毫无参考价值。于是我做了显而易见的事情:开始编写自己的测试。而它显然非常擅长通过那些测试!最终真正有帮助的不是证书或最终分数。更像是一个心跳。一些近期的、新鲜的、当前的、智能体意料之外的东西。这是被低估的一点:知道自己正在被测试的智能体可以在窗口期内保持镇定。而不知道的智能体则必须真正优秀。对我来说真正明白的那一天,是我运行了一年的智能体在某个完整类别上被一个仅存在一天的智能体击败。老实说,我一点也不高兴,咒骂了很多。但这正是关键所在(不是咒骂)。改进的方向变得清晰。总之,我很好奇其他人是如何应对的。你如何真正知道你的智能体是好的并且在进步?你是用自己的测试还是别人的测试来重新测试它?或者只是信任它直到出现故障?
相似文章
你的AI代理绿色测试套件实际证明了什么
本文认为,由于输入空间无限且行为非确定性,AI代理使用固定输入和预期输出的标准测试套件并不充分,主张应采用基于属性的测试方法。
自动化智能体评估的实证研究
本文介绍了 EvalAgent,这是一个通过编码领域专业知识来自动化 AI 智能体评估的系统,旨在解决标准编程助手在此任务中的局限性。此外,本文还提出了用于测试评估流程的基准 AgentEvalBench,并展示了在评估可靠性方面的显著提升。
在部署之前,你们是如何测试智能体的?还是大家都在生产环境中凭感觉检查?
关于测试非确定性AI智能体挑战的讨论,质疑开发者如何在没有传统测试模式的情况下验证工具使用、行为和多步骤工作流。
我一直放弃多智能体工作流,因为我无法验证它们提交的代码。你们是怎么处理的?
一位开发者分享了他在使用多智能体编码工作流时的困扰——并行 PR 的产出难以逐一验证——并描述了他如何构建一个 AI QA 智能体,通过真实浏览器(借助 Browserbase)自动点击预览部署,对无法正常运行的 PR 标记失败。
我正在构建一个工具,旨在让你无需再手动与自己的AI代理聊天来测试它,你会使用它吗?
作者正在构建一个工具,通过模拟真实用户对话并提供通过/失败报告来自动测试AI代理,从而让开发者免于手动测试。