我的代理循环中的一个验证步骤连续数周运行零测试并返回退出码0

Reddit r/AI_Agents 工具

摘要

作者描述了AI代理循环的验证步骤静默失败运行测试并导致误报的场景,并给出了改进开发工具以防止类似问题的指导。

我运行了长达几个月的自主循环。模型能够完成工作。问题在于,它根据看似正常但实际不正常的证据将任务标记为完成。最糟糕的是:我有一个表格,将更改的文件映射到测试命令。其中三行指向的测试文件后来已被拆分为兄弟文件。命令运行后,收集到零个测试,退出码为0,并打印了“未运行任何测试”。连续数周显示为绿色(通过)。报告“已验证”的代理完全诚实。一个运行后无操作却返回退出码0的命令,看起来与通过命令相同,而且自动化程度越高,这种假象持续的时间就越长。在争论使用哪个模型之前,我会在测试工具中检查以下几点:任务完成是否需要一个工件,还是仅仅依赖模型的判断?一个运行无操作的命令返回退出码0,证明不了任何事情。它运行的是真正的入口点,还是仅运行测试套件?pytest会将包添加到sys.path,而直接调用则不会,因此即使测试套件全部通过,实际调用时仍可能出现ModuleNotFoundError。我曾将这样的错误发布到一个cron job中。它能否区分截断的检索和完整的检索?长循环会积累自信的部分答案,每个答案都会为下一步提供输入。这些都不依赖于模型。在你的系统中,你如何判断“完成”?你是需要命令的输出,还是接受代理的报告?
查看原文

相似文章

让我损失最惨重的智能体故障全都声称成功

Reddit r/AI_Agents

作者分析了155个AI智能体任务,发现大多数故障源于基础设施问题,如超时和虚假成功信号,而非模型错误,从而提出了基于效果断言和使用多条验证路径等实践方法。