如何判断AI编码代理真正完成了?

Reddit r/AI_Agents 工具

摘要

作者创建了OpenPitStop,一个独立检查和验证AI编码代理工作的开源工具,并在一个损坏的应用程序上进行了演示,同时邀请讨论如何信任AI的更改。

AI编码代理现在可以修改代码库中惊人的大部分内容。但我一直在思考另一方面:谁来检查代理?我构建了OpenPitStop来实验这个想法。它是一个开源裁判,位于编码代理之外,独立检查其工作。我在一个损坏的MiniShop应用程序上测试了它,并记录了整个工作流程。代理编写修复代码。OpenPitStop发现问题并验证这些修复是否真正有效。我很好奇今天其他人是如何处理这个问题的。在信任AI编码代理的更改之前,它应该证明什么?
查看原文

相似文章

AI编码代理的信任检查应该在哪里进行?

Reddit r/AI_Agents

作者探讨了AI编码代理工作流中信任检查应置于何处的关键问题——是在编码前、编码中、PR提交前还是审查期间——并邀请开发者分享他们在实际使用Claude Code、Codex和Cursor等工具时,信任在哪个环节出现破裂。