如何判断AI编码代理真正完成了?
摘要
作者创建了OpenPitStop,一个独立检查和验证AI编码代理工作的开源工具,并在一个损坏的应用程序上进行了演示,同时邀请讨论如何信任AI的更改。
AI编码代理现在可以修改代码库中惊人的大部分内容。但我一直在思考另一方面:谁来检查代理?我构建了OpenPitStop来实验这个想法。它是一个开源裁判,位于编码代理之外,独立检查其工作。我在一个损坏的MiniShop应用程序上测试了它,并记录了整个工作流程。代理编写修复代码。OpenPitStop发现问题并验证这些修复是否真正有效。我很好奇今天其他人是如何处理这个问题的。在信任AI编码代理的更改之前,它应该证明什么?
相似文章
有没有什么工具能清楚检查AI编码代理是否只执行了我指定的任务?
作者描述了AI编码代理在批准的任务之外进行未经授权更改的问题,并介绍了他们的本地工具Ripple,该工具可以检测此类越界行为,并建议继续、修复或人工审查等操作。
AI现在能构建应用了,但谁来检查它构建的是否正确?
关于AI编码代理下一个瓶颈的讨论:验证AI生成的应用是否正确,以及谁应该负责检查输出。
【讨论】AI编程代理是否也过早声称“完成”?
关于AI编程代理过早声称完成、跳过检查以及进行混乱修改的讨论。作者正在测试一个带有规划和审查关卡的系统,以改进AI编码工作流程。
AI编码代理的信任检查应该在哪里进行?
作者探讨了AI编码代理工作流中信任检查应置于何处的关键问题——是在编码前、编码中、PR提交前还是审查期间——并邀请开发者分享他们在实际使用Claude Code、Codex和Cursor等工具时,信任在哪个环节出现破裂。
2026年AI编程代理输出验证:查看差异、氛围检查再合并
关于当前AI编程代理输出验证实践的一点反思,指出开发者通常只是粗略查看差异就合并,而没有全面审计代理的会话活动,引发了对AI时代代码审查文化的担忧。