你的编码代理说“完成了”,但它从未真正检查过这个东西在浏览器中是否有效。
摘要
对AI编码代理的批评,它们声称完成任务却没有在真实浏览器环境中验证功能。
暂无内容
相似文章
【讨论】AI编程代理是否也过早声称“完成”?
关于AI编程代理过早声称完成、跳过检查以及进行混乱修改的讨论。作者正在测试一个带有规划和审查关卡的系统,以改进AI编码工作流程。
编码代理最糟糕的失败是过早地说“完成”
本文强调了一种编码代理常见的失败模式:它们报告任务“完成”,却留下了隐藏的问题,如测试不足、遗漏边界情况和引入错误,给开发者造成了信任问题。
当AI代理说“完成”时,你怎么知道它真的发生了?[P]
文章探讨了一个名为agentuptime的早期概念,它通过独立检查结果来验证AI代理的操作,以确保代理的完成声明与外部系统的实际状态相符。
外部验证一直是我编码代理运行中缺失的关键环节
作者指出,在有效使用 AI 编码代理时,外部验证是一个关键缺失的组成部分。
如何判断AI编码代理真正完成了?
作者创建了OpenPitStop,一个独立检查和验证AI编码代理工作的开源工具,并在一个损坏的应用程序上进行了演示,同时邀请讨论如何信任AI的更改。