我构建了一个基准测试,用来检验AI代理是否违反架构规则。结果显示没有违规。(空结果,附带测试工具和数据)

Reddit r/AI_Agents 论文

摘要

一项基准研究测试了AI编码代理是否在TypeScript仓库中违反导入边界规则,发现所有模型和条件下均无违规,这挑战了严格执法规则的必要性。

常见的说法是:你的CLAUDE.md/AGENTS.md是指导,lint规则是执行,而AI编码代理会偏离文本,因此你需要确定性的规则。我想量化这个差距。我从近乎全面的24,888个公共TypeScript仓库中挖掘了一个真实的导入边界规则(请求入口文件不得导入UI组件),然后在现实编码任务上运行了Claude、GPT和Gemini,跨四种条件,从无防护的控制到将规则安装为硬性lint错误。接着,我针对最容易出错的情况:让任务更长,并故意引导其趋向违规,在无防护情况下运行了一组更便宜、更弱的模型。在所有运行的模型和条件下:零违规。即使没有规则和指导。即使是较弱的模型。在这个规则上,没有什么需要执行来修复的。这是一个狭窄的结果(一个导入边界,一个仓库),我在文章中对此很谨慎。尽管如此,我还是发布了这个空结果,连同预注册、测试工具和原始运行数据,因为负面结果是我们避免追逐相同死胡同的方式。好奇是否有人能让代理打破我未能打破的推断导入边界。
查看原文

相似文章