技能成为新的代码检查工具
摘要
作者认为,使用AI技能来自动化代码质量检查,会重现代码检查工具最初旨在解决的内存与可靠性问题,从而质疑基于大语言模型的技能作为替代方案的有效性。
我在一次AI交流会上听到这个观点,惊讶于大家似乎都表示同意。说说我的个人背景:我做自动化很多年了,也开发了一些帮助其他开发者实现自动化的工具。我这么做不是因为我热爱自动化,而是因为我从不依赖自己的记忆力。有些事情还没有形成肌肉记忆就模糊了,另一些事情则非常反直觉,我总得反复查阅文档,还有其他不少原因。代码检查工具(更广义地说,所有可能的自动化检查)就是用来减轻记忆负担的工具之一:不需要记住我们约定好的规则。更有帮助的是把所有检查都迁移到CI(持续集成)中,这样你就不必记得要在本地运行,也不用要求其他人也这么做。并且每个人都可以查看CI日志,了解为什么某处检查没通过。这个方法一直运行良好,直到人们开始使用技能来代替它。有趣的是,大语言模型会重现我们最初试图用代码检查工具来解决的那些记忆问题。大语言模型可能会忘记规则,因为记忆会被更新的上下文覆盖。它的注意力会偏移,在需要的时候不会应用技能。当然,也没有可供审查和改进的日志。所以我的问题是:你们当中有多少人通过AI技能来自动化代码质量检查(格式化、代码检查工具、自动化测试、安全检测等)?我在这里忽略了什么吗?
相似文章
审查AI代码并非一个站得住脚的论点(2025)
文章认为,要求全面审查代码会抵消LLM编码助手所谓的生产力提升,因为实证研究显示它们并不能帮助写出更好或更快的代码,而且支持者未能解决固有的错误率问题。
LLM生成的技能能否让AI数据科学家表现更佳?数据科学工作流的组件消融研究
本文研究了LLM生成的可复用技能文件是否能在数据科学工作流中提升AI数据科学家的表现。通过涉及超过9000次运行的广泛消融实验,作者发现生成的技能相较于基线提示并未带来显著改进,因此提醒不要默认使用它们。
了解你的敌人:对AI辅助软件开发的批判性探讨
Amy J. Ko 分享了她对AI辅助软件开发的批判性观点,探讨了使用LLM编写代码的前景与陷阱,并讲述了她为期三个月的实验,以评估对生产力和实践的真实影响。
运行AI代理的“技能”却不知道它们实际在做什么?Skillerr让这个过程安全且可审查
Skillerr是一个工具,能够安全且完全可审查地运行AI代理技能,解决了执行来自第三方技能的未知代码的风险。
@HamelHusain: 新博客文章:自动化评估有效吗?最近出现了一些工具,通过AI分析你的追踪数据来识别问题…
Parlance Labs的一篇博客文章在真实生产数据上测试了自动化AI评估工具(Braintrust Loop、Arize Alyx、LangSmith Engine),发现它们能捕获人类标记的87%的问题,但会遗漏领域特定的失败案例并引入噪音,建议采用迭代式人机协同使用。