@bcherny:LLM 仍然会产生 bug,但这些 bug 与过去不同。差一错误变少了,更多的是关于 s…
摘要
一位开发者观察到,LLM 生成的 bug 已从差一错误转向更高层次的设计和上下文问题,并建议使用对抗性代码审查(例如 Claude 的 /code-review)来捕获这些 bug。
查看缓存全文
缓存时间: 2026/08/13 15:31
LLMs 仍然会产生 bug,但这些 bug 与以往不同。更少出现差一错误,更多涉及系统设计、UI 可用性、缺少更广泛的上下文。某些类型的编码问题已经解决,但并非全部。
随着模型持续改进,对抗性代码审查已成为捕捉许多此类 bug 的极其强大的工具。
它可以简单到一行提示词——“使用动态工作流在 iOS 模拟器中对抗性测试每个边界情况”,或者使用 Claude 内置的 /code-review(或 /code-review low、/code-review medium 等)。
Jarred Sumner@jarredsumner·8月11日: 这不再发生了 x.com/jarredsumner/s…
相似文章
一个LLM编写了交易功能,另一个审查了它,两者都错过了未来数据漏洞
这篇文章讨论了一篇研究论文,其中用于编写和审查交易功能的LLM错过了未来数据漏洞,强调了需要在代理系统中进行结构性重新设计以防止此类问题。
LLMs 不擅长编写“氛围式”规范
Hillel Wayne 基于对社区项目的分析,讨论了尽管 LLM 在编写 TLA+ 和 Alloy 等形式化规范方面很受欢迎,但它们经常生成浅显、同义反复的属性,无法捕捉微妙的缺陷。
@msimoni: 到目前为止,我还未能让LLM在编程的困难部分显著帮助我——设计代码……
作者发现,LLM在编程的困难部分(设计简单、通用、清晰的代码)并没有显著帮助,但在其他部分却非常有用,以至于他们将其评为10倍的生产力提升。
编程中的Large Language Models:实际是修复还是重新实现不正确的代码?
该论文研究了在竞赛编程中,Large Language Models是通过最小编辑修复错误还是从头重新实现解决方案,发现LLMs经常修改超过必要,并且在生成新解决方案时解决得更好,这对调试工具有启示意义。
@mattpocockuk: LLM 非常不擅长遵循负面指令,这就是为什么代码审查效果这么好,它将所有负面指令转化为…
Matt Pocock 观察到 LLM 难以处理负面指令,并解释了代码审查如何将这些指令转化为积极、可操作的指导。