@bcherny:LLM 仍然会产生 bug,但这些 bug 与过去不同。差一错误变少了,更多的是关于 s…
摘要
一位开发者观察到,LLM 生成的 bug 已从差一错误转向更高层次的设计和上下文问题,并建议使用对抗性代码审查(例如 Claude 的 /code-review)来捕获这些 bug。
查看缓存全文
缓存时间: 2026/08/13 15:31
LLMs 仍然会产生 bug,但这些 bug 与以往不同。更少出现差一错误,更多涉及系统设计、UI 可用性、缺少更广泛的上下文。某些类型的编码问题已经解决,但并非全部。
随着模型持续改进,对抗性代码审查已成为捕捉许多此类 bug 的极其强大的工具。
它可以简单到一行提示词——“使用动态工作流在 iOS 模拟器中对抗性测试每个边界情况”,或者使用 Claude 内置的 /code-review(或 /code-review low、/code-review medium 等)。
Jarred Sumner@jarredsumner·8月11日: 这不再发生了 x.com/jarredsumner/s…
相似文章
LLMs 不擅长编写“氛围式”规范
Hillel Wayne 基于对社区项目的分析,讨论了尽管 LLM 在编写 TLA+ 和 Alloy 等形式化规范方面很受欢迎,但它们经常生成浅显、同义反复的属性,无法捕捉微妙的缺陷。
@msimoni: 到目前为止,我还未能让LLM在编程的困难部分显著帮助我——设计代码……
作者发现,LLM在编程的困难部分(设计简单、通用、清晰的代码)并没有显著帮助,但在其他部分却非常有用,以至于他们将其评为10倍的生产力提升。
@mattpocockuk: LLM 非常不擅长遵循负面指令,这就是为什么代码审查效果这么好,它将所有负面指令转化为…
Matt Pocock 观察到 LLM 难以处理负面指令,并解释了代码审查如何将这些指令转化为积极、可操作的指导。
2倍,而非10倍:2026年使用LLM编程
作者认为,由于LLM能够处理易于验证的任务,目前可为编程提供约2倍的生产力提升,但根本性限制使其无法实现10倍改进;进一步的提升将来自围绕现有能力重构工具,而非模型改进。
LLM生成代码中的拼凑问题
本文形式化描述了'拼凑问题'——即LLM生成的代码在局部正确但在整个代码库中结构上不连贯的现象,提出了一个八类故障分类法和一个混合验证框架,并证明许多故障能够避开现有工具。