@bcherny:LLM 仍然会产生 bug,但这些 bug 与过去不同。差一错误变少了,更多的是关于 s…

X AI KOLs Timeline 新闻

摘要

一位开发者观察到,LLM 生成的 bug 已从差一错误转向更高层次的设计和上下文问题,并建议使用对抗性代码审查(例如 Claude 的 /code-review)来捕获这些 bug。

LLM 仍然会产生 bug,但这些 bug 与以往不同。差一错误变少了,更多的是系统设计、UI 可用性、缺少更广泛的上下文。某些类型的编码问题已经被解决,但并非全部。 虽然模型仍在不断改进,但对抗性代码审查已成为捕获此类 bug 的极为强大的工具。 它可以简单到一行提示——“使用动态工作流在 iOS 模拟器中对每个边界情况进行对抗性测试”,或者使用 Claude 内置的 /code-review(或 /code-review low、/code-review medium 等)。
查看原文
查看缓存全文

缓存时间: 2026/08/13 15:31

LLMs 仍然会产生 bug,但这些 bug 与以往不同。更少出现差一错误,更多涉及系统设计、UI 可用性、缺少更广泛的上下文。某些类型的编码问题已经解决,但并非全部。

随着模型持续改进,对抗性代码审查已成为捕捉许多此类 bug 的极其强大的工具。

它可以简单到一行提示词——“使用动态工作流在 iOS 模拟器中对抗性测试每个边界情况”,或者使用 Claude 内置的 /code-review(或 /code-review low、/code-review medium 等)。

Jarred Sumner@jarredsumner·8月11日: 这不再发生了 x.com/jarredsumner/s…

相似文章

LLMs 不擅长编写“氛围式”规范

Hillel Wayne — Computer Things

Hillel Wayne 基于对社区项目的分析,讨论了尽管 LLM 在编写 TLA+ 和 Alloy 等形式化规范方面很受欢迎,但它们经常生成浅显、同义反复的属性,无法捕捉微妙的缺陷。

2倍,而非10倍:2026年使用LLM编程

Hacker News Top

作者认为,由于LLM能够处理易于验证的任务,目前可为编程提供约2倍的生产力提升,但根本性限制使其无法实现10倍改进;进一步的提升将来自围绕现有能力重构工具,而非模型改进。

LLM生成代码中的拼凑问题

arXiv cs.AI

本文形式化描述了'拼凑问题'——即LLM生成的代码在局部正确但在整个代码库中结构上不连贯的现象,提出了一个八类故障分类法和一个混合验证框架,并证明许多故障能够避开现有工具。