@mattpocockuk: LLM 非常不擅长遵循负面指令,这就是为什么代码审查效果这么好,它将所有负面指令转化为…
摘要
Matt Pocock 观察到 LLM 难以处理负面指令,并解释了代码审查如何将这些指令转化为积极、可操作的指导。
LLM 非常不擅长遵循负面指令
这就是为什么代码审查效果这么好,它将所有负面指令转化为正面指令:
查看缓存全文
缓存时间: 2026/07/31 14:57
LLM 在遵循负面指令方面是出了名的差劲。
这就是为什么代码审查效果这么好——它把所有负面指令都变成了正面指令:
Matt Pocock (@mattpocockuk): 这就是为什么你要在审查时做这件事
“别踩这些坑”——糟糕 “找出并消除这些坑”——很好
相似文章
@bcherny:LLM 仍然会产生 bug,但这些 bug 与过去不同。差一错误变少了,更多的是关于 s…
一位开发者观察到,LLM 生成的 bug 已从差一错误转向更高层次的设计和上下文问题,并建议使用对抗性代码审查(例如 Claude 的 /code-review)来捕获这些 bug。
@mattpocockuk:用好 LLM 的重要一课:如果你想产出一份文档(PRD、文章、长邮件),把它拆成……
Matt Pocock 建议将 LLM 文档创作拆成两步:先进行松散对齐,再正式动笔。
@omarsar0:LLM评审的怪异现象确实存在。避免对LLM评审使用评分,或如果使用需极其谨慎。尽可能使用二分类标签……
一条推文讨论了一个发现的怪现象:将论文PDF重命名为更长、更积极的标题会提高LLM评审的评分,建议谨慎使用基于评分的LLM评估,并推荐改用二分类标签。
@msimoni: 到目前为止,我还未能让LLM在编程的困难部分显著帮助我——设计代码……
作者发现,LLM在编程的困难部分(设计简单、通用、清晰的代码)并没有显著帮助,但在其他部分却非常有用,以至于他们将其评为10倍的生产力提升。
@jakevin7: 分享一个神级review提示词方法论。 LLM 自我纠正的综述 《When Can LLMs Actually Correct Their Own Mistakes?》结论是:如果没有测试结果、工具输出等可靠的外部反馈,模型仅靠自己反思,…
分享了一个基于LLM自我纠正研究的提示词方法论,强调无外部反馈时模型自查效果有限,推荐对抗式审查等逐步增强的提示策略。