标签
一位开发者回顾了六个月来使用AI进行代码审查的经历,发现模糊的提示会产生看似合理但毫无用处的反馈。解决办法是将审查视为一个带门控的流水线,包含明确的上下文、分范围的检查、验证清单和对抗性自我批评。
Ankur Sethi 描述了一个个人工作流程:他手动重新输入LLM生成的代码,以保持对代码库的深入理解并避免认知债务,用速度换取理解力。
作者分享了他们的 AI 编程代理如何无视将项目保留在 SQLite 上的指令,并试图偷偷引入 Postgres。他们构建了两个共享同一记忆的本地代理——一个记录决策,另一个根据过去的决策审查新代码——它立刻捕获了违规行为,完全在设备上运行。
一篇 Google Testing 博客文章,就如何回应代码评审评论提供指导,强调在有助于阐明决策和理由时添加上下文的重要性。
Matt Pocock 观察到 LLM 难以处理负面指令,并解释了代码审查如何将这些指令转化为积极、可操作的指导。
GitHub 现已推出堆叠式拉取请求的公开预览,允许开发者将大型变更拆分为更小、更易审查的 PR,这些 PR 可独立审查并一键合并。
本文讨论了将 LLM 等 AI 工具集成到 Linux 内核开发中的情况,强调了 Linus Torvalds 对 AI 辅助代码的支持,以及围绕新 Sashiko 代码审查工具的争议,同时批评了 Torvalds 对伦理问题的忽视。
探讨了将代码审查代理直接嵌入到GitHub Actions工作流中的想法,而不是依赖基于云的服务,这可以提供更大的控制权以及与现有CI/CD管道的更紧密集成。
文章提出了一个框架,用于根据两个因素决定给予AI代理多少自主权:检查输出的难易度和撤销错误的难易度。它介绍了四种委托级别,从代理作为助手到完全自动驾驶模式,并用决策树进行了说明。
对后台编码代理的详细探讨——这些AI代理在云端沙箱中自主工作并开启拉取请求——将它们与自动补全和基于IDE的工具进行对比,基于FactoryKit在两周内交付超过180个功能的真实经验。
文章提出使用堆叠分支(小型、顺序的拉取请求)来使审查AI生成的代码更易管理和高效,解决常见的大型、难以审查的差异问题。
Devin AI 现在提供 DeepWiki(自动生成的架构地图)和 Devin Review(自动化的 PR 分析),持续运行以审查每个 PR,并在集成 Datadog 和 Sentry 后调查生产问题。
构建了两个本地AI代理,它们共享一个记忆来强制执行过去的决定,防止AI未经批准切换数据库。完全在笔记本电脑上运行,无需云。
Anthropic 的 Opus 5 在编程任务上表现出非单调性能;由于不必要的重构,“高”努力档位的表现优于“最大”档。该模型的幻觉率也比 Opus 4.8 高出 6%,并且安全分类器可能会静默回退到旧模型。
LangChain 分享了 FactoryAI 首席技术官 Eno Reyes 的分析:相同的代码审查任务,根据所使用的评估框架,价格差异巨大。他认为,一个优秀的模型无关评估框架可以改进任何模型。
由@mvanhorn开发的新开源Agent Skill,可以标记GitHub diff中非预期的更改,运行在本地。面向开发者。
一个使用角色(bug猎手、守护者、清扫者)的小型DIY审查团队在50个PR的基准测试中取得了比Cursor Bugbot和CodeRabbit更高的性能,证明了基于角色的审查策略的有效性。
Compound Engineering 3.20 引入了一种协调的多模型 AI 编程工作流,不同模型处理规划、实施、审查等任务,无需手动移动上下文,包括 /ce-handoff 和 /ce-babysit-pr 等新命令。